Skip to content
QbitAI · WeChat

JD and CAS IIE Publish Three Papers Defining Self-Taught RLVR

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

JD and CAS IIE released three Self-Taught RLVR papers covering RLSD, NPO, and CoPD; RLSD reports that 200 training steps on Qwen3-VL-8B-Instruct exceed GRPO at 400 steps across 8 benchmarks.

Why it matters: HKR-H/K/R pass: self-taught RLVR is a clear hook; RLSD reports 8 benchmarks and a 200-vs-400-step GRPO comparison; it hits reasoning fine-tuning cost. Not a top-lab model launch and replication heat is undisclosed, so it stays low featured.

Read the original ↗Export Markdown