跳到正文
Hugging Face 博客

AI 家教知道什么时候该帮忙、什么时候该闭嘴吗?Allen AI 做了个测试

TutorMoments: Do AI tutors know when to help and when to hold back?

Allen AI 放出了一个叫 TutorMoments 的评测框架,专门看大模型当数学家教时会不会“帮过头”。他们拿真人一对一辅导的对话记录,让有经验的老师标出那些关键节点:家教是该给提示降低难度,还是逼学生自己动脑。然后把对话喂给模型,让模型接替家教,跟另一个扮演学生的模型继续聊。结果发现,只告诉模型“好好辅导”,它基本都在过度帮忙,很少逼学生深入...

推荐理由:Allen AI 放出的 TutorMoments 不是又一个刷榜的数学题集,而是拿真人辅导记录,让有经验的老师标出那些“该帮还是该忍”的关键节点,再让模型接替家教跟学生模型继续聊。结论很直白:模型一上来就忍不住帮忙,很少逼学生深入思考。这个发现对做 AI 辅导产品的人是个实打实的提醒,所以 H 和 K 都给了。但评测框架本身偏教育场景,正文也没说这套方法能直接搬到客服、编程辅导等其他对话场景,所以 R 没给。

读原文 ↗导出 Markdown