# AI 家教知道什么时候该帮忙、什么时候该闭嘴吗？Allen AI 做了个测试

> 原标题：TutorMoments: Do AI tutors know when to help and when to hold back?

- 来源：Hugging Face 博客
- 发布时间：2026-08-07T17:53:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49762
- 原文：https://huggingface.co/blog/allenai/tutormoments

## 摘要

Allen AI 放出了一个叫 TutorMoments 的评测框架，专门看大模型当数学家教时会不会“帮过头”。他们拿真人一对一辅导的对话记录，让有经验的老师标出那些关键节点：家教是该给提示降低难度，还是逼学生自己动脑。然后把对话喂给模型，让模型接替家教，跟另一个扮演学生的模型继续聊。结果发现，只告诉模型“好好辅导”，它基本都在过度帮忙，很少逼学生深入...

## 推荐理由

Allen AI 放出的 TutorMoments 不是又一个刷榜的数学题集，而是拿真人辅导记录，让有经验的老师标出那些“该帮还是该忍”的关键节点，再让模型接替家教跟学生模型继续聊。结论很直白：模型一上来就忍不住帮忙，很少逼学生深入思考。这个发现对做 AI 辅导产品的人是个实打实的提醒，所以 H 和 K 都给了。但评测框架本身偏教育场景，正文也没说这套方法能直接搬到客服、编程辅导等其他对话场景，所以 R 没给。

## 锐评

Allen AI 放出的 TutorMoments 评测框架，专门盯着大模型做数学家教时会不会“过度帮忙”。他们没让模型凭空发挥，而是拿真人一对一辅导的对话记录，请有经验的老师标出那些关键决策点：家教是该给提示降低难度，还是逼学生自己动脑。然后把对话前半截喂给模型，让模型接替家教，跟另一个扮演学生的模型继续聊。

结果很直接：只告诉模型“好好辅导”，它基本都在过度帮忙，很少逼学生深入思考。如果在提示词里明确告诉它“该帮才帮，该收就收”，表现会好一些，但跟真人老师那种看情况灵活调整的水平还是有差距。这个项目公开了脱敏的对话数据、重放测试的代码和模型扮演家教的记录，方便别人复现。

不过得注意，目前学生角色也是模型演的，不是真人，所以测出来的“教学效果”跟真实课堂还有距离。另外，正文没披露具体测试了哪些模型、样本量有多大，这些信息缺口让结论的普适性要打个折。
