Ornith-1.0:让模型自己搭脚手架,学会干编程智能体的活
Ornith-1.0: Self-scaffolding LLMs for agentic coding
Ornith-1.0 是一套开源的编程智能体模型,从 9B 到 397B MoE 都有。核心思路是训练时不让模型用人类写死的流程框架,而是让它自己生成任务“脚手架”——也就是解题时怎么组织步骤、处理错误、调用工具。这个脚手架和最终答案一起被强化学习优化,模型会自己摸索出更高效的解题路径。397B 版本在 Terminal-Bench 2.1 上拿了 7...
推荐理由:开源编程智能体模型,397B 版本在 Terminal-Bench 2.1 和 SWE-Bench Verified 上的分数直接叫板 Claude Opus 4.7。训练方法有真东西:让模型自己生成任务脚手架并联合优化,不是又一套微调流水线。团队是 Deep-Reinforce AI,新面孔,没有第三方验证,这点先别太激动。9B 到 397B 都开源,小模型能本地跑,对想自己搭 coding agent 的人是个实在选项。