跳到正文
Hacker News 首页

Ornith-1.5 让模型自己出题、搭脚手架、写答案,靠强化学习滚雪球式变强,三个尺寸在编程和智能体跑分上压过同级开源模型

Ornith-1.5: From Self-Scaffolding to Self-Improvement

Ornith-1.5 把上一代的自搭脚手架思路升级成完整的自改进闭环:模型自己生成新任务、搭好解题用的脚手架、产出多轮答案,再用强化学习从这些经验里提升自己。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,DeepSWE 上 56.0 分,跟 Claude Opus 4.8(85.0、59.0)基本打平,超过了...

推荐理由:Ornith-1.5 把自改进做成了一个闭环,397B 版本在 Terminal-Bench 和 DeepSWE 上基本跟 Claude Opus 4.8 打平,开源追到这个位置确实少见。没给更高分是因为 Ornith 还不是一线实验室,社区复现和真实部署效果还得再观察。

读原文 ↗导出 Markdown