# Ornith-1.5 让模型自己出题、搭脚手架、写答案，靠强化学习滚雪球式变强，三个尺寸在编程和智能体跑分上压过同级开源模型

> 原标题：Ornith-1.5: From Self-Scaffolding to Self-Improvement

- 来源：Hacker News 首页
- 发布时间：2026-08-19T14:48:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51644
- 原文：https://ornith.ai/ornith_1_5.html

## 摘要

Ornith-1.5 把上一代的自搭脚手架思路升级成完整的自改进闭环：模型自己生成新任务、搭好解题用的脚手架、产出多轮答案，再用强化学习从这些经验里提升自己。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分，DeepSWE 上 56.0 分，跟 Claude Opus 4.8（85.0、59.0）基本打平，超过了...

## 推荐理由

Ornith-1.5 把自改进做成了一个闭环，397B 版本在 Terminal-Bench 和 DeepSWE 上基本跟 Claude Opus 4.8 打平，开源追到这个位置确实少见。没给更高分是因为 Ornith 还不是一线实验室，社区复现和真实部署效果还得再观察。

## 锐评

Ornith-1.5 把上一代“自己搭脚手架”的思路，升级成了一个完整的自我改进闭环：模型自己生成新任务、搭好解题用的脚手架、产出多轮答案，再用强化学习从这些经验里提升自己。这相当于让模型自己给自己出卷子、找解题套路、批改并进步，不再依赖人类预先喂好的固定题目。

旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分，DeepSWE 上 56.0 分，跟 Claude Opus 4.8（85.0、59.0）基本打平，超过了 GLM-5.2 和 DeepSeek-V4-Flash-0731。但最让我注意的是 35B MoE 版，它每次推理只激活 3B 参数，却在智能体编程跑分上大幅甩开了 Gemma 4-31B 和 Meta 的 Muse Glimmer-30B，这说明它的稀疏激活效率很高。9B 的密集模型更夸张，量化后能塞进手机，在 Terminal-Bench 2.1 上跑出 47.0 分，SWE-Bench Verified 上 70.6 分，直接干掉了不少体积大几倍的模型。

不过，这篇博客没披露训练用了多少算力、数据规模多大，也没说什么时候开源或开放 API。任务奖励由有效性、前沿难度和 novelty 三项相乘得出，其中难度目标是让模型成功率保持在 20% 左右，这个设定挺聪明，能持续把模型推向能力边界。但 novelty 具体怎么算的，正文也没细说。所以，这个自我进化闭环的实际落地成本和泛化能力，还得等更多信息才能判断。
