# Ornith-1.0 开源四个编程智能体模型，397B 版本自称打平 Claude Opus 4.8

> 原标题：Ornith-1.0 开源智能体编程模型发布

- 来源：AI HOT 精选
- 发布时间：2026-06-26T11:56:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40715
- 原文：https://x.com/kimmonismus/status/2070476402692919346

## 摘要

Ornith-1.0 放出了四个尺寸的模型，从 9B 到 397B 都有，MIT 协议随便用。它们基于 gemma4 和 qwen3.5 做后训练，用的强化学习方法同时优化任务拆解和方案自我修正，相当于教模型先想清楚步骤再动手改代码。397B 在 SWE-Bench Verified 上拿了 82.4 分，Terminal-Bench 2.1 上 77...

## 推荐理由

开源编程智能体模型，397B 在 SWE-Bench Verified 上拿了 82.4 分，MIT 协议，四个尺寸可选。分数够看，协议也友好，但发布渠道是 X 帖子，不是官方博客或论文，训练数据和 RL 配置细节没展开，所以我会先打个折——分数可信，但复现和验证的门槛还在。

## 锐评

Ornith-1.0 放出了四个尺寸的智能体编程模型，从 9B 到 397B 都有，MIT 协议随便用。它的训练思路是教模型先拆任务再改代码，同时用强化学习优化这两步，相当于让模型学会“想清楚再动手”。397B 在 SWE-Bench Verified 上拿了 82.4 分，Terminal-Bench 2.1 上 77.5 分，在开源模型里确实算高的。

但主推文说它“媲美甚至超越 Claude Opus 4.8”，正文却没给出 Opus 4.8 在同样基准上的具体分数。没有对照数字，这个说法只能先打个折。另外，35B MoE 和 31B Dense 两个中等尺寸的实际表现也没展开，不知道小模型在复杂任务上会不会掉链子。

还缺的是推理成本和延迟数据。397B 的 MoE 架构虽然激活参数可能少一些，但跑起来到底要多贵的卡、响应多快，正文没提。如果实际部署成本太高，MIT 开源的意义也会打折扣。
