# Ornith-1.0 开源模型家族发布，专做编程智能体，从 9B 到 397B 全都有

> 原标题：Ornith-1.0 开源模型家族发布，专注 Agentic Coding 全参数规模

- 来源：AI HOT 精选
- 发布时间：2026-06-25T15:30:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40544
- 原文：https://x.com/berryxia/status/2070167806700908957

## 摘要

Ornith-1.0 是一套专门为“让模型自己动手写代码、改代码、跑命令”设计的开源模型，覆盖 9B、31B 两个稠密版和 35B、397B 两个混合专家版，全部 MIT 协议。它在 SWE-Bench Verified 上拿了 82.4 分，Terminal-Bench 2.1 上 77.5 分，都是开源里目前最高的。训练方法有点意思：用强化学习同时...

## 推荐理由

我会先打个折：分数是官方自己报的，还没看到第三方复现或真实项目里的反馈，所以别急着当定论。但四个尺寸全 MIT 协议、同时刷高 SWE-Bench 和 Terminal-Bench 两个榜，对做编程 agent 的人来说确实解渴——不用再拿通用模型硬改，也不用担心许可证卡脖子。训练上把代码生成和终端操作放一起用 RL 优化，思路比单刷代码榜更贴近实际 agent 工作流。正文没披露训练数据和具体 RL 细节，这点先别太激动。

## 锐评

Ornith-1.0 这套模型专门干一件事：让模型自己动手写代码、改代码、跑终端命令，不是只给建议。四个尺寸从 9B 到 397B 全 MIT 开源，SWE-Bench Verified 拿了 82.4 分，Terminal-Bench 2.1 拿了 77.5 分，都是开源里目前最高的。训练方法有点意思，用强化学习同时优化任务脚手架和最终方案，相当于让模型边干活边改进自己的执行框架，不是死板地按预设流程走。

但正文没披露训练成本、推理延迟和硬件要求。397B 的 MoE 模型虽然参数大，实际激活多少参数、本地跑要几张卡，这些关键信息全缺。GGUF 版本说支持 Ollama 本地跑，但 397B 模型在消费级硬件上能不能跑得动，先别太激动。另外 SWE-Bench 分数高不代表真实项目里也好用，基准测试和实际工程场景的差距一直存在。

还缺的是：这套模型在复杂多文件项目里的表现、跟闭源模型比如 Claude 在同样任务上的对比、以及长期自主编程时会不会越改越乱。如果训练成本确实低，那 MIT 协议下直接拿来微调做内部工具挺划算；如果成本高但没公开，就得等社区实测反馈了。
