# 字节跳动发布 Seed2.1 系列模型，重点提升让模型干活时的交付稳定性

> 原标题：Seed2.1 正式发布，深入 AI 生产力

- 来源：AI HOT 精选
- 发布时间：2026-06-23T00:02:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40037
- 原文：https://seed.bytedance.com/zh/blog/seed2-1-%E6%AD%A3%E5%BC%8F%E5%8F%91%E5%B8%83-%E6%B7%B1%E5%85%A5-ai-%E7%94%9F%E4%BA%A7%E5%8A%9B

## 摘要

Seed2.1 系列模型已在豆包和 TRAE 上线，主打真实工作场景，而不是刷榜。在通用 Agent 任务上，Seed2.1 Pro 在 Agents' Last Exam 里排第一梯队，在测手机操作的 MobileWorld 上拿了最高分，跨工具任务的平均步数减少了 16%。写代码方面，开发者盲测中对比 Claude Opus 4.6 有 59.1%...

## 推荐理由

Seed2.1 是字节跳动的新旗舰，主打真实工作场景而非刷榜，在 Agent、代码、多模态三个方向都给了可验证的指标。Agent 考试排第一梯队、手机操作最高分、跨工具步数减少 16%，代码盲测胜率 59.1% 直接对标 Claude Opus 4.6，这些数字让发布有分量。我会先打个折：正文没披露参数量、训练数据和定价，所以模型实际规模和部署成本还不清楚，这点先别太激动。但作为国内大厂旗舰更新，且已上线产品，给 82 分 featured 合理。

## 锐评

Seed2.1 这次把重心放在了“干活”上，而不是跑分。它强调在真实工作场景里的表现，比如在手机操作评测 MobileWorld 上拿了最高分，跨工具任务的平均步数减少了 16%，说明模型在理解屏幕、切换应用、调用工具这些连续动作上更流畅了。写代码方面，开发者盲测中对比 Claude Opus 4.6 有 59.1% 的胜率，这个数字挺实在，但要注意这是字节自己组织的评测，样本量和任务类型没细说，外部公平性还得看第三方复现。

多模态理解在几个图表和文档评测上拿了 SOTA，对处理 PDF、报告这类非结构化信息有帮助。不过整篇公告没提参数量、推理成本和最大上下文长度，这些对实际落地很关键。另外，模型已经在豆包和 TRAE 上线，API 也同步到火山引擎，想试的话可以直接跑跑看，别光看纸面数据。
