# Claude Opus 4.8 发布，Claude Code 学会写脚本派子任务并行干活

> 原标题：Opus 4.8

- 来源：Ben's Bites
- 发布时间：2026-06-02T13:29:05.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33048
- 原文：https://www.bensbites.com/p/opus-48

## 摘要

Anthropic 发了新模型 Claude Opus 4.8，主要卖点是 Claude Code 现在能先写一个调度脚本，再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒，这并不证明松散的 multi-agent 架构靠谱，反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”，更诚实、更少...

## 推荐理由

HKR 三项都成立，因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据，所以分数压在 85–94 这个区间。

## 锐评

Anthropic 发了 Claude Opus 4.8，核心卖点是 Claude Code 现在能先写一个调度脚本，再同时拉起多个子代理并行干活。这听起来像多智能体协作，但有开发者直接泼冷水：松散的 multi-agent 架构并不靠谱，反而是围绕小代理循环的确定性工作流更稳。模型本身被评价为“温和但有用的升级”，主要进步是更诚实，对自己代码里的缺陷没那么瞎。Every 的体感更积极，认为比 4.7 跳了一大步，在内部高级工程师基准上能和 GPT-5.5 掰手腕。但有个硬伤：Claude 的应用端体验还是比 Codex 乱。

跑分方面，它在 ARC-AGI-3 上拿了第一，分数是 GPT-5.5 的三倍，但 Datacurve 的新基准又把它排在 GPT-5.5 下面，只比 5.4 好一丢丢，而且消耗的 token 多得多，成本更高。这种基准打架的情况说明，模型强不强很看你测什么任务。另外，Anthropic 同时提交了机密 S-1 文件，并完成了 650 亿美元 H 轮融资，投后估值 9650 亿，今年很可能 IPO。

这条新闻缺的是 Opus 4.8 在真实生产环境里的延迟和成本数据，以及那个并行子代理功能在复杂项目里的失败率。基准分数看看就好，别急着下结论。
