# Ploy 把生产环境 AI 智能体从 Claude Opus 4.8 换到 GPT-5.6：快了 2.2 倍，成本降了 27%

> 原标题：Migrating a production AI agent to GPT-5.6: 2.2x faster, 27% cheaper

- 来源：Hacker News 首页
- 发布时间：2026-07-12T17:13:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44008
- 原文：https://ploy.ai/blog/migrating-a-production-ai-agent-to-gpt-5-6

## 摘要

Ploy 的 AI 智能体负责搭建真实的营销网站，过去四个月里没有模型能打过 Claude Opus，直到 GPT-5.6 Sol 出现。换模型后，网站生成时间从 8 分钟缩到 3 分 42 秒，单次成本从 3.06 美元降到 2.22 美元，视觉评分还略高一点。但切换不是即插即用：他们的评估工具、工具调用格式、缓存策略和推理回放都得重写，因为整个技术...

## 推荐理由

Ploy 发了篇当天从 Claude Opus 切到 GPT-5.6 的迁移报告，有具体的延迟和成本数字，还有工程细节，不是厂商软文。我会先打个折：这只是单团队经验，正文没披露失败案例和边缘场景，能不能复现不好说。但信息密度和时效性够，给 featured。

## 锐评

这条博客最值钱的部分不是跑分，而是他们踩过的坑。Ploy 的 AI 智能体负责搭建真实的营销网站，过去四个月里没有模型能打过 Claude Opus，直到 GPT-5.6 Sol 出现。换模型后，网站生成时间从 8 分钟缩到 3 分 42 秒，单次成本从 3.06 美元降到 2.22 美元，视觉评分还略高一点。

但切换不是即插即用。他们的评估工具、工具调用格式、缓存策略和推理回放都得重写，因为整个技术栈已经悄悄围绕 Opus 做了专门优化。比如 GPT-5.6 喜欢并行调用工具，直接打爆了原来按 Opus 串行风格设定的调用预算；评估器不支持批量文件读取，导致三分之一的初始失败案例其实是测试框架的锅，不是模型不行。

正文没披露 GPT-5.6 的 API 具体定价和上下文窗口大小，所以 27% 的成本降幅只能参考他们自己的用量结构。另外，测试样本量很小（Opus 11 次、GPT-5.6 10 次），统计上还不太稳。如果你也在考虑切模型，这篇的教训比跑分更有用：先修评估工具，再看分数。
