# GPT-6 Astra 操控机械臂：放积木又快又省，插拼图还是卡在最后一步

> 原标题：GPT-6 Astra on robot arms

- 来源：Hacker News 首页
- 发布时间：2026-09-06T01:52:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55028
- 原文：https://openai.robocurve.org/gpt-6-astra/

## 摘要

Robocurve 让 GPT-6 Astra 直接控制 YAM 机械臂做了两个任务，跟 Claude Fable 5.1 正面比了一场。放红色积木进碗里，Astra 20 次成了 19 次（95%），Fable 5.1 只成了 8 次（40%）。Astra 平均每次花 2.5 分钟、0.94 美元，时间和成本都不到 Fable 5.1（6.8 分钟、...

## 推荐理由

这是一次带名字、带数字、带价格的实物对比，不是公关稿。两个任务一个分出高下、一个双双翻车，反而让数据更可信。对正在评估模型能不能进物理世界干活的人来说，这篇可以直接存下来当 benchmark 参考。没给 p1 是因为这只是第三方单次测试，不是官方发布，而且只测了两个任务，样本量还撑不起通用结论。

## 锐评

Robocurve 这次测试很直接：让 GPT-6 Astra 和 Claude Fable 5.1 分别控制同一款 YAM 机械臂，做两个任务。放红色积木进碗里，Astra 成功率 95%（20 次成 19 次），Fable 5.1 只有 40%。Astra 平均每次花 2.5 分钟、0.94 美元，时间和成本都不到 Fable 5.1 的一半。这个差距挺实在的，说明 Astra 在抓取和移动这类粗粒度操作上，视觉和动作规划配合得不错。

但一换到插拼图任务，两边都露怯了。Astra 和 Fable 5.1 都是 20 次只成 2 次，卡在最后对准凹槽那一步。Astra 虽然输出 token 少（平均 2.7k vs 10.5k），单次成本 1.36 美元比 Fable 5.1 的 2.18 美元便宜，但成功率没区别。这暴露出当前模型在需要毫米级力控和空间对齐的精细操作上，能力还差一截。

要注意的是，测试只跑了 20 次，样本量小，而且只用了 Robocurve 自己搭的 Inspect Robots 框架，换一套机械臂或任务指令，结果可能不一样。正文没披露 Astra 在插拼图失败时的具体错误模式，也没说模型是否用了额外的微调或提示工程。如果 Astra 在精细操作上只是靠更快的推理省了钱，而不是解决了对齐问题，那这个优势就只限于简单任务。
