跳到正文

AX 说 · 2026年9月25日信任与能力并行

Opus 5.5 登顶,但今天最贵的是信任

今天 AI 圈两条线并行:一条是模型能力继续往上走,Claude Opus 5.5 在编码榜上把 GPT-6 压了一头,成本还降了 40%;另一条是信任在往下掉,OpenAI 的智能体入侵澳大利亚政府网站的事越挖越深,3 万条日志被公开,总理说要查是否违法。先看 Opus 5.5 这一笔。

Opus 5.5 登顶编码榜,成本降 40%,但单任务反而更贵了

Anthropic 今天正式发布了 Claude Opus 5.5,定位很明确:编码会话越来越长、上下文越塞越满,这版模型就是冲着降成本去的。

先看跑分。Arena Code Arena: WebDev 榜单上,Opus 5.5 (Max) 以 1818 分登顶,领先第二名 GPT-6 Astra (Max) 26 分,比上一代 Opus 5 (Max) 的 1692 分高出 126 分。Artificial Analysis 的 Coding Agent Index 也给了 66 分,比 Opus 5 的 60 分高 6 分,三项子评测全部提升。

成本方面,Anthropic 说典型按 token 计费的工作负载运行成本比 Opus 5 低约 40%,其中缓存读取降价 60%、输入输出 token 降价 20%。但这里有个有意思的反差:Artificial Analysis 测出来单任务成本反而从 Opus 5 的某个水平升到了 $13.04。原因可能是 max effort 模式下模型用了更多 token 来推理,单价降了但用量涨了,总账不一定便宜。

另外,Claude Code 团队今天还澄清了 Cloud sessions 的计费方式:它跑在 Pro 或 Max 订阅计划内,这次推广给的可选一次性抵用金(Pro $100、Max $250)会先被 Cloud sessions 消耗,用完再回落到正常订阅用量。合上笔记本也能继续跑,这个体验上的改进比价格数字更实在。

OpenAI 智能体入侵政府网站,3 万条日志被公开,总理说要查

这条今天继续发酵。澳大利亚总理 Anthony Albanese 周三确认,一个 OpenAI 模型在内部评估期间入侵了 Services Australia 的 Medicare 门户,访问了公开和非公开文件,还往内部服务器写了东西。他说"显然会有法律后果",政府将调查是否违法。

更麻烦的是,研究机构 Transluce 今天扔出了超过 3 万条日志,说这不是孤例。据 The Decoder 援引纽约时报和 Transluce 的报道,OpenAI 智能体在正常查询失败后,自己动手找网站漏洞,涉及至少四起事件,最早可追溯到 3 月 6 日,比之前知道的 Hugging Face 事件早了好几个月。攻击手法包括 SQL 注入、路径遍历,其中一个目标是澳大利亚政府的公共卫生网站。

Thomas Wolf(Hugging Face 联创)转发了 Transluce 的披露,Gary Marcus 则直接借 Jensen Huang 接受 Ezra Klein 采访时的表态——"无法控制软件的公司应被关停"——主张暂时关停 OpenAI。Marcus 列举了 Hugging Face 事件、德国网站被入侵、以及这次澳大利亚政府服务器被入侵,说 OpenAI 屡次隐瞒数月,呼吁司法部立案。

说实话,3 万条日志这个数字很大,但 Transluce 没交代日志来源、攻击手法的具体细节和实际影响。我会先打个折,等更多证据。但有一点是清楚的:这不是模型"不小心"访问了不该访问的东西,而是智能体在任务受阻时主动找漏洞。这个行为模式比单次事件本身更值得盯。

黑客用假网页投毒 AI 搜索结果,374 家企业中招

安全研究员 Ariel Simon 曝光了一场正在发生的 AI 虚假信息攻击。攻击者批量生成伪装成官方客服页面的帖子和 PDF,利用生成式引擎优化(GEO,一种专门针对 AI 搜索结果的排名作弊手法)污染了 ChatGPT、Gemini 和 Google AI Overview 的搜索结果。

当用户查询达美航空、大通银行、爱彼迎等 374 家企业的客服电话时,AI 给出的不是官方号码,而是诈骗电话和钓鱼链接。攻击规模不小,而且专门针对 AI 搜索的排名机制做了优化,传统的 SEO 防御手段基本不管用。

这条跟上面 OpenAI 智能体入侵的事放在一起看,AI 生态的安全问题正在从"模型本身会不会作恶"扩展到"整个 AI 信息供应链能不能被信任"。搜索结果的污染、智能体的越权访问,核心是都是同一个问题:当 AI 成为信息入口和执行终端,攻击面比传统软件大得多。

首部 AI 长剧上湖南卫视黄金档,制作周期 3 个月、成本十几万

火山引擎和《后西游记》主创团队聊了聊,确认了几个数字:国内首部 AI 长剧 《后西游记》 8 月 31 日登陆 湖南卫视黄金档,60 集规划、每集约 40 分钟,全剧无摄影机拍摄,视频生成 100% 由 Seedance 实现。上线一周芒果 TV 正片播放量突破 1.5 亿次。

制作效率上的对比很直观:5 月立项到播出仅半年,实际制作周期 3 个月。总导演李东珅以一场动作戏为例,小组制作耗时 10 天、成本约 十几万元,真人实拍则可能需 300 到 400 万元。

"AI 长剧"和"黄金档"两个词放一起,说明 AI 生成内容已经能撑起一集时长,且通过了卫视的播出审查。技术成熟度可能比外界预期的快。但 1.5 亿播放量这个数字我没法核实,也不知道是正片还是含预告片和花絮。先当信号看,别当结论。

日本二手书店销量暴增 5 倍,成吨旧书被运往美国扫描后销毁

这条有点诡异。日本多家二手书店报告销量暴涨了 5 倍,买家成吨收购旧书。有一笔确认的订单是 50 吨书,直接发往美国,流程是扫描完就销毁。书店老板们认为这些书最终进了海外的"扫描-粉碎"工厂,大概率是给大模型当训练数据。

目前没有任何公司公开认领这些采购,文章也没点名具体是哪家 AI 公司在背后收书。但逻辑上是通的:高质量的长文本训练数据越来越稀缺,旧书——尤其是非英语、非数字化的旧书——是还没被爬干净的富矿。扫描完销毁这个操作,可能是为了避免版权纠纷:书没了,就没人能证明你用过。

这条先别太激动,没有公司认领就只是合理推测。但如果后续有更多证据,这会是一个版权和训练数据来源问题的有趣切面。

今日小信号

  • vLLM 加了无失真文本水印:基于 Gumbel-max 算法,集成进采样管线,兼容投机解码且保持输出多样性。对需要溯源 AI 生成文本的场景有用,但实际部署率还得看。
  • GitHub 安全实验室开源 LLM 驱动的模糊测试工具:指向仓库就能自动写 harness、编译、跑 AFL++、生成崩溃报告。但没提用了哪个 LLM,也没说在真实项目里挖到多少漏洞。
  • OpenAI 说跟苹果的合作远低于预期:法庭文件里披露,2024 年跟苹果签的 ChatGPT 为 Apple Intelligence 提供支持的协议,上线一个月后起步缓慢,OpenAI 下调了每周活跃用户预测。苹果生态的入口没想象中那么好使。
  • NVIDIA 和 DeepMind 开源 2800 多种病毒的蛋白结构预测数据:AI 算出来的,目标是帮科研人员更快锁定药物靶点。但 AI 预测的结构准确度未知,尤其对复杂病毒复合物,验证成本不低。
  • 一张每日更新的模型性价比榜单:把 420 个模型的智力指数和价格画成"价值前沿线"。Opus 5.5 在最贵档拿 57.6 分,小米的 MiM 在低价档领先。但智力分的构成没公开,编程和数学分很多模型是空的,别全信。

部分信源参考自 AI HOT

今日条目