跳到正文

#其他

今日 3 条

9月23日星期三

Hacker News 首页

Claude Code 的 AGENTS.md 支持被远程开关卡住,关掉遥测就静默失效

Claude Code 2.1.277 说支持 AGENTS.md 了,但作者实测发现,这个功能被一个叫 tengu_agents_md_mod 的远程开关控制,默认是关的。只要你在环境变量里关了遥测或非必要流量,本地的 AGENTS.md 文件就会被跳过,而且没有任何提示。作者用金丝雀词测试确认了这一点,并指出在 Bedrock、Vertex 等第三...

推荐理由:这不是一篇情绪化吐槽,而是有代码证据的产品行为揭露。作者一路追到远程开关 tengu_agents_md_mod,确认 AGENTS.md 在遥测关闭时被静默忽略,H、K、R 全中。影响面限于 Claude Code 用户,但信息密度和验证方法都扎实,值得 featured。

OpenAI News

Ringg 用 GPT-5.6 把客服成本砍了 90%,65% 的电话 AI 直接搞定

印度客服平台 Ringg 接入了 OpenAI 的 GPT-5.6 系列模型,每月处理超过 700 万通电话,其中最多 65% 的请求由 AI 直接解决,客户满意度评分 4.8(满分 5)。他们的做法是把不同任务分给不同模型:实时通话用 GPT-4.1,通话后分析(摘要、情绪分类)用 GPT-5.6 Terra,模型评估和提示词优化用 GPT-5.6 ...

OpenAI News

Sam Altman 在联合国安理会发言:AI 失控和权力过度集中是两大风险

Sam Altman 9 月 23 日在联合国安理会把 AI 风险归为两类:一是人类对 AI 失去控制,二是最强大的模型被极少数人攥在手里。他明确说 OpenAI 过去单方面踩过刹车,以后还会这么做,别拿竞争压力当借口乱冲。他也反对任何一方声称“只有我能被信任掌握最强模型”。整篇是演讲实录,没披露新产品或具体政策细节。

推荐理由:Altman 这次在联合国安理会没发新产品,但他把 AI 风险讲成了两个能抓住的威胁——失控和权力集中,还公开承认 OpenAI 主动减速过,并拒绝“只有我信得过”的论调。这对天天在速度和安全之间找平衡的从业者来说,是个值得关注的信号。

TechCrunch · AI

Ema 拿了 7700 万美元 B 轮,想用 AI 智能体团队吃掉企业软件和 IT 服务

Ema 这家公司做的是把多个 AI 智能体编成团队,塞进 HR、IT、财务这些部门里跑流程,替代一部分传统软件和人力外包。这轮 7700 万美元由 Creaegis 领投,Accel、Section 32 和 Prosus 跟投,总融资到了 1.4 亿美元,估值比上一轮翻了四倍多。他们现在有超过 50 个企业客户,包括 Google 和微软。不过正文没...

AI HOT 精选

Cursor 给长时间跑的 agent 省 token,用户成本降了 7%

Cursor 从四个地方下手,把 agent 长时间任务的 token 消耗砍掉了 7%,而且没掉质量。他们先把系统提示词精简了约 66%,因为现在的模型不需要手把手教了;接着把 60% 的内置工具定义从每次请求必带改成用时再加载,这跟之前给 MCP 工具省下 46.9% token 的思路一样;还压缩了文件读取内容,并策略性地用子 agent 分担任...

推荐理由:Cursor 官方博客披露了四个降低 agent 长任务 token 消耗的具体手段,数字和方法都给了,对 Cursor 重度用户有实操参考价值。但本质是一次增量工程优化,不是产品级更新,影响面局限在 Cursor 用户群,所以放在 featured 里当一条扎实的技术快讯就好。

AI HOT 精选

Cursor 发布两个开发机器人:Rollouts 盯上线、Security Reviewer 查漏洞

Cursor 推出了两个机器人,专门处理代码合入主干后的脏活累活。Rollouts 会跟踪一个改动从 PR 到上线的全过程,把上线后的监控数据跟部署前的基线做对比,一旦发现性能退化,就通知作者、暂停灰度或者直接生成回滚 PR。Security Reviewer 会在每个 PR 上跑一遍,端到端追踪用户输入在代码里的流向,把平均审查时间从 4.8 分钟压...

推荐理由:Cursor 这次发的不是模型,是两个嵌在工作流里的机器人,一个管上线后的性能监控和自动回滚,一个管 PR 里的安全审查。Rollouts 会对比部署前后的基线,发现退化就自动暂停灰度或生成回滚 PR;Security Reviewer 端到端追踪用户输入的流向,把审查时间从 4.8 分钟压到 1.2 分钟。对天天跟 PR 和部署打交道的开发者来说,这两个机器人补的是日常最耗神的环节,实用性强。不过正文没披露误报率、覆盖的监控指标范围,也没说安全审查的漏报率,这些会直接影响实际省下的时间。整体是增量功能更新,但三个维度都踩中了,重要性维持 78 分。

Hacker News 首页

Token 便宜到不值得计费了

作者 jyn 用多张图表说明,AI 推理成本每年都在以数量级的速度下降。GPU 能效大约每两年翻一番,到 2026 年,完成同样任务的模型成本比 2025 年底便宜了两个数量级。像 vLLM 这样的推理引擎,每年还能额外带来 10% 到 50% 的吞吐量提升。文章判断,一两年内大模型会像水电一样成为计算基础设施,三到六年内,消费级硬件就能在本地跑通当前...

推荐理由:这篇不是泛泛说“AI 越来越便宜”,而是用三条下降曲线把账算出来了:GPU 能效翻番周期、推理引擎的优化红利、以及本地部署的时间窗口。数据来源和图表都有,判断有依据。扣分点在于这是个人博客,不是机构报告,但观点和论证密度够高,对正在算推理成本的人有直接参考价值。

AI HOT 精选

Qwen 发了五个音频模型,语音识别、合成和实时对话都更新了,还加了两个创作和理解的新模型

Qwen-Audio-3.1 这次一口气放出五个模型,把之前的语音识别(ASR)、语音合成(TTS)和实时对话(Realtime)都升了级,另外新加了 TTS-Next 和 ASR-Next,分别用来做音频创作和更深层的音频理解。Realtime 模型现在能随时被打断,检测到你情绪低落时还会放慢语速、用更共情的方式回话。价格砍得挺狠:TTS 降了约七成...

推荐理由:Qwen 语音全家桶一次更新五个模型,不是简单刷版本号。我会先打个折:正文没披露 ASR-Next 和 TTS-Next 的具体能力边界和评测数据,这点先别太激动。但 TTS 降价约七成、Realtime 支持情绪感知打断,都是可验证的硬信息,对从业者选型和成本估算有直接参考价值。

纽约时报中文网

托马斯·弗里德曼:AI 已经会自我改进和复制,中美再不联手设护栏就晚了

托马斯·弗里德曼拿新冠疫情初期特朗普那句“天气暖和了病毒就会奇迹般消失”来类比当下对 AI 风险的轻视。他指出,最新 AI 模型已经表现出自我改进、自我复制和自我保存的能力,而特朗普政府却把 AI 灭绝人类的风险斥为“骗局”,担心监管会戳破市场泡沫。弗里德曼呼吁中美在周四的峰会上达成 AI 安全护栏协议,并引述专家观点:好的监管能建立信任、推动市场,就...

推荐理由:弗里德曼的署名本身就有分量,他把 AI 安全直接摆到中美峰会桌上,时机和作者权重都够。但文章本质是评论,没有一手数据或实验,所以分数卡在 78。

AI 群聊日报

Anthropic Opus 5.5 和 OpenAI Sol/Luna 同日发布,群友拆解性价比与迁移踩坑

Anthropic 毫无预兆地放出 Opus 5.5,在终端操作和编程任务上跑分领先,但 max 档输出 token 量是 GPT-6 Astra 的三倍多。群友分析发现 high 档是性价比甜区:比 medium 多花 36% 的钱,智能指数涨 3 分,再往上边际成本陡增。两小时后 OpenAI 上线 Sol 和 Luna,Luna 输入价格打到每百...

推荐理由:Anthropic Opus 5.5 无预警发布,OpenAI 两小时后用 Sol 和 Luna 回击,一天内三次模型更新。日报提供了用户实测的 effort tier 性价比拆解和 prompt 迁移经验,信息密度高。扣分点:正文没展开 Sol/Luna 的具体跑分对比,但整体信号足够强,维持 featured。

AI HOT 精选

OpenAI 放出 GPT-6 系列新模型 Sol 和 Luna,API 价格直接打五折

OpenAI 在 GPT-6 家族里加了两个新模型:Sol 和 Luna。Sol 定位是干复杂编程和专业任务的,Luna 则负责速度快、量大的日常活儿。最直接的变化是价格——API 调用费比上一代 GPT-5.6 的推广价砍了一半,其中 Luna 的输出价格实际降了 58%,从每百万 token 1.2 美元降到 0.5 美元。性能上,Sol 在 Au...

推荐理由:OpenAI 一次放出两个新模型,还把价格砍到上一代推广价的一半,这个动作本身就值得上头条。Sol 的 Aura 分数和 Luna 的 0.5 美元输出价都是硬数字,能直接拿来判断性价比。我会先打个折——正文没给全量基准表,所以性能这块只能看单点,但价格信号已经足够强,做产品和做研究的人都会关注。

纽约时报中文网

美中元首峰会聊了 AI,但两边戒心太重,实质进展很难

这周美中高层会晤,AI 是核心话题。双方同意建一个 AI 安全热线,两个月后可能在深圳再谈,但分析人士普遍不看好能谈出具体结果。特朗普政府放松了芯片出口管制,允许英伟达卖 H200 芯片给中国,同时美方又指责中国公司用“蒸馏”技术(用小模型反向学习大模型输出)偷 AI 模型。参议员沃伦公开警告特朗普别只顾着照顾 AI 行业的生意,而不向中方施压谈 AI...

推荐理由:这条新闻的实质是政策博弈,不是产品或技术突破。我会先打个折:信号很强,但对一线做模型的人,眼下能立刻动手调整的东西不多。正文没披露安全热线的具体机制,也没说 H200 放松是临时还是长期,这些缺口让判断只能停在“值得盯着”的层面。

彭博科技

软银发创纪录高息垃圾债,为 AI 赌注续费

软银启动了一笔巨额垃圾债(高收益债)发行,用来给它的 AI 投资输血。这次给的票面利率创了纪录,说明市场觉得软银在 AI 上的押注风险不小,要求的回报也更高。不过这也表明孙正义愿意付更高的资金成本,留在牌桌上。正文没披露具体票息数字。

OpenAI News

ChatGPT 广告开到东南亚七国和台湾,免费用户会看到广告

OpenAI 把 ChatGPT 广告业务推到了印尼、马来西亚、菲律宾、新加坡、泰国、越南和台湾,现在覆盖超过 60 个国家。广告只对 Free 和 Go 用户展示,Plus、Pro、Enterprise 付费用户不受影响。OpenAI 强调不会把对话数据卖给广告主,广告也不会影响 ChatGPT 的回答内容。这块业务跑得很快:上线不到 200 天,到...

彭博科技

阿里将在欧洲和中东新建数据中心,为AI扩张铺路

阿里计划在欧洲和中东新建数据中心,支撑AI业务出海。正文没披露具体选址、投资额和时间表,所以目前只能当战略方向看。如果落地,意味着阿里云要在海外跟AWS、Azure正面抢AI推理和训练的单子,对国内出海企业来说也多了一个就近部署的选择。

AI HOT 精选

Qwen-Image-2.1 在 Arena 图像编辑和文生图两个开源榜都拿了第一

通义千问的 Qwen-Image-2.1 在 Arena 的图像编辑和文生图榜单上都是开源模型第一。图像编辑得分 1367,总榜排第 16,只比第 15 名的 GPT-Image-1.5-high-fidelity 低 3 分。正文没提参数量、模型架构和具体开放时间,这点先别太激动。

推荐理由:Qwen-Image-2.1 在 Arena 图像编辑榜拿到开源第一、总榜第 16,只落后 GPT-Image-1.5 三分,这是实打实的跨模型对比信号。分数定在 78 而不是更高,是因为正文完全没提参数量、模型架构和发布时间——信息缺口不小,我会先打个折。

AI HOT 精选

AI 最赚钱的市场不在最前沿,而在中间那层

Tunguz 用网关数据算了一笔账:企业真正花钱买的不是最强模型。Anthropic 的 Opus 系列五次发布都没涨价,一直定在输入 5 美元、输出 25 美元每百万 token,直到昨天才首次降价;OpenAI 更狠,Luna 先砍 80%,昨天又砍 50%。开源模型更夸张,跑着大部分 token 量,价格比闭源模型混合价低 86%。最贵最强的 F...

推荐理由:Tunguz 用网关支出数据算了一笔反直觉的账:最贵的 Fable 5.1 在 12 天内只拿到 3.7% 的支出,企业真正花钱买的是中段模型。Opus 五次发布都没涨价,开源模型跑着大部分 token 量却比闭源混合价低 86%,这些数字说明预算流向的不是最强而是最划算的模型。我会先打个折——正文没披露网关覆盖的企业类型和样本量,所以这个结论的普适性还得看具体场景,但方向本身对做应用和管成本的人很有参考价值。

AI HOT 精选

Modal 公开万亿参数编码 Agent 推理优化细节:单副本性能提升 2.8 倍,把烧钱服务做到价格有竞争力

Modal 工程团队写了一篇长文,拆解他们怎么为 Moonshot AI 的 Kimi K2.6 模型做推理加速,用来驱动编码 Agent。核心成果是把单副本(replica)性能提了 2.8 倍(按单用户交互体验算)和 5.6 倍(按多用户并发吞吐算),让原本贵到没法用的服务变得价格有竞争力。文章先讲工作负载:万亿参数的混合注意力 MoE 模型,输入...

推荐理由:Modal 这篇工程拆解直接甩出两个硬数字:单副本交互体验提了 2.8 倍,多用户并发吞吐提了 5.6 倍,对搞推理优化的人来说是能直接拿来对标的参考。没给更高分是因为这属于基础设施层的优化,不是模型能力或产品更新;但文章把万亿参数 MoE 模型怎么从贵到用不起做到价格有竞争力讲清楚了,对从业者有实际价值。

AI HOT 精选

Claude Opus 5.5 和 GPT-6 Sol/Luna 同日发布,新一轮价格战开打

Simon Willison 对比了同一天发布的三个模型。GPT-6 Luna 输入价格降到每百万 token 0.1 美元,是 GPT-5.6 Luna 的一半,也是 OpenAI 有史以来最便宜的模型之一。GPT-6 Sol 也比前代便宜了一半。Claude Opus 5.5 降了 20%,但价格仍是 GPT-6 Sol 的两倍。在测试中,Opus...

推荐理由:三个主力模型同一天发布,Simon Willison 给了第一手价格对比和初步体验。GPT-6 Luna 输入每百万 token 0.1 美元是 OpenAI 史上最低,直接改变了应用开发者的成本结构。不过文章只给了价格和简短测试印象,没有完整 benchmark,实际能力还得等更多评测。

Hacker News 首页

Google 把 AI 助手 CC 做成了家庭群聊工具

Google 把之前个人用的 AI 助手 CC 扩展成家庭群组版,一家人在一个聊天窗口里共用。CC 能记住每个成员的偏好和日程,帮忙协调活动、设提醒。正文没披露支持哪些聊天平台、收费多少、以及底层用的什么模型。

FT · 科技

特朗普拒绝建立全球AI监管机构,称其为“全球主义阴谋”,直接打脸英国市长伯纳姆的倡议

特朗普明确反对成立一个管理人工智能的国际组织,把这叫做“全球主义者的阴谋”。这等于直接否定了英国大曼彻斯特市长安迪·伯纳姆一直在推动的全球AI治理框架。伯纳姆之前呼吁各国合作,防止AI技术被少数科技巨头垄断。白宫这次拒绝,意味着美国短期内不会加入任何多边监管框架,全球协调监管AI的前景一下子暗淡了不少。

推荐理由:FT独家消息,特朗普直接否了成立国际AI监管机构的提议,把伯纳姆推的全球治理框架给顶了回去。政策信号很明确,冲突也够强,三条线都踩中了。分数维持在78(featured门槛),因为这是政治表态,不是已落地的法规,实际冲击还得看后续动作,所以没往上调。

AI HOT 精选

GPT-6 Sol 和 Luna 跑分跟前代差不多,但价格直接砍半

Artificial Analysis 的评测显示,GPT-6 的两个新模型 Sol 和 Luna,在智力指数上的得分跟 GPT-5.6 系列基本持平,没拉开明显差距。但 token 定价降了大约一半,跑一次任务的成本直接减半。他们放出的图表就是 OpenAI 各代模型在“聪明程度”和“单任务成本”之间的取舍曲线。正文没给出具体分数和定价数字,所以这个...

推荐理由:GPT-6 发布后第一个第三方性价比评测,成本减半、智力持平这个结论对选模型决策是直接信号。扣分是因为正文只给了图表趋势,没披露具体分数和定价数字,信息密度不够扎实。

TechCrunch · AI

Snorkel AI 估值翻近三倍到 35 亿美元,拿了 3.5 亿做 AI 训练数据生意

Snorkel AI 刚完成 3.5 亿美元的 E 轮融资,估值 35 亿美元,比 17 个月前 13 亿美元的估值翻了近三倍。这家公司主要帮 AI 实验室和大企业做两件事:一是批量生成训练数据,二是搭建模拟环境让模型在里面练手。客户名单里有 OpenAI、Anthropic、Google 和微软。CEO Alex Ratner 说年经常性收入(ARR...

推荐理由:Snorkel AI 估值翻三倍到 35 亿,客户名单里全是头部大模型公司,这确实是 AI 基础设施领域的一个信号。但训练数据工具属于幕后工作,从业者共鸣不强,所以 R 轴没打勾,整体放在 featured 这一档。

AI HOT 精选

OpenAI 推出 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6 促销价还低一半

OpenAI 往 GPT-6 家族里塞了两个新模型:Sol 和 Luna。它们继承了 GPT-6 Astra 的大部分本事,但跑得更快、更便宜,适合大规模调用。API 定价直接比 GPT-5.6 的促销价再砍 50%,官方说靠的是缓存和推理效率的提升。不过正文没给出任何跑分、延迟数据或上线时间,实际效果和速度还得等实测。

推荐理由:OpenAI 往 GPT-6 家族塞了 Sol 和 Luna 两个新模型,API 价格比 GPT-5.6 促销价再砍一半,对开发者是个实打实的成本信号。分数没给更高是因为正文没给任何跑分、延迟数据或上线时间,实际效果还得等实测,这点先别太激动。

Latent Space

和 John Platt 聊 AI 搞科研:他拿过奥斯卡,有两颗小行星,你 sklearn 里的算法也是他写的

John Platt 是 Platt scaling 和 SMO 算法的发明人,现在在 Google 带队做 ERA 项目。ERA 的思路是把科学问题变成一个可打分的任务,然后用 Gemini 自动迭代实验,搜索方式类似蒙特卡洛树搜索。从 Gemini 2.0 换到 2.5 之后,这个系统直接从跑不通变成能高效产出,已经产出了至少 10 篇论文。Pla...

推荐理由:John Platt 亲自聊 Google 的 ERA 项目,把科学实验变成 Gemini 自动搜索迭代的玩法。Gemini 2.5 让系统从不可用变成高效产出 10 篇以上论文,这个转折点很实在。因为是播客,具体实现细节得去听才能挖,但方向和初步验证已经够吸引人。

AI HOT 精选

OpenAI 给 GPT-6 的提示词缓存加了命中率仪表盘和诊断工具,默认就能省更多钱

GPT-6 的提示词缓存现在默认命中率更高,只要 30 分钟内复用相同的前缀内容就能拿到折扣。新上线的仪表盘可以看缓存的命中率走势,诊断工具能告诉你哪次没命中是因为工具定义变了、具体浪费了多少 token(比如一次 tools_changed 就丢了 5,629 个 token)。开发者现在可以手动设缓存断点、在不破坏缓存的前提下调整推理强度,还能提前...

推荐理由:这是 OpenAI 官方发的 GPT-6 缓存改进,不是新模型,但诊断仪表盘和手动断点对 agent 开发者是实打实的成本优化。给了 30 分钟复用窗口、5,629 token 浪费等具体数字,信息量够,所以重要性给 82,放在 featured 里。

The Verge · AI

Rabbit 的新 AI 代理不用买 R1 硬件也能用

Rabbit 发布了 OS3,一个跑在云端但能在 Windows、Mac 和 Linux 本地操作的“代理操作系统”。一个账号可以绑最多五台设备,系统会自动选文件、应用和模型来干活。你还能通过桌面网站、Telegram 或 iMessage 访问它。正文没提定价、发布日期,也没说 OS3 和 R1 原系统到底有啥区别。

TechCrunch · AI

高通发了两款新手机芯片,重点是把 AI 助手和模型塞进手机本地跑

高通在骁龙峰会上发布了骁龙 8 Elite Gen 6 和更高端的 Extreme 版本。两款芯片都主推端侧 AI:新的感知中枢能在本地跑最高 2 亿参数的小模型,用来做语音转文字、区分说话人,并根据使用习惯记住偏好来自动执行任务。Extreme 版号称能在手机上跑通一个 300 亿参数的混合专家模型,实现全程语音对话的 AI 助手。不过正文没提功耗、...

Hacker News 首页

JavaScript 的中年危机:生态赢了,但开发者正在失去对工具链的控制

JavaScript 满 30 岁了,生态比以往都大,但它的打包工具、格式化工具、linter 正在被 Rust、Go、Zig 重写。作者说,用 Rust 重写一个 bundler 能快 10 倍,但代价是能看懂并维护这些工具的 JS 开发者变少了。源码还是开源的,但贡献的门槛在变高。文章没给解决方案,只提了个醒:速度不是免费的,我们正在用可维护性换毫秒。

AI HOT 精选

GPT-6 Sol 和 Luna 评测:价格砍半,但知识类任务表现有退步

OpenAI 新发布的 GPT-6 Sol 和 Luna 把价格直接砍了一半:Sol 输入/输出每百万 token 降到 2/10 美元,Luna 降到 0.1/0.5 美元。在 Artificial Analysis 的智能指数跑分中,Sol 单次任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元,整体分...

推荐理由:OpenAI 把 GPT-6 价格砍半,Sol 单次任务成本 1.06 美元,Luna 0.07 美元,但能力变化不是一边倒的好——Luna 在 Coding Agent 指数上还倒退了。有第三方跑分数据撑着,对开发者做决策很实用。没给 p1 是因为这属于模型迭代的价格调整,不是底层架构级的大新闻。

Hacker News 首页

十个 Claude Opus 5.5 智能体花 15 小时协作,搞出了一个有正式数学证明的最短路径算法 C-HD

Vals 让十个 Claude Opus 5.5 智能体在留言板上协作,15 小时内产出了一个叫 C-HD 的新最短路径算法,并用 Lean 语言给出了完整的形式化证明。算法处理的是有向图、非负实数权重的精确最短路径问题。它的核心思路是:在局部搜索时,把那些没让距离变短的边也算进搜索次数上限,从而限制重复劳动。在边数 m 不超过 n⌊(log₂ n)^...

推荐理由:十个 Claude Opus 5.5 智能体在留言板上协作 15 小时,产出一个带形式化证明的最短路径算法,这件事本身够新鲜,H 和 K 都站得住。但它是纯理论成果,没有工程挂钩,R 完全缺位,刚好卡在 featured 门槛上。正文没披露具体性能数字,这点先别太激动。

TechCrunch · AI

Meta 承认 Muse 就是照着 OpenClaw 做的

Meta 产品负责人 Nat Friedman 在 X 上发帖,说 Muse 这个 AI 助手在产品层面“大量借鉴了 OpenClaw”。之前很多早期用户就怀疑 Muse 本质上是给 OpenClaw 套了个更易用的壳,现在 Meta 算是部分承认了。Friedman 强调代码是从头写的,但连工作区里的文件名和内容都跟 OpenClaw 很像,这点他没否认。

推荐理由:Meta 产品负责人亲自下场承认借鉴,细节够实、冲突感也够,三个维度都踩中了。但这事本质上是产品设计和开源边界争议,不是技术突破,所以放在 featured 这一档刚好。

AI HOT 精选

五角大楼内部调查:过度依赖 Palantir 的 AI 系统,导致美军误炸伊朗小学,123 名儿童死亡

一份未公开的五角大楼调查报告指出,今年 2 月美军在伊朗战争首日误炸一所小学、造成 150 多人死亡的事件,是由一连串本可避免的失误造成的。核心问题之一是操作人员过度信任 Palantir 开发的 Maven Smart System 这个 AI 军事平台。他们指望系统能自动标记过时的情报,但系统反而因为数据库里没更新的旧信息,把这个学校当成革命卫队设...

推荐理由:五角大楼内部报告直接归因于Palantir Maven系统,标题数字冲击力强,三条轴全中。分数没给更高是因为Gizmodo是二手信源,且事件本身首先是军事新闻,但其中AI失效的教训对行业有直接的警示价值。

Hacker News 首页

五角大楼报告:过度依赖 AI 导致美军导弹误炸伊朗学校

五角大楼一份调查报告指出,2025 年美军一次导弹袭击误炸了伊朗一所学校,核心原因是人太相信 AI 的目标识别结果。当时系统把学校错标成军事设施,操作员只有 11 秒的决策窗口,最终没有推翻机器的判断。报告点名了 Palantir 的 Maven 系统和 Google 的 AI 工具,但没具体说清是哪个环节出的错。这次不是 AI 自主开火,而是人机协作...

推荐理由:一份罕见的官方事故报告,把致命打击归因于对 AI 的过度依赖,还直接点了供应商的名,并给出 11 秒这个扎眼的决策窗口。三个维度都打得很实。没给更高分,是因为文章没拆清楚 Palantir 和 Google 的管线里到底是哪个环节出了问题,我会先打个折。

AI HOT 精选

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40%

Anthropic 推出了 Claude 5.5 系列的第一个模型 Opus 5.5。官方说它在大部分工作任务上能达到自家 Fable 5.1 的水平,但运行成本比上一代 Opus 5 低了 40%。在 Anthropic 内部的智能体编程、电脑操作和知识工作基准测试里,它都排第一。不过它不是全面领先——在 Terminal-Bench-Science...

推荐理由:Anthropic 旗舰模型换代,成本降四成还能打平自家高端模型,当天就该写。没给 92 是因为来源是 MarkTechPost 转述,正文没贴官方博客链接,也没给具体定价拆解,信息缺了一角。

AI HOT 精选

GPT-6 Sol 和 GPT-6 Luna 上架 Arena,API 价格比 GPT-5.6 促销价还砍一半

OpenAI 在 Arena 上放出了两个新模型,Sol 和 Luna,都基于 GPT-6 Astra 的技术。卖点是推理更快、更便宜,针对高吞吐场景优化了缓存,API 定价直接比 GPT-5.6 的促销价再低 50%。正文没给跑分和延迟数据,这点先别太激动,等第三方实测出来再看值不值。

推荐理由:OpenAI 在 Arena 放出两个 GPT-6 新模型,API 价格比 GPT-5.6 促销价再砍一半,价格信号很强。但正文没给跑分和延迟数据,性能有没有缩水还不清楚,等第三方实测出来再下结论,分数先压在 85 以下。

AI HOT 精选

Sam Altman 说 GPT-6 Sol 和 Luna 按任务定价没对手,但没给具体数据和测试

Sam Altman 发帖说 GPT-6 系列里的 Sol 和 Luna 两个模型,如果按“完成一项任务花多少钱”来比,市面上没有能打的。他提到相比 5.6 系列,新模型在智力、对齐程度、工作产出、写代码和操作电脑上都有大提升,每个 token 的价格砍了一半,按任务算更便宜。不过帖子里没给出任何跑分、定价数字或第三方验证,我会先打个折看——等有独立测...

推荐理由:Sam Altman 亲自为 GPT-6 的按任务定价站台,声称没有对手,这对关注推理成本的人来说是个直接信号。但帖子缺跑分和定价数据,目前只是单方面说法,我会先打个折,等独立测试出来再调整判断。

AI HOT 精选

OpenAI 发了 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GPT-5.6 促销价还砍一半

这两款模型都基于 GPT-6 Astra 的技术,主打便宜和快,适合跑量大的任务。OpenAI 说靠缓存和推理环节的优化把成本打下来了,所以 API 定价直接比 GPT-5.6 的促销价再低 50%。Sam Altman 转发了公告,夸角色形象可爱。正文没给跑分、延迟数据和哪些地区能用,这点先别太激动。

推荐理由:OpenAI 把 GPT-6 的 API 价格定得比 GPT-5.6 促销价还低 50%,对高并发场景是直接的成本冲击。正文没给跑分、延迟和地区可用性,所以没法判断性能有没有缩水,分数先不打满。