跳到正文

#产品更新

今日 25 条

5月8日星期五

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

AI HOT 精选

苹果带摄像头的 AirPods 进入 DVT 阶段,最快 9 月跟新 Siri 一起到

彭博社的 Mark Gurman 说,苹果那款传闻很久、自带摄像头的 AirPods 已经进入设计验证测试(DVT)阶段,外形和功能基本定型了。左右耳机各塞了一颗低分辨率摄像头,不是用来拍照,而是给 Siri 当“眼睛”,让你对着眼前的东西直接提问,比如看到一堆食材问能做什么晚饭。耳机柄为了塞摄像头比 AirPods Pro 3 稍微长一点。原计划上半...

推荐理由:HKR 三项都踩中了,但这是未确认的硬件传闻,不是苹果官方发布。DVT 状态、摄像头设计和 Gemini 合作细节让它够格进 featured,不过我会先打个折,放在低分段。正文没披露摄像头具体参数和 Gemini 合作形式,这点先别太激动。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

TechCrunch · AI

OpenAI 给 ChatGPT 加了“信任联系人”,在对话涉及自残风险时通知你指定的人

OpenAI 在 ChatGPT 里上线了一个叫“信任联系人”的安全功能。当系统判断用户对话出现自残倾向时,会通知用户提前设置好的联系人。正文没披露具体用什么信号触发、通知流程怎么走、目前覆盖哪些地区。我会先打个折:误判、隐私边界、人工审核介入到什么程度,这些关键点都没说清楚。

推荐理由:OpenAI 给 ChatGPT 加了个 Trusted Contact,对话一旦转向自伤就触发保护。我会先打个折:正文只给了名字和场景,怎么触发、联系人怎么走、哪些地区上线一概没提。真正值得盯的是误报会不会把普通对话误判、隐私怎么兜底、人工审核介入到什么程度,这些边界没划清楚之前,功能听起来有用但落地风险不小。

AI HOT 精选

OpenAI 的 Codex 插件现在能在 Chrome 里跨标签页同时干活了

Codex 插件现在支持在 macOS 和 Windows 的 Chrome 上运行,可以跨标签页在后台并行处理网页和应用,不会抢走你对浏览器的控制权。正文没提具体版本号、同时能跑几个任务,也没说企业策略怎么管。想用的话,在 Codex 应用里装一下 Chrome 插件就行。

推荐理由:HKR-H/K/R 全过,但正文只给了平台和执行机制,版本号、并发上限、企业管控都没提。分数 76,算一个实用的 OpenAI Codex 产品更新。

The Verge · AI

苹果带摄像头的 AirPods 快量产了,主要给 Siri 当眼睛用

Mark Gurman 爆料,带摄像头的 AirPods 已经进入 DVT(设计验证测试)阶段,离 PVT(生产验证测试)只差一步。苹果内部测试人员正在用原型机,摄像头不拍照片或视频,只捕捉低分辨率画面,用来帮 Siri 回答“这菜怎么做”之类需要看东西的问题。正文没披露具体像素、延迟和功耗数据,也没说什么时候上市。

推荐理由:H/K/R 全过:Gurman 和 The Verge 给出了一个 DVT 阶段的苹果 AI 硬件更新,不是发布,所以分数压在 72–77 区间。带摄像头的 AirPods 这个形态够怪,容易让人记住;DVT 到 PVT 的进度和“只采低分辨率视觉信息、不拍照不录像”是实打实的新事实;它同时碰到多模态、隐私和 AI 硬件入口三条线,对做端侧和多模态的人有参考意义。

The Verge · AI

SpaceX 要在德州砸 550 亿美元建 AI 芯片厂

SpaceX 在奥斯汀的“Terafab”芯片工厂计划投资至少 550 亿美元,一份听证会文件显示后期总投资可能拉到 1190 亿美元。马斯克 3 月说过目标是年产能支撑 200GW 算力的芯片,但正文没披露具体用哪种制程工艺。

推荐理由:这条消息的钩子就是 SpaceX 跨界造芯片,数字大得离谱,所以 HKR 全中。我会先打个折:正文没披露工艺节点、时间表和已签约客户,没法判断是动真格还是画饼。550 亿到 1190 亿的投资区间,以及 200GW 算力目标,如果是真的挺省钱——但前提是得先有厂、有客户、有产能爬坡,这些信息目前全是缺口。

AI HOT 精选

Claude 现在能直接在你的 Excel、PPT、Word 和 Outlook 里干活了

Claude 正式接入了四个微软办公软件:Excel、PowerPoint、Word 和 Outlook。其中 Excel、PPT 和 Word 已经全面开放,Outlook 还在公开测试阶段。你可以跨应用跟 Claude 对话,比如让它分析 Excel 里的数据,再把结论写成 Word 报告,最后用 Outlook 发出去,上下文是打通的。企业管理员...

推荐理由:Claude 这次不是发模型,而是把能力塞进微软 Office 全家桶里。Excel、PPT、Word 已经全量上线,Outlook 在公测,企业管理员可以通过微软管理中心统一部署,还能用 OpenTelemetry 看全流程的调用情况。对 Anthropic 来说,这是把模型推到亿级用户的工作流里,入口价值比单发一个模型版本更大。但毕竟不是底层能力突破,所以分数卡在 83 这个位置,不往上拔了。

彭博科技

苹果带摄像头的 AirPods 已进入后期测试,想做成 AI 时代的穿戴设备

彭博社拿到消息,苹果把带摄像头的 AirPods 推进到了后期开发阶段。这可能是苹果第一款明确为 AI 场景设计的穿戴设备,但报道没公布摄像头具体参数、工作原理和发布时间。我会先打个折:目前只有进度信息,产品能不能落地、怎么用 AI 都还是未知数。

推荐理由:消息来自彭博,加上带摄像头的 AirPods 这个设定,H、K、R 都站得住。分数定在 72–77 区间,是因为只说了后期测试,没给规格、没讲 AI 怎么跑、也没提什么时候发,信息密度有限。

The Verge · AI

ChatGPT 上线“紧急联系人”:检测到自残倾向时会通知你指定的人

OpenAI 给 ChatGPT 加了一个可选功能,成年用户可以在设置里填一位紧急联系人。当系统检测到对话涉及自残或自杀话题时,会自动发通知给这个人。这个功能之前只对青少年用户开放,现在推到了所有成年人。不过正文没提误报率有多高、怎么处理误触发,也没说会在哪些地区先上线。

推荐理由:OpenAI 给 ChatGPT 加了一个可选的安全兜底:让用户设一位信任联系人,系统觉得对话里有自伤或自杀风险时就通知对方。这个动作把 AI 从对话工具推到了人身安全干预的位置,产品边界拉得很开。但正文没写误报怎么处理、在哪些地区上线、用户能不能申诉,这些缺口让实际落地效果要打个问号。所以重要性给 82,比模型发布或核心能力更新低一档,但足够放进 featured。

AI HOT 精选

Perplexity 把能操控电脑的 AI 助手做成了 Mac 应用,对所有用户开放

Perplexity 发布了 Mac 版“Personal Computer”应用,不再需要邀请码。这个应用可以跨本地文件、Mac 原生软件、网页和 Perplexity 自己的服务器干活,相当于让 AI 直接操作你的电脑。正文没提收费方式、权限边界(比如它能读写哪些文件夹)和任务成功率,我会先打个折:能跑起来和跑得靠谱是两回事。

推荐理由:一条产品更新,信息量中等。Perplexity 把 agent 能力搬上 Mac 桌面,能跨文件、应用和网页干活,听着挺实用。但正文没提价格、权限怎么划、任务成功率多少,我会先打个折——没这些硬指标,实际好不好用还不好说。评分放在中等偏上的产品更新档位,合理。

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

Hacker News 首页

AlphaEvolve:DeepMind 用 Gemini 驱动的编程智能体,号称能跨领域放大影响力

Google DeepMind 发了一篇博客介绍 AlphaEvolve,说它是一个由 Gemini 驱动的编程智能体(coding agent),已经在多个领域落地并扩大影响。正文只给了标题和导航栏,没有披露具体用了哪一版 Gemini 模型、跑了什么基准测试、在哪些场景部署、效果数据如何。我会先打个折:目前能确认的只有“这是个 Gemini 驱动的...

推荐理由:标题说 AlphaEvolve 是 Gemini 驱动的编码 Agent,要跨领域放大影响,但正文只有一句话,没披露模型版本、评测结果或落地场景。我会先打个折:DeepMind 起名就是信号,编码 Agent 本身也够热,所以 H 和 R 都过;但 K 过不了,因为除了标题没任何可验证的事实。分数停在 72,没到 78+,就是因为缺评测和部署细节。

AI HOT 精选

Apify 的 mcpc 工具给 AI Agent 装了个能自动付钱的 USDC 钱包

Apify 发布了一个叫 mcpc 的通用 MCP 客户端,把 x402 支付协议塞了进去,让 AI Agent 在调用付费 API 时能自己签名付款。x402 把整套结算流程压成一次 HTTP 往返加一个签名,碰到 HTTP 402 状态码就自动完成支付,不用人插手注册绑卡。mcpc 支持 Claude Code 这类 MCP 兼容的 Agent,钱...

推荐理由:我会先打个折:这还是个集成层面的更新,正文没披露实际用量、定价或生产环境案例,所以别急着把它当成成熟方案。但它的价值在于把“机器替人付款”这件事从概念拉到了协议层——用 HTTP 402 触发、一次签名完成结算,链路很轻。对跑 Agent 工作流的人来说,付费 API 的自动结算一直是个脏活,x402 这条路径至少给出了一个可验证的起点。

量子位 · 公众号

Vidu Claw 上线:一句话加一百块预算,直接生成一条广告片

生数科技把 Vidu Claw 放出来了,主打“一句话出广告片”。你给一句提示词,它能自动走完写脚本、配旁白、加音乐、剪辑合成全流程,最后吐出一条成品视频。官方拿龙虾当例子,说百元预算就能搓出“百万级”广告片,但正文没披露这个成本具体怎么算出来的,也没给实际成片链接,我会先打个折看。配套的 Video Plan 套餐每天最多能生成 40 分钟内容,覆盖...

推荐理由:我会先打个折:正文没披露生成一支片子的实际耗时和最终成本,也没给画质、可控性的横向对比,所以“百万级”更多是噱头,别太当真。但 Vidu Claw 把脚本、配音、配乐、剪辑打包成一句话工作流,还给了每天 40 分钟的生成额度,对做短视频和广告测试的人来说,试错成本确实低。龙虾广告这个例子够具体,能让人直观感受到“输入一句话、输出成片”的完整链路,比单纯讲参数更有说服力。不过没有定价细节和商用授权说明,这点先别太激动。

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

AI HOT 精选

Amp 发布 Neo CLI,编程助手开始往“长链路、少盯屏”方向走

Amp 推出了新的命令行工具 Neo,核心变化是让编程助手从“人在旁边盯着”变成“扔给它自己跑”。Neo 支持远程控制本地线程、自动压缩上下文(不用再手动清理对话历史),并开放了 Plugin API 来扩展工具和交互方式。安全策略做了个大反转:默认允许所有操作,把安全把关交给插件系统。官方说 CPU 和内存占用也降了不少,但正文没给出具体版本号、价格...

推荐理由:Neo 把本地线程交给远程控制,默认允许所有操作,安全控制转嫁到插件系统,这个权限反转比功能更新本身更值得盯。远程编排和自动上下文压缩让 agent 能跑长链路任务,Plugin API 给了扩展空间,但正文没披露版本号、价格和性能降幅,实际省不省钱、稳不稳定还得等实测。Amp 的行业存在感加上信息缺口,把这条卡在 72–77 分区间,我会先打个折,别当成熟产品看。

OpenAI News

ChatGPT 上线“信任联系人”:检测到严重自伤风险时,可通知你指定的人

OpenAI 给 ChatGPT 加了一个可选的安全功能。成年人可以在设置里指定一位信任的联系人,比如家人或朋友。当系统自动监测和人工审核都判定你的对话里出现了严重的自我伤害倾向时,ChatGPT 会通知这位联系人。通知内容很克制,只说出现了需要关心的自伤话题,不会透露聊天细节。正文没披露具体的检测机制和误报率,只说审核团队会争取在一小时内完成判断。这...

推荐理由:H、K、R 三条都站得住:ChatGPT 的安全钩子很具体,也容易引发讨论。重要性给到 73 分、放在 featured 里是合适的,因为功能本身有话题性,但检测方式、配置流程和上线范围全是空白,没法往更高里打。

FT · 科技

Arm 预计自家 AI 芯片明年能卖 20 亿美元,但没公布客户和制程

Arm 第一次自己做 AI 芯片,就给出了明年 20 亿美元的销售预期。这个数字不小,但文章正文被付费墙挡住了,看不到具体是卖给谁、用什么工艺生产、什么时候交货。软银在背后撑腰,需求据说很强劲,不过在没有客户名单和定价的情况下,这个预测先打个折看。

推荐理由:FT 的信源加上 20 亿美元销售预期,让这条消息有硬信息量,所以 K 成立。Arm 从设计授权商变成芯片商,对行业格局有冲击,H 和 R 也站得住。但客户、价格、制程、交付节奏这些关键信息全是空白,我会先打个折,热度归热度,落地还早,所以放在 featured 这档刚好。

The Verge · AI

谷歌关停网页任务实验 Project Mariner,技术已并入 Gemini Agent

谷歌在 2026 年 5 月 4 日关掉了 Project Mariner,一个能让 AI 在浏览器里自动完成多步骤网页任务的实验项目。它之前最多支持同时跑 10 个任务。关停不是因为技术失败,而是这套能力已经挪到了谷歌正式产品里,比如 Gemini Agent 和 AI Mode。正文没披露具体迁移时间点和用户数据,所以实际落地效果还得看后续产品表现。

推荐理由:HKR 三项都过,但正文能拿到的硬信息就三块:关停时间、最多 10 个并发任务、技术并入了 Gemini Agent。Google 官方信源够硬,所以给 featured 低档,不是重大发布。

Hacker News 首页

Claude 大幅提高用量上限,并与 SpaceX 签下超 300 兆瓦算力合同

Anthropic 宣布了三项即时生效的调整:Claude Code 的 5 小时速率限制翻倍,Pro 和 Max 用户不再受高峰时段降速限制,Opus 模型的 API 调用频率也明显上调。这些变化背后是一笔新签的 SpaceX 算力合同——Anthropic 将在一个月内用上 Colossus 1 数据中心全部容量,超过 300 兆瓦、约 22 万张...

推荐理由:标题说 Claude 要提用量上限,还跟 SpaceX 签了算力合同,但点进 RSS 只有链接和评论,关键数字一个没给。我会先打个折:这事听着挺省钱,可没披露倍数和规模,就先别太激动。真正值得盯的是配额放宽是不是靠 SpaceX 的新算力在撑,这点正文没交代。

5月6日星期三

The Verge · AI

Google 的 AI 搜索摘要开始引用 Reddit 帖子了

Google 更新了 AI 搜索功能,会在摘要里直接展示来自 Reddit、社交媒体和论坛的“第一手观点”预览,把搜索词和相关的网络讨论串起来。官方说这是为了满足越来越多人在搜索时想看到真人建议的需求。不过公告没提这个功能具体什么时候、在哪些地区上线。对搜索团队来说,核心问题是 AI 摘要如何引用和排序这些用户生成内容来源。

推荐理由:我会先打个折,因为正文没写覆盖范围和上线时间,所以重要性停在 76 的产品更新档位是合理的。钩子够强——Google 把 Reddit 这种论坛内容塞进 AI 摘要,搜索的流量分配逻辑可能又要变。新事实是 perspectives 预览机制,但具体怎么触发、哪些讨论会被选中都没说。风险点很实在:UGC 来源的引用和排序机制一旦偏了,小站和原创作者会更难拿到流量。这点先别太激动,等看到实际覆盖数据再调整判断。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

量子位 · 公众号

波士顿动力高管出走,Atlas 月产仅 4 台,离现代汽车年产 3 万台目标差了 200 年

波士顿动力放出了新版 Atlas 体操演示,但同期消息显示 Atlas 月产量只有 4 台。Atlas 全身 56 个自由度,重 90 公斤,续航 4 小时,2026 年的产能已被现代 RMAC 和 Google DeepMind 预定一空。核心矛盾在规模:现代汽车目标是年产 3 万台机器人,按现在的月产 4 台算,攒够 1 万台需要超过 200 年。...

推荐理由:我会先打个折,这篇不是波士顿动力官方发布,是二手报道,所以重要性没给到85以上。但HKR三项都站得住:钩子靠月产4台和年产3万台的数字反差撑起来,知识密度有具体规格和产能分配对象,关联度直接打在机器人规模化这个行业痛点上。正文没披露Atlas具体售价和产线细节,这点先别太激动。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

TechCrunch · AI

苹果打算让 iOS 27 变成 AI 模型的自选超市

彭博社的消息说,苹果会在 iOS 27 里加一个叫“扩展”的功能,让你自己选第三方的大语言模型来驱动 Siri、写作工具、图像游乐场这些系统自带能力。iPadOS 27 和 macOS 27 也会同步支持。目前正在测试谷歌和 Anthropic 的模型,ChatGPT 大概率会保留成一个选项。具体能接管哪些任务、切换模型要不要手动操作、不同模型之间怎么...

推荐理由:HKR 三项都过了:系统级模型选择在 iOS 上是个很强的平台钩子,分发利益也大。分数留在 72–77 是因为 RSS 摘要没给模型名单、任务范围、上线时间和接口机制,正文信息缺口明显,我会先打个折。

The Verge · AI

苹果可能在 iOS 27 里让你自己选 AI 模型

Mark Gurman 爆料,苹果计划在 iOS 27、iPadOS 27 和 macOS 27 里开放“扩展”机制,让第三方聊天机器人接管 Siri、写作工具和图片生成这些系统级功能,不再只绑死 ChatGPT。用户能把自己常用的模型设成默认。不过原文没提会支持哪些模型、怎么收费、开发者接口长什么样,这些关键信息都还缺着,先别太激动。

推荐理由:HKR 三项都成立:系统级模型选择器是个强钩子,也给了具体的 Extension 落点。打 80 分是因为正文没披露支持哪些模型、怎么收费、开发者接口长什么样,目前还只是一份路线图爆料,我会先打个折。

FT · 科技

Meta 计划推出面向普通用户的“能动手干活”的 AI 助手

FT 这篇报道正文被付费墙挡住了,只留了一句话摘要。已知信息是:Meta 正在开发一款面向消费者的 agentic AI 助手,对标的是 OpenClaw 这类能替用户执行日常任务的产品。至于具体用哪个模型、什么时候上线、收不收费、在哪些地区开放、以及用户怎么控制权限,正文都没披露。

推荐理由:FT 一句话消息说 Meta 在搞消费级 agentic 助手,对标 OpenClaw,让 AI 替用户执行日常任务。我会先打个折——正文没给模型参数、上线时间、价格和地区,连任务权限怎么设都没提。这点先别太激动,真正值得盯的是执行权限和安全边界,Meta 的量一旦铺开,翻车代价不小。

NVIDIA 博客

NVIDIA 和 ServiceNow 搞了个企业桌面 AI 代理,叫 Project Arc

两家公司把合作又推了一步,这次是让 AI 代理直接在你的电脑桌面上干活。这个叫 Project Arc 的东西,通过 Action Fabric 连接企业软件,再用 OpenShell 建一个带权限管控的沙盒环境来执行操作,防止乱来。文章里还提了一嘴 Blackwell 芯片的能效:每瓦输出的 token 数是上一代 Hopper 的 50 多倍,每百...

推荐理由:我会先打个折:这就是两家大厂合作发了个桌面 agent 产品,正文没披露实际客户和上线时间,别当成立竿见影的东西。但里面几个信息值得看——Action Fabric 负责把 agent 接进 ServiceNow 的业务流程,OpenShell 在沙箱里跑任务,权限和策略都框死了,不是裸奔。Blackwell 的能效数字挺夸张,每瓦 token 数是 Hopper 的 50 倍以上,百万 token 成本低了近 35 倍,如果实测能兑现,跑企业 agent 的算力账单会好看很多。这点先别太激动,毕竟还是纸面数据。整体属于有机制、有经济账、但缺实证的...

The Verge · AI

OpenAI 说 ChatGPT 默认模型 GPT-5.5 Instant 的幻觉问题少了一大截

ChatGPT 把免费用户和 Plus 用户的默认模型换成了 GPT-5.5 Instant。OpenAI 内部测试显示,在容易出高风险幻觉的提示上,它比上一代 GPT-5.3 Instant 的瞎编次数少了 52.5%;在被标记为“难聊”的对话里,不准确的说法也降了 37.3%。不过正文没披露测试集到底有多大,也没说这些“高风险提示”具体怎么定义的,...

推荐理由:OpenAI 把 ChatGPT 默认模型换了,还主动报了两个幻觉下降的数字,热点、新知、关联度都够。不过正文没给评测集规模和复现方法,我会先打个折——数字好看,但暂时没法独立验证。默认模型换人本身就是当天该推的料,所以还是给了 p1。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

Hacker News 首页

Airbyte 给 AI 助手做了个“统一资料库”,查多系统数据能省 90% 的 token

Airbyte 推出了 Airbyte Agents,核心是一个叫 Context Store 的东西。你可以把它理解成一个专门给 AI 助手用的预索引资料库,把 Slack、Salesforce、Zendesk 这些业务系统里的数据提前整理好。这样助手在回答问题时,不用再现场去调几十次 API 拼凑信息。作者举了个例子:一个原本要跑 47 步才能回答...

推荐理由:HKR 三项都站得住:预索引这个角度比市面上又一层 MCP 包装有信息量,给了可复现的 token 节省数字,痛点也打在企业数据接入的成本和可靠性上。Airbyte 不是前沿模型厂,所以留在 featured 低段。正文没披露 Context Store 的索引延迟和更新频率,这点先别太激动。

The Verge · AI

郭明錤爆料 OpenAI 正在给 ChatGPT 做手机,计划 2027 年初量产

天风国际分析师郭明錤说,OpenAI 正在加速推进一款 ChatGPT 手机,目标是 2027 年初开始大规模生产。这款手机会用联发科定制的天玑 9600 芯片,图像处理器(ISP)专门加强了 HDR 能力,可能是为了提升相机和视觉识别体验。不过,原文没提手机卖多少钱、长什么样、用什么操作系统。郭明錤的供应链爆料准确率不低,但 OpenAI 自己还没回...

推荐理由:HKR 三项全中,但消息源是郭明錤的供应链爆料,不是 OpenAI 官方发布。我会先打个折:正文没披露价格、外观和系统,这些关键信息全缺,所以重要性到不了必写级别。

TechCrunch · AI

Meta 要用 AI 看身高和骨骼结构来判断用户是不是未成年

Meta 正在部分国家上线一套视觉分析系统,通过照片估算用户的身高和骨骼发育程度,来抓出谎报年龄的未成年用户。公司说后续会推到更多地区,但正文没披露具体是哪些国家、误判率有多高,也没提用户如果被误判后怎么申诉。

推荐理由:我会先打个折:正文没披露覆盖国家、误判率和申诉机制,所以没法判断实际效果。但这件事值得盯,因为用骨骼结构做年龄推断,比单纯看脸更隐蔽,一旦出错,未成年人可能被误拦或漏过,后续怎么申诉、谁来复核,目前全是空白。

OpenAI News

OpenAI 发布 MRC 网络协议,让超大规模 GPU 集群训练更抗断、更省电

OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...

推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。

OpenAI News

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,回答更准、废话更少

OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...

推荐理由:HKR 三项全中:OpenAI 把 ChatGPT 默认模型切到了 GPT-5.5 Instant,说答案更准、幻觉更少、个性化控制更好,但没给任何评测数字、价格或上下文窗口,我会先打个折。这点先别太激动,等看到实测再判断。