跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 501–520 条 · 共 842 条

5月7日星期四

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

AI HOT 精选

Amp 发布 Neo CLI,编程助手开始往“长链路、少盯屏”方向走

Amp 推出了新的命令行工具 Neo,核心变化是让编程助手从“人在旁边盯着”变成“扔给它自己跑”。Neo 支持远程控制本地线程、自动压缩上下文(不用再手动清理对话历史),并开放了 Plugin API 来扩展工具和交互方式。安全策略做了个大反转:默认允许所有操作,把安全把关交给插件系统。官方说 CPU 和内存占用也降了不少,但正文没给出具体版本号、价格...

推荐理由:Neo 把本地线程交给远程控制,默认允许所有操作,安全控制转嫁到插件系统,这个权限反转比功能更新本身更值得盯。远程编排和自动上下文压缩让 agent 能跑长链路任务,Plugin API 给了扩展空间,但正文没披露版本号、价格和性能降幅,实际省不省钱、稳不稳定还得等实测。Amp 的行业存在感加上信息缺口,把这条卡在 72–77 分区间,我会先打个折,别当成熟产品看。

OpenAI News

ChatGPT 上线“信任联系人”:检测到严重自伤风险时,可通知你指定的人

OpenAI 给 ChatGPT 加了一个可选的安全功能。成年人可以在设置里指定一位信任的联系人,比如家人或朋友。当系统自动监测和人工审核都判定你的对话里出现了严重的自我伤害倾向时,ChatGPT 会通知这位联系人。通知内容很克制,只说出现了需要关心的自伤话题,不会透露聊天细节。正文没披露具体的检测机制和误报率,只说审核团队会争取在一小时内完成判断。这...

推荐理由:H、K、R 三条都站得住:ChatGPT 的安全钩子很具体,也容易引发讨论。重要性给到 73 分、放在 featured 里是合适的,因为功能本身有话题性,但检测方式、配置流程和上线范围全是空白,没法往更高里打。

FT · 科技

Arm 预计自家 AI 芯片明年能卖 20 亿美元,但没公布客户和制程

Arm 第一次自己做 AI 芯片,就给出了明年 20 亿美元的销售预期。这个数字不小,但文章正文被付费墙挡住了,看不到具体是卖给谁、用什么工艺生产、什么时候交货。软银在背后撑腰,需求据说很强劲,不过在没有客户名单和定价的情况下,这个预测先打个折看。

推荐理由:FT 的信源加上 20 亿美元销售预期,让这条消息有硬信息量,所以 K 成立。Arm 从设计授权商变成芯片商,对行业格局有冲击,H 和 R 也站得住。但客户、价格、制程、交付节奏这些关键信息全是空白,我会先打个折,热度归热度,落地还早,所以放在 featured 这档刚好。

The Verge · AI

谷歌关停网页任务实验 Project Mariner,技术已并入 Gemini Agent

谷歌在 2026 年 5 月 4 日关掉了 Project Mariner,一个能让 AI 在浏览器里自动完成多步骤网页任务的实验项目。它之前最多支持同时跑 10 个任务。关停不是因为技术失败,而是这套能力已经挪到了谷歌正式产品里,比如 Gemini Agent 和 AI Mode。正文没披露具体迁移时间点和用户数据,所以实际落地效果还得看后续产品表现。

推荐理由:HKR 三项都过,但正文能拿到的硬信息就三块:关停时间、最多 10 个并发任务、技术并入了 Gemini Agent。Google 官方信源够硬,所以给 featured 低档,不是重大发布。

Hacker News 首页

Claude 大幅提高用量上限,并与 SpaceX 签下超 300 兆瓦算力合同

Anthropic 宣布了三项即时生效的调整:Claude Code 的 5 小时速率限制翻倍,Pro 和 Max 用户不再受高峰时段降速限制,Opus 模型的 API 调用频率也明显上调。这些变化背后是一笔新签的 SpaceX 算力合同——Anthropic 将在一个月内用上 Colossus 1 数据中心全部容量,超过 300 兆瓦、约 22 万张...

推荐理由:标题说 Claude 要提用量上限,还跟 SpaceX 签了算力合同,但点进 RSS 只有链接和评论,关键数字一个没给。我会先打个折:这事听着挺省钱,可没披露倍数和规模,就先别太激动。真正值得盯的是配额放宽是不是靠 SpaceX 的新算力在撑,这点正文没交代。

5月6日星期三

The Verge · AI

Google 的 AI 搜索摘要开始引用 Reddit 帖子了

Google 更新了 AI 搜索功能,会在摘要里直接展示来自 Reddit、社交媒体和论坛的“第一手观点”预览,把搜索词和相关的网络讨论串起来。官方说这是为了满足越来越多人在搜索时想看到真人建议的需求。不过公告没提这个功能具体什么时候、在哪些地区上线。对搜索团队来说,核心问题是 AI 摘要如何引用和排序这些用户生成内容来源。

推荐理由:我会先打个折,因为正文没写覆盖范围和上线时间,所以重要性停在 76 的产品更新档位是合理的。钩子够强——Google 把 Reddit 这种论坛内容塞进 AI 摘要,搜索的流量分配逻辑可能又要变。新事实是 perspectives 预览机制,但具体怎么触发、哪些讨论会被选中都没说。风险点很实在:UGC 来源的引用和排序机制一旦偏了,小站和原创作者会更难拿到流量。这点先别太激动,等看到实际覆盖数据再调整判断。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

量子位 · 公众号

波士顿动力高管出走,Atlas 月产仅 4 台,离现代汽车年产 3 万台目标差了 200 年

波士顿动力放出了新版 Atlas 体操演示,但同期消息显示 Atlas 月产量只有 4 台。Atlas 全身 56 个自由度,重 90 公斤,续航 4 小时,2026 年的产能已被现代 RMAC 和 Google DeepMind 预定一空。核心矛盾在规模:现代汽车目标是年产 3 万台机器人,按现在的月产 4 台算,攒够 1 万台需要超过 200 年。...

推荐理由:我会先打个折,这篇不是波士顿动力官方发布,是二手报道,所以重要性没给到85以上。但HKR三项都站得住:钩子靠月产4台和年产3万台的数字反差撑起来,知识密度有具体规格和产能分配对象,关联度直接打在机器人规模化这个行业痛点上。正文没披露Atlas具体售价和产线细节,这点先别太激动。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

TechCrunch · AI

苹果打算让 iOS 27 变成 AI 模型的自选超市

彭博社的消息说,苹果会在 iOS 27 里加一个叫“扩展”的功能,让你自己选第三方的大语言模型来驱动 Siri、写作工具、图像游乐场这些系统自带能力。iPadOS 27 和 macOS 27 也会同步支持。目前正在测试谷歌和 Anthropic 的模型,ChatGPT 大概率会保留成一个选项。具体能接管哪些任务、切换模型要不要手动操作、不同模型之间怎么...

推荐理由:HKR 三项都过了:系统级模型选择在 iOS 上是个很强的平台钩子,分发利益也大。分数留在 72–77 是因为 RSS 摘要没给模型名单、任务范围、上线时间和接口机制,正文信息缺口明显,我会先打个折。

The Verge · AI

苹果可能在 iOS 27 里让你自己选 AI 模型

Mark Gurman 爆料,苹果计划在 iOS 27、iPadOS 27 和 macOS 27 里开放“扩展”机制,让第三方聊天机器人接管 Siri、写作工具和图片生成这些系统级功能,不再只绑死 ChatGPT。用户能把自己常用的模型设成默认。不过原文没提会支持哪些模型、怎么收费、开发者接口长什么样,这些关键信息都还缺着,先别太激动。

推荐理由:HKR 三项都成立:系统级模型选择器是个强钩子,也给了具体的 Extension 落点。打 80 分是因为正文没披露支持哪些模型、怎么收费、开发者接口长什么样,目前还只是一份路线图爆料,我会先打个折。

FT · 科技

Meta 计划推出面向普通用户的“能动手干活”的 AI 助手

FT 这篇报道正文被付费墙挡住了,只留了一句话摘要。已知信息是:Meta 正在开发一款面向消费者的 agentic AI 助手,对标的是 OpenClaw 这类能替用户执行日常任务的产品。至于具体用哪个模型、什么时候上线、收不收费、在哪些地区开放、以及用户怎么控制权限,正文都没披露。

推荐理由:FT 一句话消息说 Meta 在搞消费级 agentic 助手,对标 OpenClaw,让 AI 替用户执行日常任务。我会先打个折——正文没给模型参数、上线时间、价格和地区,连任务权限怎么设都没提。这点先别太激动,真正值得盯的是执行权限和安全边界,Meta 的量一旦铺开,翻车代价不小。

NVIDIA 博客

NVIDIA 和 ServiceNow 搞了个企业桌面 AI 代理,叫 Project Arc

两家公司把合作又推了一步,这次是让 AI 代理直接在你的电脑桌面上干活。这个叫 Project Arc 的东西,通过 Action Fabric 连接企业软件,再用 OpenShell 建一个带权限管控的沙盒环境来执行操作,防止乱来。文章里还提了一嘴 Blackwell 芯片的能效:每瓦输出的 token 数是上一代 Hopper 的 50 多倍,每百...

推荐理由:我会先打个折:这就是两家大厂合作发了个桌面 agent 产品,正文没披露实际客户和上线时间,别当成立竿见影的东西。但里面几个信息值得看——Action Fabric 负责把 agent 接进 ServiceNow 的业务流程,OpenShell 在沙箱里跑任务,权限和策略都框死了,不是裸奔。Blackwell 的能效数字挺夸张,每瓦 token 数是 Hopper 的 50 倍以上,百万 token 成本低了近 35 倍,如果实测能兑现,跑企业 agent 的算力账单会好看很多。这点先别太激动,毕竟还是纸面数据。整体属于有机制、有经济账、但缺实证的...

The Verge · AI

OpenAI 说 ChatGPT 默认模型 GPT-5.5 Instant 的幻觉问题少了一大截

ChatGPT 把免费用户和 Plus 用户的默认模型换成了 GPT-5.5 Instant。OpenAI 内部测试显示,在容易出高风险幻觉的提示上,它比上一代 GPT-5.3 Instant 的瞎编次数少了 52.5%;在被标记为“难聊”的对话里,不准确的说法也降了 37.3%。不过正文没披露测试集到底有多大,也没说这些“高风险提示”具体怎么定义的,...

推荐理由:OpenAI 把 ChatGPT 默认模型换了,还主动报了两个幻觉下降的数字,热点、新知、关联度都够。不过正文没给评测集规模和复现方法,我会先打个折——数字好看,但暂时没法独立验证。默认模型换人本身就是当天该推的料,所以还是给了 p1。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

Hacker News 首页

Airbyte 给 AI 助手做了个“统一资料库”,查多系统数据能省 90% 的 token

Airbyte 推出了 Airbyte Agents,核心是一个叫 Context Store 的东西。你可以把它理解成一个专门给 AI 助手用的预索引资料库,把 Slack、Salesforce、Zendesk 这些业务系统里的数据提前整理好。这样助手在回答问题时,不用再现场去调几十次 API 拼凑信息。作者举了个例子:一个原本要跑 47 步才能回答...

推荐理由:HKR 三项都站得住:预索引这个角度比市面上又一层 MCP 包装有信息量,给了可复现的 token 节省数字,痛点也打在企业数据接入的成本和可靠性上。Airbyte 不是前沿模型厂,所以留在 featured 低段。正文没披露 Context Store 的索引延迟和更新频率,这点先别太激动。