跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 461–480 条 · 共 842 条

5月12日星期二

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

新智元 · 公众号

智元机器人量产破万,人形机器人已在南昌 3C 产线连续干活 8 小时零失误

智元机器人(AgiBot)公布,到 3 月底已出货超过一万台通用具身机器人。在南昌一条 3C 产线上,他们的人形机器人连续工作了 8 小时,按正式节拍要求完成了 2283 项任务,没有出错。不过,文章正文因为微信环境验证被屏蔽了,具体是哪款机型、任务细节和成本都没法看到。

推荐理由:智元自己报的量产和产线数据,我会先打个折——没有第三方验证,也没披露单台成本和故障率。但 1 万台这个数字在通用机器人圈子里确实少见,南昌那条 3C 线能跑 8 小时零失误,至少说明在特定场景下稳定性过了门槛。正文没提具体客户和付费情况,这点先别太激动。

量子位 · 公众号

OpenClaw 悄悄更新,Peekaboo v3 让龙虾在 Mac 上长出手脚

OpenClaw 的 Peekaboo v3 给 Mac 加了 agent 能力,能直接截取像素级屏幕、读取 UI 位置,然后模拟点击、打字、快捷键、滚动和拖拽。它还把 MCP 服务接进了 Cursor、Claude Code 和 Codex,等于让模型能进桌面软件里干活。正文没披露延迟和准确率数据,这点先别太激动。

推荐理由:OpenClaw 的 Peekaboo v3 给 Mac agent 加了一套完整的 GUI 感知和操作原语,还打通了 MCP,让 Cursor、Claude Code、Codex 都能调用。对搞桌面自动化的开源玩家来说是个实用更新,但毕竟只是一篇 Reddit 帖子,没有论文或代码仓库佐证,所以放在 featured 低段,78 分。

The Verge · AI

OpenAI 发布 Daybreak,正面回应 Anthropic 的安全模型 Claude Mythos

OpenAI 推出 Daybreak 安全项目,把 3 月发布的 Codex Security AI 智能体用起来,先给组织代码建威胁模型、梳理可能的攻击路径,再自动验证和检测高风险漏洞。这距离 Anthropic 公布 Claude Mythos 安全模型仅一个多月——Anthropic 当时说这模型太危险不能公开,只放在自家 Project Gla...

推荐理由:H/K/R 全中:Daybreak 有明确的竞品对标、具体的 agent 工作流,也戳中代码安全审计的共鸣点。不过这只是 Reddit 单帖,没有独立复现或论文/代码放出来,所以分数压在 82 没往上走。

The Verge · AI

Mira Murati 的新公司 Thinking Machines 在做什么:让模型边看边听边想,实时跟你协作

Thinking Machines 周一公布了他们的方向——做“交互模型”。按他们的说法,这种模型能同时接收音频、视频和文字,实时理解、回应并行动,而不是像现在的模型那样等你打完字或说完话才开始反应。正文没披露模型规模、发布时间、定价和最终产品形态,所以这东西到底多能打、什么时候能用上,现在都还是未知数。

推荐理由:这篇帖子给出了公司方向,但正文没披露模型参数、发布时间或产品形态,本质上是一次高关注度的创业方向亮相,不是可用的模型发布。HKR 三项都踩中,但信息缺口明显,所以留在 77 分这个位置,没往上拉。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

AI HOT 精选

Replit 上线并行代理,一次能跑 10 个代理同时干活

Replit 新出的并行代理功能,允许最多 10 个代理同时跑。每个代理拿到的都是你应用的独立副本,在各自的机器上互不干扰,最后通过一个代理工作流把结果合并回来。正文没披露合并冲突怎么处理、任务怎么拆分,也没给出具体提速数据,这点先别太激动。

推荐理由:Replit 这次把并行代理的上限拉到 10 个,每个代理独立跑应用副本再合并,相当于让多个 AI 程序员同时改代码然后合分支。正文没讲合并冲突怎么处理、代理间怎么分工,这点先别太激动。整体是个中等体量的开发者工具更新,还没到 Cursor Agent 模式那种量级,所以放在 featured 档。

AI HOT 精选

Gemini 现在能翻你的 Gmail 和相册,自动拼出一个旅行计划

Gemini App 推出了“个人智能”功能,可以把你的 Gmail、Google Photos、搜索记录和 YouTube 观看历史串起来,直接生成一份定制旅行行程。它省去了你自己翻邮件找酒店、从相册回忆地点的步骤。你随时可以选哪些 App 给它读,也能关掉个性化设置。正文没披露它具体怎么处理隐私数据、会不会把邮件内容喂给模型训练,这点先别太激动。

推荐理由:我会先打个折:正文只说了功能方向,没披露权限粒度、数据范围能不能自己勾选、行程质量怎么评估。亮点是 Google 第一次把四个核心数据源串起来给个人助手用,不再是单点功能。但这点先别太激动——没讲清楚用户能不能关掉某个数据源、数据是本地处理还是上传,也没给任何准确率或用户测试结果。对从业者的刺激在于:如果这套跑通,Google 助手的记忆深度会甩开只能读聊天记录的竞品一截;如果跑不通,就是一次隐私翻车现场。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

5月11日星期一

AI HOT 精选

Cognition AI 总部首次曝光:Scott Wu 和他 18 个月做到 4.45 亿美元年化收入的 Devin

推文放出了 Cognition AI 总部“Cog House”的内部画面。创始人 Scott Wu 是顶尖竞技程序员,拿过三次国际信息学奥赛金牌。他在 2023 年 11 月母亲去世、Sam Altman 被 OpenAI 解雇的同一天创立了公司,赌的是 AI 会变成能全天干活的智能体。他们做的 AI 软件工程师 Devin 刚上线时表现一般,但 1...

推荐理由:HKR 三项都过,因为这篇既有 Cognition AI 罕见的内部揭秘,又甩出了 Devin 的营收和估值数字。没给 P1 是因为它本质上是人物+公司特写,不是融资、产品发布或模型发布那种硬消息。

AI HOT 精选

腾讯混元放出 Hy3 预览版,主打复杂智能体任务,不是刷榜模型

腾讯混元开放了 Hy3 预览版的早期体验,官方说这是目前混元系列里最强的模型。它不冲着跑分去,而是强调在真实场景里能把事办成。模型用了 256K 上下文窗口,一次能塞进很长的材料;架构是混合专家(MoE),还加了快慢思考机制,碰到复杂问题会自动切换深度推理模式。底层把预训练和强化学习管线重做了一遍,目标是在大规模部署时把成本压下来。具体效果和实测数据正...

推荐理由:腾讯混元 Hy3 预览版放出了 256K 上下文和快慢思维混合专家架构,定位是处理复杂智能体任务。我会先打个折——正文没披露评测分数、定价和开放范围,所以没法判断实际能力和性价比。架构上快慢思维混合专家听起来像在推理效率和深度之间做平衡,如果是真的挺省钱,但没看到具体实现细节。256K 上下文对长链条智能体任务有用,但也要看实际召回和推理稳定性。这点先别太激动,等更多技术细节和实测出来再说。

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

AI HOT 精选

OpenAI 成立部署公司 DeployCo,并收购 Tomoro,直接往企业里派驻工程师帮他们把模型用起来

OpenAI 新成立了一家叫 OpenAI Deployment Company(DeployCo)的独立公司,专门帮企业把 AI 系统真正部署到日常业务里。核心做法是派驻一种叫“前线部署工程师(FDE)”的人进到客户公司内部,跟业务、运营、一线团队一起找出 AI 最能产生价值的地方,然后重新设计流程、搭系统、做测试,直到能稳定跑在生产环境里。为了起步...

推荐理由:OpenAI 搞 DeployCo 是个实打实的企业战略信号。H 有独立公司的钩子,R 踩中了部署竞争的神经,但 K 很弱——定价、客户、时间都没披露,所以只能放在 featured 的底线分。

量子位 · 公众号

马斯克申请 SpaceXAI 商标,要把 AI 算力搬上卫星

SpaceX 提交了 SpaceXAI 商标申请,覆盖的业务范围很广:卫星数据中心、轨道计算、AI 软件即服务、云存储、通信硬件,甚至还有社交网络。文章提到 xAI 已经通过全股交易成为 SpaceX 的子公司,并引用了一个 2500 亿美元的 xAI 估值。不过正文因为环境异常被屏蔽了,具体交易条款和商标申请细节都没披露,这个估值数字也先别太当真。

推荐理由:我会先打个折:目前只有商标申请文件,正文说xAI已并入SpaceX,但没披露交易条款或官方公告,这点先别太激动。商标覆盖范围很广,从卫星数据中心到AI SaaS都有,说明马斯克在铺路,但离真正跑起来还差落地细节。重要性给76、放featured是合理的,属于信号而非实锤重组。

Computing Life · Share · 鸭哥调研

Google 悄悄关停 Project Mariner,但三家大模型公司其实得出了同一个结论

Google 在 5 月 4 日毫无预告地关掉了去年 I/O 大会上主推的 AI 浏览器代理 Project Mariner。这件事不能简单看成 Google 掉队,因为 Anthropic 和 OpenAI 在同类产品上也撞了墙。核心问题在于,独立浏览器代理(像 Mariner、Operator)一启动就是个全新的、没有 cookie 和浏览记录的会...

推荐理由:这条消息的价值在于把三家公司对浏览器 agent 的悲观判断摆在一起,而不是只报 Google 一家关停。关停日期是新的,但正文没给出官方公告链接,也没披露失败的具体指标,比如任务成功率掉到多少、成本高到什么程度,所以信息强度有折扣。对做 agent 的人来说,知道大厂在这个方向上集体后撤,比看一篇技术方案更有参考意义,但缺少一手数据支撑,只能算一个值得注意的信号。

AI HOT 精选

Codex 自己找了个安全审计的活,花了 22 小时赚到 16.88 美元

有人让 Codex 去赚 5 美元,它自己找到开源项目的安全审计赏金,提交了能用的代码修复,跟维护者来回沟通,还搞定了 GitHub 的验证流程,最后代码被合并,拿到了 16.88 美元。整个过程大约 22 小时,如果每天重复,一个月能赚 506.40 美元。金额不大,但这是 AI 第一次自己跑通“接活—干活—收钱”的闭环。正文没披露 Codex 具体...

推荐理由:HKR 三项都站得住:一个 Codex agent 在 22 小时内走完了从接任务到收钱的闭环,有具体金额和流程细节。不过目前只有一条社交帖子作为证据,没有可复现的日志,所以先不打最高级。

AI HOT 精选

MachinaCheck:用本地大模型把 CNC 图纸审核从半小时压到 30 秒

MachinaCheck 是一个跑在 AMD MI300X 上的多智能体系统,专门分析 STEP 格式的 CNC 零件图,判断能不能做、需要什么刀具。它用 Qwen 2.5 7B 模型在本地推理,靠 192GB 显存把客户设计数据留在厂里,不往外传。核心流程是先用纯代码解析几何特征,再让多个模型分工做工序分类、刀具匹配、可行性判断和报告生成。团队说,以...

推荐理由:这是个AMD黑客松项目,不是大厂产品发布,但“30秒出CNC报价”的钩子够直接,技术条件也写得明白,所以给到featured。正文没披露实际准确率和误判案例,这点先别太激动。

5月10日星期日

新智元 · 公众号

Anthropic 计划 5 月 15 日从 Claude 应用里下架 Sonnet 4.5,API 暂时保留

Anthropic 确认会在 5 月 15 日把 Sonnet 4.5 从 Claude 应用端撤掉,API 接口暂时还能用。文章提到一份请愿书已经收集了 775 个签名,用户希望 Anthropic 保留应用内访问、把模型作为经典版本留下来,或者直接开源。不过正文因为访问环境异常,实际内容没加载出来,具体的技术理由和官方说法都没看到,所以这 775 ...

推荐理由:这事说白了就是Anthropic要在5月15号从Claude应用里砍掉Sonnet 4.5,API还能用一阵子,有775人联名请愿想留住它。标题用“处决”和“临终告白”把模型退役包装成了有情感的事件,传播力很强,但正文没给出模型下架的技术原因或后续替代方案,只说了“不想消失”这种拟人化表达。对从业者来说,实际影响是那些把Sonnet 4.5嵌进工作流的用户得赶紧换模型,API暂时保留算个缓冲。信息量集中在时间点和请愿人数上,缺了性能对比或迁移指南,所以重要性我给73,放在featured里当个提醒看。

AI HOT 精选

SpaceXAI 商标已提交申请,xAI 并入 SpaceX 后品牌统一的第一步

一份商标申请文件显示,“SpaceXAI”在 2026 年 5 月 6 日提交,目前状态是待审查。这个时间点正好是马斯克宣布把 xAI 并入 SpaceX 的时候,等于把 AI 能力和航天业务挂到同一个品牌下面,想把“上火星”和“搞超级智能”两件事放在一个实体里做。正文没披露商标覆盖的具体产品范围、审批进度和实际落地时间,所以现在只能看到品牌整合的意图...

推荐理由:标题写着“正式官宣”,但正文只给了一个待审查的商标申请,没披露交易条款、产品计划或官方公告原文。我会先打个折:关注度够高,但事实很薄,所以放 featured 而不是 p1。

5月9日星期六

AI HOT 精选

特斯拉用视觉AI提前“看”到碰撞,让气囊和安全带更早启动

特斯拉把车上摄像头看到的画面和碰撞传感器结合起来,让安全系统能提前判断要撞车了,不等传感器确认就先把安全带收紧、气囊准备好。团队用真实事故数据和仿真回放,拿人体模型测受力,发现早一点启动保护能明显降低预估伤害。这次改进通过OTA推给车主,但正文没披露具体支持哪些车型,也没给出伤害风险降低了多少的量化数字。

推荐理由:我会先打个折:信息来自马斯克的一条帖子,正文没披露 OTA 覆盖了哪些车型、伤亡率具体降了多少、验证方法是什么。所以它更像一个值得关注的产品更新,而不是一篇必须写的硬核发布。亮点在于把视觉预判和被动安全联动,思路清晰,但缺的数据让说服力打了折扣。