跳到正文

#OpenAI

今日 45 条

5月12日星期二

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

Latent Space

Thinking Machines 发布原生交互模型:2760 亿参数,120 亿激活,实时语音不再靠外挂

Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...

推荐理由:我会先打个折——基准分是 Thinking Machines 自己跑的,还没第三方复现,所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推,因为它给出了具体架构(276B MoE、12B 激活)、200ms 微轮次这个硬指标,还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说,哪怕只是思路参考也有价值。

AI HOT 精选

Mira 的新公司 Thinking Machines 发了个原生多模态交互模型,前台 200 毫秒一响应,后台跑长线推理

这个模型把音频、视频、文字直接吃进去,不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入,保持对话的实时感,用户可以随时打断;后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本,也没给评测对比,所以实际效果和泛化能力还得看后续公开信息。

推荐理由:我会先打个折:正文没披露定价、开放范围和具体 benchmark,所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重,而是给了一套前台 200 毫秒交互节点加后台推理的分层设计,原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说,至少提供了一个可参考的架构思路,但没看到代码或论文之前,不宜再往上拉。

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

The Verge · AI

OpenAI 发布 Daybreak,正面回应 Anthropic 的安全模型 Claude Mythos

OpenAI 推出 Daybreak 安全项目,把 3 月发布的 Codex Security AI 智能体用起来,先给组织代码建威胁模型、梳理可能的攻击路径,再自动验证和检测高风险漏洞。这距离 Anthropic 公布 Claude Mythos 安全模型仅一个多月——Anthropic 当时说这模型太危险不能公开,只放在自家 Project Gla...

推荐理由:H/K/R 全中:Daybreak 有明确的竞品对标、具体的 agent 工作流,也戳中代码安全审计的共鸣点。不过这只是 Reddit 单帖,没有独立复现或论文/代码放出来,所以分数压在 82 没往上走。

The Verge · AI

Mira Murati 的新公司 Thinking Machines 在做什么:让模型边看边听边想,实时跟你协作

Thinking Machines 周一公布了他们的方向——做“交互模型”。按他们的说法,这种模型能同时接收音频、视频和文字,实时理解、回应并行动,而不是像现在的模型那样等你打完字或说完话才开始反应。正文没披露模型规模、发布时间、定价和最终产品形态,所以这东西到底多能打、什么时候能用上,现在都还是未知数。

推荐理由:这篇帖子给出了公司方向,但正文没披露模型参数、发布时间或产品形态,本质上是一次高关注度的创业方向亮相,不是可用的模型发布。HKR 三项都踩中,但信息缺口明显,所以留在 77 分这个位置,没往上拉。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

彭博科技

微软曾预期从早期 OpenAI 投资中拿回 920 亿美元

彭博这篇报道的正文被付费墙挡住了,只抓到了标题和一段反爬虫提示,所以关键细节全是缺口。标题说微软给早期 OpenAI 投资设定了 920 亿美元的回报目标。这个数字很大,但正文没披露投资条款、分钱时间表,也不知道实际已经收回多少。我会先打个折:920 亿是内部测算的预期值,不是已经落袋的利润,具体怎么算出来的、基于什么估值、有没有附带条件,目前都看不到。

推荐理由:Bloomberg 这次挖出的 920 亿美元回报目标是个硬数字,让微软和 OpenAI 的财务关系变得更具体了。我会先打个折:正文没披露投资条款、兑现时间表,也不知道实际回了多少钱,所以这个目标更像一个内部测算,别直接当成已实现的收益。对从业者来说,这个数字能帮他们判断微软这笔账划不划算,以及后续合作会不会因为财务压力变味。

彭博科技

Ilya Sutskever 说他在 OpenAI 的股份值 70 亿美元

Ilya Sutskever 公开表示,他持有的 OpenAI 股份价值约 70 亿美元,这让他成为公司最大的个人股东之一。不过,正文因为 Bloomberg 的反爬机制没抓到,具体持股比例、估值怎么算的、有没有交易条款,这些关键信息目前都看不到。

推荐理由:Sutskever 亲口说自己的 OpenAI 股份值 70 亿美元,这个数字够硬、也够抓眼球。但我会先打个折——正文没说他占多少比例、按哪轮估值算的、有没有锁定期或转让限制,所以这 70 亿更像一个参考价,不是能直接换算的现金。对从业者来说,这条消息的价值在于能窥见 OpenAI 早期核心成员的财富量级,但别急着拿它当估值锚点。

5月11日星期一

AI HOT 精选

菲尔兹奖得主实测 ChatGPT 5.5 Pro:17 分钟独立解决数学难题,成果够写博士论文

剑桥数学家、菲尔兹奖得主 Timothy Gowers 用 ChatGPT 5.5 Pro 做了个实验,只给简单提示,没做任何数学指导。AI 在 17 分钟内独立解决了一个加法数论公开问题,给出的构造在理论上是最优的。Gowers 判断这个成果完全够格写进博士论文。随后 AI 又在一个更难的 k 重求和集问题上,把已知上界从指数级改进到亚指数级,审阅者...

推荐理由:H、K、R 三项全中:有实名数学家、有 17 分钟出成果的具体说法、有对博士培养的警告。但正文没披露具体题目、提示词和验证路径,所以先别太激动,分数打 84 是合理的。

AI HOT 精选

Cognition AI 总部首次曝光:Scott Wu 和他 18 个月做到 4.45 亿美元年化收入的 Devin

推文放出了 Cognition AI 总部“Cog House”的内部画面。创始人 Scott Wu 是顶尖竞技程序员,拿过三次国际信息学奥赛金牌。他在 2023 年 11 月母亲去世、Sam Altman 被 OpenAI 解雇的同一天创立了公司,赌的是 AI 会变成能全天干活的智能体。他们做的 AI 软件工程师 Devin 刚上线时表现一般,但 1...

推荐理由:HKR 三项都过,因为这篇既有 Cognition AI 罕见的内部揭秘,又甩出了 Devin 的营收和估值数字。没给 P1 是因为它本质上是人物+公司特写,不是融资、产品发布或模型发布那种硬消息。

AI HOT 精选

OpenAI 成立部署公司 DeployCo,并收购 Tomoro,直接往企业里派驻工程师帮他们把模型用起来

OpenAI 新成立了一家叫 OpenAI Deployment Company(DeployCo)的独立公司,专门帮企业把 AI 系统真正部署到日常业务里。核心做法是派驻一种叫“前线部署工程师(FDE)”的人进到客户公司内部,跟业务、运营、一线团队一起找出 AI 最能产生价值的地方,然后重新设计流程、搭系统、做测试,直到能稳定跑在生产环境里。为了起步...

推荐理由:OpenAI 搞 DeployCo 是个实打实的企业战略信号。H 有独立公司的钩子,R 踩中了部署竞争的神经,但 K 很弱——定价、客户、时间都没披露,所以只能放在 featured 的底线分。

量子位 · 公众号

OpenAI 签下 750 兆瓦算力大单,芯片公司 Cerebras 趁势把 IPO 估值抬到 350 亿美元

Cerebras 把 IPO 发行价区间上调到每股 150 到 160 美元,按上限算估值约 350 亿美元。直接推手是 OpenAI 刚签了一份 750 兆瓦的 AI 算力采购协议,交付排到 2028 年。不过原文因为微信环境验证拦截,正文内容没抓到,具体合同金额、交付节奏和 Cerebras 的财务数据都没披露,这个估值能撑多久还得看后续招股书细节。

推荐理由:这条不是普通的 IPO 消息。OpenAI 用 200 亿美元、750 兆瓦的采购协议给 Cerebras 站台,直接把估值推到 350 亿美元,等于在英伟达之外硬开了一条新路。我会先打个折:Cerebras 的芯片主打推理优化,跟英伟达的训练生态还不是一个量级,但 OpenAI 愿意砸真金白银,说明大客户已经在认真找备胎了。正文没披露这笔订单的具体年限和单价,所以 200 亿是总承诺额还是框架上限,这点先别太激动。对看算力成本和供应链安全的人来说,这条值得追。

AI HOT 精选

Cerebras IPO 被抢爆,超额认购超 20 倍,发行价打算上调近三成

路透社的消息说,做 AI 芯片的 Cerebras 准备上市,结果被投资人抢疯了,超额认购超过 20 倍。公司一看这架势,打算把发行价从原来的 115-125 美元提到 150-160 美元,涨了快三成,发行股票数量也计划从 2800 万股加到 3000 万股,最多能融到 48 亿美元。这可能会是 2026 年到现在全球最大的一笔 IPO。Cerebr...

推荐理由:这条消息的看点在于需求数字很实在,不是那种模糊的“市场反响热烈”。20倍超额认购和主动提价近三成,说明机构在拿真金白银赌Cerebras能分走AI训练/推理芯片的蛋糕。不过正文没披露具体估值和上市日期,所以先别把它当成行业转折点,更像一个强需求信号。我会先打个折,等正式挂牌再看。

Computing Life · Share · 鸭哥调研

OpenAI 和 Anthropic 同一天搞了家一样的公司,但赌的是完全相反的结局

5 月 4 日,OpenAI 和 Anthropic 先后宣布与 PE 成立合资公司(JV),专门向大企业部署 AI。结构看着一样,但条款暴露了两家对“自己是什么公司”的判断截然相反。OpenAI 的 DeployCo 给了 PE 投资人 17.5% 的保底回报,相当于高价租用 PE 的渠道和控股权,把部署当成本,核心资产还是模型。Anthropic ...

推荐理由:我会先打个折,这篇是单人评论,没有多方信源交叉验证,所以分数卡在 80 附近。但它的切入点很巧,把 OpenAI 和 Anthropic 在同一天跟私募成立合资公司这件事拎出来,用保底回报这个具体数字说清了两种商业路线的分歧。对关注 AI 公司怎么赚钱、怎么跟资本绑定的从业者来说,信息量够,读起来也不累。

Computing Life · Share · 鸭哥调研

Google 悄悄关停 Project Mariner,但三家大模型公司其实得出了同一个结论

Google 在 5 月 4 日毫无预告地关掉了去年 I/O 大会上主推的 AI 浏览器代理 Project Mariner。这件事不能简单看成 Google 掉队,因为 Anthropic 和 OpenAI 在同类产品上也撞了墙。核心问题在于,独立浏览器代理(像 Mariner、Operator)一启动就是个全新的、没有 cookie 和浏览记录的会...

推荐理由:这条消息的价值在于把三家公司对浏览器 agent 的悲观判断摆在一起,而不是只报 Google 一家关停。关停日期是新的,但正文没给出官方公告链接,也没披露失败的具体指标,比如任务成功率掉到多少、成本高到什么程度,所以信息强度有折扣。对做 agent 的人来说,知道大厂在这个方向上集体后撤,比看一篇技术方案更有参考意义,但缺少一手数据支撑,只能算一个值得注意的信号。

AI HOT 精选

《科学》研究:OpenAI 一年前的 o1 模型急诊诊断正确率 67%,超过医生的 50-55%

我会先打个折:这项研究用的是 OpenAI 一年前发布的 o1 模型,按现在标准已经算旧版了。测试数据来自真实急诊室,信息混乱、不完整,模型给出的正确或接近正确的诊断率达到 67%,而参与对比的医生是 50-55%。差距在早期分诊阶段最明显,那时能拿到的信息最少。研究还提到 o1 在处理结构化病例时临床推理几乎不出错。不过正文没披露样本量有多大、医生是...

推荐理由:我会先打个折:这只是一项诊断研究,没覆盖住院数据和影像诊断,别急着说 AI 能独立看急诊。但《科学》背书加上 o1 在真实急诊病例上比医生高出十几个百分点,确实值得从业者看一眼。它说明在特定文本诊断任务上,旧模型已经能摸到甚至超过人类平均水平,后续怎么落地、怎么担责才是真难题。

5月10日星期日

FT · 科技

OpenAI 庭审把这家公司 8520 亿美元估值背后的恩怨摆上了台面

马斯克起诉 OpenAI 的官司进入最后一周,Sam Altman 即将出庭作证。正文被付费墙挡住,看不到具体证词和庭审细节,但标题点明了核心矛盾:OpenAI 从非营利转向商业巨头的过程中,早期创始人之间的分歧和竞争关系被公开审视。8520 亿美元这个估值数字本身就在说明,这场官司不只是理念之争,背后牵扯的利益规模已经大到难以私下和解。

推荐理由:这条稿子本身没有模型、产品、融资或高管变动,纯粹是法庭进展和估值数字。我会先打个折:8520亿这个数正文没交代来源和计算方式,只能当标题信息用。但HKR三项都成立——标题自带冲突和人物,时间节点清晰,话题又压在OpenAI治理和巨头博弈的敏感带上,所以放在featured档位没问题,不升到P1。

新智元 · 公众号

硅谷顶尖 AI 甩开世界一年?这篇正文其实没给实锤

这篇文章的标题抛出一个很猛的判断,说硅谷最前沿的 AI 比外界领先一年,我们用的都是“技术余晖”。但点进去后,页面直接显示“环境异常,完成验证后即可继续访问”,正文内容完全没加载出来。所以,标题里提到的投资人 Elad Gil 的时间差说法(顶尖实验室员工领先硅谷 3-4 个月,硅谷又领先纽约 3-6 个月),以及 Mythos 在专家级网络攻击模拟中...

推荐理由:我会先打个折:这篇是二手评论,不是模型或产品发布,所以分数压在72–77这个区间。HKR三项都成立——“技术余晖”的钩子够抓人,时间差和73%成功率给了具体数字,地域焦虑感也拉满了。正文没披露Mythos测试的具体条件和样本量,这点先别太激动,但作为一篇制造FOMO的评论,它完成了任务。

5月9日星期六

TechCrunch · AI

英伟达今年已承诺 400 亿美元做 AI 股权投资

英伟达继续在 AI 圈大笔撒钱。根据 CNBC 和 FactSet 的数据,2026 年才过了几个月,它已经承诺了超过 400 亿美元的股权投资。最大一笔是给 OpenAI 的 300 亿,剩下的分布在七笔对上市公司的数十亿美元级投资,以及大约二十多轮对未上市初创公司的参投里。最近的两笔包括给玻璃制造商康宁最多 32 亿、给数据中心运营商 IREN 最...

推荐理由:HKR 三项都成立:400 亿这个半年数字冲击力强,300 亿流向 OpenAI 和约 24 笔交易都是硬信息。它不是模型发布或产品更新,而是资本结构信号,所以放在 78–84 这个区间合理。正文没披露这些投资的条款细节,比如是现金、芯片折价还是云额度,这点先别太激动。

机器之心 · 公众号

OpenAI 研究员翁家翌提出“启发式学习”:不调模型参数,靠改代码和记忆来训练 AI

OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路,核心是不再靠梯度去更新神经网络权重,而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证,提到 codex gpt-5.4 在打砖块(Breakout)上拿了满分 864 分,并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...

推荐理由:OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路,不是官方产品发布,更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分,Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折:正文没披露这套方法在更复杂任务上的泛化表现,也没说计算开销多大,所以“下一个训练范式”这个判断先别太激动。但如果是真的,意味着不用梯度也能让模型在具体环境里持续变强,对做 agent 自进化的团队是个值得盯的参考。

Latent Space

Anthropic 一年翻十倍,其他公司却在裁掉超过一成的人

Anthropic 现在被二级市场估到 1 万亿到 1.2 万亿美元,已经超过 OpenAI,排进全球前 15 大公司。这个估值背后有实打实的收入支撑:他们刚经历了一个“奇迹般”的第一季度,年化收入增速达到 80 倍,一个月内年化收入又跳涨了 150 亿美元。另一边,Block 裁了 40% 的人,Coinbase 裁了 14%,Cloudflare ...

推荐理由:这条不是官方融资或产品发布,属于行业评论,但信息密度高。Anthropic的10倍年增长和1万亿以上估值数字很扎眼,旁边又列了一串裁员百分比,对比强烈。我会先打个折:估值和增长数据正文没交代来源,是转述的说法,不能当实锤用。但即便保守看,它也点出了AI行业资金和人才在向头部集中的趋势,对从业者判断方向有参考价值。

AI HOT 精选

DeepSeek 正以 500 亿美元估值融资 70 亿,创始人自己掏了 30 亿

DeepSeek 这轮最多要融 70 亿美元,估值 500 亿,是中国 AI 公司里单轮金额最高的一次。创始人梁文锋个人出了 30 亿,占这轮融资的 40%,融完后他手里还有公司 90% 的股份。DeepSeek 最早是从他自己的对冲基金里孵化出来的。这笔钱主要用来买算力、推 V4.1 新模型,以及做企业级产品,目标是让公司开始有正向收入,路线跟 Op...

推荐理由:这条消息的钩子是梁文锋个人砸 30 亿美元,不是常规融资通稿。数字够具体,能让人算出估值和出资比例。不过正文没披露领投方、具体条款和官方确认,只有单一信源,所以我会先打个折,不把它当定论。对从业者来说,这轮融资如果属实,说明 DeepSeek 在走一条靠创始人重注维持独立性的路,跟 OpenAI 那种外部巨头主导的模式不一样,这点值得留意。

MIT Technology Review · AI

马斯克诉阿尔特曼案第二周:OpenAI 反击,齐利斯曝马斯克曾试图挖走阿尔特曼

庭审第二周,OpenAI 总裁布罗克曼出庭反驳马斯克的说法。他作证称,2017 年正是马斯克自己推动 OpenAI 成立营利部门,并试图获得多数股权、董事会控制权和 CEO 职位,后来因争夺“绝对控制权”失败才离开。布罗克曼还提到,开庭前两天马斯克曾发消息威胁“你和山姆会成为全美最招恨的人”。前 OpenAI 董事会成员齐利斯则透露,马斯克曾想挖阿尔特...

推荐理由:这条新闻是 Musk 和 Altman 法律战第二周的新进展。核心信息有两个:一是 Greg Brockman 作证说 Musk 早在 2017 年就要求 OpenAI 成立营利部门,并且自己要当老大,这和 Musk 现在“OpenAI 背叛非营利使命”的说法有矛盾;二是 Shivon Zilis 透露 Musk 曾试图把 Altman 挖去特斯拉。加上 Musk 这次索赔金额最高到 1340 亿美元,还把微软也告了,整件事已经从口水战升级成涉及控制权和巨额赔偿的官司。正文没披露 Brockman 证词的具体文件来源,但信息量足够让从业者重新审视 ...

The Verge · AI

AI 数据中心扩张引发全美争议:43% 美国人认为电费上涨要怪它们

The Verge 梳理了 AI 数据中心在全球引发的冲突。调查显示 43% 的美国人把电费上涨归咎于数据中心;犹他州一个占地 4 万英亩的项目不顾社区反对获批;Anthropic 宣布将在美国投入 500 亿美元建 AI 数据中心。报道还提到,数据中心附近的电费最高涨了 267%,俄勒冈州的数据中心被怀疑与当地癌症和流产率上升有关,而美国最大的电网系...

推荐理由:这是 The Verge 的一篇动态汇总,不是单一重磅事件,但里面塞了不少硬数字:43% 的民调归因、4 万英亩土地审批、500 亿美元资本开支计划。我会先打个折,因为它更像信息拼盘,不过这些电网和成本数据对从业者判断基础设施风险挺有用,所以放在行业报道的上限位置。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。

AI HOT 精选

OpenAI 公开自家怎么安全跑 Codex:沙箱隔离、人工审批、网络管控和代理日志四道防线

OpenAI 发了一篇技术博文,讲他们内部部署编程代理 Codex 时用的安全方案。核心是四件事:第一,用沙箱把代理的执行环境圈起来,低风险操作自动放行,高风险动作必须等人拍板;第二,网络访问不做全开放,只允许访问已知域名,陌生域名要审批;第三,身份认证强制走 ChatGPT 企业工作区,凭证存在系统钥匙串里;第四,代理的所有行为都通过 OpenTel...

推荐理由:我会先打个折:正文没给评测数据、事故率,也没说企业部署要满足什么条件,所以分数停在 74。但 HKR 三项都踩中了——OpenAI 把 Codex 的安全拆成沙盒、人工审批、网络策略和遥测四层,对做代码 agent 的人来说是能直接参考的架构思路。这点先别太激动,毕竟没看到跑分或实际事故记录,但作为安全方案框架,信息量够用。

阿里技术 · 公众号

阿里许晓斌内部访谈:工程师用 AI 后,写代码时间从 30% 降到 5%,端到端交付效率提升 2-3 倍

许晓斌在内部访谈里给了几个数:工程师重度用 AI 后,写代码占工作时间从 30% 掉到 5%,跟 Agent 对话的时间从 5% 涨到 60%,端到端交付效率提升 2 到 3 倍,纯编码效率提升 10 倍。这些数字来自内部访谈,不是大规模统计,样本量和统计口径正文没披露,所以我会先打个折看。核心变化不是代码写得更快,而是工程师的时间分配被彻底打散重排—...

推荐理由:阿里技术这篇是内部访谈整理的组织方法论,不是产品发布或模型更新,但给出的数字很具体,能让人直观感受到 AI 把工程师的工作重心从写代码拽到了指挥 Agent 上。我会先打个折:效率提升 2 到 3 倍这个说法正文没交代是怎么算出来的,样本量和统计口径都不清楚,这点先别太激动。不过 HKR 三项都踩中了,放在 featured 门槛上刚好。

机器之心 · 公众号

OpenAI 发布命令行工具,不用再折腾 SDK 了

OpenAI 开源了一个叫 openai-cli 的命令行工具,让开发者直接在终端里调用它的模型。你可以用一条命令完成对话、生成图片、编辑图片、语音转文字和文字转语音,不用再为复杂的 SDK 集成头疼。不过,这篇文章的正文因为微信环境验证被挡住了,具体支持哪些参数、怎么安装、有没有延迟数据,这些细节都没看到。

推荐理由:OpenAI 终于出了个官方命令行工具,开源,一行命令就能在终端里调模型、生图、转语音,不用再折腾各种 SDK 版本。对天天跟 API 打交道的开发者来说,这能省不少集成和维护的力气。不过这只是个工作流层面的更新,不是模型能力升级,所以重要性我给打个折,放在低 featured 档。正文没提性能对比或实际延迟数据,这点先别太激动。

Latent Space

OpenAI 发了三个实时语音模型:GPT-Realtime-2、翻译版和 Whisper 版,上下文从 32K 扩到 128K

OpenAI 在 Realtime API 里上线了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。GPT-Realtime-2 是主打的语音对话模型,OpenAI 说它用上了 GPT-5 级别的推理能力,上下文窗口从之前的 32K 直接拉到 128K,一次最多能输出 32K ...

推荐理由:我会先打个折:这不是新基础模型,是 API 层面的更新,所以分数没往 90 以上拉。但 128K 上下文和 96.6% 的音频基准分确实够硬,对实时语音应用来说是个实打实的升级。正文没提延迟和具体定价,这点先别太激动,等上线跑过再看。

AI HOT 精选

Anthropic 计划今夏融资最高 500 亿美元,估值可能冲到近万亿,反超 OpenAI

Anthropic 正在筹备一轮新融资,目标金额最高 500 亿美元,融资前估值约 9000 亿美元,完成后整体估值将接近 1 万亿美元。这个数字会超过 OpenAI 今年 3 月融资后的 8520 亿美元估值。公司年化收入预计很快超过 450 亿美元,是去年底的 5 倍。投资方 Dragoneer、General Catalyst 等已表示兴趣,部分...

推荐理由:我会先打个折:消息来自《金融时报》的“消息称”,不是官方确认的融资关闭,所以数字别当定论。但即便打七折,9000 亿的融资前估值和 500 亿的募资规模也够吓人,直接让 Anthropic 在纸面上压过 OpenAI。这点先别太激动,正文没披露这轮钱具体怎么花、投资人是谁,也没说 IPO 时间表。真正值得盯的是两件事:一是算力扩张,说明大模型烧钱竞赛还没见顶;二是年底 IPO 前的持仓需求,意味着早期投资人可能在找接盘窗口。对从业者来说,这比估值数字本身更实在。

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

FT · 科技

Anthropic 正在谈新一轮融资,估值可能冲到近 1 万亿美元

Anthropic 收到了外部投资意向,如果谈成,估值会接近 1 万亿美元,超过 OpenAI。不过这篇 FT 文章正文被付费墙挡住了,只显示了标题和导航栏,没有披露收入到底涨了多少、具体融资金额、投资人是谁、条款怎么定。所以“收入激增”这个说法暂时看不到数据支撑,先别太激动。

推荐理由:HKR全中:FT说Anthropic在考虑一笔可能让估值冲到近1万亿美元的交易,甚至超过OpenAI。我会先打个折,因为正文没披露收入到底涨了多少、谁在投、什么条件,信息缺口不小。分数留在85-94这个区间,就是因为它有猛料但缺关键数字,别太激动。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

AI HOT 精选

ChatGPT 中文回复老说“我会稳稳地接住你”,WIRED 拆解了原因

ChatGPT 在中文对话里反复蹦出“我会稳稳地接住你”这类怪话,已经成了梗。WIRED 把这归因于模式坍缩——模型在后训练中被奖励机制带偏,逮住几个讨好人的短语使劲用。一个直接原因是翻译错位:英文口语“I've got you”被生硬直译成煽情长句,再被 RLHF 强化成“用户爱听”的固定套路。类似问题还有无故冒出“砍一刀”这种营销话术。这事不是 O...

推荐理由:我会先打个折——正文没给样本量,所以“频现”到底多频繁说不清。但这条信息对做对齐和中文产品的团队有提醒价值:模式坍缩和翻译错位会让模型输出变得油腻,RLHF 讨好奖励又容易把这种表达固化下来。Claude 和 DeepSeek 新版本也出现类似表达,说明这不只是 OpenAI 一家的问题。不过,缺少数据支撑让判断只能停在“值得留意”这个级别。

TechCrunch · AI

OpenAI 给 ChatGPT 加了“信任联系人”,在对话涉及自残风险时通知你指定的人

OpenAI 在 ChatGPT 里上线了一个叫“信任联系人”的安全功能。当系统判断用户对话出现自残倾向时,会通知用户提前设置好的联系人。正文没披露具体用什么信号触发、通知流程怎么走、目前覆盖哪些地区。我会先打个折:误判、隐私边界、人工审核介入到什么程度,这些关键点都没说清楚。

推荐理由:OpenAI 给 ChatGPT 加了个 Trusted Contact,对话一旦转向自伤就触发保护。我会先打个折:正文只给了名字和场景,怎么触发、联系人怎么走、哪些地区上线一概没提。真正值得盯的是误报会不会把普通对话误判、隐私怎么兜底、人工审核介入到什么程度,这些边界没划清楚之前,功能听起来有用但落地风险不小。

AI HOT 精选

OpenAI 的 Codex 插件现在能在 Chrome 里跨标签页同时干活了

Codex 插件现在支持在 macOS 和 Windows 的 Chrome 上运行,可以跨标签页在后台并行处理网页和应用,不会抢走你对浏览器的控制权。正文没提具体版本号、同时能跑几个任务,也没说企业策略怎么管。想用的话,在 Codex 应用里装一下 Chrome 插件就行。

推荐理由:HKR-H/K/R 全过,但正文只给了平台和执行机制,版本号、并发上限、企业管控都没提。分数 76,算一个实用的 OpenAI Codex 产品更新。

The Verge · AI

Mira Murati 的证词把 Sam Altman 被罢免的内幕掀开了

The Verge 拿到了 Mira Murati 在马斯克诉 Altman 案中的证词,里面讲的是 2023 年感恩节前 OpenAI 董事会炒掉 Sam Altman 的细节。董事会当时的理由是 Altman 没有一直坦诚沟通。不过 Murati 拿出的聊天记录和邮件,反而让她自己的说法显得有点前后矛盾。正文没披露完整的证词内容,但现有材料指向的是...

推荐理由:HKR 三项都成立:Murati 证词是强钩子,法庭材料是新信源,治理话题切中行业神经。但核心事件是 2023 年的旧事,只是多了证词角度,而且 RSS 摘要没给出完整证词细节,所以放在 featured 档刚好,上不了 P1。

The Verge · AI

ChatGPT 上线“紧急联系人”:检测到自残倾向时会通知你指定的人

OpenAI 给 ChatGPT 加了一个可选功能,成年用户可以在设置里填一位紧急联系人。当系统检测到对话涉及自残或自杀话题时,会自动发通知给这个人。这个功能之前只对青少年用户开放,现在推到了所有成年人。不过正文没提误报率有多高、怎么处理误触发,也没说会在哪些地区先上线。

推荐理由:OpenAI 给 ChatGPT 加了一个可选的安全兜底:让用户设一位信任联系人,系统觉得对话里有自伤或自杀风险时就通知对方。这个动作把 AI 从对话工具推到了人身安全干预的位置,产品边界拉得很开。但正文没写误报怎么处理、在哪些地区上线、用户能不能申诉,这些缺口让实际落地效果要打个问号。所以重要性给 82,比模型发布或核心能力更新低一档,但足够放进 featured。

r/LocalLLaMA

警惕:Hugging Face 上的 Open-OSS/privacy-filter 仓库实为窃密木马

Reddit 用户发帖警告,Hugging Face 上名为 Open-OSS/privacy-filter 的仓库是信息窃取器。它伪装成 OpenAI 的隐私过滤器,通过 loader.py 拉取 PowerShell 脚本,再下载一个 EXE 文件并利用 Windows 任务计划程序运行。发帖者已向微软和 Hugging Face 举报,帖子提到 ...

推荐理由:HKR 三项都成立:伪装成 OpenAI 隐私过滤器的恶意模型有明确的 Windows 执行链,对本地部署用户来说是个实在的供应链风险。信息源目前只有 Reddit 用户报告,缺少官方确认,所以重要性停在 73 分 featured 档位是合理的。