跳到正文

#OpenAI

今日 45 条

5月7日星期四

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

OpenAI News

OpenAI 在 API 里上线了三款实时语音模型,能边听边推理、翻译和转写

OpenAI 这次发了三个新模型:GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型,能处理更复杂的请求,说话中间可以插话、改主意,它还能边想边回一句“我查一下”,同时调用多个工具;GPT‑Realtime‑Translate 做实时翻译,支持 70 多种输入语言转 13 种输出语言,语速跟得上说话人;GPT‑Realtime‑Whi...

推荐理由:OpenAI 官方放出了语音 API 更新,方向明确但信息不全。能推理、翻译、转写,听着挺全,可没给价格、没给延迟、没给上下文限制,我会先打个折。如果是真的省钱又低延迟,那对语音应用开发者是直接利好;现在只能说方向对了,落地还得等更多参数。

AI HOT 精选

OpenAI 内斗短信曝光:董事会换掉 Altman 的真实动机是“不想让 AGI 落你手里”

马斯克起诉 OpenAI 的庭审文件公开了前 CTO Mira Murati 的证词和 2023 年 11 月政变当晚的内部短信。短信记录显示,董事会在解雇 Altman 后态度反转,已经选定前 Twitch CEO 当接班人;Altman 当时还提过让微软收购 OpenAI 来达成董事会想要的治理目标。被问到为什么非要赶走 Altman 时,Mura...

推荐理由:我会先打个折:这事发生在 2023 年,现在属于旧案新料,而且原文是 X 上的摘要级信息,细节完整度有限。但 H、K、R 三项都站得住。内部短信和 Murati 证词把“董事会为什么非要赶走 Altman”这个老问题拉回了台前,那句“不想让 AGI 掌控在你手上”比之前任何公开声明都更直白。1800 亿美元索赔是个硬数字,说明马斯克这次不是口头喊话。对从业者来说,这不止是八卦,而是直接关系到 OpenAI 的决策机制和 AGI 控制权会落在谁手里。所以给到 82 分、featured 级别,没再往上拉是因为信息源本身是二手转述,原始证词全文还没看到。

OpenAI News

ChatGPT 上线“信任联系人”:检测到严重自伤风险时,可通知你指定的人

OpenAI 给 ChatGPT 加了一个可选的安全功能。成年人可以在设置里指定一位信任的联系人,比如家人或朋友。当系统自动监测和人工审核都判定你的对话里出现了严重的自我伤害倾向时,ChatGPT 会通知这位联系人。通知内容很克制,只说出现了需要关心的自伤话题,不会透露聊天细节。正文没披露具体的检测机制和误报率,只说审核团队会争取在一小时内完成判断。这...

推荐理由:H、K、R 三条都站得住:ChatGPT 的安全钩子很具体,也容易引发讨论。重要性给到 73 分、放在 featured 里是合适的,因为功能本身有话题性,但检测方式、配置流程和上线范围全是空白,没法往更高里打。

r/LocalLLaMA

Reddit 帖子称有匿名资金在付费让网红把中国 AI 塑造成威胁

一篇 r/LocalLLaMA 的帖子提到,有来源不明的资金在 TikTok 上付费给网红,让他们把中国 AI 渲染成安全威胁。帖子附了 WIRED 的链接,并点名一个由 OpenAI 和 Palantir 支持的超级政治行动委员会,但正文没披露具体花了多少钱、找了哪些创作者、以及针对哪些人群投放。另外,Reddit 原文链接返回了 403,帖子内容本...

推荐理由:我会先打个折:目前只有 Reddit 帖子和 WIRED 链接,正文没披露具体金额、网红名单、投放机制,所以事实底座还比较薄。但钩子够强——暗钱、网红、中国 AI 威胁,这三样凑一起,对关注 AI 政策与安全的人来说很难忽略。可验证性也成立,因为付费投放的说法是可以追查的。综合看,话题性拉满,信息密度偏低,放在低分 featured 档是合适的。

The Verge · AI

OpenAI 前 CEO Mira Murati 在法庭上说,她没法再信 Sam Altman 的话

Mira Murati 在 Musk 诉 Altman 案中宣誓作证,说 Altman 曾就一个新模型的安全流程对她撒谎。Altman 声称法务部门已批准跳过部署安全委员会的审查,但 Murati 发现事实并非如此。报道没透露具体是哪个模型。这件事的核心争议点在于 OpenAI 内部的安全治理到底有没有人真正在把关。

推荐理由:Murati 的证词把 OpenAI 内部安全流程的争议从传闻变成了法庭记录。她说 Altman 对她谎称一个未具名新模型不需要经过部署安全委员会,理由是法务已经认定——如果属实,等于安全委员会被架空了一次。正文没披露模型名称,也没说这个模型最终是否部署了,所以实际影响还判断不了。但“CEO 对 CTO 撒谎来绕过安全流程”这件事本身,比模型能力分数更值得从业者留意。我会先打个折,因为关键细节缺失,没法确认是单次事件还是系统性操作。

TechCrunch · AI

DeepSeek 首次对外融资,估值可能冲到 450 亿美元

DeepSeek 正在谈第一笔外部投资,几周内估值就从 200 亿涨到了 450 亿美元。这家中国 AI 实验室 2025 年初靠一个训练成本远低于 OpenAI、Anthropic 等美国模型的大语言模型出圈,之后在推理和编程能力上一直咬住第一梯队,模型权重也开放下载。创始人梁文锋原本没打算融资,但对手开始挖人,他才决定引入资金好给员工发股份。领投方...

推荐理由:DeepSeek 第一次对外融资,目标估值 450 亿美元,我会先打个折——正文没给金额、没列投资方、也没提条款,所以这个数目前更像一个信号而不是定论。真正值得盯的是:如果首轮真按这个价成交,中国 AI 实验室的估值天花板就被重新画了一条线。这点先别太激动,等更多细节出来再说。

5月6日星期三

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

Latent Space

GPT-5 用 11 分钟复现了物理学家的硬核论文,OpenAI 开始正经搞科研了

理论物理学家 Alex Lupsasca 聊了他怎么用 GPT-5 做研究。他先让模型做了道课本里的热身题,然后 GPT-5 只花了 11 分钟就复现了他一篇获奖级别的论文,这篇论文的发表日期在模型训练数据截止之后。后来,他加入 OpenAI 的科学团队,用 GPT-5.2 去算一个以前被认为不可能手算的胶子振幅公式,模型真给出了非零结果,团队花了三周...

推荐理由:Alex Lupsasca 在访谈里说,他们拿教材给 GPT-5 预热后,模型 11 分钟就复现了他论文里的结果;ChatGPT 又在一天内产出 110 页引力子计算,团队花了三周才验证完。我会先打个折:这是单人访谈,没有第三方复现,而且理论物理这个领域太窄,换到其他任务能不能跑通还不清楚。正文没披露验证过程中改了多少轮 prompt,也没说那 110 页里有多少是废话。所以先给 84 分,放在 featured 里,等有更硬的基准测试出来再调。

The Verge · AI

OpenAI 说 ChatGPT 默认模型 GPT-5.5 Instant 的幻觉问题少了一大截

ChatGPT 把免费用户和 Plus 用户的默认模型换成了 GPT-5.5 Instant。OpenAI 内部测试显示,在容易出高风险幻觉的提示上,它比上一代 GPT-5.3 Instant 的瞎编次数少了 52.5%;在被标记为“难聊”的对话里,不准确的说法也降了 37.3%。不过正文没披露测试集到底有多大,也没说这些“高风险提示”具体怎么定义的,...

推荐理由:OpenAI 把 ChatGPT 默认模型换了,还主动报了两个幻觉下降的数字,热点、新知、关联度都够。不过正文没给评测集规模和复现方法,我会先打个折——数字好看,但暂时没法独立验证。默认模型换人本身就是当天该推的料,所以还是给了 p1。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

5月5日星期二

The Verge · AI

郭明錤爆料 OpenAI 正在给 ChatGPT 做手机,计划 2027 年初量产

天风国际分析师郭明錤说,OpenAI 正在加速推进一款 ChatGPT 手机,目标是 2027 年初开始大规模生产。这款手机会用联发科定制的天玑 9600 芯片,图像处理器(ISP)专门加强了 HDR 能力,可能是为了提升相机和视觉识别体验。不过,原文没提手机卖多少钱、长什么样、用什么操作系统。郭明錤的供应链爆料准确率不低,但 OpenAI 自己还没回...

推荐理由:HKR 三项全中,但消息源是郭明錤的供应链爆料,不是 OpenAI 官方发布。我会先打个折:正文没披露价格、外观和系统,这些关键信息全缺,所以重要性到不了必写级别。

OpenAI News

OpenAI 发布 MRC 网络协议,让超大规模 GPU 集群训练更抗断、更省电

OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...

推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。

OpenAI News

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,回答更准、废话更少

OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...

推荐理由:HKR 三项全中:OpenAI 把 ChatGPT 默认模型切到了 GPT-5.5 Instant,说答案更准、幻觉更少、个性化控制更好,但没给任何评测数字、价格或上下文窗口,我会先打个折。这点先别太激动,等看到实测再判断。

OpenAI News

GPT-5.5 Instant 系统卡发布,这是 OpenAI 首个在网络安全和生化风险上被标为“高能力”的 Instant 模型

OpenAI 放出了 GPT-5.5 Instant 的系统卡,确认了模型代号是 gpt-5.5-instant。这篇公告主要是定性说明,没有给出具体的评测分数、上下文窗口大小或发布时间。值得留意的是,这是 Instant 系列里第一次在网络安全、生物与化学武器制备这两个风险类别上被提升到“高能力”等级,并配套了相应的安全防护措施。OpenAI 还特别...

推荐理由:我会先打个折:这张系统卡目前只有一个标题,正文什么都没披露。H 和 R 能过,是因为 OpenAI 官方放出 GPT-5.5 Instant 这个名字本身就够抓眼球,从业者会关心它跟现有模型的定位差异和价格。但 K 完全站不住——没有跑分、没有安全测试结果、没有上下文长度,连发布时间都没提,等于只有个壳。这点先别太激动,等后续有实际数据再重新评估。

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

新智元 · 公众号

OpenAI 总裁当庭承认:自己没掏一分钱,就拿到了估值近 300 亿美元的股权

Greg Brockman 在法庭上承认,他获得 OpenAI 营利性子公司的股权时,自己没出任何现金。这部分股权现在价值超过 200 亿美元,接近 300 亿美元。听证会还挖出他和 Sam Altman 都持有芯片公司 Cerebras 的股份,而 OpenAI 先给了 Cerebras 一份 100 亿美元的订单,后来又追加到 200 亿美元,中间...

推荐理由:我会先打个折:信息来自单一庭审爆料,标题带点煽风点火的味道,但核心事实够硬——没投现金却拿天价股权、高管同时持有供应商股份、订单金额从100亿翻到200亿,这些数字把OpenAI非营利转营利的合规问题钉得很死。正文没披露交叉持股的具体比例和贷款条件,但现有信息已经足够让从业者重新审视这家公司的治理结构。

OpenAI News

OpenAI 给 ChatGPT 广告加了自助下单和按点击付费

OpenAI 开始在美国小范围测试自助广告后台,广告主可以直接注册、充值、上传素材、管理投放。同时新增了按点击付费(CPC)的出价方式,之前只有按千次展示付费(CPM),现在广告主可以只为用户点击买单。文章说 ChatGPT 对话里很多人正在做决策,点击能说明广告确实帮到了用户。测量工具也加了转化 API 和像素追踪,能看广告带来的购买、留资、注册等后...

推荐理由:OpenAI 把 ChatGPT 广告做成可自助采买的工具了,上线了 beta 版广告管理器,支持按点击付费,还补了测量工具。官方强调广告和对话数据是分开的,不会拿聊天记录去投广告。但正文没披露价格、投放范围,也没说什么时候全面开放,所以先打个折,这还是个中等体量的产品更新,别当重大商业化节点来读。

TechCrunch · AI

Cerebras 准备上市,估值可能冲到 266 亿美元,背后是跟 OpenAI 的深度绑定

AI 芯片公司 Cerebras 正在推进 IPO,目标估值至少 266 亿美元。它的核心卖点不是通用芯片,而是跟 OpenAI 绑得很紧的供应链关系。文章没披露 OpenAI 有没有持股、具体贡献了多少收入,也没说上市时间表。所以这轮估值更多是在赌 OpenAI 的算力需求会持续砸在 Cerebras 身上,而不是单纯看芯片本身的技术指标。

推荐理由:我会先打个折:正文其实没给出营收、持股和上市时间表,所以别把它当芯片概念股去追。真正有意思的是 OpenAI 供应链外溢出来的估值效应——一家靠绑定 OpenAI 起来的芯片公司能冲到 266 亿美元以上,说明市场在给 AI 算力渠道和合作关系定高价。这点先别太激动,但确实值得放进雷达里观察。

FT · 科技

OpenAI 总裁为转营利辩护,自曝持有 300 亿美元股份

OpenAI 总裁公开回应了公司从非营利转向营利的争议,并透露自己在这家公司的持股价值高达 300 亿美元。马斯克之前起诉说高管们为了个人利益出卖了慈善使命。不过这篇报道正文被付费墙挡住了,没披露这位总裁具体是谁、股权结构怎么设计、以及重组的具体条款。

推荐理由:OpenAI 总裁为营利化重组辩护,顺带曝出 300 亿美元持股,Musk 的诉讼正好咬住这点说高管为个人收益背离慈善使命。热度够高,当天就该推。但正文只有 RSS 摘要,连总裁是谁、股权怎么分、重组什么条件都没写,信息缺口太大,所以分数到不了 95 以上。

彭博科技

OpenAI 总裁 Greg Brockman 在法庭上承认,他手里的公司股份价值接近 300 亿美元

马斯克的律师在庭审中追问 Brockman,既然 OpenAI 最初是非营利机构,为什么他没把大部分收益捐给基金会的非营利部门。Brockman 当庭给出的数字是“接近 300 亿美元”。不过报道没披露他具体持股比例、这个估值是怎么算出来的,也没说案件现在走到哪一步了。

推荐理由:我会先打个折:正文只给了庭上追问和证词,没披露持股比例、估值怎么算的,也没说诉讼走到哪一步,所以信息缺口不小。但“近 300 亿”这个数字本身够炸,加上 Musk 律师直接喊话退钱,画面感强,对关注 OpenAI 治理和创始人财富的从业者来说是个值得追的信号。

5月4日星期一

TechCrunch · AI

Anthropic 和 OpenAI 同时成立合资公司,要把企业 AI 服务卖得更猛

两家公司都找了资产管理方合伙,成立合资公司来推企业级 AI 产品。具体是哪家资管、股权怎么分、定价多少、什么时候上线,正文都没披露。这种操作说明两家都在想办法把企业客户圈得更紧,但没看到实际条款之前,我会先打个折——合资公司到底是为了深度定制服务,还是换个渠道铺销售,现在还不好说。

推荐理由:我会先打个折:正文只给了 RSS 摘要,没写资管方名字、股权怎么分、定价和什么时候上线,所以现在只能看个方向。两家同时走合资这条路,说明他们想把企业销售这件事做得更重、更贴近大客户,但具体谁出钱、谁控盘还不清楚。这点先别太激动,等细节出来再判断实际影响。

新智元 · 公众号

DeepMind 用 AI 挑战 700 道数学难题,结果有一题题干是错的,AI 还硬写了数十页证明

Google DeepMind 搞了个叫 Aletheia 的流程,拿 Gemini Deep Think 去啃 700 道 Erdős 数学猜想。流程是先让模型生成 200 个候选答案,再用验证器筛到 63 个,最后产出 13 个原创解答。乌龙出在 Erdős-75 这道题上:题干本身就有问题,但 Aletheia 没发现,照样洋洋洒洒推导了几十页。...

推荐理由:我会先打个折:文章本身是媒体转述,原始论文细节得去看 arXiv,正文没披露验证器的具体设计和人类专家的复核标准。但选题确实抓人——一个题干有误的 Erdős-75 问题,AI 照样输出几十页证明,这比单纯报 benchmark 分数更能让人停下来想一下推理可靠性。700 个问题、13 个原创答案、200 到 63 的筛选管线,这些数字把流程讲清楚了,不是空泛的“AI 做数学”。对从业者来说,验证器能筛掉什么、筛不掉什么,才是真正关心的,文章至少把这个问题摆到了台面上。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。

Hacker News 首页

哈佛急诊分诊试验:OpenAI o1 诊断准确率 67%,比医生高出 12-17 个百分点

哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者,而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小,但正文没披露样本量、病例构成和具体评估方法,所以数字本身只能当个方向参考。模型是在结构化信息里做判断,和医生在嘈杂急诊室里干活的条件完全不一样,直接比准确率会高估模型的实际可用性...

推荐理由:HKR 三项都成立:急诊分诊是高 stakes 场景,67% vs 50–55% 给了一个可讨论的数字,临床信任和职业边界问题自带传播力。但样本量和测试条件全没披露,所以分数压在 78–84 区间,不给 P1。

5月2日星期六

r/LocalLLaMA

Reddit 帖子称有黑钱资助网红把中国 AI 塑造成威胁,但原文被屏蔽无法核实

这篇 Reddit 帖子指控一个叫 Build American AI 的组织花钱请网红散布“中国 AI 是威胁”的叙事,并把它和 OpenAI、a16z 高管支持的政治行动委员会扯上关系。但帖子正文被网络屏蔽,返回了 403 错误,具体花了多少钱、找了哪些网红、投放机制全都没披露。目前只能看到标题和摘要,信息缺口很大,这点先别太激动。

推荐理由:HKR 三项都成立:审判式冲突有了,具体事实包括 3800 万美元和 xAI 承认部分蒸馏,OpenAI 的治理问题本身就是个活靶子。不过目前没有判决或产品层面的变化,所以还够不上 P1。

MIT Technology Review · AI

马斯克告奥特曼第一周:马斯克承认 xAI 蒸馏了 OpenAI 的模型

马斯克在法庭上说自己当年被忽悠了,给 OpenAI 捐了 3800 万美元,结果现在变成一家估值 8000 亿美元的公司。他要求法院把奥特曼和布罗克曼踢出管理层,并撤销 OpenAI 的营利性重组。最劲爆的细节是,马斯克当庭承认自己的 AI 公司 xAI 会拿 OpenAI 的模型来训练自家聊天机器人 Grok——也就是用大模型的输出当教材去教小模型,...

推荐理由:我会先打个折:审判才第一周,还没有判决,所以别当定论看。但信息量已经不小。马斯克说自己被忽悠了,投了 3800 万美元,现在要求法院把 Sam Altman 和 Greg Brockman 踢出局,还要撤销 OpenAI 营利子公司的重组。真正让从业者耳朵竖起来的是 xAI 当庭承认“部分”蒸馏了 OpenAI 的模型——用大模型的输出训练自己的小模型。OpenAI 之前因为类似操作指控过 DeepSeek,现在轮到自家投资人旗下的公司做同样的事,这就把蒸馏到底算不算抄袭、边界在哪的问题直接摆上台面了。正文没披露蒸馏的具体比例和用在哪些模型上,这点...

TechCrunch · AI

马斯克在法庭上反复强调“你不能偷一家慈善机构”,他和 OpenAI 的官司打到哪了

马斯克本周在起诉 OpenAI 的案子里出庭作证,前后花了将近三天。法庭上翻出了邮件、短信和他自己发的推文,场面挺难看。他的核心指控是:Sam Altman 把 OpenAI 从非营利转成营利公司,背叛了当初“为人类造福”的承诺。马斯克的原话是“你不能偷一家慈善机构”。这期播客除了聊庭审进展,还顺带说了几大云厂商的财报——谷歌云季度收入破了 200 亿...

推荐理由:标题已经把冲突点讲得很直白,但正文其实是个播客页面,披露的事实有限:Musk 作证近三天、OpenAI 非营利争议、有邮件和短信等证据,没写完整诉讼请求和裁决状态。我会先打个折,因为信息增量主要就是“Musk 出庭了”和“证据类型”,其他细节正文没展开。

5月1日星期五

The Verge · AI

五角大楼跟 OpenAI、Google、Nvidia 签了涉密 AI 合同,但把 Anthropic 排除在外

五角大楼一口气和七家公司签了涉密 AI 使用协议,包括 OpenAI、Google、微软、亚马逊、Nvidia、xAI 和 Reflection。Anthropic 被挡在门外,理由是供应链风险。合同金额、具体要用哪些模型、怎么部署,正文都没披露。之前五角大楼处理机密信息时用过 Anthropic,这次突然不带它玩,原因没说透。

推荐理由:我会先打个折:正文没披露合同金额、模型范围和部署条件,所以重要性停在82。但五角大楼点名7家涉密AI供应商、唯独不带上Anthropic,这个选择本身就很有信息量。国防部给出的理由是供应链风险,等于把安全审查摆到了台面上,对从业者来说,这比一份普通合作公告更值得留意。

TechCrunch · AI

马斯克诉阿尔特曼案才刚开场

马斯克这周在针对 OpenAI 的诉讼中出庭作证,一待就是将近三天,场面已经很难看了。邮件、短信、他自己的推文都被当庭翻了出来,后面还有一堆证人排队。马斯克的核心指控是:OpenAI 转向营利模式,背叛了他当初掏钱支持的那个“为人类造福的非营利”使命。他在法庭上反复念叨的一句话是:“你不能偷一家慈善机构。”这期播客聊了这场官司到底在争什么。

推荐理由:我会先打个折:这不是判决,也不是禁令,只是一场马拉松诉讼的早期阶段,正文没披露任何裁决结果。但马斯克亲自出庭三天,加上邮件和短信进了法庭记录,信息增量是实打实的。对 AI 圈来说,OpenAI 的治理结构到底算不算背离初衷,这事关整个行业怎么定义“安全”和“商业化”的边界,所以给到 featured 档位是合理的。

r/LocalLLaMA

OpenAI 隐私过滤器与 GLiNER 在 600 条 PII 样本上的实测对比

Reddit 上有用户拿 OpenAI 的隐私过滤器(privacy-filter)和 GLiNER large-v2.1 在 600 条含个人身份信息(PII)的样本上跑了一轮。纯 CPU 推理速度,OpenAI 模型每秒处理 2.8 条,GLiNER 是 1.1 条,前者快了一倍多。英文边界识别的宏观 F1 分数,OpenAI 模型 0.498,G...

推荐理由:Reddit 上一个测试用 600 条含姓名、邮箱、电话的样本,把 OpenAI 刚发的 privacy-filter 和 GLiNER large-v2.1 放在 CPU 上跑。宽松边界匹配时,OpenAI 的 macro F1 是 0.498,GLiNER 是 0.416,速度上 OpenAI 每秒 2.8 条,GLiNER 1.1 条,看起来 OpenAI 小胜。但一切到严格匹配,OpenAI 的分数直接掉到 0.155,原因是 tokenizer 切词偏移导致边界对不齐,很多实体只抓到半截。这个坑比速度差距更值得注意,说明实际部署时如果要求...

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。