跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 1141–1160 条 · 共 1,551 条

5月3日星期日

Hacker News 首页

哈佛急诊分诊试验:OpenAI o1 诊断准确率 67%,比医生高出 12-17 个百分点

哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者,而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小,但正文没披露样本量、病例构成和具体评估方法,所以数字本身只能当个方向参考。模型是在结构化信息里做判断,和医生在嘈杂急诊室里干活的条件完全不一样,直接比准确率会高估模型的实际可用性...

推荐理由:HKR 三项都成立:急诊分诊是高 stakes 场景,67% vs 50–55% 给了一个可讨论的数字,临床信任和职业边界问题自带传播力。但样本量和测试条件全没披露,所以分数压在 78–84 区间,不给 P1。

5月2日星期六

r/LocalLLaMA

Reddit 帖子称有黑钱资助网红把中国 AI 塑造成威胁,但原文被屏蔽无法核实

这篇 Reddit 帖子指控一个叫 Build American AI 的组织花钱请网红散布“中国 AI 是威胁”的叙事,并把它和 OpenAI、a16z 高管支持的政治行动委员会扯上关系。但帖子正文被网络屏蔽,返回了 403 错误,具体花了多少钱、找了哪些网红、投放机制全都没披露。目前只能看到标题和摘要,信息缺口很大,这点先别太激动。

推荐理由:HKR 三项都成立:审判式冲突有了,具体事实包括 3800 万美元和 xAI 承认部分蒸馏,OpenAI 的治理问题本身就是个活靶子。不过目前没有判决或产品层面的变化,所以还够不上 P1。

MIT Technology Review · AI

马斯克告奥特曼第一周:马斯克承认 xAI 蒸馏了 OpenAI 的模型

马斯克在法庭上说自己当年被忽悠了,给 OpenAI 捐了 3800 万美元,结果现在变成一家估值 8000 亿美元的公司。他要求法院把奥特曼和布罗克曼踢出管理层,并撤销 OpenAI 的营利性重组。最劲爆的细节是,马斯克当庭承认自己的 AI 公司 xAI 会拿 OpenAI 的模型来训练自家聊天机器人 Grok——也就是用大模型的输出当教材去教小模型,...

推荐理由:我会先打个折:审判才第一周,还没有判决,所以别当定论看。但信息量已经不小。马斯克说自己被忽悠了,投了 3800 万美元,现在要求法院把 Sam Altman 和 Greg Brockman 踢出局,还要撤销 OpenAI 营利子公司的重组。真正让从业者耳朵竖起来的是 xAI 当庭承认“部分”蒸馏了 OpenAI 的模型——用大模型的输出训练自己的小模型。OpenAI 之前因为类似操作指控过 DeepSeek,现在轮到自家投资人旗下的公司做同样的事,这就把蒸馏到底算不算抄袭、边界在哪的问题直接摆上台面了。正文没披露蒸馏的具体比例和用在哪些模型上,这点...

TechCrunch · AI

马斯克在法庭上反复强调“你不能偷一家慈善机构”,他和 OpenAI 的官司打到哪了

马斯克本周在起诉 OpenAI 的案子里出庭作证,前后花了将近三天。法庭上翻出了邮件、短信和他自己发的推文,场面挺难看。他的核心指控是:Sam Altman 把 OpenAI 从非营利转成营利公司,背叛了当初“为人类造福”的承诺。马斯克的原话是“你不能偷一家慈善机构”。这期播客除了聊庭审进展,还顺带说了几大云厂商的财报——谷歌云季度收入破了 200 亿...

推荐理由:标题已经把冲突点讲得很直白,但正文其实是个播客页面,披露的事实有限:Musk 作证近三天、OpenAI 非营利争议、有邮件和短信等证据,没写完整诉讼请求和裁决状态。我会先打个折,因为信息增量主要就是“Musk 出庭了”和“证据类型”,其他细节正文没展开。

5月1日星期五

The Verge · AI

五角大楼跟 OpenAI、Google、Nvidia 签了涉密 AI 合同,但把 Anthropic 排除在外

五角大楼一口气和七家公司签了涉密 AI 使用协议,包括 OpenAI、Google、微软、亚马逊、Nvidia、xAI 和 Reflection。Anthropic 被挡在门外,理由是供应链风险。合同金额、具体要用哪些模型、怎么部署,正文都没披露。之前五角大楼处理机密信息时用过 Anthropic,这次突然不带它玩,原因没说透。

推荐理由:我会先打个折:正文没披露合同金额、模型范围和部署条件,所以重要性停在82。但五角大楼点名7家涉密AI供应商、唯独不带上Anthropic,这个选择本身就很有信息量。国防部给出的理由是供应链风险,等于把安全审查摆到了台面上,对从业者来说,这比一份普通合作公告更值得留意。

TechCrunch · AI

马斯克诉阿尔特曼案才刚开场

马斯克这周在针对 OpenAI 的诉讼中出庭作证,一待就是将近三天,场面已经很难看了。邮件、短信、他自己的推文都被当庭翻了出来,后面还有一堆证人排队。马斯克的核心指控是:OpenAI 转向营利模式,背叛了他当初掏钱支持的那个“为人类造福的非营利”使命。他在法庭上反复念叨的一句话是:“你不能偷一家慈善机构。”这期播客聊了这场官司到底在争什么。

推荐理由:我会先打个折:这不是判决,也不是禁令,只是一场马拉松诉讼的早期阶段,正文没披露任何裁决结果。但马斯克亲自出庭三天,加上邮件和短信进了法庭记录,信息增量是实打实的。对 AI 圈来说,OpenAI 的治理结构到底算不算背离初衷,这事关整个行业怎么定义“安全”和“商业化”的边界,所以给到 featured 档位是合理的。

r/LocalLLaMA

OpenAI 隐私过滤器与 GLiNER 在 600 条 PII 样本上的实测对比

Reddit 上有用户拿 OpenAI 的隐私过滤器(privacy-filter)和 GLiNER large-v2.1 在 600 条含个人身份信息(PII)的样本上跑了一轮。纯 CPU 推理速度,OpenAI 模型每秒处理 2.8 条,GLiNER 是 1.1 条,前者快了一倍多。英文边界识别的宏观 F1 分数,OpenAI 模型 0.498,G...

推荐理由:Reddit 上一个测试用 600 条含姓名、邮箱、电话的样本,把 OpenAI 刚发的 privacy-filter 和 GLiNER large-v2.1 放在 CPU 上跑。宽松边界匹配时,OpenAI 的 macro F1 是 0.498,GLiNER 是 0.416,速度上 OpenAI 每秒 2.8 条,GLiNER 1.1 条,看起来 OpenAI 小胜。但一切到严格匹配,OpenAI 的分数直接掉到 0.155,原因是 tokenizer 切词偏移导致边界对不齐,很多实体只抓到半截。这个坑比速度差距更值得注意,说明实际部署时如果要求...

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

TechCrunch · AI

OpenAI 一边吐槽 Anthropic 搞限量,一边也给自家安全工具 Cyber 上了门禁

OpenAI 要把 GPT-5.5 Cyber 先推给“关键网络防御人员”,普通用户暂时用不上。这个工具能做渗透测试、漏洞发现和利用、恶意软件逆向,相当于帮公司找安全漏洞的武器库。Sam Altman 之前还嘲笑 Anthropic 对 Mythos 搞限量是“恐惧营销”,现在自己用了同一招。正文没披露具体的申请门槛、定价和全面开放时间,想用的人得先填...

推荐理由:我会先打个折:正文只有 RSS 摘要,能确认的就是 GPT-5.5 Cyber 会搞分级访问,先给安全圈子里的人用。至于谁算“关键网络防御者”、要不要付费、什么时候轮到普通用户,这些全没披露。真正值得盯的不是 Cyber 本身有多强,而是 OpenAI 在安全工具上也开始玩分批放量,这跟它之前批评 Anthropic 的姿势放在一起看,就有点意思了。如果是真的为了安全可控,那可以理解;但如果只是换个说法控节奏,那这波操作就挺双标。

The Verge · AI

马斯克在法庭上承认 xAI 用 OpenAI 的模型训练了 Grok

马斯克在加州联邦法院作证时,承认 xAI“部分”使用了 OpenAI 的模型来改进自家聊天机器人 Grok。用的方法是模型蒸馏,也就是让一个更聪明的大模型当老师,把知识“教”给一个更小、更省钱的模型。不过报道没说他具体用了 OpenAI 的哪个模型、喂了多少数据、跑了多少次训练。这点先别太激动,正文没披露细节,没法判断这到底是一次常规操作还是越界行为。

推荐理由:HKR 三项全中:马斯克法庭自曝用 OpenAI 模型训 Grok,机制是蒸馏,但模型名、规模、轮次都缺,信息有硬缺口,所以重要性停在 84 而不是更高。

TechCrunch · AI

马斯克在法庭上承认 xAI 用 OpenAI 模型训练了 Grok

马斯克在加州联邦法院作证时,被问到 xAI 是否用 OpenAI 的模型来训练 Grok,他回答“部分是”。这种技术叫“蒸馏”,就是拿大模型的对话结果当教材去教小模型。正文没披露具体用了哪些模型、蒸馏了多少数据、以及这种做法对 Grok 性能的实际影响。

推荐理由:我会先打个折:正文只给了“蒸馏”这个关键词,没展开训练规模、模型版本和诉讼背景,所以信息缺口不小。但 Musk 的证词本身就是一个新信号,把 xAI、Grok 和 OpenAI 的蒸馏嫌疑绑在了一起。对从业者来说,重点不是八卦,而是蒸馏证据链会不会被法庭或社区进一步扒出来——如果是真的挺省钱,但合规风险也摆在那。这点先别太激动,等更多细节浮出来再调判断。

彭博科技

Anthropic 在谈新一轮融资,估值可能超过 9000 亿美元

彭博社的消息源说,Anthropic 正在考虑启动一轮新融资,估值会定在 9000 亿美元以上。如果这轮谈成,Anthropic 的估值会超过 OpenAI,成为全球最贵的 AI 创业公司。不过正文没披露这轮融资的具体金额、投资方和时间表,我会先打个折,等更多细节出来再看。

推荐理由:Bloomberg 放出的消息,说 Anthropic 在考虑估值超过 9000 亿美元的融资要约,这个数字能把头部实验室的资本排位重新洗牌。HKR 三项都踩中了,但我会先打个折:正文没披露具体金额、投资方和时间表,交易还没落地,所以别直接当成定局。

The Verge · AI

微软和 OpenAI 的新协议拆解:不再独占云服务,但关系没断

微软周一更新了和 OpenAI 的协议,最大的变化是 OpenAI 以后可以把产品和服务卖给所有云厂商,不再被微软的云独占。这相当于两家从“独家绑定”变成了“开放式关系”。但正文没披露具体的收入分成比例、算力承诺这些关键条款,所以 OpenAI 到底能省多少钱、微软又能从新客户那里分到多少,目前还不清楚。

推荐理由:我会先打个折,因为正文没披露完整的合同条款、收入怎么分、算力承诺这些关键细节,所以重要性停在 84 分。但“云独占限制解除”这条信息本身是实打实的,意味着 OpenAI 的销售渠道和基础设施选择都打开了,对依赖这两家生态的团队来说,是个需要重新评估的信号。

4月30日星期四

The Verge · AI

OpenAI 解释为什么它的代码模型突然满嘴地精和哥布林

Wired 发现 OpenAI 的代码模型 Codex 会主动建议用户“避开哥布林”之类的奇幻生物,OpenAI 现在出来回应了。他们说,GPT-5.1 新增的“书呆子”人格喜欢用奇幻生物打比方,结果这个习惯传染给了其他模型。至于具体怎么修、修到什么程度,这篇声明里没细说。

推荐理由:这条新闻的钩子很足——一条禁止模型提“地精”的内部指令被扒出来,本身就够离谱。知识增量在于 OpenAI 没糊弄过去,而是点名了 GPT-5.1 的 Nerdy 人格是起点,后续模型把生物隐喻越玩越花,这比单纯说“有个 bug”要具体。对从业者来说,隐藏的系统提示直接影响编程模型的输出可控性,而正文没披露完整修法,这点先别太激动,所以放在低分 featured 档刚好。

新智元 · 公众号

陶哲轩说数学界从缺证明变成证明太多,AI 生成的“生肉证明”堆满 GitHub

陶哲轩最近公开说,数学研究的瓶颈已经从“找不到证明”变成了“证明太多看不过来”。在一个关于 Erdős 问题的 GitHub 页面上,已经有 20 多个 AI 生成的解法等着人去评估。文章提到 GPT-5.4 Pro 用 80 分钟就给出了 Erdős #1196 的一个思路,陶哲轩自己在 24 小时内验证了核心部分。现在真正头疼的不是 AI 能不能解...

推荐理由:这篇东西不是模型发布,但把陶哲轩的发言和 GitHub 上的 AI 证明积压摆在一起,信息量够硬。我会先打个折,因为正文没给出那 20 多份解法的具体通过率或质量分布,只能看到数量堆上去了。真正值得盯的是陶哲轩说的验证与消化工作流——证明便宜了,判断力反而更贵,这个转向对从业者比裸看模型跑分更有参考价值。

量子位 · 公众号

OpenAI 正经解释 GPT-5.5 为什么爱说“哥布林”

OpenAI 发公告说,GPT-5.5 老把“哥布林”挂嘴边,是因为训练时给“书呆子”人设的回复打了高分,这个偏好通过强化学习和后续训练扩散开了。GPT-5.1 之后,ChatGPT 用“哥布林”的频率涨了 175%;书呆子风格的回复只占总回复的 2.5%,却贡献了 66.7% 的“哥布林”出现次数。核心问题是奖励信号有偏差,在强化学习的采样和生成、以...

推荐理由:我会先打个折,这不是什么重大能力发布,但 OpenAI 自己复盘模型行为偏差的料很实在。核心就一件事:他们给模型加了“书呆子”人格的奖励信号,结果这信号通过 RL、rollouts 和 SFT 扩散到完全无关的场景,让 GPT-5.5 动不动就 cue 哥布林。数字摆在那——175% 的用量飙升,2.5% 的回复源头——说明偏差放大效应有多猛。对做对齐和微调的人来说,这是个活生生的警告:奖励函数里一个看似无害的偏好,最后能在产品里闹出笑话。正文没展开他们具体怎么修的,但光这个诊断过程就值得从业者盯一眼。