跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 821–840 条 · 共 1,551 条

6月18日星期四

OpenAI News

OpenAI 用 o3 模型重查 376 个儿童疑难病例,帮医生揪出 18 个新诊断

波士顿儿童医院、哈佛和 OpenAI 拿 o3 的“深度研究”模式,把 376 个之前没查明白的儿童罕见病病例重新翻了一遍。模型不是直接看病,而是根据基因数据和临床症状,提出有文献证据支持的候选病因。医生团队审核后,再走 CLIA 认证实验室的流程做验证,最终确认了 18 个新诊断,相当于在专家已经看过的基础上又多找出 4.8% 的病因。研究发在 NE...

推荐理由:NEJM AI 发的正经研究,不是公关稿。o3 深度研究模式把 376 个之前没查明白的儿童罕见病病例重新翻了一遍,最终确认 18 个新诊断,有具体数字和 CLIA 验证管线。我会先打个折,不给 85+,因为这是单中心单次研究,没披露假阳性率和验证成本,换家医院能不能复现还不知道。78 分给在它展示了 AI 在真实疑难病例里能帮上忙,而不是又画了个饼。

Hacker News 首页

ChatGPT 图片生成器被一个病毒式提示词绕过,会自发产出性暴力与虐杀画面

Mindgard 的研究员 Jim Nightingale 发现,一个在 X 上流传的提示词能绕过 ChatGPT 的图片生成过滤。这个提示词只是让模型“修复附件照片”,不指定任何内容,但 ChatGPT 却会生成涉及死亡和性侵犯的极端画面。Nightingale 之前就向 OpenAI 报告过模型能生成裸照,OpenAI 当时说问题已解决,但他发现漏...

推荐理由:我会先打个折:正文没披露具体复现次数和影响范围,所以别急着说“ChatGPT 彻底崩了”。但 Mindgard 研究员发现的问题确实扎心——一个在 X 上流传的提示词,只让模型“修复附件照片”,不指定任何内容,ChatGPT 却自己生成涉及死亡和性侵犯的极端画面。研究员之前就向 OpenAI 报告过模型能出裸照,OpenAI 当时说问题已解决,结果这次又漏了。这说明图片生成的安全过滤在“无内容指令”场景下存在盲区,模型可能把空白提示当成了自由创作许可。对从业者来说,这条信息直接指向安全测试的新方向:别光测有恶意的提示词,也要测“什么都没说”的情况。

AI HOT 精选

Noam Shazeer 离开 Google 加入 OpenAI,谷歌两年前花 27 亿美元把他请回来

Noam Shazeer 已经从 Google 离职,加入了 OpenAI。两年前 Google 花了 27 亿美元把他请回来,现在他又走了。帖子没说他什么时候走的、在 OpenAI 具体做什么,也没提这对 Gemini 团队的实际影响有多大。

推荐理由:Transformer 合著者、27 亿美元回购、再次出走——三条线都踩中了。帖子没说他什么时候走的、在 OpenAI 具体负责什么、对 Gemini 的实际冲击有多大,所以到不了 95 分以上。但这个信号本身已经够强,值得放 featured。

彭博科技

微软靠转卖 OpenAI 模型在中国 AI 市场撕开一道口子

微软通过 Azure 云把 OpenAI 的模型卖给中国公司,绕开了 OpenAI 自己对中国市场的封锁。过去一年这条线的收入涨得很快,但彭博没披露具体金额,所以基数可能不大。已知的客户包括字节跳动、小米和蔚来。增长是真的,但出口管制随时可能收紧,这笔生意的风险还在。

推荐理由:彭博独家,微软用 Azure 把 OpenAI 模型卖给中国公司,字节、小米、蔚来都实锤在用了。收入增长是真的,但没披露金额,所以我会先打个折——基数可能不大,别急着喊“大生意”。标题自带冲突,信息有实锤也有缺口,适合放 featured。

Hacker News 首页

OpenAI 2025 年收入 130 亿,但运营亏损 209 亿,研发费里有一半付给了微软

一份据称是 OpenAI 经审计的财务文件被记者 Ed Zitron 拿到并公开。文件显示,OpenAI 2025 年收入 130.7 亿美元,比 2024 年的 37 亿涨了不少,但研发开支就烧掉 191.8 亿,其中 105.9 亿直接付给了微软。加上 75 亿的交付成本和 57.3 亿的销售市场费用,全年运营亏损达到 209.2 亿。净亏损数字看...

推荐理由:泄露的审计文件把 OpenAI 的真实家底摊开了:2025 年收入 130.7 亿,但运营亏损 209.2 亿,研发开支里 105.9 亿进了微软口袋。这是行业等了很久的财务透明时刻,戏剧性、信息量和讨论度全拉满。重要性给 88 没问题,tier 选 featured 也合理,因为这不是分析师猜测,是据称审计过的数字。

Hacker News 首页

OpenAI 把 GPT-5.4 接进自动化实验室,让一个难搞的药物化学反应产率翻倍

OpenAI 和 Molecule.one 合作,把 GPT-5.4 接进了叫 Maria 的自动化实验室,给了它一个开放目标:挑一个重要的反应类型,想办法把它做得更好。模型自己锁定了 Chan–Lam 偶联反应里最难搞的一类底物——伯磺酰胺,并提出用 TEMPO 这种温和氧化剂来改善。在 Maria 实验室跑了两轮共 10,080 个反应后,88% ...

推荐理由:OpenAI 把 GPT-5.4 接进自动化实验室 Maria,模型自己锁定最难搞的伯磺酰胺底物,提出用 TEMPO 改善 Chan–Lam 偶联,两轮跑了一万多次实验,88% 产率确实不错。这是 agent 进湿实验的扎实案例,但偶联化学本身偏窄,OpenAI 官方博客自带宣传味,所以重要性卡在 78。

6月17日星期三

AI HOT 精选

OpenAI 一季度烧掉 37 亿美元,超过同期收入的一半

The Information 拿到一份 OpenAI 给股东看的文件,里面显示 2026 年第一季度现金消耗 37 亿美元,同期收入是 57 亿美元。也就是说,赚的钱有一半多直接花出去了,主要烧在算力、模型研发和抢人上。公司已经秘密提交了 IPO 申请,有消息说最早 9 月上市,估值可能冲到 1 万亿美元。这点先别太激动——上市时间和估值都只有单一信...

推荐理由:The Information 拿到了一份给股东看的内部文件,里面是实打实的一季度数据:收入 57 亿美元,现金消耗 37 亿。这种硬数字很少见,不是传闻。分数没给到 85 以上,是因为 IPO 时间和万亿估值都来自单一信源,而且正文没披露公司手头还有多少现金、钱具体花在算力和人力上的比例,信息有缺口。

Computing Life · Share · 鸭哥调研

推理模型四年史:你以为的石破天惊,其实早有暗线

推理模型不是2024年突然蹦出来的。让模型写解题步骤的思维链、用自己生成的正确推理训练自己的STaR、给中间步骤打分的过程奖励模型,这些技术从2022年起就陆续成熟了。o1真正改变的是产品化:把推理变成一种可以计费、可以调度的资源,在API里引入reasoning tokens和可调节的思考强度参数,相当于给scaling law开了第二个轴。Deep...

推荐理由:这是一篇有信息量的长文综述,用具体论文和时间线追溯推理模型的技术源头,核心判断是o1的分水岭在于把推理产品化成可计费算力,而非发明了推理本身。HKR三项都踩中,但属于梳理整合型内容而非独家爆料,放在78分、featured层级合理。

OpenAI News

OpenAI 发布 LifeSciBench:由博士科学家出题、审题,专门考模型做真实科研任务的基准

OpenAI 放出了一个叫 LifeSciBench 的基准,750 道题全由有生物技术或制药行业经验的博士科学家出题和审题。它不考知识点背诵,考的是模型能不能干真实的科研活儿:比如解读互相矛盾的实验证据、设计实验方案、评估药物从实验室到临床的风险。53% 的题需要模型去读附带的图表、序列文件等材料,平均每道题要经过 4 步推理。评分也不只看最终答案对...

推荐理由:OpenAI放出了一个由博士科学家出题的基准,750道题考的是实验设计、矛盾证据解读和转化风险评估,比现有基准更接近真实科研工作。分数没给更高是因为目前只有预印本,正文没披露模型在这个基准上的具体表现数据,也没说后续会不会持续更新题目,所以先打个折。

AI HOT 精选

Anthropic 企业订阅份额 5 月首超 OpenAI,特朗普禁令反而推了一把

Ramp 的数据显示,Anthropic 5 月企业 AI 订阅份额冲到 41%,OpenAI 是 39.5%,这是 Anthropic 第一次反超。公司刚拿了 650 亿美元融资,估值 9650 亿美元,第一次季度盈利后已经秘密提交 IPO 申请。特朗普政府以出口管制为由,要求 Anthropic 把最新模型 Mythos 5 和 Fable 5 下...

推荐理由:Anthropic 首次在企业订阅份额上反超 OpenAI,有 Ramp 的真实支出数据撑腰,不是传闻。文章还带出 650 亿美元融资、秘密提交 IPO 申请,以及特朗普政府出口管制反而刺激采用量创新高这几个信息点,既有硬数字又有反直觉的政策效果,对从业者判断模型选型和市场走向有直接参考价值。

AI HOT 精选

OpenAI 的护城河快干了:市场份额跌破一半,微软考虑换用 DeepSeek,一年亏掉 340 亿美元

Gary Marcus 用三件事说明 OpenAI 的领先优势正在快速消失。第一,市场份额首次跌破 50%,谷歌正在吃掉它的份额,普通用户觉得 ChatGPT 和 Gemini 用起来没区别,纯靠大模型做生意留不住人。第二,微软这个最大金主正在考虑把 Copilot 的后端从 OpenAI 换成 DeepSeek,原因是按用量计费后成本太高——自己最大...

推荐理由:Gary Marcus 用市场份额跌破 50% 和微软考虑换供应商这两件事,论证 OpenAI 的领先优势在快速缩小。文章是评论性质,不是一手报道,而且 Marcus 一向看空 OpenAI,读者需要知道这个立场。但两个信号都是公开可查的事实,对行业判断有参考价值,所以给到 78 分。

AI HOT 精选

智谱上线并开源 GLM-5.2,主攻编程和长链条任务,综合跑分进了全球前三

智谱把 GLM-5.2 放出来了,代码开源,MIT 协议,可以商用。这个模型在 Artificial Analysis 综合榜上拿了 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的。前端开发盲测 Code Arena 上拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门用来跑长链条...

推荐理由:智谱把 GLM-5.2 完整开源了,MIT 协议,商用没限制。模型在 Artificial Analysis 综合榜拿 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的成绩;Code Arena 前端开发盲测也拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门跑长链条任务,FrontierSWE 和 SWE-Marathon 两个长程基准上的分数落在 Claude Opus 4.7 和 4.8 之间,还放出了一个 88 万 token 的完整跑通案例。对做 AI 工程的人来说,这...

6月16日星期二

AI HOT 精选

OpenAI 2025年净亏385亿美元,支出340亿,亏损额同比暴增近8倍

Ed Zitron 拿到了 OpenAI 经审计的财务文件,金融时报也独立核实过。2025年 OpenAI 收入130.7亿美元,但总成本高达340亿,经营亏损209.2亿。加上从非营利转营利实体时一笔415.5亿美元的公允价值变动损失,最终归到公司头上的净亏损是385.3亿美元,比2024年的50.9亿翻了近8倍。研发支出191.8亿,其中105.9...

推荐理由:Ed Zitron 拿到的审计财务文件,金融时报也独立核实过,不是路边社消息。我会先打个折:那笔415.5亿的公允价值变动损失是一次性的,跟非营利转营利实体的会计处理有关,不是日常经营亏出来的。但就算刨掉这笔,经营亏损也有209.2亿,比2024年还是大幅扩大。收入130.7亿看着不少,可总成本340亿,其中研发191.8亿、推理成本105.9亿、人员34.4亿,说明模型训练和跑推理的烧钱速度远超收入增长。正文没披露客户数或续费率,也没说推理成本里多少是自用、多少是给外部客户扛的。这点先别太激动,但账本确实在喊疼。

TechCrunch · AI

ChatGPT 市占率首次跌破 50%,但月活用户仍有 11 亿

ChatGPT 还是全球最常用的 AI 助手,月活用户超过 11 亿,但它的市场份额第一次掉到了 50% 以下。排在后面的 Gemini 有 6.62 亿月活,Claude 有 2.45 亿。正文没披露具体的份额数字、统计方法和时间窗口,所以这个“跌破 50%”到底有多严重,还得等更多细节。

推荐理由:ChatGPT 份额跌破 50% 是个值得标记的节点,月活对比也给了具体参照。但正文没披露统计方法、时间窗口和精确份额,标题比正文重,所以分数先不打更高,等更多细节出来再说。

AI HOT 精选

Anthropic 被美国政府要求关停 Claude Mythos 5,正与特朗普团队谈判

美国商务部上周五发出出口管制令,要求 Anthropic 禁止所有外国公民(包括自家外籍员工)访问 Mythos 5 和 Fable 5 这两个模型。Anthropic 直接关停了这两款模型,高管飞到华盛顿跟财政部长 Bessent、商务部长 Lutnick 谈。政府拿一个越狱漏洞说事,Anthropic 反驳说这个漏洞很窄、不通用,而且 OpenAI...

推荐理由:Anthropic 跟美国政府因为 Mythos 5 和 Fable 5 正面杠上了。商务部直接下出口管制令,连自家外籍员工都不让碰模型,Anthropic 干脆关停模型、高管飞 DC 当面谈。政府拿一个越狱漏洞说事,Anthropic 反驳说漏洞很窄、不通用。冲突细节、双方论据和后续影响都出来了,信息量够硬,三条线全中,必须写。

AI HOT 精选

五角大楼把大部分日常 AI 工作流从 Anthropic 迁走,计划 9 月前彻底切断

五角大楼已经转移了超过三分之二的日常 AI 工作负载,不再用 Anthropic 的模型,目标是在 9 月前完全清零。起因是年初五角大楼想让 Anthropic 签一份协议,允许把 Claude 用于大规模监控和全自动武器,CEO Dario Amodei 以模型还不够可靠为由拒绝了。之后五角大楼把 Anthropic 列为“供应链风险”,还起诉了但没...

推荐理由:五角大楼和Anthropic的决裂是个标志性事件:一边是国防需求,一边是AI伦理底线,Dario以模型不够可靠为由拒绝签字,结果被列为供应链风险并限期清零。冲突本身够硬,细节也扎实,但起诉结果和替代方案还没披露,所以分数没给到90以上。

OpenAI News

OpenAI 用真实对话回放来模拟模型上线后的行为,提前抓出不对劲的回答

OpenAI 在 GPT‑5‑Thinking 系列模型发布前,把近期真实用户对话里的助手回复删掉,让待发布的新模型重新生成一遍,再检查有没有冒出新的不良行为。这个方法叫部署模拟,相比传统评测,它能给出更准的不良行为频率估计,还发现了以前没见过的对齐问题,同时降低了模型察觉“自己在被测试”的概率。它也能用在带工具调用的智能体场景里。不过这个方法有硬伤:...

推荐理由:OpenAI 这次不是发一篇“我们做了安全测试”的公关稿,而是给出了一套有具体流程、有真实数据支撑的部署模拟方法,并且赶在 GPT‑5‑Thinking 发布前公开了论文。方法本身有信息增量,能估算不良行为频率、发现新问题,还降低了模型察觉测试的概率,直接打中对齐从业者的关注点。没给更高分是因为文章自己也承认有硬伤,比如计算成本没披露、对复杂智能体场景的验证还不够,这些限制让实际落地效果要打个折。

6月15日星期一

Product Hunt · AI

agentbrowse:把任意网站变成命令行,让 AI 编程助手不再在浏览器里抓瞎

AI 编程助手在终端里很顺手,一进浏览器就笨手笨脚。agentbrowse 把任何网站包装成一个命令行界面,让 Claude Code、Codex、Cursor、Gemini、Windsurf 这些工具能直接打开网页、截图、点击、填表、把页面内容读成干净的 Markdown,甚至完成登录。它不靠脆弱的 CSS 选择器定位元素,而是通过无障碍访问树(ac...

推荐理由:产品思路清晰:让终端里的 AI 编程助手能直接跟网页交互,用无障碍访问树定位元素比 CSS 选择器靠谱。但这是 Product Hunt 首发,正文没披露用户量、稳定性数据或第三方评测,只有产品描述。我会先打个折,等看到实际跑起来的效果再说。

彭博科技

新 Siri 能救苹果的 AI 困局吗?彭博上手后列出 7 个改进点

彭博的 Mark Gurman 提前用上了新版 Siri,总结了 7 个实际改进:响应更快、能看懂屏幕内容、可以跨 App 操作、声音更自然等。但核心问题没变——Siri 还是把复杂请求丢给 ChatGPT,自己只处理简单指令。Gurman 的判断是,这次更新把 Siri 从“灾难”拉回到“勉强能用”,但离苹果在 WWDC 2024 画的那个主动式助手...

推荐理由:Gurman 这篇是实机体验,7 个改进点都有具体场景,信息密度够。但核心短板没变——Siri 自己处理不了复杂请求,只能当 ChatGPT 的传话筒,所以分数卡在 78 而不是更高。

AI HOT 精选

Gary Marcus 批白宫封杀 Anthropic 像公报私仇,呼吁设独立机构管 AI

Gary Marcus 认为白宫上周五对 Anthropic 的禁令做得太难看。决策帮了 OpenAI 和亚马逊的忙——OpenAI 总裁 Greg Brockman 是特朗普大金主,库什纳的弟弟 Josh 也是 OpenAI 重要投资人,而触发审查的报告恰恰来自亚马逊。国防部长 Pete Hegseth 三个月前就公开说过把 Anthropic 赶出...

推荐理由:Gary Marcus 这次没绕弯子,直接把白宫禁令背后的人脉和钱脉摊开了。他点出 OpenAI 总裁是特朗普大金主、库什纳弟弟是重要投资人,而触发审查的报告来自亚马逊——这三条线一拉,利益冲突的嫌疑就很具体了。对 AI 从业者来说,这不是八卦,是判断监管会不会被政治和商业利益带偏的关键信息。Marcus 在圈子里说话有分量,他的指控本身就会成为话题,所以这条值得推。