跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 941–960 条 · 共 1,551 条

5月28日星期四

AI HOT 精选

Cognition AI 拿了超 10 亿美元,投前估值 260 亿,想把软件工程师效率提 10 倍

Cognition AI 新融了超过 10 亿美元,投前估值 260 亿美元。它的年化收入一年里从 3700 万美元涨到约 4.92 亿美元,涨了十几倍。核心产品 Devin 被定位成能自主干活的初级工程师,不是只补代码,而是能自己规划、测试、部署,走完多步骤流程。公司不绑死一家模型,既用自己的模型,也接 OpenAI 和 Anthropic 的大模型...

推荐理由:这条消息硬数字够多,估值和收入增速都摆在那,Devin 的定位也从“写代码助手”变成了能自己规划、测试、部署的初级工程师,对从业者的冲击感很直接。不过信息源单一,正文没披露具体投资方和估值计算细节,所以没给到行业地震级的高分。

AI HOT 精选

OpenAI 产品现在能直连你内网的 MCP 服务器了

OpenAI 给 ChatGPT、Codex 和 Responses API 加了个能力:可以走纯出站 HTTPS 去调你团队放在内网的 MCP 服务器。服务器不用暴露到公网,模型这边只往外发请求,不接收入站连接。正文没提延迟和鉴权细节,实际部署前最好先测一下链路稳定性。

推荐理由:我会先打个折:正文没披露权限控制怎么配、收不收费、什么时候全量推,这些缺口让实际落地还有变数。但方向很明确——让模型直接进公司内网干活,而且用仅出站 HTTPS 绕过了安全团队最头疼的入站暴露问题。对正在评估 AI agent 接内部系统的团队来说,这是个值得马上跟进的消息。

AI HOT 精选

Anthropic 和 OpenAI 把编程助手从包月套餐改成按量收费,我觉得他们终于找到赚钱的感觉了

Simon Willison 发现,从 2026 年 4 月起,Anthropic 和 OpenAI 悄悄把企业版编程助手(Claude Code/Cowork 和 Codex)的收费方式从固定座位费改成了按 API 调用量计费,跟直接买 token 一个价。他自己一个月用这些工具烧掉的 token 折合 2180 美元,但个人套餐只要 200 美元,...

推荐理由:这篇不是官方公告,是一篇行业评论,但它抓的点很实在:Anthropic 和 OpenAI 在 2026 年 4 月前后把编程智能体的收费从打折卖席位改成按 API 调用量算钱。我会先打个折——正文没给出具体定价数字或客户迁移数据,所以“找到产品市场契合点”更多是作者基于计费模式转向的判断,不是有财报支撑的结论。但这点本身对从业者有用,因为它直接关系到采购和用量评估。整体属于有观点、有信息缺口、但不虚的评论,放在 featured 档位合理。

5月27日星期三

The Verge · AI

AI 公司砸钱想埋掉这个政客,结果反而让他出了名

OpenAI 和 Anthropic 这两家死对头,正通过各自的超级政治行动委员会(Super PAC)在纽约第 12 选区民主党初选中烧钱打仗。被集火的对象是候选人 Alex Bores,他因为提出过一份对 AI 公司不太友好的监管法案,从 2025 年底开始就遭到由 OpenAI、Palantir 和 a16z 高管资助的团体“引领未来”砸下数百万...

推荐理由:我会先打个折:正文没披露 Anthropic 和 OpenAI 具体各投了多少,只说围绕 AI 监管权在 6 月初选前投入数百万美元。但这条值得上 featured,因为故事的反转本身就够抓人——AI 大佬们砸钱想干掉一个纽约州议员候选人,结果反而帮他做了宣传。对从业者来说,这比干巴巴的政策分析更直观地展示了 AI 公司现在怎么用钱影响立法,以及这种操作可能翻车。

AI HOT 精选

Runway 发布 MCP 服务器,让 Claude、ChatGPT 这类助手能直接在对话框里帮你生图和剪视频

Runway 推出了一个 MCP 服务器,相当于给 AI 助手装了个插件,让 Claude、ChatGPT、Cursor 等工具能在聊天窗口里直接调用 Runway 的模型生成图片和视频。你不用再切换软件,给助手扔一个商品链接、一张参考图或一段文字描述,它就能把成品返回到同一个对话框里。这次接入的模型包括 Gen-4.5、Seedance 2.0、GP...

推荐理由:这条消息的钩子很直接——Runway 的视频能力进了程序员和创作者天天用的对话工具。技术上不是模型突破,而是集成方式变了,MCP 服务器当中间人,让多个模型被一个入口调度。对从业者来说,这比单纯发个新模型更贴近实际工作流,所以 HKR 三项都成立。不过正文没提延迟、并发限制和计费方式,实际体验还得观望。整体算一次产品整合更新,重要性给 76 分,放在 featured 里合理。

量子位 · 公众号

7B小模型在医学影像理解上跑赢o3和GPT-5,靠的是教会模型“看哪里、怎么看”

上海创新研究院的LeapQuest和三所大学搞了两个医学AI系统Ophiuchus和MedScope,核心思路是让模型在看图看视频时学会像医生一样先定位关键区域再分析。Ophiuchus-7B在8个医学视觉问答基准上拿了68.0分,比OpenAI-o3的62.2、Gemini 2.5 Pro的61.8和GPT-5的59.9都高。正文没披露具体参数量以外...

推荐理由:我会先打个折:标题里 GPT-5 目前没公开评测数据,更像噱头,但 7B 模型在医学 VQA 上跑赢 o3 这个事实本身够抓人。正文给了 8 个 benchmark 的平均分对比,信息量撑得起 featured。不是通用大模型发布,分数定在 80 合理。

纽约时报中文网

谷歌怎么从 AI 掉队变成领跑的?

两年前谷歌的 AI 还在建议人吃石头、往披萨上抹胶水,现在它的聊天机器人 Gemini 月活用户已经冲到 9 亿,跟 OpenAI 自报的 ChatGPT 用户数打平。谷歌没把 Gemini 当独立产品养,而是直接塞进 Gmail、地图、Google.com 这些每天被几十亿人用的服务里,连苹果 Siri 未来的底层技术也换成了它,等于 Gemini ...

推荐理由:HKR三项全中。文章用逆袭主线把谷歌从掉队拉到能打的位置,钩子够强;9亿用户、770亿广告收入、Siri合作这些数字和信息量扎实,不是空谈;对从业者来说,模型竞争格局和分发渠道的变动直接关系工作判断,相关性高。整体是产业分析而非模型发布,放在78-84分档合理。

Computing Life · 鸭哥

用好AI的第二步:先写Skill再执行

作者提出一个反直觉但关键的工作习惯:让AI干活前,先把成功标准、踩过的坑和固定工具写成一个Skill文档。因为AI没有记忆,每次新对话都是白纸一张,不把经验外化落盘,它下次还会犯同样的错。文章解释了为什么程序员反而容易掉进“只有代码才能复用”的陷阱,并给出Skill的三个要素:描述最终想要什么而不是微操步骤、只记录AI真正犯过的错、提供确定性的工具调用...

推荐理由:这篇文章没讲新模型或产品能力,也没给实验数据,但“先写 Skill”这个动作把 agent 工作流从一次性尝试变成了可积累的资产,对日常用 Claude Code 或类似工具的人有直接参考价值。三个 Skill 要素讲得清楚,复用方式也具体,所以放在 featured 档。

AI HOT 精选

Anthropic 工程师称 Claude Mythos 用“巧妙简洁的证明”解开了 OpenAI 此前攻克的 Erdős 数学猜想

Anthropic 工程师 Sholto Douglas 在 X 上说,Claude Mythos 用一个“巧妙简洁的证明”解决了 Erdős 单位距离猜想,而 OpenAI 前不久刚把这个问题当作 AI 数学推理的里程碑。团队的做法是把问题丢给多个独立的 Claude Code 实例,让它们各自找解题路径,再汇总分发,Mythos 经常走出和 Ope...

推荐理由:HKR 三项都成立:标题自带反差,信息点具体,又牵动前沿推理模型的竞争格局。但正文没披露证明内容、验证方式、Mythos 是否已发布,所以只能放 featured,不能上 P1——我会先打个折,等看到证明再说。

5月26日星期二

AI HOT 精选

SynthID 水印覆盖超千亿条内容,OpenAI、ElevenLabs 等也将接入

Google DeepMind 说 SynthID 已经给超过 1000 亿条内容打了水印,现在要把这套技术塞进 OpenAI、ElevenLabs 和 Kakao 的模型里。之前他们跟 NVIDIA 合作推过一轮,这次算是把更多大厂拉进来一起做 AI 内容溯源。不过正文没提具体怎么集成、水印在不同模型上会不会影响输出质量,也没说这 1000 亿条里有...

推荐理由:这条消息有实打实的数字(超千亿条)和明确的合作方名单,不是空泛的声明。OpenAI 集成 SynthID 这个点比较意外,能打破常规叙事。不过正文没展开技术细节和具体效果,更像一次合作进展通报,所以分数到 82 就差不多了,再高需要更强的独家信息或验证数据。

r/LocalLLaMA

SkillOpt 把 Markdown 技能文件当成可训练参数,用编辑操作来优化

这篇帖子正文被 Reddit 屏蔽了,只能看到标题和摘要。从现有信息看,SkillOpt 的做法是把给模型用的 Markdown 技能说明文件当作可优化的对象,而不是写死就完事。它让一个更强的模型对技能文件提出增、删、改的编辑建议,然后只在留出的验证集上接受那些确实能提升效果的改动。摘要里说,最好的技能文件通常在 1 到 4 次被接受的编辑后就会收敛,...

推荐理由:我会先打个折:目前只看到一个项目源和 Reddit 讨论,没有大规模落地数据,所以分数定在 78、featured 而不是 p1。但 HKR 三项都站得住——把技能文件当可训练参数这个 hook 够新鲜,留出验证集加 1-4 次编辑收敛的机制也讲得清楚,对做 agent 的人来说省手工调 prompt 的钱和时间是实打实的痒点。正文没披露验证集规模和任务多样性,这点先别太激动。

新智元 · 公众号

OpenAI 总裁回忆:奥特曼被罢免当天我就辞职了,起初觉得夺回公司只有一成胜算

Greg Brockman 在采访里复盘了 OpenAI 那场 72 小时宫斗。2023 年 11 月 17 号,董事会突然撤掉 Sam Altman 的 CEO 职位,同时把 Brockman 踢出董事会。他当天就辞职了,说当时估算把公司拿回来的概率只有 10%。正文因为微信页面需要验证,没能抓到更多细节,比如董事会具体用什么理由动手、员工联名信怎么...

推荐理由:这篇是 Brockman 对 2023 年 11 月那场宫斗的亲身复盘,不是第三方转述。他给出了辞职时间点和 10% 概率这两个新细节,对理解当时董事会决策的混乱程度有帮助。不过事件本身已经过去一段时间,信息增量集中在个人视角而非技术或产品层面,所以重要性停在 76 分这个区间是合理的。

纽约时报中文网

教宗发了一份4万多字的人工智能通谕,直接对硅谷的“技术救世主”心态说不

教宗良十四世发表了首份通谕《崇高人性》,全文42300字,核心就一个意思:AI会放大有钱、有技术、有数据的人手里的权力。他警告,如果任由少数人把他们的道德观塞进AI系统,变成看不见的底层规则,那会是一场灾难。文章没点名,但指向很明确,就是硅谷那些科技巨头。有意思的是,通谕发布时还邀请了自称“善良AI”的Anthropic联合创始人站台,说明教宗不是要砸...

推荐理由:这篇不是讲模型或产品,而是从外部权力视角给 AI 行业泼冷水。教宗用一份 42300 词的通谕,把 AI 的风险归结为资源、专业知识和数据会进一步向强者集中,这个判断本身比很多行业报告更直白。我会先打个折:正文没披露具体监管建议或技术细节,所以它更像一记舆论重锤,而不是可操作的路线图。但考虑到它罕见地把宗教权威拉进 AI 安全讨论,而且直接点名 Anthropic 和 OpenAI,对从业者反思安全责任和平台权力有刺激作用,给 78 分放在 featured 是合适的。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

5月25日星期一

r/LocalLLaMA

一个让 Codex 在无头 Linux 上安全折腾的沙盒框架

作者 superSmitty9999 放出了一个概念验证工具 ai-sandbox-manager,用 LXC 模板给 Codex 开了 sudo 权限、浏览器操作、Docker 和共享 GPU 访问,同时加了个钩子阻止 git push,让模型在隔离副本里干活,降低把系统搞崩的风险。正文没披露性能开销和具体延迟数据。

推荐理由:这是个 Reddit 上的个人概念验证,作者把 Codex 塞进 LXC 沙箱,给了 sudo、浏览器和 GPU,还加了防 push 的钩子。思路很实用,解决了“让模型干活又怕它闯祸”的矛盾,但正文没给任何性能数据、稳定性测试或实际跑任务的案例,目前只能当个有趣的工程方案看,离生产环境还有距离。

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

5月24日星期日

AI HOT 精选

格雷格·布罗克曼亲述:差点让 OpenAI 散伙的那 72 小时

OpenAI 联合创始人兼总裁格雷格·布罗克曼在这期播客里,第一次详细讲了公司最惊险的一次内部危机。他回忆了 Sam Altman 被董事会解雇后,自己接到电话时的场景、当天就辞职的原因,以及第二天在 Sam 家里策划“凤凰”备份公司的经过。转折点出现在 Ilya Sutskever 发了一条推文之后。除了这场风波,他还聊了 OpenAI 早期在纳帕谷...

推荐理由:我会先打个折:标题很抓人,Brockman 作为内部人出来讲“差点覆灭”的故事,天然有传播力,所以 H 和 R 都过了。但正文没披露任何实质内容——时间线、谁做了什么、怎么收场的,全都没说,K 完全站不住。整体只能放在 featured 底线,等后续有细节再升级。

5月23日星期六

AI HOT 精选

Anthropic 最快下周完成超 300 亿美元融资,估值将反超 OpenAI

彭博社援引知情人士消息,Anthropic 的新一轮融资最快下周敲定,总额预计超过 300 亿美元,公司估值可能突破 9000 亿美元,直接超过 OpenAI。这轮融资推进很快,几周内就从收到提案走到了谈判尾声,但正文没披露具体领投方和条款细节。公司同时给出了很猛的收入预期:第二季度营收 109 亿美元,比上季度翻了一倍多,并且有望首次实现季度盈利;年...

推荐理由:HKR 三项全中:彭博社报的 300 亿+ 融资、9000 亿+ 估值和 109 亿 Q2 营收预期,让这条消息成了当天 Anthropic 资本赛道的核心故事。不过交易还没正式落定,所以重要性压在 85-94 这个区间。我会先打个折——正文没披露这轮融资的具体条款和投资人名单,估值反超也只是“有望”,别太激动。

彭博科技

Anthropic 最快下周完成超 300 亿美元融资,估值冲到 9000 亿以上

彭博社援引知情人士消息,Anthropic 计划最快下周关闭一轮超过 300 亿美元的融资,投后估值超过 9000 亿美元。这个数字会让它超过 OpenAI,成为全球最值钱的 AI 创业公司。不过正文被 Bloomberg 的机器人验证墙挡住了,具体条款、投资方和资金用途都没披露。

推荐理由:彭博说 Anthropic 最快下周就能把这轮超过 300 亿美元的融资关掉,投后估值冲到 9000 亿美元以上,按这个数字它会超过 OpenAI 成为估值最高的 AI 初创公司。我会先打个折:正文没披露具体投资人、资金用途和估值计算方式,而且交易还没落袋,所以重要性停在 91 分,没往 95 以上推。但这条消息本身够直接——钱、时间、排名三个要素都给了,对关注前沿实验室资本动态的人就是一条硬消息。

5月22日星期五

MIT Technology Review · AI

Google I/O 暴露了 AI 做科研的两条路:专用工具还在用,但资源正流向通用智能体

Google I/O 上,DeepMind 的 Hassabis 一边用“我们正站在奇点的山脚下”这种大词,一边展示的是 WeatherNext 提前预警飓风救了人命。这正好点出了 AI 做科研的两条路线:一条是像 WeatherNext、AlphaFold 这种专为解决某个科学问题训练的专用工具;另一条是让通用大模型像智能体一样自己搞研究。现在资源明...

推荐理由:我会先打个折:这篇是 MIT Technology Review 的评论,不是一手技术报告,所以细节有限。但它的判断站得住——Google 把科学 AI 的牌子从 AlphaFold 那套单独炫技,换成 Gemini for Science 这个统一入口,还塞进了 AI Co-Scientist 和 AlphaEvolve 两个组件,并且开放申请。对做 AI 应用的人来说,这比发一篇论文实在,因为能摸到产品了。不过别太激动,正文没披露这套东西的算力成本、实际科研产出对比,也没说普通团队用不用得起,所以目前更像一个方向牌,不是落地手册。