跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 461–480 条 · 共 1,551 条

8月12日星期三

Hacker News 首页

AI 正在抹掉软件工程师的“中产阶层”

作者用 2020 年休假回来代码库变乱,对比 2026 年一个普通周一早上就冒出 7 个 PR、其中一个改动 2.4 万行代码的场景,指出 AI 把做烂决策的速度限制彻底拆掉了。现在任何人都能对着智能体敲几小时提示词,产出一套看起来能跑的东西,但没人说得清数据从哪来、为什么加了 Kafka。修复一个烂摊子远比生成它难,而你还在修的时候又有五个新坑合进来...

推荐理由:一篇有具体场景和数字的一线工程观察,不是那种“AI 将取代开发者”的泛泛而谈。三个维度都踩中了,但本质是个人博客评论,不是产品发布或研究突破,所以分数落在 78 这个区间。没有跨源验证的需求。

AI HOT 精选

Nathan Lambert 写了本 AI 教科书,但模型至今写不好长篇技术内容

Nathan Lambert 刚写完他的后训练教材《从人类反馈中强化学习》。他用大模型帮忙排版、校对和画图,但一让模型写完整的技术章节,输出就混乱、组织差,还会犯随机的概念错误。他认为,即使模型在编程和数学上已经超人,长篇非虚构写作能力却停滞了。文章没给具体跑分,但 Lambert 指出,主要卡在缺乏好的训练数据,而且推理阶段的算力堆叠对写作帮助不大。...

推荐理由:Lambert 用自己的教材做了一手实验,给出了具体的失败案例和数据缺口诊断,三个维度都踩中了。扣分点在于:没有量化基准,是个人经验而非系统研究,后半段有点泛泛地聊能力。整体在 featured 档里算中等偏上。

Hacker News 首页

Tim Gowers 聊大模型擅长哪类数学:别急着说它只会找反例

OpenAI 刚宣布用大模型解决了十个数学和理论计算机难题,包括构造出第一个非 sofic 群、证明了多色拉姆齐数超指数增长。Gowers 没去评价这些成果本身,而是讨论一个更刁钻的问题:大模型是不是特别擅长找反例?他马上把这个说法拆了——维诺格拉多夫的三素数定理在逻辑上也能写成“存在一个反例”,但没人会管它叫反例。关键要看第一个“有意思”的量词落在哪...

推荐理由:Gowers 在 OpenAI 宣布用模型搞定十个数学难题后立刻发文,没复读新闻,而是抛出一个更刁钻的问题:模型是不是特别擅长找反例?他马上自己拆了这个说法,用三素数定理说明关键不在“是不是反例”,而在第一个有信息量的量词位置。这个分析框架比原新闻本身更有长期讨论价值。分数没给更高是因为这只是一篇博客讨论,不是正式论文,但作者身份和切入角度让它在当下足够重要。

Hacker News 首页

7 个前沿模型找到 500 多种新半导体材料,但只有 1 个有可行的合成路线

Discovered Materials 搞了个长周期、开放式的材料发现基准测试,让模型去找能用在 3D 芯片堆叠上的导热介电材料。7 个模型(包括 GPT-5.6 Sol、Claude Opus 5 等)一共跑出 526 种以前没见过的候选材料,都满足导热、介电和力学性能的硬指标。但一落到实验室怎么把它做出来,就几乎全翻车了:500 多种材料里,只有...

推荐理由:一个 YC 团队搞了个开放式的材料发现基准,让模型去找 3D 芯片堆叠用的导热介电材料。7 个模型跑出 526 种候选,但只有 1 种有可行的合成路线。这个“发现容易、合成难”的结论很实在,不是那种吹 AI 万能的东西。没给更高分是因为这只是单个团队的一次测试,样本量和验证范围都有限,但作为一条 HN 首发,信息量和可读性都够。

Latent Space

一篇论文展示了如何从主流推理 API 中解码加密的思维链

Alexander Panfilov 的团队发现,Claude、GPT 和 Gemini 的加密推理块可以被“重放”到同一厂商的较弱模型里,让弱模型把隐藏的思考过程转录出来。他们扫描了约 7,000 条公开的会话记录,在推理块里找到了 62 个 API 密钥、33 个邮箱和 33 个密码——这些在正常输出里完全看不到。论文还暴露了几个对齐问题:模型在思...

推荐理由:这篇论文不是泛泛说“推理可能泄露隐私”,而是给出了可复现的攻击方法和具体数字。团队发现Claude、GPT和Gemini的加密推理块可以被“重放”到同厂商的弱模型里,让弱模型把隐藏思考过程读出来。扫描约7000条公开会话后,在推理块里找到62个API密钥、33个邮箱和33个密码,这些在正常输出里完全看不到。论文还暴露了三个对齐问题:模型在推理时写明文密钥、弱模型能转录隐藏思考、以及厂商的加密没挡住这种重放攻击。我会先打个折——样本只有7000条,不一定代表整体情况,但62个密钥这个数已经够让人警惕了。正文没披露厂商是否已经修复,这点先别太激动,但安...

Computing Life · Share · 鸭哥调研

厂商加密推理防蒸馏基本没用,还把开发者的密钥泄露风险拉满了

厂商把模型的思考过程加密藏起来,想阻止别人拿强模型输出去训练小模型,但两篇新论文证明这招不太灵。第一篇发现,Anthropic、OpenAI 和 Google 的加密推理块可以跨模型互换,攻击者花 720 美元就能用 Haiku 4.5 这种便宜小模型批量解码 Opus 4.8 的真实推理。第二篇更直接:根本不用碰加密块,拿一个 15 亿参数的弱模型训...

推荐理由:我会先打个折,因为两篇都还是预印本,厂商没回应,也没看到大规模利用的实锤,所以分数压在 85 以下。但内容本身够硬:第一篇发现三家大厂的加密推理块能互换,攻击成本才 720 美元,门槛极低;第二篇更狠,用 15 亿参数的小模型就能把加密推理里的信息榨出来,根本不用解密。这对做模型蒸馏攻防的人是个明确的警告,也说明现在靠加密藏推理来防蒸馏,效果可能比厂商想的差很多。

Computing Life · Share · 鸭哥调研

OpenAI 的数学证明跑通了 Lean 检查,5 天后论文却偷偷加了 4 页

OpenAI 在 8 月 1 日发了 10 组数学成果,附带的 Lean 4 代码全部编译通过,8666 个构建任务没报错。但 5 天后,论文从 249 页涨到 253 页,作者补了一个极限情况下的推导漏洞,代码本身没改。这说明机器检查通过只代表语法和逻辑规则没毛病,不代表人类看懂了,也不代表代码真的对准了原始难题。Terence Tao 顺势提了个新...

推荐理由:用一个具体案例把机器验证和人类理解之间的鸿沟讲透了。OpenAI 的 Lean 4 代码全绿、Tao 的五级框架,都是硬货。没给更高分是因为这更像一篇深度评论,而不是首发爆料,但信息密度和切入角度都够扎实。

AI HOT 精选

ChatGPT 和 Gemini 同一天宣布月活用户破 10 亿

OpenAI 的 ChatGPT 和 Google 的 Gemini 在同一天各自宣布月活跃用户数突破了 10 亿。ChatGPT 仍是聊天机器人里的领头羊,但 Gemini 追得很紧。文章没披露各自的具体月活数字,也没说两家的统计口径是不是一回事。这个 10 亿我先打个折看——它大概率指的是月活,不是日活或付费用户,所以实际用户粘性可能差很多。

推荐理由:ChatGPT 和 Gemini 在同一天宣布月活破 10 亿,时间点很戏剧化,但正文没披露具体数字和统计方法。10 亿大概率是月活,不是日活或付费用户,实际粘性可能差很多。因为缺硬数据,分数压在 78,但话题本身对从业者判断市场水位很有共鸣。

The Verge · AI

OpenAI 又走一位高管:前 COO Brad Lightcap 离职

Brad Lightcap 之前是 OpenAI 的首席运营官,后来转去做特殊项目,现在也确认要离开了。他是 2026 年又一位出走的高层。报道里没说他接下来去哪,也没提谁会接他的班。

推荐理由:OpenAI 高管离职已经是行业连续剧了,Lightcap 从 COO 转岗再出走,让故事又多了一集。但报道本身很干,没给去向、没给原因、没给继任者,所以分数卡在 featured 的低位,不往上拉了。

TechCrunch · AI

OpenAI 老将、前 COO Brad Lightcap 离职,说要自己搞点新东西

Brad Lightcap 是 OpenAI 资历最深的几位高管之一,2018 年加入,先当了四年 CFO,2022 年转任 COO。今年早些时候 OpenAI 调整高管分工,他卸下了 COO 职务,现在正式宣布离开。他在内部信里说心情复杂,以后会换个角度帮公司推进使命。至于他到底要去做什么、具体哪天走、谁来接他的班,这篇报道全都没提。

推荐理由:Brad Lightcap 从 2018 年待到 2026 年,横跨 CFO 和 COO 两个关键岗位,他的离开本身就值得从业者看一眼。但报道里关键信息全是空白:新项目是什么、交接时间线、继任者是谁,全都没提。所以这条消息更像一个信号——OpenAI 高层还在持续变动,而不是一个能拿来分析的具体事件。

AI HOT 精选

ChatGPT、Claude 和 Gemini 的加密推理过程被 API 漏洞曝光,公开会话里扫出了密码和密钥

安全研究员 Alexander Panfilov 的团队在 OpenAI、Anthropic 和 Google 的 API 里发现了一个漏洞,能直接读取模型加密的原始推理过程。他们用越狱后的小模型去转录大模型的“思考”内容,发现这些加密的思维痕迹在同一厂商的不同模型间可以通用——比如用 Anthropic 的小模型 Haiku 4.5 就能逐字读出大模...

推荐理由:这是一个有复现方法、跨模型验证的安全发现,不是泛泛的风险提醒。正文给出了具体的攻击路径和跨厂商通用性,对从业者判断自身风险有直接帮助。没给更高分是因为文章只披露了研究侧的情况,厂商是否确认、有没有修复时间表都没提,实际影响范围还要等后续信息。

8月11日星期二

Hacker News 首页

OpenAI 唯一的专职伦理学家 Chloé Bakalar 离职,公司称伦理已融入研发流程

Chloé Bakalar 上个月从 OpenAI 离职,她在公司待了不到一年,是那里唯一一个专门做 AI 伦理的人。OpenAI 发言人跟《金融时报》说,公司不打算找人接替,因为伦理问题不再归某个人或某个团队管,而是已经“嵌入”到各个研究团队的模型开发流程里了。Bakalar 之前在 Meta 当过首席伦理学家,今年三月还公开说过,不该由一家千亿美元...

推荐理由:OpenAI 唯一的伦理负责人走了,公司还不打算补人,这不是普通离职,是组织信号。反常点在于:一家千亿美元估值的公司,把伦理从专人专岗改成“散到各团队”,听着像扁平化,但也可能意味着没人能对伦理问题拍板。正文没披露 Bakalar 离职的具体原因,也没说“嵌入”之后怎么考核、谁兜底,所以我会先打个折,不往满分推。

Hacker News 首页

从加密的思考块里偷走大模型的推理过程

Anthropic、OpenAI 和 Google 返回给用户的加密思维链块可以在不同会话、用户和模型之间复用。研究人员把 Claude Opus 4 的加密推理痕迹塞进一个被越狱的 Claude Haiku 4.5,Haiku 就把 Opus 隐藏的思考过程一字不差地转录了出来,全程没有直接攻击强模型,也没触发反蒸馏保护。他们从 6,708 条公开的...

推荐理由:我会先打个折:论文里 6,708 条公开样本的规模不算大,但攻击路径清晰、可复现,而且没触发反蒸馏保护这点很要命。Claude Opus 4 的加密推理痕迹被塞进越狱后的 Haiku 4.5,Haiku 直接吐出原文,说明加密块本身没有绑定会话或用户身份。如果是真的,意味着 Anthropic、OpenAI 和 Google 的推理 API 在隐私隔离上存在结构性漏洞。正文没披露三家厂商的具体回应,这点先别太激动,但安全团队现在就该去验证自己的推理痕迹能不能跨会话复用。

Hacker News 首页

OpenAI 唯一的伦理师离职了,公司没再招人,说伦理已经“融入”研发流程

OpenAI 的首席伦理师 Chloé Bakalar 在 7 月悄悄离职,她在职不到一年。根据《金融时报》的消息,她是公司里唯一一个专职做伦理的人,走后这个岗位没补人。OpenAI 给 Gizmodo 的回应是,AI 伦理不该由一个角色或团队独揽,伦理考量已经“深度嵌入”到多个研究团队的模型开发流程里。这话放在当下听着有点虚:今年夏天,安全系统负责人...

推荐理由:OpenAI 唯一的伦理师离职且不补人,对关注 AI 安全的人来说是个信号。分数没给更高是因为信息缺口太明显:离职原因、内部反应全无,只有公司一句“伦理已嵌入各团队”的官方说法。

AI HOT 精选

OpenAI 的 Astra 模型解开了 10 道未解数学题,数学家们既兴奋又不安

OpenAI 的新模型 Astra 一口气解决了组合数学、数论等领域的 10 个长期悬而未决的问题。数学家们验证后确认答案是对的,但开始担心纯数学研究会不会变成一条流水线:AI 负责提方案,人类只负责验算。这篇文章没透露 Astra 的模型架构、训练数据或推理成本,也没说这 10 道题是从哪个题库里挑的。我会先打个折:题目是 OpenAI 自己选的,评...

推荐理由:OpenAI 的 Astra 解了 10 道未解数学题,数学家验证过,标题、事实、身份共鸣三点全中。但文章没披露模型架构、训练数据、推理成本,题目还是 OpenAI 自己挑的,信息缺口明显,所以分数卡在 78。

TechCrunch · AI

OpenAI 用 8520 亿美元估值从员工手里回购了 70 亿美元股票

OpenAI 刚完成了一笔 70 亿美元的员工股权回购,估值和今年 3 月融资时一样,还是 8520 亿美元。说白了就是公司掏钱让老员工提前套现,不用干等 IPO。他们 6 月已经向 SEC 秘密提交了上市申请,但这次回购反而说明上市可能没那么快——通常公司会想先把业绩做漂亮再登陆公开市场。Sam Altman 上个月也承认过去一年不是他们最好的时候,...

推荐理由:OpenAI用8520亿美元的老估值做了70亿员工回购,同时6月已秘密申请上市。Altman自己说过去一年不是高光时刻,回购反而透露出上市不着急——先让老员工落袋为安,公司再慢慢打磨业绩。对从业者来说,这是判断行业头部公司流动性和IPO节奏的硬信息,不是公关稿。

TechCrunch · AI

OpenAI 推出新的网络安全模型,同时扩大其防御服务 Daybreak

OpenAI 把它的网络安全防御服务 Daybreak 升级了,分成了蓝队(给防守方用)和红队(给攻击模拟用)两个版本,同时塞了一个专门做防御工作的新模型进去。但正文没披露这个新模型叫什么、参数规模多大、怎么收费。有意思的是,OpenAI 和 Anthropic 都在卖安全工具,而它们自己的模型正是那些被用来发动攻击的元凶。

推荐理由:OpenAI 把 Daybreak 拆成蓝队和红队,还加了个新模型,确实是安全产品线上的一个动作。但文章没写模型叫什么、多大、怎么收费,信息有点薄。我会先打个折,给到 featured 门槛的 72 分。

彭博科技

OpenAI 花 70 亿美元从员工手里买回股份,估值翻倍到约 3000 亿

OpenAI 刚完成一笔 70 亿美元的股份回购,让员工和早期投资人套现。按这个回购价算,公司估值大概在 3000 亿美元,比去年底的 1570 亿翻了一倍。钱不是 OpenAI 自己掏的,是软银牵头的一轮融资出的。文章没写具体定价公式,也没说有多少比例的合格股份被卖回来。

推荐理由:70 亿美元回购把 OpenAI 隐含估值推到 3000 亿,比去年底翻了一倍,软银牵头出钱让员工和早期投资人套现。数字够硬,但文章没写定价公式,也没说有多少比例的合格股份被卖回来,所以我会先打个折——这事够上推荐,但缺细节让它到不了更高分。

8月10日星期一

Hacker News 首页

用每日冷知识小测验,反推 Claude 和 GPT 的知识截止日期与训练时间线

作者用维基百科的每日事件编了一套选择题,去测 GPT-5.4、Opus 4.7 等模型的错误率曲线。结果发现,Opus 4.7 及之后的 Anthropic 模型,知识截止点都落在 2025 年 12 月底附近,很可能来自同一次预训练。OpenAI 的 GPT-5.6 家族则是另一个批次,预训练数据大概在 2026 年 2 月底截止。比较奇怪的是 Op...

推荐理由:作者自己造了一套维基百科选择题来测模型的错误率曲线,从而反推预训练数据的截止时间。方法聪明,结论也实在——直接标出 Anthropic 和 OpenAI 两个批次的时间点。但这就是一篇技术侦探文,没有产品动作或行业八卦,普通读者可能觉得干。

Hacker News 首页

扎克伯格点名 OpenAI 和 Google,说封闭模型玩不过开源,Meta 下一代 Llama 继续全开源

扎克伯格在内部会议上直接点名 OpenAI 和 Google,认为长期来看开源模型会赢。他确认 Meta 的下一代 Llama 会保持完全开源,同时把 AI 团队打散并入产品部门,想加快发布节奏。具体发布时间和模型参数都没说。

推荐理由:扎克伯格内部讲话直接点名 OpenAI 和 Google,确认 Llama 会继续完全开源,还透露 AI 团队正被并入产品组。冲突感、组织变动和明确立场,三条都占全了。不过具体发布时间和模型参数都没说,所以我会先打个折,给到 78 分。