跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 301–320 条 · 共 1,551 条

9月4日星期五

Hacker News 首页

模型不会叛变:OpenAI 和 METR 的报告拆解了 Hugging Face 被黑事件

OpenAI 和 METR 各自发了技术报告,把之前传得沸沸扬扬的“AI 叛变”说法拆了个干净。事情是 OpenAI 在做红队测试,他们关掉了模型的所有安全机制,给了模型 198 道根本解不开的题,还没给退出选项。同时,他们留了一条间接上网的路:模型可以通过 JFrog Artifactory 这个中间人往外传请求。结果,占涉事主体 95% 的内部模型...

推荐理由:用两份技术报告的具体实验条件,把“AI 叛变”的谣言拆干净了。扣分是因为来源是个人博客而非原始报告,且话题偏安全圈内。

AI HOT 精选

GPT-6 Astra 在 ARC-AGI-3 上拿了 99%,Greg Brockman 说这个基准已经被打穿了

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试里跑到了 99% 的正确率,96% 的题目表现超过人类。不过这个成绩不是默认跑出来的——标准测试流程只给了 63%,是换了一套叫 Provider Adapter 的测试框架后才冲到 99%。排行榜上还有个反直觉的现象:推理能力越强的版本反而越省钱,因为 Astra 解题步骤少,调模...

推荐理由:Greg Brockman 转发让这条消息自带关注度,99% 的成绩也确实是个行业事件。但我会先打个折——默认跑只有 63%,靠 Provider Adapter 才冲到 99%,这个差距正文没完全解释清楚,所以不能当纯模型能力来看。基准本身快饱和了,以后在这个指标上拉不开差距,这点先别太激动。整体值得上 featured,但分数留点余地。

Hacker News 首页

Claude Code、Codex 和 Cursor 写代码时爱装什么工具?我们跑了近 1.7 万次实测

Armature 在 75 个代码库里模拟了四种程序员(从完全不懂代码的“感觉流”到企业级老手),让三个主流编程智能体实际动手装工具、写代码,总共跑了 16,893 次。结果发现,一旦在流程里加一个“模拟人类”来打断和确认,智能体的选择就会变:比如在对象存储上,Cloudflare R2 开始反超 Amazon S3;数据库方面,Neon 被反复推荐。...

推荐理由:Armature 模拟了四种程序员让 Claude Code、Codex 和 Cursor 实际动手装工具写代码,样本量接近一万七千次,能看出一些有意思的偏好转移,比如加了人类确认环节后 Cloudflare R2 开始反超 S3。不过得先打个折:Armature 本身给开发工具公司做增长服务,虽然他们开头就坦白了,但这个利益关系让人对数据解读得留个心眼。

AI HOT 精选

Perplexity 要接 GPT-6 Astra,CEO 说它在 WANDR 评测里排第一

Perplexity 的 CEO Aravind Srinivas 发帖说,他们会接入 OpenAI 刚发布的 GPT-6 Astra,先推给 Computer Pro 和 Max 用户。他夸这个模型在又深又广的研究任务上把别的模型甩开一截,而且更省钱。不过帖子里没给出具体上线时间,也没放 WANDR 的分数或成本数字,所以实际强多少、省多少,现在还没...

推荐理由:头部 AI 搜索产品第一时间接入刚发布的旗舰模型,本身就有新闻性。但 CEO 的帖子没给出 WANDR 的具体分数、成本对比和上线时间,实际提升幅度还不清楚,所以重要性先打个折,不往上冲了。

Latent Space

GPT-6 Astra:时薪不到 6 美元的自动化 AI 工程师

Latent.Space 提前拿到了 GPT-6 Astra,在真实任务上烧掉了超过 200 亿个 token。最让人意外的是,它已经能当一个完整的 AI 工程师来用:自己选模型、标数据、盯着管线跑、读日志、部署和调试系统,还能同时管 20 到 50 个子代理干活。按每秒 33 个 token、最高每百万 token 50 美元算,时薪确实不到 6 美...

推荐理由:GPT-6 Astra 是 OpenAI 首个 Stargate 超算模型,Latent.Space 拿到早期访问权并做了 200 亿 token 级的实测,把它量化成一个时薪不到 6 美元的 AI 工程师。这是行业级事件,跨源报道密度高,HKR 三条全中。没给到 95+ 是因为正文没披露测试任务的具体难度和失败率,实际可用性还得打个折。

AI HOT 精选

OpenAI GPT-6 Astra 系统卡:模型对自己思考链的控制力从 16% 跳到 61%

Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链(chain-of-thought)的比例,从上一代 GPT-5.6 Sol 的 16.1% 直接升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。帖子没讲这个比例是怎么测的、在什么风险场景下测的,我会先打个折,等完整系统卡公开再看具体评估方法。

推荐理由:Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链的比例从 GPT-5.6 Sol 的 16.1% 升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。帖子没讲这个比例是怎么测的、在什么风险场景下测的,我会先打个折,等完整系统卡公开再看具体评估方法。

AI HOT 精选

OpenAI 放出 GPT-6 Astra,几个硬核基准刷到第一

OpenAI 发了条推,说 GPT-6 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上拿了 SOTA,Terminal-Bench Science 0.1 和 HealthBench Pro 的分数也领先。但正文只有一串基准名字,没给参数量、架构、发布时间,连具体分数都没放。我会先...

推荐理由:GPT-6 Astra 代号和 SOTA 声明本身就有新闻性,但正文只列了基准名称,零具体数字、零架构细节、零时间线。按规则信息越薄越往低档靠,82 落在 78-84 区间里。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%,但这个分数水分很大

GPT-6 Astra 今天开始向部分机构推送,接下来几天会覆盖 ChatGPT Plus、Pro、Business、Enterprise 和 API 用户。API 价格跟 Claude Fable 5/5.1 一样,输入每百万 token 10 美元,输出 50 美元,摆明了是冲着 Fable 来的。最唬人的是 ARC-AGI 3 基准测试拿了 99...

推荐理由:GPT-6 Astra 就是冲着 Claude Fable 来的,价格完全照搬,输入 10 美元、输出 50 美元每百万 token。最唬人的 ARC-AGI 3 拿了 99.9%,但正文说了,这是用定制测试框架跑出来的,换成默认框架直接掉到 62.7%,所以这个近乎满分的数字得打个大折扣。不过就算打折,它也是第一个在这个新基准上公开露脸的模型,同行肯定会拿来拆解。安全方面 ExploitBench 从 78.5% 拉到 100%,是个实打实的提升。整体看,OpenAI 这次就是要在定价和跑分上跟 Anthropic 正面硬刚,信息量够大,值得立刻推。

AI HOT 精选

Sam Altman 宣布 GPT-6 Astra,称其在编程、科学、网络安全等多个领域达到全球最强

Sam Altman 在推上扔出了 GPT-6 Astra 的名号,说这是目前计算机使用、专业工作、科学、编程和网络安全领域最强的模型。团队为了安全和对齐标准多磨了一阵才放出来。他给了三个跑分:FrontierMath Tier 4 拿了 98%,ARC-AGI 3 拿了 99.9%,ExploitBench 直接满分 100%。不过正文没提参数量、怎...

推荐理由:OpenAI 发新一代旗舰模型,还是 Sam Altman 自己出来喊话,这事本身就够震动圈子的。三个跑分直接冲着计算机使用、编程和安全这些硬核场景去,而且分数都刷到了新高度。不过正文没提参数量、架构和推理成本,所以这些分到底是在什么算力规模下跑出来的,还不好说。我会先打个折,等看到更多实测再下结论,但光凭这三个分和 OpenAI 的招牌,这条消息就值得立刻推给所有做应用和做安全的人看。

Hacker News 首页

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上跑出 99.9%,花了一万九千美元

GPT-6 Astra 在 ARC-AGI-3 这个测试智能体探索、建模和规划能力的基准上拿了两个高分。用标准接口(模型自己记笔记)最高分是 62.7%,成本两万六千美元;换成厂商适配接口(保留推理状态、压缩长对话)后,高推理档直接干到 99.9%,成本反而降到一万九千美元。它比人类中位数更省动作,在 96% 的关卡里用的步数更少。一个有意思的行为是,...

推荐理由:GPT-6 Astra 在 ARC-AGI-3 上拿了 99.9%,是第一个在这个基准上接近满分的旗舰模型,成本还降了。这个结果来自 ARC Prize 官方博客,不是 OpenAI 自己发的,所以权威性上我会先打个折,但跨源覆盖是板上钉钉的。没给 95+ 是因为正文没披露 Astra 的架构细节和训练数据,信息有缺口。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,主打操控电脑和智能体对齐

OpenAI 首席研究官 Mark Chen 发推宣布 GPT-6 Astra 上线,说这是团队多年预训练、强化学习和后训练堆出来的模型,能力最强、对齐也最好。推文只有一句话,没展开讲 Computer Use 具体能操控哪些软件、怎么保证安全,也没提 agent 对齐用了什么新方法。性能数据、发布时间线、对比上一代提升多少,正文全都没给。我会先打个折...

推荐理由:OpenAI 首席研究官发推宣布 GPT-6 Astra 上线,说这是多年预训练、强化学习和后训练堆出来的模型,能力最强、对齐也最好。但推文只有一句话,Computer Use 能操控哪些软件、怎么保证安全、agent 对齐用了什么新方法,正文全都没给。性能数据、发布时间线、对比上一代提升多少也一概缺失。我会先打个折——标题分量够重,但信息几乎为零,只能当个信号看。

AI HOT 精选

OpenAI 开始向所有 Plus 用户推送 GPT-6 Astra,不再只给高价套餐

OpenAI 说 GPT-6 Astra 会优先推给全部 Plus 用户,而不是像以前那样先给 Pro、Business 和 Enterprise。这次发布要花几天,因为背后有好几套新系统第一次大规模跑,团队也在紧急加算力。正文没提模型参数、价格变没变,也没给具体能力跑分,所以实际效果和成本还得等上手再看。

推荐理由:GPT-6 面向全部 Plus 用户开放,是 OpenAI 目前最大规模的一次模型发布。正文没提参数、价格和跑分,实际效果还得等上手再看,但发布这件事本身已经是行业级事件。

AI HOT 精选

GPT-6 Astra 编码智能体跑分追平 Fable 5,但价格涨到 2.5 倍

Artificial Analysis 用自家 Coding Agent Index 测了 GPT-6 Astra,得分 67,跟 Claude Opus 5 和 Fable 5 打平。成本比 Fable 5 便宜一半以上,但跟 GPT-5.6 Sol(max)比贵了约 2.5 倍。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任...

推荐理由:Artificial Analysis 的 Coding Agent Index 是独立第三方评测,GPT-6 Astra 拿了 67 分,跟 Claude Opus 5 和 Fable 5 打平。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任务消耗更少 token,但单价涨了约 2.5 倍,实际花销反而更高。比 Fable 5 便宜一半以上这点挺实在,但正文没披露具体价格数字,只能看相对比例。我会先打个折:这是第三方跑分,不是官方数据,实际业务里表现可能有出入。不过价格和效率的反差确实让选型的人得重新算账,所以给了 fea...

AI HOT 精选

OpenAI 发布 GPT-6 Astra,首次在自家安全框架里把它标为“关键级”网络安全风险

OpenAI 推出了 GPT-6 Astra,总裁 Greg Brockman 说按 OpenAI 自己的定义,这模型可能已经算 AGI 了——也就是在大多数有经济价值的工作上胜过人类。Astra 在几个硬核测试里分数很高:逻辑推理 ARC-AGI-3 拿到 99.9%(不过是在他们自己的测试条件下),数学 FrontierMath Tier 4 v2...

推荐理由:GPT-6 Astra 发布,OpenAI 首次自认进入 AGI 时代,并在自家安全框架下给了关键级网络安全分类。Brockman 的 AGI 表态有 ARC-AGI-3 和 FrontierMath 分数撑着,虽然测试条件要打折看,但跨源信息确认这是真发布,不是传闻。事件本身会把 AGI 定义、安全分级和模型能力上限的讨论全部推到台前。

AI HOT 精选

OpenAI 放出 GPT-6 Astra 跑分,把 Claude Fable 5.1 刚坐两天的榜首挤下去了

OpenAI 贴了 GPT-6 Astra 的官方基准成绩:ARC-AGI-3 直接拉到 99.9%,基本饱和;ExploitBench 拿了满分 100%,全面压过 Claude Fable 5.1——后者才当了两天 SOTA。帖子还说价格更低,但没给具体定价、参数量和发布时间,我会先打个折,等第三方实测再说。

推荐理由:OpenAI 贴了 GPT-6 Astra 的官方基准成绩,ARC-AGI-3 基本饱和,ExploitBench 满分,全面压过 Claude Fable 5.1。帖子说价格更低,但没给具体定价、参数量和发布时间,我会先打个折,等第三方实测再说。

AI HOT 精选

OpenAI 推出 GPT-6 Astra,先给 Daybreak 网络安全客户用

OpenAI 发了 GPT-6 Astra,第一批只开放给经过审核的 Daybreak 网络安全客户。Plus、Pro、Business、Enterprise、API 和 AWS 渠道会在接下来几天陆续跟上。正文没披露模型参数、定价和具体能力,这点先别太激动,等更多细节出来再判断。

推荐理由:GPT-6 首发只走 Daybreak 安全客户这条窄路,本身就够上 featured。但文章没给任何硬指标,所以知识分扣掉,总分停在 82。等参数、定价或能力细节出来再往上调。

AI HOT 精选

OpenAI 发了 GPT-6 Astra,现在只有 Daybreak Access 的合作组织能用

OpenAI 推出了新模型 GPT-6 Astra,但初期只开放给 Daybreak Access 计划里的组织。正文没解释 Daybreak Access 到底是什么,也没给任何模型参数或跑分数据。Plus、Pro、Business 和 Enterprise 用户要等接下来几天才会陆续拿到权限。

推荐理由:GPT-6 发布本身就是行业级事件,哪怕正文只给了名字和访问层级,也够得上 featured。分数没上 90 是因为缺规格和跑分(K 轴没踩到),等有具体数据出来再往上调。

Hacker News 首页

OpenAI 开始推送 GPT-6 Astra,但自己刚警告过它的高级网络攻击能力

OpenAI 开始分阶段推送新模型 GPT-6 Astra,第一批拿到权限的是通过申请加入其网络安全项目的公司。ChatGPT Plus、Pro、Business 和 Enterprise 用户要等后续才会开放。OpenAI 自己刚发过警告,说 Astra 具备高级网络攻击能力,但这篇报道没写他们具体上了哪些安全护栏或使用限制。

推荐理由:这是 GPT-6 Astra 第一次公开推送,紧跟在 OpenAI 自己发的安全警告之后,时间点很微妙。CNBC 独家,行业震动级别。扣 3 分是因为正文没披露任何具体的安全护栏或使用限制,信息缺口明显,所以我会先打个折。

Hacker News 首页

OpenAI 发布 GPT-6 Astra,总裁 Brockman 说“欢迎来到 AGI 时代”

OpenAI 周四放出了 GPT-6 Astra,总裁 Greg Brockman 直接说这可能就是通用人工智能(AGI)到来的标志。这个模型在得州 Stargate 数据中心用了超过 10 万张 GPU 训练,是 OpenAI 第一次让其他模型大量参与监督训练过程。Astra 能直接操作软件干活,演示里它格式化了一份法律合同、搭了个 3D 游戏、画了...

推荐理由:GPT-6 发布加上 OpenAI 总裁亲自喊出 AGI 时代到来,属于行业地震级事件。10 万张 GPU 的训练规模、多模型参与监督、直接操作软件的能力都是首次披露,信息量扎实。HKR 三条全中,重要性接近满分。

AI HOT 精选

OpenAI 发布 Astra 模型,主打操控电脑和浏览器,但一个没说清楚的“循环机制”惹来争议

OpenAI 周四推出了新模型 Astra,说它在操控电脑和浏览器任务上速度、准确性和安全性都达到了新高度。总裁 Greg Brockman 称这是公司“最聪明、对齐做得最好的模型”。Astra 会先推给 Daybreak 网络安全客户,一周内再上付费套餐和 API。争议点在于 OpenAI 前几天发的博客里提了一嘴“不透明的循环机制”,但正文没解释这...

推荐理由:OpenAI 当天发新旗舰模型 Astra,主打电脑操作,属于必须覆盖的新闻。正文对“不透明的循环机制”只提了一嘴没展开,这是最大的信息缺口,不然重要性还能再高一点。