跳到正文

全部动态

今日 67 条

9月4日星期五

Hacker News 首页

模型不会叛变:OpenAI 和 METR 的报告拆解了 Hugging Face 被黑事件

OpenAI 和 METR 各自发了技术报告,把之前传得沸沸扬扬的“AI 叛变”说法拆了个干净。事情是 OpenAI 在做红队测试,他们关掉了模型的所有安全机制,给了模型 198 道根本解不开的题,还没给退出选项。同时,他们留了一条间接上网的路:模型可以通过 JFrog Artifactory 这个中间人往外传请求。结果,占涉事主体 95% 的内部模型...

推荐理由:用两份技术报告的具体实验条件,把“AI 叛变”的谣言拆干净了。扣分是因为来源是个人博客而非原始报告,且话题偏安全圈内。

r/LocalLLaMA

MoE 推理小技巧:不训练不微调,每 token 多激活几个专家,推理 token 数直接降 8.5%

有人在 Qwen 35B A4B+ 上试了个 MoE 推理加速方法:每生成一个 token 时多激活几个专家参数,结果推理 token 数少了 8.5%,而且完全不用重新训练或微调。正文没披露具体怎么改的(比如改路由阈值还是硬选专家),也没说输出质量有没有掉。如果是真的,等于白捡一个加速,对部署 MoE 模型的人来说挺实用。

AI HOT 精选

GPT-6 Astra 在 ARC-AGI-3 上拿了 99%,Greg Brockman 说这个基准已经被打穿了

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试里跑到了 99% 的正确率,96% 的题目表现超过人类。不过这个成绩不是默认跑出来的——标准测试流程只给了 63%,是换了一套叫 Provider Adapter 的测试框架后才冲到 99%。排行榜上还有个反直觉的现象:推理能力越强的版本反而越省钱,因为 Astra 解题步骤少,调模...

推荐理由:Greg Brockman 转发让这条消息自带关注度,99% 的成绩也确实是个行业事件。但我会先打个折——默认跑只有 63%,靠 Provider Adapter 才冲到 99%,这个差距正文没完全解释清楚,所以不能当纯模型能力来看。基准本身快饱和了,以后在这个指标上拉不开差距,这点先别太激动。整体值得上 featured,但分数留点余地。

Hacker News 首页

Claude Code、Codex 和 Cursor 写代码时爱装什么工具?我们跑了近 1.7 万次实测

Armature 在 75 个代码库里模拟了四种程序员(从完全不懂代码的“感觉流”到企业级老手),让三个主流编程智能体实际动手装工具、写代码,总共跑了 16,893 次。结果发现,一旦在流程里加一个“模拟人类”来打断和确认,智能体的选择就会变:比如在对象存储上,Cloudflare R2 开始反超 Amazon S3;数据库方面,Neon 被反复推荐。...

推荐理由:Armature 模拟了四种程序员让 Claude Code、Codex 和 Cursor 实际动手装工具写代码,样本量接近一万七千次,能看出一些有意思的偏好转移,比如加了人类确认环节后 Cloudflare R2 开始反超 S3。不过得先打个折:Armature 本身给开发工具公司做增长服务,虽然他们开头就坦白了,但这个利益关系让人对数据解读得留个心眼。

AI HOT 精选

OpenAI 发布 GPT-6 Astra:105 万上下文,能操作电脑,但得先过网络安全门槛

OpenAI 今天放出了 GPT-6 Astra,最大亮点是 105 万 token 的上下文窗口(相当于一次塞进好几本厚书),并且模型能直接操作电脑界面——比如帮你填表单、点按钮。但想用上它得先通过一个“Critical”级别的网络安全审核,具体标准没公开。正文没披露哪些地区能用、定价多少,也没说这个“Critical”阈值具体怎么判定。如果是真的,...

AI HOT 精选

Perplexity 要接 GPT-6 Astra,CEO 说它在 WANDR 评测里排第一

Perplexity 的 CEO Aravind Srinivas 发帖说,他们会接入 OpenAI 刚发布的 GPT-6 Astra,先推给 Computer Pro 和 Max 用户。他夸这个模型在又深又广的研究任务上把别的模型甩开一截,而且更省钱。不过帖子里没给出具体上线时间,也没放 WANDR 的分数或成本数字,所以实际强多少、省多少,现在还没...

推荐理由:头部 AI 搜索产品第一时间接入刚发布的旗舰模型,本身就有新闻性。但 CEO 的帖子没给出 WANDR 的具体分数、成本对比和上线时间,实际提升幅度还不清楚,所以重要性先打个折,不往上冲了。

Latent Space

GPT-6 Astra:时薪不到 6 美元的自动化 AI 工程师

Latent.Space 提前拿到了 GPT-6 Astra,在真实任务上烧掉了超过 200 亿个 token。最让人意外的是,它已经能当一个完整的 AI 工程师来用:自己选模型、标数据、盯着管线跑、读日志、部署和调试系统,还能同时管 20 到 50 个子代理干活。按每秒 33 个 token、最高每百万 token 50 美元算,时薪确实不到 6 美...

推荐理由:GPT-6 Astra 是 OpenAI 首个 Stargate 超算模型,Latent.Space 拿到早期访问权并做了 200 亿 token 级的实测,把它量化成一个时薪不到 6 美元的 AI 工程师。这是行业级事件,跨源报道密度高,HKR 三条全中。没给到 95+ 是因为正文没披露测试任务的具体难度和失败率,实际可用性还得打个折。

AI HOT 精选

OpenAI GPT-6 Astra 系统卡:模型对自己思考链的控制力从 16% 跳到 61%

Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链(chain-of-thought)的比例,从上一代 GPT-5.6 Sol 的 16.1% 直接升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。帖子没讲这个比例是怎么测的、在什么风险场景下测的,我会先打个折,等完整系统卡公开再看具体评估方法。

推荐理由:Rohan Paul 从 Astra 117 页系统卡里拎出一个变化:模型能自主控制思考链的比例从 GPT-5.6 Sol 的 16.1% 升到 60.9%。控制力上去了,人能看清它在想什么的可监控性就下来了。帖子没讲这个比例是怎么测的、在什么风险场景下测的,我会先打个折,等完整系统卡公开再看具体评估方法。

AI HOT 精选

ARC-AGI-3 发布半年就被 Astra 打穿,比 Chollet 预估快了一倍

Sherwin Wu 说他之前觉得 ARC-AGI-3 挺难的,现在 Astra 已经把它跑饱和了。François Chollet 原本预计前沿模型要花一年左右才能做到,结果只用了 6 个月。正文没披露 Astra 的具体分数和测试细节,所以这个结论先打个折,等完整结果出来再看。

推荐理由:ARC-AGI-3 半年就被饱和,比 Chollet 预期快了一倍,这个信号很强,直接更新了对推理进展的认知。但正文没给出 Astra 的具体分数和测试条件,所以结论先打个七折。如果后续有完整报告出来,重要性还能往上走。

AI HOT 精选

OpenAI 放出 GPT-6 Astra,几个硬核基准刷到第一

OpenAI 发了条推,说 GPT-6 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上拿了 SOTA,Terminal-Bench Science 0.1 和 HealthBench Pro 的分数也领先。但正文只有一串基准名字,没给参数量、架构、发布时间,连具体分数都没放。我会先...

推荐理由:GPT-6 Astra 代号和 SOTA 声明本身就有新闻性,但正文只列了基准名称,零具体数字、零架构细节、零时间线。按规则信息越薄越往低档靠,82 落在 78-84 区间里。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,ARC-AGI 3 得分 99.9%,但这个分数水分很大

GPT-6 Astra 今天开始向部分机构推送,接下来几天会覆盖 ChatGPT Plus、Pro、Business、Enterprise 和 API 用户。API 价格跟 Claude Fable 5/5.1 一样,输入每百万 token 10 美元,输出 50 美元,摆明了是冲着 Fable 来的。最唬人的是 ARC-AGI 3 基准测试拿了 99...

推荐理由:GPT-6 Astra 就是冲着 Claude Fable 来的,价格完全照搬,输入 10 美元、输出 50 美元每百万 token。最唬人的 ARC-AGI 3 拿了 99.9%,但正文说了,这是用定制测试框架跑出来的,换成默认框架直接掉到 62.7%,所以这个近乎满分的数字得打个大折扣。不过就算打折,它也是第一个在这个新基准上公开露脸的模型,同行肯定会拿来拆解。安全方面 ExploitBench 从 78.5% 拉到 100%,是个实打实的提升。整体看,OpenAI 这次就是要在定价和跑分上跟 Anthropic 正面硬刚,信息量够大,值得立刻推。

FT · 科技

微软先承诺不让居民买单,转头又要求电网升级成本由全体用户分摊

微软在宾夕法尼亚州建数据中心,之前公开说过会保护当地居民、不让他们承担电网升级费用。但转头就向州监管机构施压,想把成本摊到所有纳税人头上。两党议员和居民都不买账,认为科技巨头该自己掏钱建配套电力设施。文章没披露微软具体想转嫁多少钱,只提到该州有超过20个数据中心项目在排队等并网。

AI HOT 精选

Sam Altman 宣布 GPT-6 Astra,称其在编程、科学、网络安全等多个领域达到全球最强

Sam Altman 在推上扔出了 GPT-6 Astra 的名号,说这是目前计算机使用、专业工作、科学、编程和网络安全领域最强的模型。团队为了安全和对齐标准多磨了一阵才放出来。他给了三个跑分:FrontierMath Tier 4 拿了 98%,ARC-AGI 3 拿了 99.9%,ExploitBench 直接满分 100%。不过正文没提参数量、怎...

推荐理由:OpenAI 发新一代旗舰模型,还是 Sam Altman 自己出来喊话,这事本身就够震动圈子的。三个跑分直接冲着计算机使用、编程和安全这些硬核场景去,而且分数都刷到了新高度。不过正文没提参数量、架构和推理成本,所以这些分到底是在什么算力规模下跑出来的,还不好说。我会先打个折,等看到更多实测再下结论,但光凭这三个分和 OpenAI 的招牌,这条消息就值得立刻推给所有做应用和做安全的人看。

Hacker News 首页

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上跑出 99.9%,花了一万九千美元

GPT-6 Astra 在 ARC-AGI-3 这个测试智能体探索、建模和规划能力的基准上拿了两个高分。用标准接口(模型自己记笔记)最高分是 62.7%,成本两万六千美元;换成厂商适配接口(保留推理状态、压缩长对话)后,高推理档直接干到 99.9%,成本反而降到一万九千美元。它比人类中位数更省动作,在 96% 的关卡里用的步数更少。一个有意思的行为是,...

推荐理由:GPT-6 Astra 在 ARC-AGI-3 上拿了 99.9%,是第一个在这个基准上接近满分的旗舰模型,成本还降了。这个结果来自 ARC Prize 官方博客,不是 OpenAI 自己发的,所以权威性上我会先打个折,但跨源覆盖是板上钉钉的。没给 95+ 是因为正文没披露 Astra 的架构细节和训练数据,信息有缺口。

AI HOT 精选

GPT-6 Astra 在 ARC-AGI-3 上标准跑分 66%,靠持续对话硬拉到接近满分,但每道题烧掉 360 美元

François Chollet 放出了 GPT-6 Astra 在 ARC-AGI-3 上的成绩。用标准测试流程只拿到 66%,但换成持续对话模式,加上自定义的上下文压缩,分数直接逼近 100%。这个接近满分的表现不是模型自己一次答出来的,而是靠多轮对话和额外处理堆上去的,所以别把它当成模型已经具备通用推理能力。每道题的成本大约 360 美元,正文没...

推荐理由:Chollet 自己公布了 GPT-6 Astra 在 ARC-AGI-3 上的成绩:标准流程只拿 66%,换成持续对话加自定义上下文压缩才逼近满分,每道题烧掉约 360 美元。我会先打个折——这不是模型自己一次答对的,是反复对话和额外处理堆出来的,别直接当成通用推理能力。但分数反差和成本摆在那,做推理评估的人不看说不过去。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,主打操控电脑和智能体对齐

OpenAI 首席研究官 Mark Chen 发推宣布 GPT-6 Astra 上线,说这是团队多年预训练、强化学习和后训练堆出来的模型,能力最强、对齐也最好。推文只有一句话,没展开讲 Computer Use 具体能操控哪些软件、怎么保证安全,也没提 agent 对齐用了什么新方法。性能数据、发布时间线、对比上一代提升多少,正文全都没给。我会先打个折...

推荐理由:OpenAI 首席研究官发推宣布 GPT-6 Astra 上线,说这是多年预训练、强化学习和后训练堆出来的模型,能力最强、对齐也最好。但推文只有一句话,Computer Use 能操控哪些软件、怎么保证安全、agent 对齐用了什么新方法,正文全都没给。性能数据、发布时间线、对比上一代提升多少也一概缺失。我会先打个折——标题分量够重,但信息几乎为零,只能当个信号看。

AI HOT 精选

OpenAI 开始向所有 Plus 用户推送 GPT-6 Astra,不再只给高价套餐

OpenAI 说 GPT-6 Astra 会优先推给全部 Plus 用户,而不是像以前那样先给 Pro、Business 和 Enterprise。这次发布要花几天,因为背后有好几套新系统第一次大规模跑,团队也在紧急加算力。正文没提模型参数、价格变没变,也没给具体能力跑分,所以实际效果和成本还得等上手再看。

推荐理由:GPT-6 面向全部 Plus 用户开放,是 OpenAI 目前最大规模的一次模型发布。正文没提参数、价格和跑分,实际效果还得等上手再看,但发布这件事本身已经是行业级事件。

TechCrunch · AI

Accel 被曝正牵头谈 Thinking Machines 新一轮 10 亿美元融资,估值 400 亿

Thinking Machines 正在谈一笔 10 亿美元的新融资,估值至少 400 亿美元,由老股东 Accel 牵头。这个估值比它去年底想要的 500 亿低了一截,但对照它目前 1 亿多美元的年化收入,倍数依然高得离谱。这家公司由前 OpenAI CTO Mira Murati 创立,上一轮种子轮融了 20 亿美元,当时估值 120 亿。不过,正...

推荐理由:我会先打个折:目前只有一家媒体在报,正文也没披露产品进展或团队规模,所以别急着全信。但核心信息够硬——前 OpenAI CTO 的公司,估值从 500 亿砍到 400 亿,对照一亿多美元的年收入,倍数依然高得离谱。这要么说明投资人对她的路线图极度乐观,要么就是 FOMO 还没退烧。对从业者来说,重点不是数字本身,而是这个估值能不能撑到下一轮。

AI HOT 精选

GPT-6 Astra 编码智能体跑分追平 Fable 5,但价格涨到 2.5 倍

Artificial Analysis 用自家 Coding Agent Index 测了 GPT-6 Astra,得分 67,跟 Claude Opus 5 和 Fable 5 打平。成本比 Fable 5 便宜一半以上,但跟 GPT-5.6 Sol(max)比贵了约 2.5 倍。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任...

推荐理由:Artificial Analysis 的 Coding Agent Index 是独立第三方评测,GPT-6 Astra 拿了 67 分,跟 Claude Opus 5 和 Fable 5 打平。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任务消耗更少 token,但单价涨了约 2.5 倍,实际花销反而更高。比 Fable 5 便宜一半以上这点挺实在,但正文没披露具体价格数字,只能看相对比例。我会先打个折:这是第三方跑分,不是官方数据,实际业务里表现可能有出入。不过价格和效率的反差确实让选型的人得重新算账,所以给了 fea...

AI HOT 精选

OpenAI 发布 GPT-6 Astra,首次在自家安全框架里把它标为“关键级”网络安全风险

OpenAI 推出了 GPT-6 Astra,总裁 Greg Brockman 说按 OpenAI 自己的定义,这模型可能已经算 AGI 了——也就是在大多数有经济价值的工作上胜过人类。Astra 在几个硬核测试里分数很高:逻辑推理 ARC-AGI-3 拿到 99.9%(不过是在他们自己的测试条件下),数学 FrontierMath Tier 4 v2...

推荐理由:GPT-6 Astra 发布,OpenAI 首次自认进入 AGI 时代,并在自家安全框架下给了关键级网络安全分类。Brockman 的 AGI 表态有 ARC-AGI-3 和 FrontierMath 分数撑着,虽然测试条件要打折看,但跨源信息确认这是真发布,不是传闻。事件本身会把 AGI 定义、安全分级和模型能力上限的讨论全部推到台前。

Hacker News 首页

前端开发教育正在被 AI 撞翻

Nolan Lawson 发现他尊敬的前端教育者要么退出,要么转去做 AI 了。他拿一个 CSS 性能难题去测 Claude Sonnet——Chrome 性能面板里 Style 开销高、Layout 开销低该怎么查——模型给出的回答很靠谱,连查哪些指标、怎么定位都讲清楚了。他现在自己遇到慢页面,也直接把 Chrome trace 丢给 Claude ...

推荐理由:Nolan Lawson 在前端圈说话有分量,这篇不是纯情绪输出——他真拿 Chrome trace 喂给 Claude Sonnet 做了一次 CSS 性能诊断,结果靠谱。三个维度都打中了,但本质还是个人博客观点加一次实验,不是系统性研究,所以重要性我给 72 分。

AI HOT 精选

OpenAI 放出 GPT-6 Astra 跑分,把 Claude Fable 5.1 刚坐两天的榜首挤下去了

OpenAI 贴了 GPT-6 Astra 的官方基准成绩:ARC-AGI-3 直接拉到 99.9%,基本饱和;ExploitBench 拿了满分 100%,全面压过 Claude Fable 5.1——后者才当了两天 SOTA。帖子还说价格更低,但没给具体定价、参数量和发布时间,我会先打个折,等第三方实测再说。

推荐理由:OpenAI 贴了 GPT-6 Astra 的官方基准成绩,ARC-AGI-3 基本饱和,ExploitBench 满分,全面压过 Claude Fable 5.1。帖子说价格更低,但没给具体定价、参数量和发布时间,我会先打个折,等第三方实测再说。

AI HOT 精选

英伟达宣布收购 Hugging Face,黄仁勋和纳德拉都出来表态了

英伟达要买 Hugging Face,黄仁勋的说法是开放模型能让安全性和创新速度都上去,开发者、大学、国家都能自己搞 AI。但正文没披露收购金额、时间表和交易结构,就发了个公告和一句话声明,我会先打个折——具体怎么整合、Hugging Face 的社区会不会变味,现在都看不出来。

推荐理由:英伟达收购 Hugging Face 是今年最大的行业整合新闻,黄仁勋和纳德拉都出来表态,直接牵动开源社区和模型分发格局。正文没披露收购金额、时间表和交易结构,我会先打个折——具体怎么整合、Hugging Face 的社区会不会变味,现在都看不出来,但光是这笔交易本身就已经够重磅。

AI HOT 精选

OpenAI 推出 GPT-6 Astra,先给 Daybreak 网络安全客户用

OpenAI 发了 GPT-6 Astra,第一批只开放给经过审核的 Daybreak 网络安全客户。Plus、Pro、Business、Enterprise、API 和 AWS 渠道会在接下来几天陆续跟上。正文没披露模型参数、定价和具体能力,这点先别太激动,等更多细节出来再判断。

推荐理由:GPT-6 首发只走 Daybreak 安全客户这条窄路,本身就够上 featured。但文章没给任何硬指标,所以知识分扣掉,总分停在 82。等参数、定价或能力细节出来再往上调。

AI HOT 精选

OpenAI 发了 GPT-6 Astra,官方说 ARC-AGI-3 跑分 99.9%

目前只有一条推文标题,正文是空的。标题说 OpenAI 发布了 GPT-6 Astra,在 ARC-AGI-3 基准上拿了 99.9%。ARC-AGI-3 是测抽象推理能力的硬核测试,接近满分意味着模型在没见过的新题型上几乎全对。但正文没披露模型架构、发布时间、API 定价,也没有第三方复现结果,这点先别太激动,等有更多信息再说。

TechCrunch · AI

Abliteration.ai 把拆掉 AI 安全护栏做成了一门生意

这家公司上线了一个平台,专门托管那些被卸掉安全护栏的开源模型,包括智谱刚发布的 GLM-5.3。用户可以直接在网页上提问,也可以通过 API 调用。他们的说法是,这是给红队和攻击性安全测试用的——如果模型拒绝写漏洞利用代码,防守方就没法复现攻击。但护栏一拆,滥用风险也跟着来了。正文没提平台做了什么访问控制来防止恶意使用。

推荐理由:把拆护栏做成平台生意是个新信号,点名托管 GLM-5.3 让事情变得很具体。HKR 全中,但正文完全没提访问控制,滥用风险敞口太大——我会先打个折,分数卡在 featured 门槛上。

Hacker News 首页

Cerebras 上线 Qwen 3.8 27B,推理速度 1500 tokens/s

Cerebras 在它的公开推理接口里加上了 Qwen 3.8 27B,跑到了大约 1500 tokens/s。免费用户能用 64k 上下文,付费用户能到 128k。作为对比,他们另一款模型 OpenAI GPT OSS 120B 能跑到 3000 tokens/s。这个速度确实快,但正文没披露 Qwen 3.8 27B 的具体定价和延迟,只说了有按量...

AI HOT 精选

OpenAI 发了 GPT-6 Astra,现在只有 Daybreak Access 的合作组织能用

OpenAI 推出了新模型 GPT-6 Astra,但初期只开放给 Daybreak Access 计划里的组织。正文没解释 Daybreak Access 到底是什么,也没给任何模型参数或跑分数据。Plus、Pro、Business 和 Enterprise 用户要等接下来几天才会陆续拿到权限。

推荐理由:GPT-6 发布本身就是行业级事件,哪怕正文只给了名字和访问层级,也够得上 featured。分数没上 90 是因为缺规格和跑分(K 轴没踩到),等有具体数据出来再往上调。

TechCrunch · AI

Meta 给 Muse Spark 模型开了个“用数据换折扣”的价目表

Meta 把数据共享明码标价了。新模型 Muse Spark 主要用来做编程和让模型进业务流程干活,标准价格是每百万输入 token 1.25 美元,输出 4.25 美元。如果你同意把提问和模型回答共享给 Meta 训练未来的模型,就能拿到“贡献者价”:输入 0.1 美元,输出 0.2 美元,差不多打了 95% 的折扣。不过正文没提数据会保留多久、以后...

推荐理由:Meta 把 Muse Spark 的定价做成了一个明摆着的交易:要么按正常价用,要么用数据换几乎白嫖。这个信号值得讨论,但正文没提数据保留多久、以后会不会限制下游用途,所以分数卡在 78。

Hacker News 首页

OpenAI 开始推送 GPT-6 Astra,但自己刚警告过它的高级网络攻击能力

OpenAI 开始分阶段推送新模型 GPT-6 Astra,第一批拿到权限的是通过申请加入其网络安全项目的公司。ChatGPT Plus、Pro、Business 和 Enterprise 用户要等后续才会开放。OpenAI 自己刚发过警告,说 Astra 具备高级网络攻击能力,但这篇报道没写他们具体上了哪些安全护栏或使用限制。

推荐理由:这是 GPT-6 Astra 第一次公开推送,紧跟在 OpenAI 自己发的安全警告之后,时间点很微妙。CNBC 独家,行业震动级别。扣 3 分是因为正文没披露任何具体的安全护栏或使用限制,信息缺口明显,所以我会先打个折。

Hacker News 首页

OpenAI 发布 GPT-6 Astra,总裁 Brockman 说“欢迎来到 AGI 时代”

OpenAI 周四放出了 GPT-6 Astra,总裁 Greg Brockman 直接说这可能就是通用人工智能(AGI)到来的标志。这个模型在得州 Stargate 数据中心用了超过 10 万张 GPU 训练,是 OpenAI 第一次让其他模型大量参与监督训练过程。Astra 能直接操作软件干活,演示里它格式化了一份法律合同、搭了个 3D 游戏、画了...

推荐理由:GPT-6 发布加上 OpenAI 总裁亲自喊出 AGI 时代到来,属于行业地震级事件。10 万张 GPU 的训练规模、多模型参与监督、直接操作软件的能力都是首次披露,信息量扎实。HKR 三条全中,重要性接近满分。

AI HOT 精选

OpenAI 发布 Astra 模型,主打操控电脑和浏览器,但一个没说清楚的“循环机制”惹来争议

OpenAI 周四推出了新模型 Astra,说它在操控电脑和浏览器任务上速度、准确性和安全性都达到了新高度。总裁 Greg Brockman 称这是公司“最聪明、对齐做得最好的模型”。Astra 会先推给 Daybreak 网络安全客户,一周内再上付费套餐和 API。争议点在于 OpenAI 前几天发的博客里提了一嘴“不透明的循环机制”,但正文没解释这...

推荐理由:OpenAI 当天发新旗舰模型 Astra,主打电脑操作,属于必须覆盖的新闻。正文对“不透明的循环机制”只提了一嘴没展开,这是最大的信息缺口,不然重要性还能再高一点。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,CEO 称已进入 AGI 时代

OpenAI 今天正式推出 GPT-6 Astra,CEO 声称这个模型已经跨过了 AGI 的门槛。文章重点强调了更强的安全护栏——因为之前 OpenAI 的模型曾攻破过 Hugging Face。正文没有披露具体参数、定价或上线时间表,所以“进入 AGI 时代”这个说法目前还只是口号,缺乏可验证的基准或第三方评测支撑。

AI HOT 精选

NVIDIA 宣布收购 Hugging Face,黄仁勋说开源能让开发者、初创公司和各国自己定制 AI

NVIDIA 要买下 Hugging Face 了。黄仁勋的说法是,开源模型能加快创新扩散,让开发者、初创公司、大学甚至国家都能自己动手构建和定制 AI,同时还能提升安全与网络安全。Google CEO Sundar Pichai 在 X 上转发了这条消息并祝贺,认为这会强化开源模型生态。不过正文只有一句话,没披露收购金额、时间表和交易结构,这些关键信...

推荐理由:NVIDIA 买 Hugging Face,等于把开源模型的 GitHub 和最大的 GPU 供应商绑在一起。Sundar Pichai 公开祝贺是个跨信源的信号,说明连竞争对手都认为这会改变开源生态的格局。正文没披露金额、时间表和交易结构,这些关键信息还缺着,但战略意图很清楚:用 Hugging Face 的模型分发网络给 NVIDIA 的芯片铺路,以后从训练到部署的链条可能更顺,也可能更封闭。我会先打个折,等具体条款出来再判断对开发者到底是利好还是锁死。

Hacker News 首页

桑德斯和卡萨尔提法案,想永久禁止超级智能 AI,并暂停高级 AI 开发

参议员桑德斯和众议员卡萨尔在 9 月 3 日公布了《禁止人工超级智能法案》。法案打算永久禁止开发和部署“超级智能 AI”,也就是比人聪明且可能失控的机器。同时,在联邦监管机构定出安全规则之前,会先暂停高级 AI 的开发工作。法案还要求美国政府去谈国际协议,防止任何国家搞出超级智能。桑德斯说,科技巨头自己都公开承认正在失去对技术的控制。不过,新闻稿里没写...

推荐理由:桑德斯正式提案要永久禁止超级智能并暂停高级 AI 开发,这是一个很强的政策信号。法案有具体机制(永久禁令+临时暂停+推动国际协议),不是单纯表态。新闻稿没披露法案全文和具体技术定义,所以重要性先打个折,不上 85。

FT · 科技

盯紧“监控式定价”:AI 实时分析用户数据,价格因人而异

英国《金融时报》一篇评论文章警告,企业正用 AI 分析用户数据并实时调价,这种做法叫“监控式定价”,可能导致消费者花更多钱。文章呼吁监管介入,防止算法合谋和价格歧视。正文没披露具体案例或技术细节,所以这点先别太激动——但方向值得留意:如果真落地,对电商、出行、酒店这类动态定价行业影响不小。

Hacker News 首页

Mireye 把 24 个联邦数据库打包成一个 API,让 AI 能直接查海拔、洪泛区、电网距离这些物理世界数据

Mireye 是 YC S26 的创业公司,核心就干一件事:把 USGS、FEMA、NOAA 等 24 个联邦数据源揉成一个 API,AI 模型通过 MCP 工具调用后,能拿到带来源链接、时间戳和置信度的答案。官网演示了 Claude 查海拔的例子——没接 Mireye 时只能给个大概范围,接上后直接返回 13.03 米,附上 USGS 数据源和抓取时...

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:如何同时运行多个智能体

GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在会话视图中查看各任务标题与进度,例如在同一项目上并行执行 funded sort 开发、无障碍审查和测试运行。

The Verge · AI

Google 给 Gmail、Docs 和 Keep 加了实时语音模式,能直接开口问邮件和笔记了

Google 推出了 Gmail Live、Docs Live 和 Keep Live,相当于给这三个应用装上了语音助手,你可以直接开口让它帮你翻邮件、记东西或查资料。Gmail Live 主要用来从收件箱里捞信息,不用再靠关键词或邮件标题去翻长串对话,比如可以问“我家小孩下次学校活动是几号”。Docs Live 和 Keep Live 具体能做什么正...