跳到正文

#评测/基准

今日 2 条

9月19日星期六

Hacker News 首页

19 个模型打《星际争霸》,没有一个超过新手水平

Ben Swerdlow 让 19 个模型在《星际争霸:母巢之战》里互相对打,结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一,但它靠的不是运营,而是早期派一个探机去骚扰对手工人,对面模型会花几十秒思考怎么处理,直接瘫痪。Grok 4.6 表现最差,xhigh 版本在 43 分钟里只发出了 6...

推荐理由:Ben Swerdlow 搞了个《母巢之战》模型对战测试,19 个模型互打,没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一,但赢法不是靠运营,而是早期派一个探机去骚扰农民,对面模型会花几十秒想对策,直接卡死。Grok 4.6 最拉胯,xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观,数据也扎实,胜率、APM、单局成本都有。我会先打个折,因为这只是一个人做的非正式 benchmark,样本量和环境控制有限,但信号很强,值得从业者看一眼。

Hacker News 首页

PlanetScale 发布 TIN:给 Postgres 用的全文搜索插件

PlanetScale 把 TIN 正式推成 GA 了,这是一个给 Postgres 用的全文搜索扩展。它支持布尔、短语、模糊和正则匹配,并且在并发写入时能正确处理 MVCC 可见性。文章用 1.5 亿条 Stack Exchange 数据跑了基准测试,给了索引构建时间和混合查询延迟,但没直接跟现有的 Postgres 全文搜索方案做横向对比,这点先别...

TechCrunch · AI

a16z 投了一家想做 AI 评测裁判的公司 Vals,但还没公布具体怎么评

Vals 拿了 a16z 的投资,想当 AI 模型评测的“中立第三方”。现在各家模型厂商都自己出分,Vals 想站出来当那个大家信得过的裁判。不过正文没披露它的评测方法、技术细节和早期客户,所以它到底怎么保证中立、怎么避免自己也变成另一个刷分工具,目前还看不出来。

Hacker News 首页

Apple M6 Pro 在 Geekbench 7 单核跑分登顶,4150 分创公开纪录

一台型号为 Mac18,6 的设备跑出了 Geekbench 7 单核 4150 分,是目前公开的最高分。这颗 M6 Pro 有 18 个核心,分成 6+12 两组,基础频率 4.78 GHz,配了 48 GB 内存。多核 37565 分。单核成绩比前代 M 系列明显高出一截,说明苹果在单线程性能上还在往前推。不过这只是个跑分,实际功耗、散热和最终量产...

9月18日星期五

9月17日星期四

Hacker News 首页

AI 在地缘政治预测上,开始赢过顶尖人类预测员了

《经济学人》报道,在一些地缘政治事件的预测比赛里,AI 模型的表现已经超过了部分顶尖的人类预测员。文章提到了具体的竞赛和模型,但正文没披露模型名字、用了多少数据训练、误差范围有多大。我会先打个折:等看到完整评测再判断这个领先到底有多稳。

r/LocalLLaMA

AI 智能体能不能像真人一样过一天?Qwen3.8-27b 跑了个测试,成功率 56.7%

Reddit 上有人发了个新测试集叫 AndroidLife,专门看 AI 智能体能不能完成一个真实用户一天里会做的各种任务。目前只放了一个结果:Qwen3.8-27b 跑下来成功率 56.7%,刚过一半。正文被 Reddit 屏蔽了,所以具体测了哪些任务、怎么算成功、有没有对比其他模型,一概没披露。这个数字本身不算惊艳,但方向有意思——以前测智能体多...

Hacker News 首页

编程助手的“外壳”可能让你多花一倍的钱,准确率却没变

UC Berkeley 和 Arena 的研究人员把 7 个模型装进 3 种不同的编程助手外壳(Claude Code、Codex CLI 和 Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑了 30 个任务,每个组合重复 3 次。结果发现,换外壳对任务成功率影响很小(±2–5%),但成本最多能差到 5 倍。比...

推荐理由:UC Berkeley和Arena的人做了件挺实在的事:把7个模型塞进3种不同的编程助手外壳里跑分,结果发现换壳对能不能完成任务影响很小,但花的钱最多能差5倍。这个结论对天天在终端里切工具的开发者来说很实用,而且实验设计干净、数字具体,没有吹牛成分。分数定在78,因为正文摘要没展开讲成本差异具体从哪来、不同外壳的失败模式有什么不同,信息有缺口,先不打更高。

Hacker News 首页

顶尖模型物理其实不差,是考题和评分标准本身出了大问题

耶鲁等机构的研究人员找来物理系教授和博士生,把六个常用物理基准测试的评分重新审了一遍。结果发现,之前被判错的答案,大部分是评分程序出错、参考答案本身是错的,或者题目问得不清不楚。以 GPT-5.6-Sol 为例,在 HLE-Physics 上,修正后的 mean@4 从 47.3% 跳到了 78.7%;在 CMT-Benchmark 上,从 61.0%...

推荐理由:耶鲁等机构的研究人员拉来物理系教授和博士生,把六个常用物理基准测试的评分重新审了一遍。结果发现,之前被判错的答案,大部分是评分程序出错、参考答案本身是错的,或者题目问得不清不楚。以 GPT-5.6-Sol 为例,在 HLE-Physics 上,修正后的 mean@4 从 47.3% 跳到了 78.7%;在 CMT-Benchmark 上,从 61.0% 跳到 89.1%,接近满分。这个涨幅说明,很多“模型物理不行”的判断,其实是基准本身质量不行。我会先打个折:正文没披露重新评分时有没有统一标准、不同评审之间一致性如何,这点先别太激动。但至少提醒我们...

Hacker News 首页

训练一个 4B 模型,让它生成的查询计划比 Postgres 默认的快 81%

Rohan Bansal 拿 Qwen 4B 模型做实验,先让 GPT-6 Astra 当老师,用 500 条示范轨迹做监督微调,再设计了一套强化学习变体,让模型自己生成查询计划、扔到 Postgres 里实测耗时,根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上,最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%,...

推荐理由:一个 4B 小模型,靠强化学习训出来的查询计划比 Postgres 默认计划快 81%,方法本身有实用价值。但测试只跑了 113 条多表联查 SQL,能不能泛化到其他场景还没验证,所以分数卡在 78。

Latent Space

AIUC 拿了 4000 万美元 A 轮,给 AI 代理上保险,出事了你能直接告它

AIUC 刚宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投。CEO Rune Kvist 是 Anthropic 第一个产品岗员工,他认为限制 AI 落地的不是能力,而是信任和出了事谁负责。他们搞了一套叫 AIUC-1 的标准,专门给 AI 代理做压力测试,查越狱、幻觉、数据泄露这些毛病...

推荐理由:AI 代理保险是个新品类,AIUC-1 标准加上 4000 万 A 轮让这事有实感,不是纯 PR。CEO 的 Anthropic 出身和 Ribbit Capital 背书增加了可信度,但产品还在早期——正文没披露实际理赔数据或保费定价,所以我会先打个折,不把它吹成已经跑通的生意。

9月16日星期三

NVIDIA 博客

NVIDIA Vera Rubin NVL72 首秀 MLPerf 推理榜,官方只说“领先”没给分

NVIDIA 的下一代旗舰 Vera Rubin NVL72 第一次跑 MLPerf Inference v6.1 就拿了第一。这台机器是 Blackwell 之后的顶配,72 张 GPU 通过 NVLink 连在一起,专门为大规模推理场景设计。不过官方博客只说了“领先性能”,没公布具体分数,也没说跟谁比、领先多少。对买家来说,这暗示推理吞吐和延迟会比...

AI HOT 精选

Arena 更新图片转网页排行榜:GPT-6 Astra 1733 分登顶,领先第二名 129 分

Arena 把四个新模型丢进了图片转网页的评测榜单。GPT-6 Astra(Max)拿了 1733 分排第一,比第二名的 GPT-5.6 Sol(xHigh)高出 129 分。Claude Fable 5.1(Max)1710 分排第三,Muse Spark 1.3(Max)1645 分第四,GLM-5.3-Flash 1588 分第十。正文没披露具体...

推荐理由:GPT-6 Astra 首秀就登顶,领先幅度 129 分,这个信号够硬,值得上首页。但正文只给了分数和排名,没展开方法细节或模型差异,读起来像一条快讯。H 和 K 都踩中了,R 缺位,整体重要性我给 72 分,放在 featured 里刚好。

Latent Space

在游戏里学到的技能,能用到真实工作中吗?

Good Start Labs 拿一款 30B 参数的模型在铁路经营游戏《1830》里训练,然后让它去做金融研究任务——查数据库、写 Excel 公式、边推理边算。结果发现,只有做成多轮终端智能体(让模型自己用工具探索环境、实时调整策略)的版本,技能才迁移得过去;单轮问答式的训练就没这个效果。这家公司去年 10 月从 Every 分拆出来,拿了 360...

推荐理由:实验设计有新意,给出了技能迁移的正面证据和一个失败对照组,对 agent 训练研究有参考价值。但公司刚分拆出来,产品路径不明,金融任务上也没给具体数字,所以我会先打个折,重要性给到 72。

Hacker News 首页

RL 训练大模型有个马太效应:难题越练越少,这篇博客提出“永不放弃”来纠正它

Michael Noukhovitch 写了篇博客介绍他新论文里的发现:用强化学习(RL)做模型后训练时,会出现马太效应——训练越往后,模型越爱挑简单题做,难题被采样的次数越来越少,因为早期在简单题上拿到的奖励把训练方向带偏了。他提出的修正方法叫 Never Give Up(NGU),核心是给难题设一个最低采样比例,不让它们被挤掉。在 Olmo 3.1...

推荐理由:Michael Noukhovitch 把自家论文写成了博客,讲的是 RL 后训练里一个隐蔽的退化现象:模型会越来越爱做简单题,难题采样率一路下滑,因为早期简单题的奖励把训练方向带偏了。他管这个叫马太效应,提出的修正方案 NGU 就是给难题设最低采样比例,强制保留训练信号。正文没披露 NGU 在 Olmo 3.1 之外更多模型上的验证结果,这点先别太激动,但思路本身对正在跑 RL 流程的团队有直接参考价值。

9月15日星期二

AI 群聊日报

空仓库让 Astra 写代码翻车,喂了 code review 经验后质量飞升

今天最直观的教训来自 @搞仁义毛义仁:给 Astra 一个空白 C++ 仓库,代码写得一塌糊涂;把积累了大量 code review 经验的 GacUI 上下文导进去,质量立刻飙升。这说明模型不是不会写,是得用具体规则去“规训”。@今天群内信息量极大 实测了 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐是官方 API ...

推荐理由:今天群聊里两条实操经验比大多数论文都实在。第一条来自 @搞仁义毛义仁:用 Astra 写 C++,给个空仓库代码质量很差,但把积累了多年 code review 规则的 GacUI 上下文喂进去,质量立刻上来了。这说明模型不是不会写,是得用具体、有约束的规则去“规训”,光靠模型自己发挥不行。第二条是 @今天群内信息量极大 实测 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐比官方 API 高出一截,但正文没披露具体延迟和成本数字,所以这个“快”到底在什么条件下成立、性价比如何,还得自己测了才知道。两条都指向同一个方向...

AI HOT 精选

Fireworks 实测 DeepSeek-V4.1-Flash:写代码能力看齐 GPT-6 Astra,单次成本只要 1/15

Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 74.12% 在同一档,但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍...

推荐理由:DeepSeek V4.1-Flash 在 DeepSWE 上跟 GPT-6 Astra 平起平坐,成本却砍了一个数量级,是本周最强的性价比信号。扣分是因为数据来自 Fireworks 自己的评测,不是独立第三方,而且原文被 cookie 墙截断,看不到完整方法和误差范围,所以结论先打个折。

Hacker News 首页

GPT-5.6 Luna 对比 GPT-6 Astra:花 3.6% 的钱,能抓到 75% 的代码 bug 吗?

Entelligence 用 50 个真实 PR 测了这两个模型做代码审查。Luna 每百万输出 token 只要 1.2 美元,Astra 要 50 美元,单次审查成本差了 28 倍。最终 Luna 找到 69 个确认 bug,Astra 找到 92 个。但 Luna 的误报率高得多,93 条意见里有 24 条是错的,Astra 只有 4 条。在 S...

推荐理由:Entelligence 自己测了自己的模型,正文没交代这 50 个 PR 从哪来、有没有人类审查员做对照,独立性要打个折。但实验设计清楚,成本、召回、误报率都给了具体数字,对选模型做代码审查的人有参考价值。

Hacker News 首页

Nari Labs 在 Coval 语音 AI 跑分中,语音识别延迟最低、合成准确率最高

Nari Labs 用他们部署的 Qwen3-ASR 和 Qwen3-TTS 模型,在 Coval 的语音 AI 基准测试里拿了两个第一。语音识别(STT)这边,从用户说完话到出最终文本的中位延迟只有 44 毫秒,错误率 3.6%,排第二,仅次于 AssemblyAI 的 3.5%,但价格只要后者的四分之一不到。语音合成(TTS)那边,从文字到出第一段...

9月14日星期一

Hacker News 首页

2026年AI就业市场:谁在被抢、谁在拿高薪、哪些岗位正在消失

Maksim Ilin 把 LinkedIn、世界经济论坛、斯坦福、普华永道和贝恩的数据拼在一起,画出了 2026 年 9 月的 AI 就业图景。最抢手的岗位是 AI 工程师,就是把大模型塞进产品里干活的人,美国周均新增约 1550 个职位,年薪中位数 17.6 万美元。最顶尖的是前沿实验室的研究科学家,Anthropic 年薪中位数约 74.6 万美...

推荐理由:一篇个人博客把几份公开报告的数据揉在一起,给出了 2026 年 9 月 AI 岗位的薪资和需求全景。数字具体、来源可查,对从业者有直接参考价值。扣分是因为本质上是二手数据整合,不是一手调研,权威性有限,所以停在 72 分。

Hacker News 首页

30 个 SVG 画图题,看 2025-2026 年的大模型谁能画好“鹈鹕骑自行车”风格的图

Tom Gally 用 Claude Fable 5.1 搭了个站,把 Simon Willison 那个经典的“鹈鹕骑自行车”测试扩展成了 30 道 SVG 画图题,比如“章鱼弹管风琴”、“长颈鹿组装落地钟”。2026 年跑了 6 个模型,2025 年跑了 10 个。页面直接贴模型返回的原始 SVG,没做主观打分,你自己看图画得怎么样。每张图下面标了...

推荐理由:Simon Willison 那个经典的鹈鹕骑自行车测试,社区里玩了好几年了。Tom Gally 这次把它扩成 30 道题,还跑了 2025 和 2026 两批模型,信息量挺大。页面没做主观打分,就让你自己看图判断,这点反而实在——省得被一个分数带偏。缺点是你得一张张翻,没法一眼扫出排名,但当成一个原始素材库来用,价值很高。

Computing Life · Share · 鸭哥调研

谁在改尺子:AI 榜单的两重张力

OpenAI 发布 GPT-6 Astra 后,评测机构 Artificial Analysis 一周内两次修改评分规则,让 Astra 从落后 5 分变成与 Claude Fable 5.1 并列第一,模型本身没动过。榜单是门生意:评测方卖高价订阅需要大厂背书,厂商需要排名做营销,双方利益绑在一起。DeepSeek V4 Flash 只重训了后训练阶...

推荐理由:这篇评论用一件具体的事——Artificial Analysis 在 GPT-6 Astra 发布后一周内两次改评分规则,让排名从落后 5 分翻成并列第一——把 AI 榜单的商业逻辑讲透了。有版本号、有分数、有权重变化,信息扎实。对从业者来说,它不是在复述新闻,而是在提醒:你花钱订阅的排行榜,尺子可能随时跟着大厂的新模型重画。我会给高分,因为这种“拆台”视角比单纯报分数更有价值。

9月13日星期日

Hacker News 首页

CadQuery vs OpenSCAD:AI 做 3D 打印件,哪个更靠谱?

ModelRift 让 6 个 AI 智能体分别用 CadQuery 和 OpenSCAD 建模三个可打印零件,所有 STL 文件都通过了水密性检测。区别在于失败模式:OpenSCAD 更快(平均 2061 秒 vs CadQuery 的 2406 秒),但无法检查零件边缘;CadQuery 支持 B-rep 有效性验证,但更慢。最难的 M24 螺纹接...

9月11日星期五

Hacker News 首页

代码能跑但写得烂:怎么衡量 AI 生成的代码有多“水”

Sebastian 在 Earendil 的博客里用 SlopCodeBench 的指标测了 AI 写代码的“水分”。AI agent 写的代码平均啰嗦度 0.33,人类仓库只有 0.15;侵蚀度 0.68,人类是 0.31——AI 代码的啰嗦和臃肿程度大概是人类的两倍。在多轮、清空上下文的迭代测试里,哪怕最顶尖的模型,严格通过率也是 0%,坏决策会越...

推荐理由:Sebastian 在 Earendil 的博客里用 SlopCodeBench 测了 AI 写代码的“水分”,给了两个新指标:啰嗦度(verbosity)和侵蚀度(erosion)。AI agent 写的代码啰嗦度 0.33,人类仓库 0.15;侵蚀度 0.68,人类 0.31——AI 代码的臃肿程度大概是人写的两倍。多轮迭代测试里,哪怕最顶尖的模型,严格通过率也是 0%,坏决策会越滚越多。这个角度比泛泛说“AI 代码质量差”具体得多,直接量化了“能用但脏”的状态。我会先打个折:这是单篇博客,不是同行评审,SlopCodeBench 也没开源,可...

9月10日星期四

Hacker News 首页

在真实的 Claude Code 会话里,LRU 缓存淘汰策略比很多新论文说的更难打败

这个仓库重放了 393 次真实 Claude Code 会话里的 6.8 万个请求,专门测试那些号称能替代 LRU 的 KV 缓存淘汰新策略。结果发现,很多新方法在论文的标准测试集上看着挺美,一碰到真实 agent 工作流(让模型进业务流程干活)的访问模式就露馅了。正文没给出具体的命中率数字,但核心结论很明确:真实场景下的访问规律跟学术基准差得远,生产...

推荐理由:这个仓库没走论文老路,而是拿真实 agent 工作流的访问模式来压测 KV 缓存淘汰策略。393 次会话、6.8 万个请求的规模够看,直接点出很多新方法在学术基准上好看、一上生产就露馅。不过正文没披露具体命中率数字,所以分数先停在 featured 这一档,等有数据再往上调。

AI HOT 精选

OpenRouter 推出 Fusion:让多个模型先辩论,再合成一个最终答案

Fusion 不是新模型,而是一套让模型“开会讨论”的流程。你提一个问题,它会同时发给最多 8 个模型(评审团)各自回答,然后由一个裁判模型对比它们的答案,找出共识、分歧和遗漏点,最后让主模型综合这些分析写出最终回复。默认三模型评审团的成本大约是单次调用的 4 到 5 倍,耗时 2 到 3 倍。在 DRACO 深度研究基准测试中,一个由 Gemini ...

推荐理由:Fusion是一套多模型辩论后合成的流程,不是新模型。成本和延迟数字、DRACO基准数据让它比纯营销稿扎实,但本质是路由层的产品更新,不是基础模型突破,所以放在featured低分段。

AI HOT 精选

Cognition 发布 SWE-2 编码模型,跑分逼近前沿但成本砍掉六成多

Cognition 推出了新模型 SWE-2,在 FrontierCode 1.1 Main 上拿到 50.0% 的分数,比自家上一代 SWE-1.7 高出 8 个百分点,同时成本比对手 Fable 5.1 低了 64%。它是在 2.8 万亿参数的 Kimi K3 基础上做强化学习后训练得到的,用的是一种单轮训练法,把不同思考深度的模式一起练出来。实际...

推荐理由:SWE-2 在 FrontierCode 1.1 Main 上跑到 50.0%,比前代涨了 8 个点,成本比 Fable 5.1 便宜 64%,是 Cognition 目前最接近前沿的一次。没给 85 分是因为它还是比 GPT-6 Astra 差几个点,而且基座用的是 Kimi K3 而不是自研模型。不过单轮 RL 训练法把不同思考深度揉在一起练,工程上省事,成本控制也漂亮,对想用第三方模型做编码 agent 的团队来说是个很实际的参考。

9月9日星期三

9月7日星期一

Computing Life · Share · 鸭哥调研

AI 把作业下限抬高了,但评分标准还在惩罚想得更深的人

两场千人级实验揭开了同一个真相。土耳其高中数学课上,用 ChatGPT 做练习的学生成绩暴涨 48%,但一关屏幕独立考试,分数反而比没用 AI 的对照组低了 17%。屏幕亮着时的漂亮卷面,只是向外部算力借来的下限,一断网就清零。米兰商学院的营销写作实验更微妙:用了 AI 的学生,作业得分在 5 分制上高出近 1 分,表达逼近专家水平。但实验同时发现,那...

推荐理由:两场千人级随机对照实验给出了硬数字,把 AI 辅助学习的幻觉拆得很清楚:练习分数虚高,闭卷考试反而倒退,学生跳过推理直接抄答案。HKR 三项都强,但文章是综述性质,不是一手研究发布,所以分数压在 85 以下。

r/LocalLLaMA

Qwen 3.8-27B 的 4-bit 量化版调两个参数后,跑分反超 Q5 量化并逼近官方满血版

一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式:用 NInfer 跑的 NVFP4(4-bit 量化)和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数(temp=1.0, min_p=0.0)跑 IFBench 指令遵循测试,Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...

推荐理由:这是一篇单人单卡、单模型的实测笔记,不是纸上谈兵。作者发现NVFP4默认参数下指令遵循能力被压住了,调参后直接反超更高比特的量化方案,还附了速度对比。我会先打个折:测试只在一张5090上跑了一个模型,依赖NInfer这个相对小众的推理引擎,普适性有限。但文章的价值在于给出了一个具体、可复现的调参思路,对本地部署党来说比泛泛的量化对比报告有用得多。

9月6日星期日

AI HOT 精选

OpenAI 在 GPT-6 Astra 发布后反复修改跑分,幻觉率一度从 4.2% 砍半到 2% 又改回去

Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后,多次悄悄修改了官方博客里的基准测试成绩。最夸张的是 Astra 的幻觉率,先是从 4.2% 降到 2%,后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃,数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前...

推荐理由:GPT-6 Astra 发布本身就是大事,Fortune 抓到发布后改基准测试成绩,还动了竞品分数,热点、知识增量、读者决策影响全占了。没给到 95 是因为目前只有 Fortune 一家报道,OpenAI 的回应也比较模糊,先观望一下后续。

AI HOT 精选

OpenAI GPT-6 Astra 在 Code Arena WebDev 榜单拿第一,比第二名 Claude Fable 5.1 高出 35 分

GPT-6 Astra(Max 版本)在 Code Arena 的网页开发专项榜上跑出 1797 分,排第一。第二名 Claude Fable 5.1(Max)是 1762 分,第三名 Claude Opus 5(Max)1688 分。这条信息只来自一条推文,正文没披露测试样本量、具体任务类型和响应延迟,所以这个领先幅度先别太当真,等有更多细节再判断。

推荐理由:GPT-6 在 Code Arena 网页开发专项上首次超过 Claude,35 分的差距值得聊一聊。但消息只来自一条推文,没给测试样本量、具体任务和响应延迟,分数先打个折,等更多信息出来再调整。

9月5日星期六

AI 群聊日报

GPT-6 Astra 全面开放首日实测:更快但更贵,额度战同步开打

GPT-6 Astra 今天向所有 Pro 用户开放,Codex CLI 和 Copilot 都已接入。群友实测同一个任务从 12 分钟缩到 6 分钟,但单次消耗比 Sol 贵约 75%,有人用 API 跑一轮代码审查直接烧掉 100 美元。Tibo 和 Anthropic 同一天都给用户重置了额度,Codex 则顺手封堵了一个能无限白嫖的漏洞。另外,...

推荐理由:GPT-6 Astra 全量上线是本周最大的产品动作,这份群聊日报用第一天的实测数字把速度和成本都摆出来了,比官方公告更有参考价值。打 78 分是因为来源是匿名群聊整理,不是一手官方公告,部分细节(比如漏洞具体怎么堵的)正文没展开,所以没给更高。

Hacker News 首页

Artificial Analysis 发布 v4.2 智能指数,用隐藏题库防刷分,并加入模拟知识工作的新测试

Artificial Analysis 更新了模型评测榜单到 v4.2 版,主要做了两件事:一是新增了 AA-Briefcase 和 GDP.pdf 两个更贴近真实场景的测试;二是把不公开的隐藏题库权重翻倍到 40%,专门防止模型厂商针对公开题刷分。AA-Briefcase 是它们自己出的隐藏题,模拟需要好几周才能完成的知识工作项目,让模型处理几千个源...

推荐理由:这次更新核心就一件事:防刷分。Artificial Analysis把不公开题库的权重从20%提到40%,摆明了告诉厂商别想靠背题拿高分。新增的AA-Briefcase和GDP.pdf两个测试也值得看一眼,前者让模型处理几千个源文件做长周期项目,后者直接扔一本4592页的文档考信息提取,比MMLU这类饱和基准更接地气。不过正文没披露具体模型排名变化,只说后续会陆续放出,所以现在只能当方法论预告看,别急着拿它做选型决策。

Hacker News 首页

AI 能画电路板了吗?EEBench 用仿真跑分告诉你还差多远

EEBench 搞了个电路设计基准测试,不让模型在 GUI 里点来点去,而是用声明式代码(atopile)直接操作元器件和约束,然后跑 SPICE 仿真检查电压、容差、成本和真实零件能不能买到。Claude Opus 5 目前最高,得分 61.6%,Grok 4.6 以 57.1% 紧随其后。在一个电能表任务里,有设计选了个标称 22µF 的电容,但在...

推荐理由:EEBench 用声明式代码加 SPICE 仿真测了几家大模型做电路板设计的能力,Claude Opus 5 目前最高 61.6%,Grok 4.6 紧随其后。文章正好接在 GPT-6 Astra 的 KiCad 演示后面,时机很巧,热度够。分数和翻车案例都有,信息量扎实。不过 PCB 设计话题本身比较垂直,普通 AI 从业者不一定追,所以可读性上我会先打个折。

9月4日星期五

r/LocalLLaMA

GPT-6 Astra 在 ARC AGI-3 跑出 98.6% 别激动,OpenAI 用了自家改装套件

OpenAI 宣称 GPT-6 Astra 在 ARC AGI-3 基准上拿了 98.6%,但用的是他们自己定制的测试套件,不是官方标准版。Nvidia 之前用自家的 AVO 套件已经跑到了 100%,更早的 Arc-Skill 和 VISTA 系统也接近满分。换成标准套件后,Astra 的成绩掉到 66%。这个分数依然不错,但远没到 AGI。Open...

推荐理由:这篇文章用两个数字拆掉了 OpenAI 的 98.6% 叙事——Nvidia 的 100% 和标准套件下的 66%,信息密度高,冲突直接。没给更高分是因为来源是 Reddit 个人帖,不是机构评测,正文也没披露标准套件的具体测试条件和样本量,验证力度有限。

AI 群聊日报

Flash 模型集体冲顶:Gemini 3.8 Flash 和 Muse Spark 1.3 同天发布,便宜模型已能搞定九成任务

Google 发布 Gemini 3.8 Flash,输入价格每百万 token 0.75 美元,在 DeepSWE 编程基准上拿到 71% 的分数,多项智能体跑分超过 Sol 和 Opus 5。同一天 Meta 放出 Muse Spark 1.3,智力分跟 Grok 4.6 持平,Contributor 档位输入价只要 0.1 美元,但默认会用你的数...

推荐理由:Gemini 3.8 Flash 以 Flash 档位定价在智能体跑分上超过 Sol 和 Opus 5,这个信号很炸。来源是群聊日报而非官方公告,所以我会先打个折,但里面给的数字和实测笔记密度很高,对做模型选型的人有直接参考价值。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,能跨应用操作电脑,越狱率直接压到零

GPT-6 Astra 主打两件事:一是让模型像人一样操作电脑,二是安全对齐。在 OSWorld 真实桌面任务测试里,完成任务的时间从 75 分钟缩短到 40 分钟;职场自动化任务成功率从 18% 涨到 41%。对齐方面,上一代模型不加防护时越狱率是 48%,Astra 直接压到 0%。作者还提到,用 2000 美元的算力就让 Astra 解出了 10...

推荐理由:GPT-6 Astra 发布本身就是行业级事件。电脑操作和对齐两条线都给了具体数字,不是空泛宣传,所以 H、K、R 全中。没给 98-100 分,是因为目前只有推文摘要,缺官方博客或第三方复现,等更多材料出来可以再往上调。