跳到正文

#编码

今日 7 条

9月26日星期六

Hacker News 首页

用《波斯王子》给前沿模型做进度条:从 6502 汇编到 C# 的四年穿越

作者把 1989 年《波斯王子》Apple II 版的 6502 汇编源码丢给几代前沿模型,让它们原样移植成 C#,自己只负责玩和挑错。Claude Opus 4.6 能读汇编、能写 C#,但搞错了游戏引擎的底层架构,把王子做成了逐格跳的棋子,手感完全不对。OpenAI Codex 修了渲染细节,没动那套错误骨架。Claude Opus 5 被接上 D...

推荐理由:这是一篇一手实验文,用同一份 6502 汇编源码压测了三代 Claude,失败模式具体到能当反面教材。不是产品发布或行业活动,信号噪音比很高,但信息量还不到改写行业认知的程度,所以留在高质量波段。

Hacker News 首页

Meta 的编程助手 Muse 被发现偷偷调用 OpenAI 模型,内部代号 muse-special

一个开发者在翻 Muse 的本地文件时,发现了一个叫 azure/muse-special 的模型,走的是 OpenAI 的 GPT Responses API。虽然绝大多数任务都由 Meta 自研的 Avocado 模型处理,但至少有一个子代理任务被路由到了外部。Muse 的守护进程里还打包了 Claude Opus 4.6/4.7/4.8、Sonn...

推荐理由:这是一手逆向工程发现,有具体文件名和路由逻辑作证,不是捕风捉影。信息量够硬:模型名、API 类型、路由策略都扒出来了。扣分点在于来源是单篇个人博客,Meta 没回应,没法交叉验证。但即使只当一个技术线索看,对从业者的参考价值也够高。

TechCrunch · AI

OpenAI 的 Astra 和 Anthropic 的 Opus 联手破译了二战遗留的恩尼格玛密文

两个密码分析员用 Astra 和 Opus 把两条从二战到现在都没人解开的恩尼格玛(Enigma)密文给破了。开发者 Carter Leffen 让 Astra 自己去翻档案、找上下文线索、搭了个恩尼格玛模拟器,最后还原出了明文。Opus 具体干了什么、整个过程花了多长时间、准确率有多高,正文都没提。

推荐理由:故事本身很有传播力,Astra 自主搭模拟器这个点也够具体,能让人看到模型在复杂推理和工具调用上的进展。但我会先打个折:Opus 的角色完全是个黑盒,关键指标一个都没给,这让我没法判断是实打实的突破还是精心挑选的展示案例。另外,历史密码破译离大多数人的日常工作太远,共鸣感会弱一些。综合下来,给到 featured 这个档位是合适的。

9月25日星期五

Ben's Bites

AI 花一上午做了个 50 年科技设备时间线

Ben Tossell 用 Codex 和 Factory 花一上午搭了个网站,展示 1976 到 2026 年间 87 款经典设备,所有图片由 Astra 生成,只用了 40 条指令和 7 个子代理。网站已收到 1455 票。项目灵感来自一个“被遗忘的设备”想法,又参考了 Cole 的时间线拖拽演示,代理们自己找参考图、生成新图,还补上了 2009 ...

AI HOT 精选

微软给 Copilot 加了三个新模块:Home、Code 和 Autopilot

微软把 Copilot 重新定位成“为工作而生的 AI”,这次一口气推出三个新东西。Home 是个统一入口,把人、团队和项目串在一起,不用在多个工具间来回跳。Code 让 Copilot 直接进到写代码、修 bug 和代码审查的流程里。Autopilot 是把 AI 嵌进业务流,自动处理审批、数据录入这类重复活。正文没提具体上线日期和定价,只说“今天正...

推荐理由:微软这次把 Copilot 重新打包成“为工作而生”,一口气推了 Home、Code 和 Autopilot 三个模块,产品意图很清楚:不再只是聊天窗口,而是往工作流里嵌。Home 解决的是工具碎片化,Code 直接进开发环节,Autopilot 想接管审批、录入这类重复活。但正文没给上线日期和定价,实际落地效果和成本都还是未知数,所以重要性停在 72,刚好够 featured 门槛。

The Verge · AI

微软把 Copilot 重做成“超级应用”,聊天、写代码和 AI 助手塞进一个界面

微软正式发布了重新设计的 Copilot 应用,把聊天、编程和 AI 代理三个功能揉进了一个界面里。应用分三个标签页:Home 合并了 Copilot Chat 和 Cowork,Code 和 Autopilot 各自独立。之前 Build 大会上亮相的个人助手 Scout,现在改名叫 Autopilot。Home 里还会加一个叫 Today 的个性化...

推荐理由:微软这次 Copilot 改版,把聊天、编程和代理塞进一个应用,还放话说影响力要对标 Office,野心很大。我会先打个折:目前看更像是把已有功能重新收纳,三个标签页确实比之前清爽,但“超级应用”这个帽子戴得有点早。Autopilot 就是之前的 Scout,换了个名字,能力上正文没披露有质的飞跃。如果是真的能打通日常办公和自动化流程,那挺省钱,但现在只能算一次结构清晰的重组,实际效果还得等上手。

Hacker News 首页

把 Casio 合成器音色喂给 Claude,五分钟转成网页能用的 JSON

作者在做 Casio CZ-101 的网页模拟器 CZP-1 时,看到 oliveoil22 的 YouTube 演示视频,想要那些音色。他从视频简介下载了 .syx 格式的原始音色文件,直接丢给 Claude,五分钟后 Claude 就返回了一个 JSON 文件,可以直接加载进 CZP-1 使用。CZP-1 支持通过 JSON 文件或带参数的 URL...

AI 群聊日报

Opus 5.5 一条提示词出宣传片,Jev 估值九天翻 50 倍

今天最实在的发现是 Opus 5.5 配合 Remotion 能直接从一句提示词生成完整产品宣传片,群里多人验证并晒出了成本:约 5000 万 token 换一支 53 秒带配乐的视频。不过纯 AI 输出节奏偏平,有剪辑经验的同事花半小时调整后,情绪调动明显更强。行业方面,Jev 的估值从 2 亿飙到超 100 亿美元只用了九天,但护城河很薄,一周内就...

Hacker News 首页

DHH 在 Rails World 2026 上宣布:Hey 将离开 Rails,用 Rust 和 LLM 重写原生应用

DHH 在 Rails World 2026 的开场演讲里说自己已经从专业程序员退休,现在是个“maker”。他认为英语是最好的编程语言,手写代码对大多数程序员来说已经不再划算。37signals 正在用 LLM 把 Hey 重写成六个原生客户端,后端换成 Rust——他说 Rust 对人类很丑,但对 LLM 很友好。他八月写了 15 万行代码,Rub...

推荐理由:DHH 在 Rails World 2026 的开场演讲几乎没怎么谈 Rails 本身,反而抛出了一堆有数字、有产品决策支撑的挑衅性判断。文章是二手转述,不是完整演讲实录,Rails 路线图细节也偏少,所以没给更高分。但“退休声明”加“手写代码不划算”加“用 LLM 重写 Hey”这三件事放在一起,对 AI 从业者来说是个很具体的信号——一个顶级程序员在用自己的产品和行动投票。

Product Hunt · AI

GenCode:Genspark 超级应用里塞了个写代码的 AI 助手

Genspark 在自家超级应用里上线了 GenCode,一个专门写代码的 AI 代理。目前官方只给了一句话介绍,没提支持什么编程语言、能处理多复杂的任务、也没说要不要额外付费。信息太少,暂时没法判断它跟 Cursor、Copilot 这些比到底怎么样。

Computing Life · Share · 鸭哥调研

一周四份成绩单:每个数字各在测什么

阶跃星辰的 Step 5 Preview 公布了四类成绩,但自报的 Terminal-Bench 分数还没上公开排行榜,权重许可条款也没披露。独立开发者用 111 道公开难题测了 TypeSafe 的判断接口 Jev,发现它答错时平均把握 0.690,答对时 0.684,把握高低分不出对错。加州州长签了 AI 行政令,但只是让政府部门去起草修法建议,目...

Simon Willison

Simon Willison:编码智能体让软件工程变得更难

Simon Willison 表示,与编码智能体协作越久,越确信它们让软件工程变得更难。借助智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。

Hacker News 首页

Vibe Coding 生产套件:把 AI 写代码从“玩票”变成正经工作流

这个 GitHub 仓库给团队提供了一套从想法到上线的完整流程,专门配合 Copilot 这类 AI 编程助手用。它覆盖了写需求文档、搭架构、做测试、安全检查、代码审查和 CI/CD(自动构建部署),作者说已经在实际项目中验证过。不过正文没放任何跑分数据或用户案例,效果到底怎么样得自己试。

Hacker News 首页

LaunchVideo 用 Opus 5.5 把链接或一句话变成产品解说视频,不用视频生成模型

LaunchVideo 的做法是:你给它一个网址或一段文字描述,Opus 5.5 直接写 HTML、CSS 和动画脚本,然后一个无头 Chromium 微虚拟机逐帧渲染成 1080p 30fps 的 MP4。整个过程没有用到视频生成模型,靠的是把页面里的时钟(requestAnimationFrame、Date、CSS 动画等)替换成虚拟时钟,保证每一...

推荐理由:把 Opus 5.5 的写代码能力包装成“贴链接出视频”的工具,管线解释得清楚,例子也看得见,H 和 K 都打中了。但产品本身还轻,R 偏弱,分数刚好卡在 featured 门槛上。

Hacker News 首页

AI 实验室该掏钱支持历史研究了:用 GPT-6 和 Opus 5.5 追炼金术知识、破译 17 世纪信件

作者用 GPT-6 Sol 和 Opus 5.5 试了两道历史难题:一是破译一条 1941 年的恩尼格玛密文,模型自己跑去德国联邦档案馆翻出了补充记录;二是把牛顿一段拉丁文炼金术笔记,追溯到此前未被指认的法文出处。他的判断是,现在的顶尖模型在密码破译、跨语言文本溯源、跨小众领域串联线索上,已经能给出可验证的结果,跟去年只能当助手完全不是一回事。文章没提...

推荐理由:文章用两个可验证案例展示了前沿模型在密码破译和跨语言文本溯源上的真实能力,不是空谈。但话题是学术历史,对 AI 行业读者的吸引力偏弱,所以分数刚好卡在 featured 门槛上。

AI HOT 精选

GitHub 安全实验室用 LLM 自动给 C/C++ 项目做模糊测试,写用例、编译、跑测试、出报告一条龙

GitHub 安全实验室发布了一个叫 Taskflow Agent 的工具,用大模型自动完成 C/C++ 项目的模糊测试全流程:它自己写测试用例、编译、跑 fuzzer,最后生成崩溃报告。相当于把安全研究员从重复劳动里解放出来,但正文没披露具体用了哪个 LLM,也没说在真实项目里挖到了多少漏洞,效果到底多好还得看后续数据。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,专门给那种上下文越吃越多、一写就停不下来的编码会话省成本

Anthropic 官宣了 Claude Opus 5.5,定位很明确:编码会话现在越来越长、上下文越塞越满,这版模型就是冲着降成本去的。但正文除了标题和导航栏,什么都没展开——没给定价、没跑分、也没提上下文窗口到底多大。唯一能确认的是成本优化这个方向,其他细节一概欠奉。

推荐理由:Anthropic 发新模型本身是个信号,但正文只有标题和导航栏,所有关键事实都欠奉。H 和 R 都踩中了,K 不成立。内容太薄,勉强够 featured 门槛,分数压在 72 这个底线。

9月24日星期四

Latent Space

AI 让科学思考变便宜了,但动手做实验还是贵

Adrian Sanborn 把 AI 生物技术公司分成两类:Foundries(铸造厂)和 Navigators(导航员)。铸造厂像 Xaira、Insitro,砸钱把实验工业化,靠高通量测序或自动化设备把“动手做”的成本打下来,AI 负责读懂海量数据。导航员不搞重资产,而是把 AI 塞进公司的日常运转里,用便宜的思考能力加速分析、做决策看板、筛选研...

推荐理由:这篇文章提出了一个原创的分类框架,用“铸造厂”和“导航员”把 AI 生物技术公司的两种省钱路径讲明白了。铸造厂靠自动化设备把实验成本打下来,导航员把 AI 塞进日常流程,用便宜的推理能力替代昂贵的人力分析。例子具体,但本质是观点文章而非硬新闻,按规则放在 featured 档的偏低位置。

TechCrunch · AI

Lovable 年化收入冲到 6 亿美元,靠“凭感觉写代码”吃下大公司市场

Lovable 联合创始人 Fabian Hedin 在 HumanX 大会上说,公司年化收入已超过 6 亿美元,三个月前这个数字是 5 亿。增长主要来自企业客户:全球 500 强里三分之二的公司都有人在用,点名的大客户有微软、英伟达和德国电信。平台上用户做的应用每月能拿到近 10 亿次浏览。不过这个 6 亿是拿最近一个月收入乘以 12 算出来的,不是...

推荐理由:Lovable年化收入破6亿美元,还带上了微软、英伟达这些大客户的名字,在vibe coding赛道里是个实打实的信号。不过这个6亿是拿最近一个月收入乘以12算出来的,不是审计过的全年收入,所以热度高但还没到现象级。

Hacker News 首页

斯坦福和英伟达推出对比语言模型 CLM,做决策比 Jev 快 9 倍

CLM 的思路和传统语言模型不一样:它不生成文字,而是把“当前状态”和“可选动作”分别编码成向量,用余弦相似度打分,选最匹配的动作。这相当于让模型直接做选择题,省掉了逐字生成的时间。CLM-8B 在电脑操作、游戏和工具调用上效果跟 Jev 持平,但延迟最高能降 9 倍——候选动作越多、动作能跨状态复用时,提速越明显。在 DeepSWE 和 Termin...

推荐理由:CLM 提出了一套和自回归生成完全不同的决策架构,用向量相似度代替逐字输出,在 agent 基准上效果持平但延迟降 9 倍,属于少见的范式级探索。我会先打个折:文章是 Notion 页面形式,作者来自学界,离生产落地还有距离,但思路本身值得关注。

AI HOT 精选

Claude Opus 5.5 在 Code Arena 网页开发榜拿第一,1818 分

Anthropic 的 Claude Opus 5.5(Max 版)在 Arena 的 Code Arena WebDev 排行榜上拿了 1818 分,排第一。比第二名的 GPT-6 Astra(Max 版)高了 26 分,比自家上一代 Opus 5(Max 版)的 1692 分多了 126 分。帖子只给了分数和排名,没讲具体怎么测的、测了哪些题,所以...

推荐理由:Claude Opus 5.5 登顶 Code Arena WebDev,分数和差距都给了,对 Claude 重度用户有参考价值。但帖子没披露评测方法、任务范围和评测条件,信息密度只够 featured,到不了 p1。

AI HOT 精选

Claude Opus 5.5 在编程智能体评测里拿了第一,但跑一次任务要花 13 美元

Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index,得分 66,比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨:Terminal-Bench 4.0 正确率 63.1%,DeepSWE v1.1 正确率 68....

推荐理由:Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分,比 Opus 5 高出 6 分,三项子测试全线上涨,登顶没问题。但单任务成本 13.04 美元是硬数字,比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果,数据具体、来源可信,对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试,不代表整体能力。

Hacker News 首页

1Password 的 AI 漏洞修复论文被指引用单薄、事实错误,研究规范遭质疑

Suha Sabi Hussain 公开批评 1Password 旗下 Off-by-1 Labs 发布的 FLAWED 论文。这篇论文声称前沿模型生成的漏洞补丁常有缺陷,但 Hussain 指出它只引用了 19 个来源,大部分是公司博客和 XKCD 漫画,却漏掉了 Meta 的 AutoPatchBench 和一篇 NDSS 论文等直接相关的前人研究...

推荐理由:作者 Suha Sabi Hussain 是安全研究员,不是空口骂人,她拿出的证据很具体——FLAWED 论文漏引了 Meta 的 AutoPatchBench 和一篇 NDSS 论文,而这两篇跟它的研究问题直接相关。这比单纯说“你做得不行”有力得多。不过,这毕竟是一篇个人博客反驳,不是一手研究或产品发布,所以重要性我给 72 分,不会更高。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 动手优化了 36 个生物分子软件包,最快提速 4.1 倍

Anthropic 的两位研究员带着 Claude,在不到四周内重构了 30 多个开源生物分子模型的代码。他们没让 AI 去替科学家做判断,而是让它干最实在的活:写了一套叫 FlashPairformer 的 GPU 内核,把蛋白质结构预测里最吃资源的三角几何运算合并成高吞吐的流式操作,再给每个模型加上缓存和 CUDA 图重放,清理掉 Python 的...

推荐理由:Anthropic 研究员用 Claude 在不到四周内重构了 30 多个生物分子模型的代码,交付了 FlashPairformer 内核和一系列可复现的优化。技术细节具体,代码开源,结果可衡量,不是公关稿。扣分点:这是 yage.ai 的报道,不是一手论文,但信息量足够支撑判断。

AI HOT 精选

Fireworks 发布 Ember-1:推理 token 砍掉四成,Kimi K3 的答题质量还在

Fireworks Research 基于 Kimi K3 训了个新模型 Ember-1,把推理时产生的内部思考 token 压掉了 35% 到 50%,但准确率没掉。他们跑了 50 多次训练实验,发现 K3 超过九成的 token 都花在内部推理上,其中很多是多余的。Ember-1 保留了有用的自我纠错,跳过了没产出的思考循环。在多轮 agent 任...

推荐理由:Fireworks 把 Kimi K3 蒸馏成 Ember-1,推理 token 压掉 35% 到 50%,准确率持平,有 50 多次训练实验和客户实测数据撑腰。分数没给更高,是因为这本质上是对现有模型的优化,不是新能力发布,而且 Fireworks 自己就是推理服务商,我会先打个折看后续第三方复现。

Hacker News 首页

Anthropic 用两周把 claude.ai 速度提了 3 倍,让 Claude 自己找瓶颈、改代码、盯上线

Anthropic 在 8 月搞了一次两周的性能冲刺,把 claude.ai 和桌面端四个核心操作的速度平均提了约 3 倍。冷启动到能打字的页面从 3.1 秒降到 0.55 秒,开新的 Claude Code 会话从 0.8 秒降到 0.3 秒,加载云端协作会话从 2.6 秒降到 0.73 秒。团队在一个 Slack 频道里让 Claude Tag(一...

推荐理由:Anthropic 官方工程博客,给出了具体的延迟优化数据和 Claude Tag 爬山式调优的做法,对 Claude 用户和工程师有参考价值。但本质是一次性能优化,不是新能力发布,所以放在 featured 78 分,没往上提。

AI HOT 精选

Claude 团队用自家模型给自己提速,两周把 claude.ai 响应速度拉快 3 倍

Claude 团队发了一篇博客,讲他们怎么用 Claude 自己来给 claude.ai 做性能优化。具体做法是让模型去测延迟、找瓶颈、提修复建议,连用的提示词都公开了。两周后整体速度提升到原来的 3 倍。博客链接给了,但正文没贴出优化前后的具体延迟数据,所以实际快了多少秒、在哪些环节提的速,得点进去看原文才知道。

推荐理由:Anthropic 团队发了一篇实操案例,用 Claude 自己给 claude.ai 做性能优化,两周后整体速度提到原来的 3 倍,连提示词都公开了。这事在 H、K、R 三个维度上都踩中了。扣分点在于正文没给出优化前后的具体延迟数字,实际快了多少秒得点进博客原文才看得到,所以分数没再往上走。

AI HOT 精选

Antigravity SDK 支持本地模型,智能体可以完全断网运行

Google 给 Antigravity SDK 加上了本地模型支持,首发适配的是 Gemma 4 26B A4B,通过 LiteRT 在本地跑。智能体现在能完全离线工作,代码和请求都不出本机。官方演示了一个混合模式:用 Gemini 3.8 Flash 在云端当规划器,只花 95 个 token 做任务拆解,本地 Gemma 4 26B 实例负责审计...

推荐理由:Google 给 Antigravity SDK 加了本地模型支持,首发适配 Gemma 4 26B,通过 LiteRT 在本地跑。我会先打个折:目前只绑定了 Google 自家的模型,生态还没打开。但亮点在于那个混合模式演示——云端 Gemini 3.8 Flash 只花 95 个 token 做规划,本地模型执行审计,成本数字摆出来了,不是画饼。对需要在设备上跑智能体、又不想把数据送出去的团队,这是个值得动手试试的信号。正文没提跨平台支持和第三方模型接入计划,这点先别太激动。

AI HOT 精选

GPT-6 Sol(Max)在 WebDev 榜单排第 4,价格 $8/M tokens

Arena 公布了 GPT-6 Sol(Max)的真实投票结果,它在 Code Arena: WebDev 榜单上拿了 1689 分,排第 4。价格是 $8/M tokens(混合输入/输出),比 GPT-4o 便宜不少。但正文没披露测试环境、对比了哪些模型、以及延迟数据,所以这个排名参考价值要打个折。

9月23日星期三

AI HOT 精选

Anthropic 工程师给代码现代化项目划了6步准备法:别上来就让AI重写

Anthropic 一位前线工程师发了一篇实操指南,讲怎么用AI改造遗留代码。核心建议是别急着让AI直接重写,先做六步准备:画依赖图、补测试、挑一个小模块试点、选对模型(比如 Claude Code)、设好人工审查流程。正文没有给具体案例或成本数字,但步骤够具体,适合不知道从哪下手的团队。

Latent Space

Claude Opus 5.5 发布:写作质量大幅提升,成本降了 40%,直接成了 AINews 的默认模型

Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...

推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。

AI 群聊日报

Anthropic Opus 5.5 和 OpenAI Sol/Luna 同日发布,群友拆解性价比与迁移踩坑

Anthropic 毫无预兆地放出 Opus 5.5,在终端操作和编程任务上跑分领先,但 max 档输出 token 量是 GPT-6 Astra 的三倍多。群友分析发现 high 档是性价比甜区:比 medium 多花 36% 的钱,智能指数涨 3 分,再往上边际成本陡增。两小时后 OpenAI 上线 Sol 和 Luna,Luna 输入价格打到每百...

推荐理由:Anthropic Opus 5.5 无预警发布,OpenAI 两小时后用 Sol 和 Luna 回击,一天内三次模型更新。日报提供了用户实测的 effort tier 性价比拆解和 prompt 迁移经验,信息密度高。扣分点:正文没展开 Sol/Luna 的具体跑分对比,但整体信号足够强,维持 featured。

AI HOT 精选

OpenAI 放出 GPT-6 系列新模型 Sol 和 Luna,API 价格直接打五折

OpenAI 在 GPT-6 家族里加了两个新模型:Sol 和 Luna。Sol 定位是干复杂编程和专业任务的,Luna 则负责速度快、量大的日常活儿。最直接的变化是价格——API 调用费比上一代 GPT-5.6 的推广价砍了一半,其中 Luna 的输出价格实际降了 58%,从每百万 token 1.2 美元降到 0.5 美元。性能上,Sol 在 Au...

推荐理由:OpenAI 一次放出两个新模型,还把价格砍到上一代推广价的一半,这个动作本身就值得上头条。Sol 的 Aura 分数和 Luna 的 0.5 美元输出价都是硬数字,能直接拿来判断性价比。我会先打个折——正文没给全量基准表,所以性能这块只能看单点,但价格信号已经足够强,做产品和做研究的人都会关注。

Computing Life · Share · 鸭哥调研

同一个工具开关,一个模型赚了,一个崩了:编程智能体外层设计的关键决策

一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...

推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...

AI HOT 精选

Claude Opus 5.5 和 GPT-6 Sol/Luna 同日发布,新一轮价格战开打

Simon Willison 对比了同一天发布的三个模型。GPT-6 Luna 输入价格降到每百万 token 0.1 美元,是 GPT-5.6 Luna 的一半,也是 OpenAI 有史以来最便宜的模型之一。GPT-6 Sol 也比前代便宜了一半。Claude Opus 5.5 降了 20%,但价格仍是 GPT-6 Sol 的两倍。在测试中,Opus...

推荐理由:三个主力模型同一天发布,Simon Willison 给了第一手价格对比和初步体验。GPT-6 Luna 输入每百万 token 0.1 美元是 OpenAI 史上最低,直接改变了应用开发者的成本结构。不过文章只给了价格和简短测试印象,没有完整 benchmark,实际能力还得等更多评测。

Latent Space

和 John Platt 聊 AI 搞科研:他拿过奥斯卡,有两颗小行星,你 sklearn 里的算法也是他写的

John Platt 是 Platt scaling 和 SMO 算法的发明人,现在在 Google 带队做 ERA 项目。ERA 的思路是把科学问题变成一个可打分的任务,然后用 Gemini 自动迭代实验,搜索方式类似蒙特卡洛树搜索。从 Gemini 2.0 换到 2.5 之后,这个系统直接从跑不通变成能高效产出,已经产出了至少 10 篇论文。Pla...

推荐理由:John Platt 亲自聊 Google 的 ERA 项目,把科学实验变成 Gemini 自动搜索迭代的玩法。Gemini 2.5 让系统从不可用变成高效产出 10 篇以上论文,这个转折点很实在。因为是播客,具体实现细节得去听才能挖,但方向和初步验证已经够吸引人。

AI HOT 精选

Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现有害行为

Anthropic 发了新模型 Claude Opus 5.5,性能对标 Fable 5.1。价格降了不少:输入每百万 token 4 美元,输出 20 美元,缓存读取直接打四折到 0.2 美元。输出速度比上一代快 30% 以上,还有个 Fast 模式能再快 2.5 倍,但 token 价格翻倍。系统卡里提到一个安全演习:给模型一套模拟的公共包仓库登录...

推荐理由:Anthropic 旗舰模型更新,降价提速的幅度够实在,系统卡里那个安全演习的料也够猛。小遗憾是正文没列出 Opus 5 的原价做对比,Fast 模式翻倍定价也没展开说清楚。