跳到正文

#编码

今日 7 条

9月23日星期三

AI HOT 精选

GPT-6 Sol 和 Luna 评测:价格砍半,但知识类任务表现有退步

OpenAI 新发布的 GPT-6 Sol 和 Luna 把价格直接砍了一半:Sol 输入/输出每百万 token 降到 2/10 美元,Luna 降到 0.1/0.5 美元。在 Artificial Analysis 的智能指数跑分中,Sol 单次任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元,整体分...

推荐理由:OpenAI 把 GPT-6 价格砍半,Sol 单次任务成本 1.06 美元,Luna 0.07 美元,但能力变化不是一边倒的好——Luna 在 Coding Agent 指数上还倒退了。有第三方跑分数据撑着,对开发者做决策很实用。没给 p1 是因为这属于模型迭代的价格调整,不是底层架构级的大新闻。

AI HOT 精选

Sam Altman 说 GPT-6 Sol 和 Luna 按任务定价没对手,但没给具体数据和测试

Sam Altman 发帖说 GPT-6 系列里的 Sol 和 Luna 两个模型,如果按“完成一项任务花多少钱”来比,市面上没有能打的。他提到相比 5.6 系列,新模型在智力、对齐程度、工作产出、写代码和操作电脑上都有大提升,每个 token 的价格砍了一半,按任务算更便宜。不过帖子里没给出任何跑分、定价数字或第三方验证,我会先打个折看——等有独立测...

推荐理由:Sam Altman 亲自为 GPT-6 的按任务定价站台,声称没有对手,这对关注推理成本的人来说是个直接信号。但帖子缺跑分和定价数据,目前只是单方面说法,我会先打个折,等独立测试出来再调整判断。

Hacker News 首页

Unreal Agent 开源:让工具调用全异步,GPT-6 Astra 跑分成本比 Codex 低 40%

Unreal Labs 开源了一个 agent 调度器,核心思路是把工具调用改成全异步:模型发出指令后不用干等,工具在后台跑,结果回来再补进对话记录。在 Terminal-Bench、SWE-Atlas、DeepSWE 和 ALE-CLI 四个基准上,用 GPT-6 Astra xhigh 跑,成本比 Codex 最多低 40%,比 Pi 最多低 20...

TechCrunch · AI

OpenAI 发布 GPT-6 小模型 Sol 和 Luna,主打更便宜、更少出错

OpenAI 在旗舰模型 Astra 之后,又推出了两个“青春版”:Sol 和 Luna。Sol 负责写代码这类复杂任务,Luna 则用来干摘要、信息提取、快问快答这些目标明确、量大的活。公司说这两个模型比 Astra 更省钱、效率更高,但正文没公布具体定价、错误率对比和上线日期。所以“更少出错”这个说法,我建议先打个折,等实测跑分出来再说。

推荐理由:OpenAI 在 Astra 之后快速放出 Sol 和 Luna,产品线扩张的动静不小,TechCrunch 独家报道也拉高了关注度。但文章只说了定位和分工,没披露定价、错误率对比和具体上线日期,所以“更少出错”这个卖点我建议先打个折,等实测数据出来再说。分数维持 88,放在 featured 没问题。

AI HOT 精选

OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6 直接砍半

OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...

推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。

Hacker News 首页

Claude Opus 5.5 智商分登顶但价格不菲,输出还特别啰嗦

Artificial Analysis 把 Claude Opus 5.5(开自适应推理、最大努力模式、默认回退)排在了 206 个模型里的第一名,智商指数拿了 58 分,比中位数的 25 分高出一大截。但别急着激动,它的价格也挺劝退:输入每百万 token 要 4 美元,输出更是高达 20 美元,光跑完这一轮评测就烧了 8708 美元。另外这模型话特...

推荐理由:Artificial Analysis 的独立评测把 Claude Opus 5.5 送上智商榜首,但价格也创了新高。文章给了硬数字和明确基线,对团队选模型有直接参考价值。没打更高分是因为这是第三方分析,不是一手发布或技术突破。

AI HOT 精选

Anthropic 工程师实测 Claude Opus 5.5:移植 HAProxy 比 Fable 5.1 快 21%,成本砍半

Anthropic 的 Boris Cherny 把 Claude Opus 5.5 当主力模型用了好几周。他拿一个实战任务对比:让 Opus 5.5 和 Fable 5.1 分别把 HAProxy 从 C 语言移植到 Rust。两个模型都几乎通过了全部测试,但 Opus 5.5 只用了 9.5 小时就跑完,Fable 5.1 花了 12 小时,而且 ...

推荐理由:Boris Cherny 拿真实任务跑了一遍:把 HAProxy 从 C 移植到 Rust,Opus 5.5 用 9.5 小时跑完,比 Fable 5.1 的 12 小时快,成本还低了 51%。有名字、有任务、有对比,比厂商自己出的跑分有用。没给更高是因为这是单次测试,不能当通用结论。

AI HOT 精选

Claude Opus 5.5 上架 OpenRouter,编码干活更利索,价格还打了八折

Anthropic 在 OpenRouter 上放出了 Claude Opus 5.5,这是 5.5 系列的第一个模型。跟 Opus 5 和 Fable 5.1 比,它在让模型自己动手写代码、处理知识类任务和操作电脑这些场景上表现更好。上下文窗口还是 1M token,没缩水。价格方面,每百万输入 token 收 4 美元,输出收 20 美元,比 Op...

推荐理由:Anthropic 把 Claude Opus 5.5 放上 OpenRouter,是 5.5 系列首发,主打智能体编码、知识任务和电脑操作三项提升,对比对象是 Opus 5 和 Fable 5.1。上下文窗口保持 1M token,定价每百万输入 4 美元、输出 20 美元,比 Opus 5 便宜。三个维度都踩中了:时效性上这是当天消息,知识增量有具体对比和场景,相关性直接打中 Claude 生态里的开发者和 agent 用户。没给更高分是因为目前只有平台上线信息,缺技术报告和实测数据,实际提升幅度还得等第三方验证。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,比上代快三成、便宜四成,Claude Code 的用量额度也跟着涨了

Claude Opus 5.5 是 Claude 5.5 系列的第一个模型,官方说它在多数任务上能打平 Claude Fable 5.1,但运行成本比 Opus 5 低了 40%。Claude Devs 补充,每个任务的实际速度快了约 30%。因为定价降了,Claude Code 的 5 小时会话限额虽然只提了 20%,但额度内能用的量多了 25%。P...

推荐理由:Anthropic 旗舰模型更新,速度和成本都有明显提升,当天值得写。分数没上 90 是因为目前只有官方推文和社区反馈,还没有第三方基准测试或跨模型对比,实际表现还得等更多验证。

AI HOT 精选

Anthropic 放出 Claude Opus 5.5,性能打平 Fable 5.1,运行成本比上代降了四成

Claude Opus 5.5 是 5.5 家族第一个模型,多数任务表现跟 Fable 5.1 持平,但跑起来的开销比 Opus 5 少了 40%。作者提到这版沟通更清楚、token 用得更省,而且所有 effort level 都能用。5 小时调用限额也上调了,还加了个 banked reset 机制。正文没给具体跑分和定价,所以降成本这点先看实际账...

推荐理由:Anthropic 放出 Claude Opus 5.5,声称性能对标 Fable 5.1,运行成本比 Opus 5 降了 40%,还上调了调用限额并加了 banked reset。这是一次针对用户长期吐槽成本和限额的实质性旗舰更新。没给更高分是因为正文缺跑分和定价,降成本这点先看实际账单再说。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,运行成本比上代低 40%,token 定价也更便宜

Opus 5.5 是 Claude 5.5 系列的第一个模型。Anthropic 说它在多数任务上能打平自家的 Fable 5.1,但跑起来的成本比 Opus 5 低了 40%,每个 token 的单价也更低,而且用 token 更省。模型支持所有 effort level,已经能在 Claude Code 里用。正文没给具体定价和跑分对比,所以实际便...

推荐理由:Anthropic 旗舰模型换代,成本砍掉 40% 还能打平 Fable 5.1,对 Claude 生态用户是实打实的好消息。分数没给更高是因为正文没披露具体定价和基准测试数字——真省钱还是得跑自己的任务看。

TechCrunch · AI

Anthropic 发布 Opus 5.5,号称编程和知识工作能力最强,价格还降了

Anthropic 周二放出了新模型 Opus 5.5,官方说法是“目前测过最强的模型”,尤其在写代码和处理知识类任务上刷到了新高度。价格比之前的 Opus 系列更低,但具体降了多少、每百万 token 收多少钱,正文没披露。性能方面,Anthropic 拿它跟自家的 Fable 模型比,说水平相当,可也没给出具体的跑分对比。所以“最强”这个结论,最好...

推荐理由:Anthropic 旗舰模型更新还降价,是个真信号。但正文没给具体价格和跑分,最关键的省钱和实力都只能靠猜,所以分数压一压。

9月22日星期二

Hacker News 首页

AI 写不出可维护的代码,靠它的人也一样学不会

作者 Alexandru Nedelcu 直接开喷:靠 AI 一口仙气(vibe-coding)堆出来的项目,时间一长都会烂成没法维护的屎山。核心问题在于,代码好不好维护、架构合不合理,没有即时反馈信号——坏味道可能要几个月甚至几年才会爆发,而现在的 AI 训练(比如强化学习)只看眼前奖励,根本学不会这种需要长期直觉的东西。他指出现有最强模型连“把大函...

Hacker News 首页

当 AI 代理 30 秒就能生成一个工具包,开源还有存在的必要吗?

作者 Alberto Arena 抛出一个很现实的问题:现在让 AI 代理写个小工具只要半分钟,没人再去下载、看 README 或给星标了,开源维护者最后那点“被看见”的回报没了,谁还愿意干?他拿自己维护的 Laravel 包举例,2.4 万次安装只有 281 个星标,回报本来就薄。但文章也指出,代理能秒出代码,是因为它读遍了公开的 README、测试...

OpenAI News

Parallel 用 GPT‑6 Astra 做研究,时间和成本各砍一半

AI agent 基础设施公司 Parallel 拿 GPT‑6 Astra 去查六个州六个月内的劳动力市场数据,结果时间和代码成本都降了 50%。原因是 Astra 搜索更精准、中间步骤更少,还能把子任务分给多个 agent 并行跑。正文没提对比的是哪个旧模型,所以 50% 这个数字先当参考,但如果是真的,对做长链研究任务的团队挺省钱。

Hacker News 首页

JetBrains 发布 Air:把 AI 编程助手从编辑器里拆出来,做成一套给团队用的开放系统

JetBrains 把过去半年在 AI 辅助开发上的实验整合成了 Air,一套不再只绑在 IDE 上的产品体系。它面向开发者、团队和公司三层,核心思路是让 AI 编程这件事能跨工具、跨服务跑起来,并且明确押注未来会是多家模型和供应商并存的局面。文章确认了 Central CLI、共享上下文、云端智能体、自动化流程和 AI 成本控制这些功能已经在铺开,但...

推荐理由:我会先打个折:文章是产品发布视角,不是第三方评测,效果和实际体验还没验证。但信息量够实在。JetBrains 把过去半年在 AI 辅助开发上的实验打包成 Air,核心变化是不再把 AI 能力锁死在自家 IDE 里,而是拆成 Central CLI、共享上下文、云端智能体和成本控制这些组件,让开发者在不同工具间都能用。他们明确说未来是多模型、多供应商的局面,这点判断挺清醒,没硬推自家模型。对 AI 从业者来说,这相当于一个老牌工具厂商在 agent 编程方向上的正式出牌,思路和组件都列出来了,值得看一眼。

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

AI 群聊日报

Jev 一周被开源追平,M5 Ultra 本地跑 agent 评测出炉

社区用几百道题测了 Jev,发现它在难题上基本分不清对错——答对和答错的信心值只差 0.006。DeepSeek V4.1 Flash 准确率 95%,开源的 reflex-27b 也以 76% 超过 Jev 的 74%,而且没做微调,成本更低。群友的结论是:想训练一个好分类器,不如先训练一个会聊天的模型,Jev 跳过思维链校准等于主动放弃准确度。同一...

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

AI HOT 精选

NVIDIA 把 Nemotron 3.5 Lightning 定位成 Agent 流水线里的执行工兵,专干高频、低延迟的脏活累活

Nemotron 3.5 Lightning 是个 30B 参数的混合专家模型,但每次推理只激活大约 3B 参数,所以跑得快、成本低。NVIDIA 把它设计给 Agent 流程里的执行层用:比如选工具、读文件、检查结果这些需要反复调用模型、但单次任务很明确的步骤。它跟 Nemotron 3 Ultra 不是替代关系,Ultra 负责费脑子的规划,Lig...

推荐理由:OpenRouter 这篇解读把 Nemotron 3.5 Lightning 的定位讲明白了:它不是来跟 Ultra 抢规划任务的,而是专门填 Agent 执行层的坑。30B 参数、每次只激活 3B 这个设计,直接对应高频调用场景下的成本和延迟压力,信息量够,判断也实在。不过话题本身偏技术选型,缺了点能让人主动转发的钩子,所以 R 没给。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

AI HOT 精选

小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智能体评测里跟 Claude Opus 5、GPT-5.6 Sol 打...

小米这次放出的 MiMo-V2.6 Pro 和 Flash 都走全模态路线,靠大规模强化学习训出来的。Pro 版在多数智能体基准测试里能对标 Claude Opus 5 和 GPT-5.6 Sol,在 Artificial Analysis 智能指数上拿了 46 分,是目前开源模型里最高的。能力覆盖写代码、操控电脑界面、3D 推理和创作类任务。正文没披...

推荐理由:小米发了 MiMo-V2.6 Pro 和 Flash 两个全模态开源模型,Pro 版在智能体基准测试里直接对标 Claude Opus 5 和 GPT-5.6 Sol,Artificial Analysis 智能指数 46 分是开源最高。我会先打个折,正文没披露训练数据、参数量和具体推理成本,但光是这个分数和开源定位,就足够让做智能体的人关注了。

AI HOT 精选

马斯克称 Grok 4.7 在智能体编码上排第三

马斯克引用 Artificial Analysis 的评测说,Grok 4.7 让 xAI 在智能体编码能力上排到第三,仅次于 Anthropic 和 OpenAI。但正文没披露具体评测指标、分数或版本对比,只有排名和对手。这个排名如果是真的,说明 Grok 在让模型自主写代码、调工具这类任务上进步明显,但缺少数据支撑,建议先观望。

Hacker News 首页

Foremerge 在代码冲突发生前,先检查多个 AI 编程助手的修改意图有没有打架

Foremerge 是一个架在 Git 上的开源协调协议,专门解决多个 AI 编程助手并行干活时“逻辑打架”的问题。它不是处理代码合并冲突,而是提前发现两个助手改了不同文件、但逻辑上互相矛盾的情况。做法是让助手在动手写代码前,先在意图文件里声明自己要改什么、为什么改,协议先比对意图,再合并代码。项目目前还在早期阶段,正文没披露具体支持哪些助手框架,也没...

9月21日星期一

AI HOT 精选

Grok 4.7 发布,编码和知识工作任务更强,速度翻倍但价格不变

xAI 推出了 Grok 4.7,一个主要面向编码和知识工作的新模型。它用了更大的基础模型,并通过更长时间的强化学习训练,专门啃那些需要好几个小时才能完成的硬骨头任务,自我检查能力也更强了。在考验长线编程的 CursorBench 4.0 上,它拿到了 46.3% 的分数,超过了 GPT-5.6 Sol Max 的 41.7%,但还落后于 Fable ...

推荐理由:Grok 4.7 主攻编码和知识工作,CursorBench 4.0 上 46.3% 的分数压过了 GPT-5.6 Sol Max,但还落后于 Fable。文章给了具体的基准分和训练思路(更长的强化学习、更强的自我检查),对从业者有参考价值。没给满分是因为正文没披露模型规模、架构变化和推理成本,实际可用性还得等上手验证。

Simon Willison

工程师爆料:大公司团队全靠 Claude Code 写代码,无人阅读任何产出

一名新入职大公司的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。团队无人喜欢这种方式,却被高层要求尽可能多地产出,因为高层认为推送代码不是瓶颈;人们每天工作 12 到 13 小时,只是为了按回车,没有人阅读任何内容。

Hacker News 首页

MCP 从一开始就是个坏主意:模型变聪明了,该让智能体直接调 API 和命令行

作者直接开喷,说 MCP(模型上下文协议)是给当年不够聪明的模型设计的,现在已经过时了。现在的模型能自己写脚本、读 --help 文档、直接调 HTTP API,根本不需要中间再套一层 MCP 服务器。文章指出,MCP 生态搞出了一堆服务器和工具,结果反而造成上下文臃肿,各家平台还得想办法用搜索模式来精简工具列表,这本身就是个短期补丁。Cloudfla...

Hacker News 首页

Will Larson 在 Imprint 试水“软件工厂”模式,让 AI 代理自己盯目标、补任务、提 PR

Will Larson 把他在 Imprint 的 AI 代理用法又往前推了一步。他给代理一个 Linear 项目,代理会先检查有没有对应的 Notion 设计文档和 Datadog/Snowflake 监控看板,没有就催你建。接着它会扫一遍任务状态,发现缺活就自己往项目里加,然后挑没被阻塞的任务开始干活:写 PR、催 review、或者提澄清问题。一...

推荐理由:Will Larson 的“软件工厂”实验是 2026 年 AI 编码落地最扎实的一手记录之一。从全公司推 Claude Code 到 Agent Fleet 编排,每一步都有具体的决策和失败模式,对正在推 AI 编码的团队来说直接可用。我会先打个折:文章没给出量化效果数据,比如开发速度提升多少、bug 率变化,但作为工程实践分享,信息密度和可操作性都很高,值得上 featured。

9月20日星期日

Hacker News 首页

AI 写代码质量变差?不是 AI 的锅,是你没把质量关卡搭好

作者 Iouri Khramtsov 分享了一套他实测有效的 7 层防御体系,能让 AI 写代码的产出翻 2-3 倍,同时 bug 反而变少。第一层是让 AI 先审一遍需求文档,把没想清楚的边界情况和交互漏洞挑出来,这是他发现 bug 骤降的主要原因。第二层是逼 AI 做测试驱动开发,要求单元测试覆盖率超过 95%,但得先让它想好测试场景再写实现,防止...

Hacker News 首页

微软用 AI 智能体把 Copilot 运行时从 C# 迁到 Rust,花了 12 万美元

微软一个团队用内部 AI 智能体系统 Nachete,把 Copilot 运行时从 C# 重写成了 Rust。整个过程跑了 7 轮迭代,智能体自己写代码、编译、修错误,最终产出了 12.5 万行 Rust 代码,首次编译就通过了。人类只参与了代码审查和安全审计。团队估算,如果纯人工重写要花 110 万美元和 9 个月,但文章没细说这个基线是怎么算出来的...

推荐理由:微软用内部智能体系统 Nachete 把 Copilot 运行时从 C# 移植到了 Rust,7 轮迭代产出 12.5 万行代码,首次编译通过,总花费 12 万美元。文章说人工重写得 110 万美元和 9 个月,但没解释这个基线怎么算的,我会先打个折。这事在工程圈里话题性很强,因为 Rust 重写难度高,智能体还能自己修错误、迭代,人类只做审查,直接关系到开发者对 AI 替代编码的想象。

Hacker News 首页

Chief of Staff 模式:让一个 Claude Code 会话当指挥,其他会话干活

这篇文章讲了一种跑长时间 AI 编程任务的方法:把指挥和干活拆开。一个长会话负责分配任务、核实结果、记录教训,但不写代码;多个短会话负责具体实现。状态存在一个外部任务板里,不靠对话上下文,因为上下文会被压缩、会丢细节。核心纪律是别信 agent 自己说“搞定了”——得重新跑一遍命令、看退出码。作者管这叫 Chief of Staff 模式,本质上就是 ...

推荐理由:这篇文章不卖概念,给的是实操套路。作者把长会话拆成只派活不写代码的协调层和只干活的执行层,状态全放外部任务板,绕开了对话上下文被压缩后丢信息的坑。最值钱的一条纪律:agent 说任务完成不算数,得重新执行一遍命令、检查退出码。我会先打个折——正文没披露这套方法在真实项目里的成功率和翻车案例,但思路本身对常跑长时间 AI 编程任务的人很有参考价值。

Hacker News 首页

阶跃星辰发布 Step 5 Preview,一个 600B 参数的 MoE 旗舰模型,主打编程和金融任务

阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...

推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。

Computing Life · Share · 鸭哥调研

这一周,AI 工程工具的四件实事

TypeSafe 上线了 Jev 云端接口,程序发一段文字过去,直接取回一排离散概率,用来做客服分流比大模型快约 25 倍、成本低两个数量级,但一致率不等于准确率,校准主张没有独立验证,官方定价页面也没上线。Slack 八月发布的 Slack Code 把编程 agent 写代码的中间过程搬进专门的群聊频道,支持行级批注和原型预览,但权限机制和人工签署...

9月19日星期六

r/LocalLLaMA

GLM 5.3 Flash 不靠视频模型,直接生成了一段40秒的股市信息图动画

Reddit 用户 9r4n4y 用 GLM 5.3 Flash 做了一个约 40 秒的股市信息图动画。模型收到的不是一个视频脚本,而是一个 zip 压缩包,里面装着手绘风格的动画技能包,外加一句“给我一个视频,别问我问题”。它跑在 4 台 DGX 机器上,用了 8-bit 量化和 vllm 推理框架。这事的本质是模型自己写动画代码并渲染出视频,而不是...

Computing Life · Share · 鸭哥调研

Anthropic 复盘:AI 写代码太快,给测试系统打补丁不再划算

Anthropic 工程师发了一篇复盘,讲他们内部一个给自动化测试记账和挑选用例的服务,半年内任务量涨了 25 倍。团队连续打了三次补丁,第一次扩容换来 70 天安稳,第二次并行分片换来 29 天,第三次只能靠每天重启硬撑,连一天都稳不住。最后一名工程师用三周推倒重写,而作者估计一年前这活要干一个季度。核心变化是两条成本曲线交叉点左移了:AI 让重写的...

推荐理由:这是一篇来自一线工程师的复盘,不是泛泛的 AI 提效公关稿。它用三次补丁的失效曲线,把“重写变便宜”这个趋势讲成了可感知的工程决策变化。我会先打个折:它不涉及模型突破或产品发布,属于工程实践类的硬核分享,但数字扎实、视角刁钻,对从业者的实际工作有直接启发,放在 featured 里作为实践案例是合适的。

Hacker News 首页

Claude Code 新增 AGENTS.md 支持:项目没有 CLAUDE.md 时会自动读取

Claude Code 2.1.277 版本加了一个小但实用的功能:如果项目根目录没有 CLAUDE.md,它会自动读 AGENTS.md 作为项目指令。你可以在 /config 里改这个设置。目前 Bedrock、Vertex 和 Foundry 上还不可用。另外修了一堆 bug:claude -p 和 Agent SDK 会话在内部错误后不再卡死,...

TechCrunch · AI

ChatGPT 核心作者做了个不聊天的模型 Jev,专跑代码和调 API,开发者很买账

Diogo Almeida 是 RLHF(从人类反馈中强化学习,让模型更听话的关键技术)的发明人之一。他觉得让模型只优化人类语言是条死胡同,因为电脑之间交流用的是代码。于是他离开 OpenAI 创办了 TypeSafe AI,本周发布了新模型 Jev。Jev 还是基于 Transformer 架构,但训练目标不是生成人话,而是直接执行代码和调用 API...

推荐理由:我会先打个折:文章没给跑分、定价、API 成功率这些硬数字,所以重要性停在 78。但信号本身很强——RLHF 发明人出走创业,第一枪就打向“代码执行”而非“人话生成”,这个转向本身就值得关注。正文没披露模型规模、训练成本和实际调用延迟,这点先别太激动,等他们放出技术报告再重新评估。

Hacker News 首页

一旦你停止动脑,AI 编程这条路就走不通了

Dan Luu 观察到,越来越多开发者把 LLM 的输出直接当成品用,自己只充当一个按回车键的“肉代理”。到 2026 年 9 月,这种不动脑的开发方式已经能产出勉强能跑的软件,但 Luu 的核心观点很直接:如果 AI 真强到能无监督干活,公司直接让模型自己跑循环就行了,何必还雇你这个“肉代理”?他举了几个翻车例子,比如一个 AI 棋类机器人连简单的启...

推荐理由:Dan Luu 用“肉代理”这个词把 AI 编程的核心矛盾讲透了:模型越强,不动脑的开发者就越容易被替换。观点尖锐,有 2026 年 9 月的时间戳,但缺少硬数据支撑,所以我会先打个折,给 78。

9月18日星期五

GitHub Blog · AI & ML

GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,可组合使用;RAG 并未死亡,它为模型提供训练数据之外的相关信息,减少 token 浪费并让回答更有依据。

AI HOT 精选

Justin Cormack 用 35 万行 Rust 复盘:评估 AI Agent,先拿证据,别看覆盖率

Justin Cormack 让 AI 写了一个兼容 S3 的对象存储系统,代码量干到了 35 万行 Rust。他直接拿真实的 S3 当“标准答案”来跑测试,攒了 1500 个测试用例,结果还真抓到了 S3 自己的 500 错误。他踩了几个坑:追 100% 代码覆盖率会让 AI 写一堆没用的测试凑数;AWS 的文档经常不准,AI 也不擅长从文档里挖边界...

推荐理由:这是一篇带真实数字和踩坑记录的一手实验,不是泛泛而谈。35 万行 Rust + 1500 个测试用例的规模让结论有分量。扣分点在于文章本质上是 Tessl 的品牌内容,所以没给到 85 分以上。但实验本身的方法论——拿真实 S3 当标准答案来测 AI 生成的代码——对从业者很有启发。