跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 61–80 条 · 共 1,195 条

9月23日星期三

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,比上代快三成、便宜四成,Claude Code 的用量额度也跟着涨了

Claude Opus 5.5 是 Claude 5.5 系列的第一个模型,官方说它在多数任务上能打平 Claude Fable 5.1,但运行成本比 Opus 5 低了 40%。Claude Devs 补充,每个任务的实际速度快了约 30%。因为定价降了,Claude Code 的 5 小时会话限额虽然只提了 20%,但额度内能用的量多了 25%。P...

推荐理由:Anthropic 旗舰模型更新,速度和成本都有明显提升,当天值得写。分数没上 90 是因为目前只有官方推文和社区反馈,还没有第三方基准测试或跨模型对比,实际表现还得等更多验证。

AI HOT 精选

Anthropic 放出 Claude Opus 5.5,性能打平 Fable 5.1,运行成本比上代降了四成

Claude Opus 5.5 是 5.5 家族第一个模型,多数任务表现跟 Fable 5.1 持平,但跑起来的开销比 Opus 5 少了 40%。作者提到这版沟通更清楚、token 用得更省,而且所有 effort level 都能用。5 小时调用限额也上调了,还加了个 banked reset 机制。正文没给具体跑分和定价,所以降成本这点先看实际账...

推荐理由:Anthropic 放出 Claude Opus 5.5,声称性能对标 Fable 5.1,运行成本比 Opus 5 降了 40%,还上调了调用限额并加了 banked reset。这是一次针对用户长期吐槽成本和限额的实质性旗舰更新。没给更高分是因为正文缺跑分和定价,降成本这点先看实际账单再说。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,运行成本比上代低 40%,token 定价也更便宜

Opus 5.5 是 Claude 5.5 系列的第一个模型。Anthropic 说它在多数任务上能打平自家的 Fable 5.1,但跑起来的成本比 Opus 5 低了 40%,每个 token 的单价也更低,而且用 token 更省。模型支持所有 effort level,已经能在 Claude Code 里用。正文没给具体定价和跑分对比,所以实际便...

推荐理由:Anthropic 旗舰模型换代,成本砍掉 40% 还能打平 Fable 5.1,对 Claude 生态用户是实打实的好消息。分数没给更高是因为正文没披露具体定价和基准测试数字——真省钱还是得跑自己的任务看。

TechCrunch · AI

Anthropic 发布 Opus 5.5,号称编程和知识工作能力最强,价格还降了

Anthropic 周二放出了新模型 Opus 5.5,官方说法是“目前测过最强的模型”,尤其在写代码和处理知识类任务上刷到了新高度。价格比之前的 Opus 系列更低,但具体降了多少、每百万 token 收多少钱,正文没披露。性能方面,Anthropic 拿它跟自家的 Fable 模型比,说水平相当,可也没给出具体的跑分对比。所以“最强”这个结论,最好...

推荐理由:Anthropic 旗舰模型更新还降价,是个真信号。但正文没给具体价格和跑分,最关键的省钱和实力都只能靠猜,所以分数压一压。

9月22日星期二

Hacker News 首页

JetBrains 发布 Air:把 AI 编程助手从编辑器里拆出来,做成一套给团队用的开放系统

JetBrains 把过去半年在 AI 辅助开发上的实验整合成了 Air,一套不再只绑在 IDE 上的产品体系。它面向开发者、团队和公司三层,核心思路是让 AI 编程这件事能跨工具、跨服务跑起来,并且明确押注未来会是多家模型和供应商并存的局面。文章确认了 Central CLI、共享上下文、云端智能体、自动化流程和 AI 成本控制这些功能已经在铺开,但...

推荐理由:我会先打个折:文章是产品发布视角,不是第三方评测,效果和实际体验还没验证。但信息量够实在。JetBrains 把过去半年在 AI 辅助开发上的实验打包成 Air,核心变化是不再把 AI 能力锁死在自家 IDE 里,而是拆成 Central CLI、共享上下文、云端智能体和成本控制这些组件,让开发者在不同工具间都能用。他们明确说未来是多模型、多供应商的局面,这点判断挺清醒,没硬推自家模型。对 AI 从业者来说,这相当于一个老牌工具厂商在 agent 编程方向上的正式出牌,思路和组件都列出来了,值得看一眼。

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

AI HOT 精选

NVIDIA 把 Nemotron 3.5 Lightning 定位成 Agent 流水线里的执行工兵,专干高频、低延迟的脏活累活

Nemotron 3.5 Lightning 是个 30B 参数的混合专家模型,但每次推理只激活大约 3B 参数,所以跑得快、成本低。NVIDIA 把它设计给 Agent 流程里的执行层用:比如选工具、读文件、检查结果这些需要反复调用模型、但单次任务很明确的步骤。它跟 Nemotron 3 Ultra 不是替代关系,Ultra 负责费脑子的规划,Lig...

推荐理由:OpenRouter 这篇解读把 Nemotron 3.5 Lightning 的定位讲明白了:它不是来跟 Ultra 抢规划任务的,而是专门填 Agent 执行层的坑。30B 参数、每次只激活 3B 这个设计,直接对应高频调用场景下的成本和延迟压力,信息量够,判断也实在。不过话题本身偏技术选型,缺了点能让人主动转发的钩子,所以 R 没给。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

AI HOT 精选

小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智能体评测里跟 Claude Opus 5、GPT-5.6 Sol 打...

小米这次放出的 MiMo-V2.6 Pro 和 Flash 都走全模态路线,靠大规模强化学习训出来的。Pro 版在多数智能体基准测试里能对标 Claude Opus 5 和 GPT-5.6 Sol,在 Artificial Analysis 智能指数上拿了 46 分,是目前开源模型里最高的。能力覆盖写代码、操控电脑界面、3D 推理和创作类任务。正文没披...

推荐理由:小米发了 MiMo-V2.6 Pro 和 Flash 两个全模态开源模型,Pro 版在智能体基准测试里直接对标 Claude Opus 5 和 GPT-5.6 Sol,Artificial Analysis 智能指数 46 分是开源最高。我会先打个折,正文没披露训练数据、参数量和具体推理成本,但光是这个分数和开源定位,就足够让做智能体的人关注了。

9月21日星期一

AI HOT 精选

Grok 4.7 发布,编码和知识工作任务更强,速度翻倍但价格不变

xAI 推出了 Grok 4.7,一个主要面向编码和知识工作的新模型。它用了更大的基础模型,并通过更长时间的强化学习训练,专门啃那些需要好几个小时才能完成的硬骨头任务,自我检查能力也更强了。在考验长线编程的 CursorBench 4.0 上,它拿到了 46.3% 的分数,超过了 GPT-5.6 Sol Max 的 41.7%,但还落后于 Fable ...

推荐理由:Grok 4.7 主攻编码和知识工作,CursorBench 4.0 上 46.3% 的分数压过了 GPT-5.6 Sol Max,但还落后于 Fable。文章给了具体的基准分和训练思路(更长的强化学习、更强的自我检查),对从业者有参考价值。没给满分是因为正文没披露模型规模、架构变化和推理成本,实际可用性还得等上手验证。

Hacker News 首页

Will Larson 在 Imprint 试水“软件工厂”模式,让 AI 代理自己盯目标、补任务、提 PR

Will Larson 把他在 Imprint 的 AI 代理用法又往前推了一步。他给代理一个 Linear 项目,代理会先检查有没有对应的 Notion 设计文档和 Datadog/Snowflake 监控看板,没有就催你建。接着它会扫一遍任务状态,发现缺活就自己往项目里加,然后挑没被阻塞的任务开始干活:写 PR、催 review、或者提澄清问题。一...

推荐理由:Will Larson 的“软件工厂”实验是 2026 年 AI 编码落地最扎实的一手记录之一。从全公司推 Claude Code 到 Agent Fleet 编排,每一步都有具体的决策和失败模式,对正在推 AI 编码的团队来说直接可用。我会先打个折:文章没给出量化效果数据,比如开发速度提升多少、bug 率变化,但作为工程实践分享,信息密度和可操作性都很高,值得上 featured。

9月20日星期日

Hacker News 首页

微软用 AI 智能体把 Copilot 运行时从 C# 迁到 Rust,花了 12 万美元

微软一个团队用内部 AI 智能体系统 Nachete,把 Copilot 运行时从 C# 重写成了 Rust。整个过程跑了 7 轮迭代,智能体自己写代码、编译、修错误,最终产出了 12.5 万行 Rust 代码,首次编译就通过了。人类只参与了代码审查和安全审计。团队估算,如果纯人工重写要花 110 万美元和 9 个月,但文章没细说这个基线是怎么算出来的...

推荐理由:微软用内部智能体系统 Nachete 把 Copilot 运行时从 C# 移植到了 Rust,7 轮迭代产出 12.5 万行代码,首次编译通过,总花费 12 万美元。文章说人工重写得 110 万美元和 9 个月,但没解释这个基线怎么算的,我会先打个折。这事在工程圈里话题性很强,因为 Rust 重写难度高,智能体还能自己修错误、迭代,人类只做审查,直接关系到开发者对 AI 替代编码的想象。

Hacker News 首页

Chief of Staff 模式:让一个 Claude Code 会话当指挥,其他会话干活

这篇文章讲了一种跑长时间 AI 编程任务的方法:把指挥和干活拆开。一个长会话负责分配任务、核实结果、记录教训,但不写代码;多个短会话负责具体实现。状态存在一个外部任务板里,不靠对话上下文,因为上下文会被压缩、会丢细节。核心纪律是别信 agent 自己说“搞定了”——得重新跑一遍命令、看退出码。作者管这叫 Chief of Staff 模式,本质上就是 ...

推荐理由:这篇文章不卖概念,给的是实操套路。作者把长会话拆成只派活不写代码的协调层和只干活的执行层,状态全放外部任务板,绕开了对话上下文被压缩后丢信息的坑。最值钱的一条纪律:agent 说任务完成不算数,得重新执行一遍命令、检查退出码。我会先打个折——正文没披露这套方法在真实项目里的成功率和翻车案例,但思路本身对常跑长时间 AI 编程任务的人很有参考价值。

Hacker News 首页

阶跃星辰发布 Step 5 Preview,一个 600B 参数的 MoE 旗舰模型,主打编程和金融任务

阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...

推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。

9月19日星期六

Computing Life · Share · 鸭哥调研

Anthropic 复盘:AI 写代码太快,给测试系统打补丁不再划算

Anthropic 工程师发了一篇复盘,讲他们内部一个给自动化测试记账和挑选用例的服务,半年内任务量涨了 25 倍。团队连续打了三次补丁,第一次扩容换来 70 天安稳,第二次并行分片换来 29 天,第三次只能靠每天重启硬撑,连一天都稳不住。最后一名工程师用三周推倒重写,而作者估计一年前这活要干一个季度。核心变化是两条成本曲线交叉点左移了:AI 让重写的...

推荐理由:这是一篇来自一线工程师的复盘,不是泛泛的 AI 提效公关稿。它用三次补丁的失效曲线,把“重写变便宜”这个趋势讲成了可感知的工程决策变化。我会先打个折:它不涉及模型突破或产品发布,属于工程实践类的硬核分享,但数字扎实、视角刁钻,对从业者的实际工作有直接启发,放在 featured 里作为实践案例是合适的。

TechCrunch · AI

ChatGPT 核心作者做了个不聊天的模型 Jev,专跑代码和调 API,开发者很买账

Diogo Almeida 是 RLHF(从人类反馈中强化学习,让模型更听话的关键技术)的发明人之一。他觉得让模型只优化人类语言是条死胡同,因为电脑之间交流用的是代码。于是他离开 OpenAI 创办了 TypeSafe AI,本周发布了新模型 Jev。Jev 还是基于 Transformer 架构,但训练目标不是生成人话,而是直接执行代码和调用 API...

推荐理由:我会先打个折:文章没给跑分、定价、API 成功率这些硬数字,所以重要性停在 78。但信号本身很强——RLHF 发明人出走创业,第一枪就打向“代码执行”而非“人话生成”,这个转向本身就值得关注。正文没披露模型规模、训练成本和实际调用延迟,这点先别太激动,等他们放出技术报告再重新评估。

Hacker News 首页

一旦你停止动脑,AI 编程这条路就走不通了

Dan Luu 观察到,越来越多开发者把 LLM 的输出直接当成品用,自己只充当一个按回车键的“肉代理”。到 2026 年 9 月,这种不动脑的开发方式已经能产出勉强能跑的软件,但 Luu 的核心观点很直接:如果 AI 真强到能无监督干活,公司直接让模型自己跑循环就行了,何必还雇你这个“肉代理”?他举了几个翻车例子,比如一个 AI 棋类机器人连简单的启...

推荐理由:Dan Luu 用“肉代理”这个词把 AI 编程的核心矛盾讲透了:模型越强,不动脑的开发者就越容易被替换。观点尖锐,有 2026 年 9 月的时间戳,但缺少硬数据支撑,所以我会先打个折,给 78。

9月18日星期五

AI HOT 精选

Justin Cormack 用 35 万行 Rust 复盘:评估 AI Agent,先拿证据,别看覆盖率

Justin Cormack 让 AI 写了一个兼容 S3 的对象存储系统,代码量干到了 35 万行 Rust。他直接拿真实的 S3 当“标准答案”来跑测试,攒了 1500 个测试用例,结果还真抓到了 S3 自己的 500 错误。他踩了几个坑:追 100% 代码覆盖率会让 AI 写一堆没用的测试凑数;AWS 的文档经常不准,AI 也不擅长从文档里挖边界...

推荐理由:这是一篇带真实数字和踩坑记录的一手实验,不是泛泛而谈。35 万行 Rust + 1500 个测试用例的规模让结论有分量。扣分点在于文章本质上是 Tessl 的品牌内容,所以没给到 85 分以上。但实验本身的方法论——拿真实 S3 当标准答案来测 AI 生成的代码——对从业者很有启发。

AI HOT 精选

Trail of Bits 用 AI Agent 给 Miden zkVM 审计造了全套工具:LSP、反编译器、Lean 证明

Trail of Bits 在审计 Miden zkVM 之前,花了六个月让 AI agent 从零搭建了一套工具链,包括一个 LSP 服务器(让代码能跳转、看文档)、一个反编译器、一个静态分析引擎,以及一套 Lean 形式化模型。这些工具发现了真实漏洞,比如一个未校验的输入能让恶意证明者伪造 Falcon 签名、偷走账户资金。Lean 那边产出了 9...

推荐理由:Trail of Bits 花了六个月让 AI agent 从零搭了一套审计工具链,还挖出了能偷钱的真实漏洞,这是 AI 辅助安全审计里少见的硬核案例。三条 HKR 都踩中了,但安全垂直领域太专,普通读者门槛偏高,扣 3 分。