跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 341–360 条 · 共 1,195 条

7月30日星期四

Hacker News 首页

一个本地合并队列,让多个 Claude Code 智能体并行干活不打架

funador 开源了一个本地工具,把 GitHub 风格的合并队列搬到了 Claude Code 上。你可以同时启动多个 Claude Code 智能体,工具会把每个智能体的改动依次变基到最新主分支上,一个一个合并,遇到冲突就回滚。README 里给了两种用法:直接通过 `claude` 命令行跑,或者配成 Claude Desktop 的 MCP ...

推荐理由:一个把 CI 合并队列模式移植到本地 Claude Code 多 agent 工作流的实用工具,机制清晰,用法具体。扣分是因为单人开源项目,没有规模验证,受众也窄(重度 Claude Code 用户),所以归到 r 档。

Latent Space

AI 正在吃掉金融业;AIE 纽约大会开放报名

OpenAI 和 Anthropic 同时在纽约办了金融 AI 活动。OpenAI 在 Codex 里放出了专门的股票投资和投行插件,Anthropic 则发布了覆盖企业财务全流程的 Cowork 和 Claude Code 智能体模板。AIE 纽约大会把“AI 在金融”定为主舞台主题,早鸟票已开售。另外,OpenAI 的智能体安全事件扩大了,除了 H...

推荐理由:OpenAI 和 Anthropic 同一天在纽约办了金融 AI 活动,两边都拿出了具体产品:OpenAI 在 Codex 里加了股票投资和投行插件,Anthropic 则发了覆盖企业财务全流程的 Cowork 和 Claude Code 智能体模板。AIE 纽约大会也把“AI 在金融”定成主舞台主题,早鸟票已经开卖。另外 OpenAI 的智能体安全事件还在扩大,正文没披露具体细节,这点先别太激动。整体看,金融场景的 AI 落地在加速,但安全事件也在同步发酵,值得从业者关注这两条线的交叉影响。

7月29日星期三

AI HOT 精选

算力价格未来可能涨 10 倍以上

Dwarkesh Patel 算了笔账:如果一块 H100 能跑出人类软件工程师的水平,按现在的工程师市场价,这块卡一年租金应该超过 25 万美元,是当前现货价的 15 倍。文章从 Anthropic 年收入可能冲到 1000-1500 亿美元出发,指出实验室的训练算力每年只增长 3 倍,要撑起 10 倍收入增长,要么利润率飙升,要么算力变贵。目前两者...

推荐理由:Dwarkesh 用工程师工资倒推算力定价,给了一个具体的估值锚点,比泛泛聊趋势有用。但这只是一篇个人思考,不是行业事件,所以分数卡在 featured 门槛上。

Hacker News 首页

自建 GPU 跑 Kimi K3:硬件贵 20%,任务完成率高 24 个百分点,但慢 8 倍

imec 的 aistack 团队用 64 个真实编程任务测了自建 GPU、租用硬件和商业 API 三种方案。新加入的 Kimi K3 跑在 8×B300 节点上,硬件成本比跑 GLM-5.2 的 8×B200 节点贵约 20%,但任务完成率达到 86.4%,比 GLM-5.2 和 Claude Opus 4.8 的 62.5% 高出近 24 个百分点...

推荐理由:imec 的 aistack 团队拿 64 个真实编程任务,把自建 GPU、租硬件和商业 API 三种方案拉出来比了一遍。新上的 Kimi K3 跑在 8 块 B300 的节点上,硬件成本比跑 GLM-5.2 的 8 块 B200 节点贵了大约 20%,但任务完成率干到了 86.4%,比 GLM-5.2 和 Claude Opus 4.8 的 62.5% 高出将近 24 个百分点。这个差距不小,说明多花的硬件钱换来了实打实的任务成功率提升。不过正文没披露具体任务难度分布和失败原因,这点先别太激动,得看你的业务场景是不是跟这 64 个任务类似。

Hacker News 首页

Linux 内核开始用 AI 写补丁和审代码,Linus 拒绝讨论伦理问题

Drew DeVault 对 Linus Torvalds 力挺 AI 进入内核开发的做法很不满。目前已有超过 1200 个内核提交带上了“Assisted-by”标签,大部分是用大模型辅助写的补丁。新工具 Sashiko 用 Google Gemini 自动生成代码审查意见,这意味着就算你不想用 AI,只要给内核贡献代码,也躲不开跟 AI 打交道。L...

推荐理由:Linus 给内核开发用 AI 定了调,Drew DeVault 这篇反驳是目前最有分量的反对声音之一。1200 个提交和 Sashiko 工具让这事不再是空谈。扣分点在于这只是单篇观点文章,不是社区正式决议,但争论本身已经够有看头了。

OpenAI News

OpenAI 给 10 万名学术研究者免费开放 GPT-5.6,先从数学和科学领域开始

OpenAI 搞了个“ChatGPT for Academic Researchers”项目,计划到 2027 年让 10 万名科研人员免费用上他们最强的模型,包括 GPT-5.6 Sol Pro 和 Codex。今年夏天先开放 1 万个名额,高等研究院和巴黎高师已经能用上了。每个参与者还能拉上最多四个同事一起用,默认不会拿你的数据去训练模型。除了给工...

推荐理由:OpenAI 直接给学术界发福利,计划到 2027 年覆盖 10 万人,今年夏天先放 1 万个名额。高等研究院和巴黎高师已经用上了,每个参与者还能拉四个同事组队白嫖,数据默认不用于训练。这不是模型能力升级,是分发策略的大动作,对科研圈吸引力很强,对商业定价也可能有间接压力。正文没提申请门槛和筛选标准,这点先别太激动。

AI HOT 精选

OpenAI 发布 GPT-5.6 模型家族:Sol、Terra 与 Luna

OpenAI 推出了 GPT-5.6 系列,包含三个模型。旗舰款 Sol 在编程智能体评测上赢了 Claude Fable 5,成本还不到对方一半。Terra 的性能追平上一代 GPT-5.5,但价格砍半;Luna 则比 Sol 便宜 80%。省钱的秘诀主要来自推理环节的优化和一套让模型自己干活的“智能体流程”:Sol 自己动手重写了生产环境里的 GP...

推荐理由:OpenAI 发布 GPT-5.6 系列,旗舰 Sol 在编程智能体评测上压过 Claude Fable 5,成本不到对方一半,Terra 和 Luna 分别打价格和性能档位。这是头部模型的一次重要换代,有明确的对比对象、成本数据和效率机制说明,对从业者选型和成本判断有直接参考价值。

7月28日星期二

Latent Space

OpenAI 的 Codex 和 ChatGPT Work 用户破千万,非开发者占两成,增速是开发者的三倍多

OpenAI 产品工程负责人 Akshay Nathan 在播客里聊了 ChatGPT Work 的来历。Codex 本来是个写代码的工具,结果在 OpenAI 内部先被非技术员工用火了。现在知识工作者大概占 Codex 用户的 20%,增长速度是开发者的 3 倍多。团队干脆把 Codex 的智能体框架抽出来,做了个给文档、表格、幻灯片用的 ChatG...

推荐理由:OpenAI 产品工程负责人第一次详细拆解了 ChatGPT Work 的来历,给出了知识工作者增速是开发者 3 倍这个具体数字。对做 agent 产品的人有用。没给更高分是因为这是播客访谈,不是正式产品发布或论文,部分细节可能没展开。

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

Hacker News 首页

Kimi Linear:混合线性注意力架构,首次在公平对比下跑赢标准注意力

月之暗面 Kimi 团队发了一篇技术报告,提出 Kimi Linear 这个混合线性注意力架构。核心是一个叫 Kimi Delta Attention(KDA)的模块,它在 Gated DeltaNet 基础上加了更细粒度的门控,让有限的 RNN 记忆用得更高效。他们训了一个总参数 48B、激活 3B 的 MoE 模型,把 KDA 和多头隐式注意力(M...

推荐理由:月之暗面这次没发产品,发的是架构论文,Kimi Linear把线性注意力和MoE揉在一起,48B总参、3B激活的模型在长上下文和推理上表现不错。KDA的门控设计让RNN记忆用得更省,这点挺巧。不过目前只是arxiv预印本,没有产品落地时间表,实际效果还得看社区复现和第三方评测,所以分数先打个折,不往更高给。

AI 群聊日报

群聊日报:Gowers 说数学正在死去,Opus 5 实测第三天掉链子

菲尔兹奖得主 Gowers 拒签《莱顿宣言》,写了长文说数学不会死于 AI 无能,而会死于证据过剩——像湖泊富营养化,文献疯长但人类专家消失。他两次亲眼看到 GPT 5.6 Pro 一次性解出他苦思过的问题。群友讨论认为,现在给现有模型做各种外挂(harness)意义不大,下一代模型直接碾压;写论文的速度赶不上出成果的速度,是短暂的套利窗口。另一边,C...

推荐理由:Gowers 拒签《莱顿宣言》并发表长文,核心论点不是 AI 无能,而是 AI 太能产,导致数学界像湖泊富营养化一样被“证据”淹没。他两次亲眼看到 GPT 5.6 Pro 一次性解出自己苦思的问题,这个一手证据让整件事从观点升级为事实。群聊讨论补充了从业者的真实反应:给现有模型做外挂可能是在浪费时间,因为下一代模型会直接碾压,现在是个短暂的套利窗口。信息来自群聊日报,不是原始报道,所以我会先打个折——Gowers 的具体实验细节和模型版本限制都没披露,但核心事实和判断已经足够清晰有力。

TechCrunch · AI

Cursor 在被 SpaceX 收购前推出印度专属套餐,月费约 7 美元

Cursor 搞了个叫 Cursor Start 的新套餐,专供印度市场,每月 649 卢比(大概 7 美元),比它常规 20 美元一个月的 Pro 版便宜了一大截。这是 Cursor 第一次针对单个国家定价。印度现在是它全球第三大市场,公司还打算在当地招人、推企业版销售。这个动作发生在 SpaceX 预计完成收购的前几周——文章没说收购后这套印度策略...

推荐理由:Cursor 第一次做单一国家定价,印度直接降到 7 美元,比标准 Pro 版便宜 65%,而且赶在 SpaceX 收购完成前几周推出,时间点很微妙。文章给了具体价格锚点和印度是第三大市场的数据,但没披露收购后这套定价会不会被改掉,也没说印度本地化后续的产品适配计划。分数没给更高是因为这本质上是市场扩张动作,不是产品能力更新,而且收购后的不确定性让长期影响打折扣。

TechCrunch · AI

微软发布首个网络安全模型 MAI-Cyber-1-Flash 和智能体安全平台 Perception

微软在旧金山一场小型活动上掏出了两样新东西:一个是专门做网络安全的模型 MAI-Cyber-1-Flash,用来在复杂代码库里找那些难发现的漏洞,并驱动自家的 MDASH 漏洞挖掘工具;另一个叫 Perception 的平台,可以派出一组 AI 智能体去自动跑安全流程,比如找 bug 和修 bug。不过正文没披露模型参数量、跑分、定价,也没说 Perc...

推荐理由:微软这次掏出了两样东西:一个叫 MAI-Cyber-1-Flash 的网络安全模型,用来在复杂代码库里挖那些难找的漏洞,还驱动自家的 MDASH 漏洞挖掘工具;另一个是 Perception 平台,能派出一组 AI 智能体自动跑安全流程,比如找 bug 和修 bug。机制上确实有新意,不是换个壳的常规更新。但正文没披露模型参数量、跑分、定价,也没说 Perception 具体怎么跟现有安全工具打通,信息缺口不小,所以知识增量打了折扣。H 和 K 都踩中了,R 偏弱,刚好卡在 featured 门槛上。

7月27日星期一

Import AI

AI 用 14 小时复现人类数周编程任务,机器人叠衣服成功率 99.1%

Epoch 和 METR 的 MirrorCode 基准测试显示,Claude Opus 4.7 在 14 小时内、花 251 美元推理成本,重新实现了一个人类需要 2 到 17 周才能完成的软件项目。测试方式是只给模型命令行交互权限,不让看源码也不让上网,让它从零写出功能一样的程序。25 个目标程序里有 17 个至少有一次满分复现,但 ruff 这类...

推荐理由:MirrorCode 是 Epoch 和 METR 搞的一个长周期编程基准,Claude Opus 4.7 用 14 小时复现人类数周的工作,数字和失败案例都摆出来了。HKR 三条全中,但这是 newsletter 摘要不是原论文,而且任务复杂度高,我会先打个折——信息密度够,但别当完整评测报告看。

Hacker News 首页

Bun 用 Rust 重写六周后仍无新版本发布,实际花费可能已逼近 80 万美元

Bun 在 7 月 8 日宣布用 Anthropic 的 Claude 把代码从 Zig 重写成 Rust,声称花了 11 天、16.5 万美元 API 费用就完成了合并。Tom Lockwood 翻了一遍代码仓库,发现合并六周后一个正式版本都没发——上次发版还是 5 月 12 日。由 Claude Code 提交的待处理 PR 从 1277 个涨到了...

推荐理由:一篇独立翻仓库、带实锤的核查文,直接回应 Bun 那篇'11 天 AI 重写完成'的 splashy 公告。三个 HKR 轴都踩中了:标题有悬念,数字和发版空窗期够硬,话题正好卡在 AI 替代开源维护者这条断层线上。没给更高分是因为正文没披露重写后的性能对比和 bug 率,只能算阶段性打脸,结论还得等正式发版再验证。

OpenAI News

OpenAI 研究:近一半非通用类 ChatGPT 工作对话,是在干别人岗位的活

OpenAI 经济研究团队分析了 80 多万条美国用户的 ChatGPT 对话,发现一个他们称为“任务跨界”的现象:在工作相关的非通用类消息里,有 43.5% 的内容其实属于另一个职业的活儿。客服(77%)、设计(75%)和 HR(69%)这三类人“借用”其他岗位任务的比例最高。营销和工程类的任务跑得最远,经常出现在非本行人员的对话里。小公司里这种跨界...

推荐理由:OpenAI 自己拿 80 万条对话做分析,数据源可信,规模也够。43.5% 这个跨界比例是个新鲜信号,比常见的“AI 提升效率”叙事有记忆点。没给 85 分是因为这是份研究报告,不是产品发布或模型更新,冲击力相对分散。

Computing Life · Share · 鸭哥调研

四款 AI 编程工具都叫多 Agent,底层架构和设计信仰完全不同

这篇文章拆了 Claude Code、OpenAI Codex、Cursor 和 Antigravity 四款 AI 编程工具的多 Agent 实现。Claude Code 在实验点对点的 Agent Teams,用 tasks.md 共享账本让子 Agent 动态抢任务,默认协同上限 15 个。OpenAI Codex 走实用路线,主节点能按任务给子...

推荐理由:一篇把四款 AI 编程工具的多 Agent 实现拆到源码级细节的横向对比,有共享账本、任务分配机制、协同上限这些具体数字和设计选择,密度远超普通体验文。因为是独立博客而非官方发布,我会先打个折,但整体信息量和切入角度仍然扎实。

Computing Life · Share · 鸭哥调研

SWE-bench 高分,为什么在大厂 Kotlin 项目里照样抓瞎?

JetBrains 在 2026 年 7 月 24 日发布了 Kotlin Benchmark,用 8 个开源项目的 105 个真实任务测 AI 编程助手。同样用 Opus 4.7 模型,Claude Code 成功率 85.71%,JetBrains 自家的 Junie 是 81.9%,差了近 4 个百分点。差距不在模型本身,而在外层 Harness...

推荐理由:JetBrains 官方基准测试给出了具体数字和工程层面的拆解,不是泛泛抱怨排行榜失真,而是追溯到静态编译开销 vs Python 动态运行反馈的根因。扣分点在于文章本身没披露更多任务细节和失败模式,但作为一条快讯,信息密度和判断力都够。

Hacker News 首页

AST-grep 用 Rust 重写了 Tree-sitter 核心,解析速度提升 30%

AST-grep 把 Tree-sitter 的 C 语言解析核心用 Rust 重写了一遍,代码大部分是 AI 生成的。单纯解析文件的速度快了约 30%,跑完整 ast-grep 任务(解析仓库所有文件并提取结构)快了 22%,代价是多用大约 8 MiB 内存。这个新核心砍掉了增量解析和 WASM 加载,专门为那些分析完整文件快照的 AI 编程工具服务...

推荐理由:性能数字和工程取舍写得很清楚,H 和 K 都站得住。但这事只跟一小撮做代码分析、用 ast-grep 的人有关,R 起不来,所以定在 featured 档的 72 分。如果后续文章能拿出 AI 生成代码的质量数据,分数还有往上走的空间。

7月26日星期日

AI 群聊日报

Opus 5 实测次日:靠饱和式自测换质量,综合成本可能反超 Fable;OpenAI 深夜宕机换来全员重置卡

第三方测评显示,Claude Opus 5 最大的行为变化是饱和式自测——前端会对着需求截图逐个功能确认,后端能写超过 1000 个测试用例,大面上的交付问题几乎消失。代价是时间和 token 消耗极大,复杂场景下综合成本可能反超 Fable;关掉自测后直出代码的 bug 率并不比前代低。Anthropic 的策略是用长程细致 debug 替代一次写对...

推荐理由:第三方测评给出了 Opus 5 最实在的行为和成本数据,自测换质量的取舍是真实信号。因为是群聊日报转述而非一手测评原文,我会先打个折,但信息密度够上 featured。