跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 941–960 条 · 共 1,195 条

5月9日星期六

AI HOT 精选

用 Codex 并行调试验证修复

作者查 bug 时会让 Codex 在临时沙盒里重建出问题现场,先确认 bug 能复现,再修,修完再验证一遍。本地环境不会被搞乱,因为所有操作都在隔离的临时环境里跑;速度也不掉,因为他同时开 10 个会话并行处理。正文没披露具体修复成功率或单次耗时。

推荐理由:这是一篇第一人称的工作流笔记,不是产品发布或基准测试,但 10 个 Codex 会话并行修 bug 的实操信号很强。我会先打个折——正文没披露修复成功率、单会话耗时和资源消耗,所以实用性还缺几块拼图。不过它把“临时沙盒 + 并行验证”这套打法讲清楚了,对想用 AI agent 干活的开发者有直接参考价值,放在 featured 里偏低的位置合理。

量子位 · 公众号

拆解 Claude Code 源码:它为什么不做“完美”的 AI 智能体

MBZUAI 和 UCL 的研究人员直接扒了 Claude Code v2.1.88 的源码,没看公关稿,就看代码怎么写的。他们从里面挖出了 5 条设计哲学、13 条设计原则、7 层权限控制和 5 层上下文压缩策略。核心结论是:Claude Code 没追求做一个万能 agent,而是主动做减法,把模型塞进一个边界清晰、行为可控的工程框架里。比如它的权...

推荐理由:这篇不是 Anthropic 官方通稿,而是第三方扒源码做的分析,把 Claude Code 为什么这么设计、在哪做了让步讲得很透。标题的反直觉钩子够强,内容有 v2.1.88 的版本号和具体机制撑住,对正在踩坑的 Agent 开发者来说,比看十篇趋势报告都管用。不过毕竟是外部解读,不是一手发布,所以放在 featured 而不是 must-write。

机器之心 · 公众号

OpenAI 研究员翁家翌提出“启发式学习”:不调模型参数,靠改代码和记忆来训练 AI

OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路,核心是不再靠梯度去更新神经网络权重,而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证,提到 codex gpt-5.4 在打砖块(Breakout)上拿了满分 864 分,并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...

推荐理由:OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路,不是官方产品发布,更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分,Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折:正文没披露这套方法在更复杂任务上的泛化表现,也没说计算开销多大,所以“下一个训练范式”这个判断先别太激动。但如果是真的,意味着不用梯度也能让模型在具体环境里持续变强,对做 agent 自进化的团队是个值得盯的参考。

Latent Space

Anthropic 一年翻十倍,其他公司却在裁掉超过一成的人

Anthropic 现在被二级市场估到 1 万亿到 1.2 万亿美元,已经超过 OpenAI,排进全球前 15 大公司。这个估值背后有实打实的收入支撑:他们刚经历了一个“奇迹般”的第一季度,年化收入增速达到 80 倍,一个月内年化收入又跳涨了 150 亿美元。另一边,Block 裁了 40% 的人,Coinbase 裁了 14%,Cloudflare ...

推荐理由:这条不是官方融资或产品发布,属于行业评论,但信息密度高。Anthropic的10倍年增长和1万亿以上估值数字很扎眼,旁边又列了一串裁员百分比,对比强烈。我会先打个折:估值和增长数据正文没交代来源,是转述的说法,不能当实锤用。但即便保守看,它也点出了AI行业资金和人才在向头部集中的趋势,对从业者判断方向有参考价值。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

AI HOT 精选

让 Claude 直接输出 HTML,效果比 Markdown 好得多

Anthropic 的 Thariq Shihipar 提出一个反直觉的建议:让 Claude 输出 HTML 而不是 Markdown。Simon Willison 过去一直默认用 Markdown,因为 GPT-4 时代 8192 token 的上下文限制让 Markdown 更省 token。但 Thariq 的文章让他重新考虑这件事——HTML...

推荐理由:HKR 三项都踩中了,但本质是个工作流技巧,不是 Claude 本身的功能更新。作为一篇质量在线的 Claude Code 教程,放在 72–77 分段合理,加上 Simon Willison 的转发背书,进 featured 没问题。

5月8日星期五

Hacker News 首页

re_gent:给 AI 编程助手配一个 Git,能回滚、能查它为什么改文件

regent-vcs 开源了一个叫 re_gent 的工具,想给 AI 编程助手(目前只支持 Claude Code)加上类似 Git 的版本控制。它能记录 AI 为什么改某个文件、支持把整个对话过程回滚到之前的状态,还能用二分法定位 AI 的哪一步操作引入了问题。项目刚发布,正文没披露许可证、数据存储格式和具体安装步骤,目前只有 42 个星标和 2 ...

推荐理由:HKR 三条都站得住:Git 的类比让人一眼就懂,功能描述具体到删除追踪和 bisect,Claude Code 用户回退的痛点是真实存在的。不过正文没披露许可证、存储格式和安装方式,信息缺口明显,所以分数先打个折,放在 featured 这一档。

AI HOT 精选

OpenAI 公开自家怎么安全跑 Codex:沙箱隔离、人工审批、网络管控和代理日志四道防线

OpenAI 发了一篇技术博文,讲他们内部部署编程代理 Codex 时用的安全方案。核心是四件事:第一,用沙箱把代理的执行环境圈起来,低风险操作自动放行,高风险动作必须等人拍板;第二,网络访问不做全开放,只允许访问已知域名,陌生域名要审批;第三,身份认证强制走 ChatGPT 企业工作区,凭证存在系统钥匙串里;第四,代理的所有行为都通过 OpenTel...

推荐理由:我会先打个折:正文没给评测数据、事故率,也没说企业部署要满足什么条件,所以分数停在 74。但 HKR 三项都踩中了——OpenAI 把 Codex 的安全拆成沙盒、人工审批、网络策略和遥测四层,对做代码 agent 的人来说是能直接参考的架构思路。这点先别太激动,毕竟没看到跑分或实际事故记录,但作为安全方案框架,信息量够用。

机器之心 · 公众号

OpenAI 发布命令行工具,不用再折腾 SDK 了

OpenAI 开源了一个叫 openai-cli 的命令行工具,让开发者直接在终端里调用它的模型。你可以用一条命令完成对话、生成图片、编辑图片、语音转文字和文字转语音,不用再为复杂的 SDK 集成头疼。不过,这篇文章的正文因为微信环境验证被挡住了,具体支持哪些参数、怎么安装、有没有延迟数据,这些细节都没看到。

推荐理由:OpenAI 终于出了个官方命令行工具,开源,一行命令就能在终端里调模型、生图、转语音,不用再折腾各种 SDK 版本。对天天跟 API 打交道的开发者来说,这能省不少集成和维护的力气。不过这只是个工作流层面的更新,不是模型能力升级,所以重要性我给打个折,放在低 featured 档。正文没提性能对比或实际延迟数据,这点先别太激动。

AI HOT 精选

自适应并行推理:让模型自己决定什么时候分头干活

BAIR 这篇博客梳理了并行推理的最新进展,核心观点是:与其让外部规则替模型决定怎么拆分任务、开几个线程,不如让模型自己判断。文章介绍了 ThreadWeaver 和 Multiverse 两种方法,它们能让模型在解题时动态决定是否并行、开多少并行分支、以及如何汇总结果。相比传统的多数投票、树搜索或固定并行结构,这种自适应方式更省算力,也更贴合问题本身...

推荐理由:BAIR 的出身让这篇有基本可信度,HKR 三项都过关。文章把动态控制并行线程的机制讲清楚了,但我会先打个折:没给任何量化结果,也没说怎么复现,所以分数卡在 74 不动。这点先别太激动,等他们把延迟降幅和基准跑出来再说。

阮一峰的网络日志

软件开发的第三种方式:像老太太盖神秘屋一样用 AI 写代码

阮一峰这期周刊把 AI 辅助编程比作“神秘屋”式开发——没有整体规划,想到哪写到哪,代码层层堆叠,充满个性但外人看不懂。这种开发方式可能取代传统的大教堂和集市模式,成为个人和小团队的主流。另外介绍了一个叫 HN SOTA 的大模型人气榜,通过扫描 Hacker News 每天最热的 200 个帖子里对模型的讨论和好评来排名,本周前三名是 Claude ...

推荐理由:阮一峰这期周刊把 AI 编程总结成“第三种方式”,核心是“神秘屋”——你给需求,模型直接出结果,中间过程你看不到。这个说法比“低代码”或“辅助编程”更直白,也更容易让人理解为什么开发者会又爱又怕。HN SOTA 的榜单用每天 200 个 HN 热门话题来量模型人气,不是跑分,而是看社区讨论热度,算是一种接地气的 benchmark。整篇是评论性质,没有新模型或产品发布,所以重要性停在 72。HKR 三项都过:比喻够新、方法够简单、情绪够普遍。

AI HOT 精选

OpenAI 的 Codex 插件现在能在 Chrome 里跨标签页同时干活了

Codex 插件现在支持在 macOS 和 Windows 的 Chrome 上运行,可以跨标签页在后台并行处理网页和应用,不会抢走你对浏览器的控制权。正文没提具体版本号、同时能跑几个任务,也没说企业策略怎么管。想用的话,在 Codex 应用里装一下 Chrome 插件就行。

推荐理由:HKR-H/K/R 全过,但正文只给了平台和执行机制,版本号、并发上限、企业管控都没提。分数 76,算一个实用的 OpenAI Codex 产品更新。

AI HOT 精选

AI 代理生成的 PR 到处都是,GitHub 发了份审查指南

GitHub 这篇博客直接给了一套审查 AI 代理提交的 Pull Request 的方法。核心就三点:先看代码改了什么,别被大段生成代码吓住;再查逻辑漏洞和安全问题,因为模型容易写出看起来对但实际有坑的代码;最后在合并前把技术债清掉,别让自动提交把代码库搞乱。文章没给出具体的自动化检查工具,更多是人工审查的思路。

推荐理由:GitHub 这篇博客没推新模型或新功能,而是给了一份审查 AI 代理生成的 PR 的实操指南。我会先打个折:它更像经验总结,不是严格验证过的规范。但 3 个审查关注点——代码变更、逻辑/安全漏洞、合并前技术债——确实把“怎么审”拆成了能落地的步骤。对天天被 AI 提 PR 的工程师来说,这篇直接回应了“审不审得动”的问题,所以放在 featured 档位是合适的。

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

Hacker News 首页

AlphaEvolve:DeepMind 用 Gemini 驱动的编程智能体,号称能跨领域放大影响力

Google DeepMind 发了一篇博客介绍 AlphaEvolve,说它是一个由 Gemini 驱动的编程智能体(coding agent),已经在多个领域落地并扩大影响。正文只给了标题和导航栏,没有披露具体用了哪一版 Gemini 模型、跑了什么基准测试、在哪些场景部署、效果数据如何。我会先打个折:目前能确认的只有“这是个 Gemini 驱动的...

推荐理由:标题说 AlphaEvolve 是 Gemini 驱动的编码 Agent,要跨领域放大影响,但正文只有一句话,没披露模型版本、评测结果或落地场景。我会先打个折:DeepMind 起名就是信号,编码 Agent 本身也够热,所以 H 和 R 都过;但 K 过不了,因为除了标题没任何可验证的事实。分数停在 72,没到 78+,就是因为缺评测和部署细节。

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

AI HOT 精选

Amp 发布 Neo CLI,编程助手开始往“长链路、少盯屏”方向走

Amp 推出了新的命令行工具 Neo,核心变化是让编程助手从“人在旁边盯着”变成“扔给它自己跑”。Neo 支持远程控制本地线程、自动压缩上下文(不用再手动清理对话历史),并开放了 Plugin API 来扩展工具和交互方式。安全策略做了个大反转:默认允许所有操作,把安全把关交给插件系统。官方说 CPU 和内存占用也降了不少,但正文没给出具体版本号、价格...

推荐理由:Neo 把本地线程交给远程控制,默认允许所有操作,安全控制转嫁到插件系统,这个权限反转比功能更新本身更值得盯。远程编排和自动上下文压缩让 agent 能跑长链路任务,Plugin API 给了扩展空间,但正文没披露版本号、价格和性能降幅,实际省不省钱、稳不稳定还得等实测。Amp 的行业存在感加上信息缺口,把这条卡在 72–77 分区间,我会先打个折,别当成熟产品看。

机器之心 · 公众号

TACO 让命令行 Agent 自己学会扔掉没用的上下文

TACO 是一套不用额外训练的命令行输出压缩方法,让模型在执行任务时自己发现哪些终端回显是废话、哪些必须保留。它在 TerminalBench 1.0 和 2.0 上同时提升了任务成功率和 token 利用率,并发现 TerminalBench 2.0 的原始提示里有 24.6% 到 44.1% 的低价值冗余。核心机制是“任务内进化规则 + 全局规则池...

推荐理由:这篇论文解决的是终端 agent 上下文越跑越臃肿的老问题,方法很轻量——任务里生成纠偏规则,再存进全局规则池复用。TerminalBench 上的成功率提升和 token 效率改善都有数据支撑,24.6%–44.1% 的冗余比例和 >90% 的规则留存率是两个值得盯的指标。没有新模型或产品发布,属于扎实的 agent 工程研究,放在 featured 档合适。