跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1101–1120 条 · 共 1,195 条

4月15日星期三

X · @dotey(宝玉)

Claude Code 桌面端重写,现在能在一个仓库里同时跑多个编程任务

Anthropic 的 Claude Code 桌面端负责人说他们把应用从底层重写了一遍,主要为了让用户能更方便地并行处理多个编程任务。实现方式是用 Git worktree 给每个会话一个独立的代码副本,改完之前互不干扰,合并时再做可视化差异对比。负责人自称已经好几周没开过 IDE 和终端了。正文没提发布时间、性能数据和具体支持哪些平台,这点先别太激动。

推荐理由:这次 Claude Code 桌面端重构瞄准了一个很实际的场景:同一个仓库里同时开多个编程任务。用 Git worktree 做隔离,每个会话改自己的副本,合并前互不干扰,再配上可视化 diff 和预览,工作流是完整的。我会先打个折——正文没给发布时间、性能数据和具体支持平台,这些缺口让实际体验还不好判断。但光凭并行会话这个方向,对天天跟代码打交道的开发者来说,吸引力已经够了。

X · @claudeai

Claude Code 桌面版改版,一个窗口里能同时开好几个 Claude 会话干活

Anthropic 给 Claude Code 桌面版换了新界面,现在你可以在一个窗口里并排跑多个 Claude 会话,左边多了个侧边栏来管理这些会话。对写代码的人来说,这主要解决的是来回切窗口的打断问题——比如一边让 Claude 改后端,另一边让它写前端,不用再开好几个终端或 IDE 面板。正文没提具体推送时间、支持哪些平台,也没说多会话之间能不能...

推荐理由:Anthropic 官方发的产品更新,改动具体,直接关系到编码工作流里的上下文切换成本,所以 H、K、R 都成立。我会先打个折:没公布上线时间和平台覆盖,交互细节也缺,这让它的实际影响还看不全,所以分数压在 featured 门槛附近,不往上拔。

X · @op7418(歸藏)

Claude Code 推出 routines,把定时任务和事件触发搬上云端,电脑关了也能跑

Claude Code 新出的 routines 功能,让你把一套工作流——提示词、代码仓库、运行环境和外部连接器——打包成一个云端自动任务。支持按小时/天定时、HTTP API 调用,或者响应 GitHub 上的 PR、push、issue 等事件。每次触发都会在云端开一个完整的 Claude Code 会话,能执行 shell 命令、调用仓库里的技...

推荐理由:Claude Code 这次更新的 routines 功能,核心是把提示词、代码仓库、运行环境和外部连接器打包成一个可自动执行的云端任务。触发方式给了三种:定时、HTTP 请求和 GitHub 事件,每次触发都会拉起一个完整的云端会话,能执行 shell 命令、调用仓库内的自定义技能、访问外部服务,任务跑完后本地可以直接接手继续工作。这个设计思路是本地优先、云端接管重复劳动,对日常开发流程的侵入性低。我会先打个折:正文没提定价、配额限制和支持哪些平台,这些缺口让实际可用性还看不清,所以虽然方向对,但别急着全量切过去。

X · @dotey(宝玉)

Claude Code 加了个 Routines 功能,让 AI 按预设条件自动跑任务,不用人盯着

Routines 相当于给 Claude Code 写好的任务模板,接上代码仓库和外部工具后,靠定时、GitHub 事件或 API 调用就能在 Anthropic 云端自己跑。Anthropic 内部已经在用,比如代码合并到发布分支后自动生成文档更新。Pro、Max、Team、Enterprise 用户都能用,任务数量不限,但每天运行次数有上限,超出要...

推荐理由:这不是小修小补。Routines 把 Claude Code 往事件驱动的云端 agent 推了一步,3 种触发、套餐覆盖和用户身份执行都交代清楚了,所以 H、K、R 全过。没进 p1 是因为现在还挂着研究预览的标签,每日配额也没公布,我会先打个折。

X · @claudeai

Claude Code 推出定时任务功能,写好指令就能在云端自动跑,不用一直开着电脑

Anthropic 给 Claude Code 加了一个叫 routines 的研究预览功能。你可以一次性配好提示词、代码仓库和要对接的工具,然后让它按时间表、API 调用或事件触发自动执行。这些任务跑在 Anthropic 自己的服务器上,所以你的笔记本不用一直开着。正文没提怎么收费、有没有次数限制,也没说这个功能会推给哪些用户。

推荐理由:这次更新把 Claude Code 从本地交互式编程扩展到了托管、定时和事件驱动的执行模式,HKR 三项全中,Anthropic 的产品动态本身也有加分。但正文没公布价格、配额和具体开放范围,所以先放在 featured 而不是 P1。真正值得盯的是托管执行这条链路,不是单次补全功能。

4月14日星期二

X · @dotey(宝玉)

与其说 AI First,不如先把测试、CI/CD 和监控这些软件工程的基础搭好

这篇文章的核心判断是:AI First 不是买几个 AI 工具订阅就能跑通的,它首先是一道软件工程题。AI 两小时写完代码,如果审查、测试、部署、监控和回滚还得靠人慢慢排队,瓶颈就从写代码转移到了 QA 和运维,25 人的团队照样快不起来。作者列出了几个硬性前提:自动化测试覆盖得够,不然每次 AI 提交你都得人工回归;CI/CD 流水线要全自动跑通,代...

推荐理由:这是一篇从业者视角的评论,不是新闻事件。H 分给那个反直觉的标题翻转,K 分给具体的工程前提和适用边界,R 分给瓶颈转移的痛点论述。分数停在 75 左右,因为正文没有给出具体案例、一手测试数据或团队规模外的量化验证,更像经验判断。

X · @dotey(宝玉)

Vercel 开源 Open Agents:一个教你搭企业编程助手的参考项目,核心是把 Agent 和执行环境拆开

Vercel 把 Open Agents 开源了,这是一个给企业自建编程 Agent 的参考实现,可以直接 fork 走改。CEO 说现成编程 Agent 在大仓库里不好使,也不懂公司内部流程,所以 Stripe、Spotify 这些公司都在自己造。这个项目架构分三层:前端管会话和登录,Agent 作为持久化工作流跑着,沙箱提供隔离的代码执行环境。一个...

推荐理由:Vercel 开源的这个 Open Agents 不是又一个套壳工具,它把 Agent 和沙箱拆开,Agent 通过文件读写、Shell、搜索这些工具远程操作沙箱,而不是驻留在里面。这个设计是当前编程 Agent 基础设施的共识方向,不是包装差异。正文还给了三层架构和 Anthropic 的定价数字,让成本有据可查。我会先打个折:它是个参考实现,不是开箱即用的产品,但架构思路和定价信息对正在选型的企业团队有直接参考价值。

最佳拍档

斯坦福论文:让 AI 自己写外挂代码,Meta-Harness 用完整历史记录教 coding agent 迭代优化

斯坦福、MIT 和 KRAFTON AI 搞了个叫 Meta-Harness 的系统,核心想法很简单:别让工程师手动调那层包裹在大模型外面的代码逻辑(harness),而是把这件事变成一个搜索问题,交给 coding agent 自己去翻历史记录、自己改代码。它跟现有文本优化方法最大的区别是不压缩反馈信息,所有候选代码、完整执行日志和评分都摊在文件系统...

推荐理由:这篇把 harness 优化从人工调参改成外循环搜索,让 coding agent 读文件历史、跑代码、看日志,不压缩反馈。我会先打个折,因为来源是 YouTube 解读而非原论文,但给出的数字够具体:TerminalBench-2 跑 20 轮要几百美元,在线文本分类 4 轮就顶别人 60 轮的效果。对做 agent 工程的人,这个思路比单纯改 prompt 更解渴,所以放在 featured 档。

4月12日星期日

X · @Yuchenj_UW

MiniMax 开源 M2.7,并公开了用模型自己跑研发流程的实验结果

MiniMax 把 M2.7 开源了,同时发了一篇博客讲他们怎么让模型参与自己的研发。他们做了两件事:一是搭了个研究助手 agent,帮研究员查文献、盯实验流程、看日志、改代码、提 merge request,现在能扛起 30% 到 50% 的研发工作量。二是让 M2.7 自己改自己的测试脚手架,全自动跑了 100 多轮,内部代码评测涨了 30%。博客...

推荐理由:MiniMax 把 M2.7 开源了,同时扔出一个挺敢说的数字:他们内部的研究代理已经扛了 30% 到 50% 的研发流程。具体怎么干?代理自己查文献、排实验、看日志、修代码、提合并请求,还在内部脚手架里自己改 harness,自动循环了 100 多轮,内部编码评测涨了 30%。我会先打个折——正文没披露许可证、仓库地址、基准测试上下文,也没说外部能不能复现,所以这些数字目前只能当内部说法看。但即便打对折,代理能稳定吃掉三成研发流程,这个信号也够强了。

4月11日星期六

X · @dotey(宝玉)

OpenAI Codex 工程师:别反复给 AI 喂脏数据,给它造几个专用命令行工具

OpenAI Codex 团队的 Nick Baumann 分享了一个干活技巧:与其每次把文档、日志、API 输出整坨丢给 AI 去啃,不如把常用操作封装成带参数、输出 JSON 的 CLI 命令。Codex 本身就擅长用命令行,会自己搜命令、加 flag 筛选、把上一个命令的结果串到下一个,不需要你教它怎么调。他自己日常用三个自建工具:codex-t...

推荐理由:这是 OpenAI Codex 团队成员写的日常心得,不是正式发布,但提供了一个很实用的机制:把杂乱的日志、文档、API 输出包成带参数、返回 JSON 的 CLI 命令,让模型去调这些窄接口,而不是直接读原始数据。文章给了三个他自用的工具,教程和 skill 也放到了开发者文档里。没有基准测试、规模数据或重大产品更新,所以分数打 75。

X · @dotey(宝玉)

Anthropic 发布 Claude for Word 插件测试版,直接在 Word 侧边栏改文档

Claude 现在能直接嵌进 Word 干活了。选中文字用自然语言说怎么改,修改结果会以 Word 原生的“修订模式”呈现,接受或拒绝都在审阅面板里完成,不用再把内容复制到网页端来回倒。它会识别标题样式、编号和项目符号,改完格式不乱。你还可以上传参考文档,写作时标注引用来源。团队能把反复用的工作流(比如合同审查)封装成 Skill,一键复用。这个插件和...

推荐理由:这是 Anthropic 面向 Team 和 Enterprise 的一个有料的产品更新,不是泛泛的集成公告。HKR 三项都踩中了:钩子够直接、机制有细节、卡位也准。但我会先打个折——目前只是测试版,正文没披露定价、地区和正式发布时间,所以热度先控在中等偏上。

X · @dotey(宝玉)

Claude Code 新增 ultraplan:在终端发起规划,去浏览器审阅批注,再决定云端或本地执行

Claude Code 推出了 ultraplan 预览功能,把代码规划从终端搬到了浏览器。你在终端输入 /ultraplan 加需求描述,Claude 会在云端读代码库、起草实现方案,终端不占着,你可以干别的。方案写好后在浏览器里打开,像审文档一样对具体段落加批注、打表情、反复改到满意。最后二选一:让云端直接执行并开 PR,或者把方案拉回本地终端跑。...

推荐理由:Claude Code 这次更新不是加个小功能,而是把规划从执行里拆出来。你在终端敲 /ultraplan,Claude 去云端读代码库、出方案,你在浏览器里像改文档一样批注修改,满意了再决定让云端直接跑完开 PR,或者拉回本地终端自己跑。规划阶段终端不卡住,正文说 token 消耗跟本地 plan 模式差不多,这点先别太激动,等实测数据。目前还是预览版,只对开网页版的用户开放,正文没披露云端规划的实际延迟和成功率。

X · @claudeai

Claude 出了 Word 插件,现在可以在侧边栏直接写稿、改稿

Anthropic 把 Claude 塞进了 Word,目前是测试版。你在文档侧边栏就能让它帮你起草、编辑和修改内容,Claude 会保留原有格式,改动以修订模式显示,方便你逐条确认。这个功能只开放给 Team 和 Enterprise 用户,正文没提价格、支持地区,也没说什么时候正式上线。

推荐理由:这是个有用但分量中等的 Anthropic 产品更新。官方帖子确认了 Word 侧边栏入口、Team 和 Enterprise 方案可用、保留原有格式并以修订模式显示改动,所以 K 和 R 都站得住。但价格、地区和具体上线时间都没说,信息缺口明显,只能放在 featured 的低位。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。

量子位 · 公众号

腾讯开源3B模型HiVG,用“分段打包”把SVG序列缩短六成,生成质量对标GPT和Claude

腾讯混元放出了一个30亿参数的开源模型HiVG,专门把图片转成SVG矢量图。它的核心思路是把绘图指令和坐标打包成“段token”,再用一个叫HMN的模块给坐标编码做初始化,让模型更懂几何关系。这样生成的SVG代码序列比传统方法短了62.7%到63.8%,省token就是省钱。在Image-to-SVG任务上,它的SSIM达到0.896、LPIPS低到0...

推荐理由:腾讯混元把 3B 小模型做到 SVG 指标能跟 GPT-5.2、Claude-4.5-Sonnet 掰手腕,靠的不是堆参数,而是把绘图命令和坐标打包成 segment token,再用 HMN 初始化坐标 embedding,序列长度直接砍掉六成多。文章给了 SSIM、LPIPS、CLIP-S 三组数,信息量够,不是空口说白话。不过 SVG 生成本身偏小众,离多数人的业务场景还有点距离,所以 novelty 和 knowledge 都到位,但 relevance 只能算一般。

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

4月9日星期四

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

4月8日星期三

量子位 · 公众号

DeepSeek 深夜更新网页版,新增快速和专家模式,灰度测试视觉模型

DeepSeek 网页版悄悄加了两个模式:快速模式主打日常对话,专家模式则专攻代码、网页搜索和更难的生成任务。有用户通过对话套话,模型自己说专家模式就是 V4,但官方没发公告,正文也没披露模型 ID、上下文规格、定价和发布时间,这点先别太激动。目前专家模式限量供应,不支持多模态和文件上传,有用户测出上下文上限大约 13.3 万 token。另外,视觉模...

推荐理由:我会先打个折:V4 这个说法目前只有网友实测和模型自述,官方没确认模型名、价格和上下文窗口,这点先别太激动。但文章把能复现的行为讲清楚了——专家模式偏代码和复杂生成、限量、不能传文件,还给了约 133K token 的长度上限,对实际用的人有参考价值。真正该盯的是官方后续会不会补参数和上下文说明,现在信息缺口不小。

X · @dotey(宝玉)

Anthropic 发了 Claude Mythos Preview,跑分断崖式领先,但不公开用,只借给 12 家大厂找漏洞

Anthropic 的新模型 Claude Mythos Preview 在 SWE-bench Verified 上拿到 93.9%,USAMO 数学证明冲到 97.6%,比自家上一代旗舰 Opus 4.6 提升巨大,对比 GPT-5.4 和 Gemini 3.1 Pro 也是全面领先。但 Anthropic 不开放 API 和公开访问,理由是模型自...

推荐理由:这条帖子抓人的点不在跑分第一,而在 Anthropic 把 Mythos Preview 锁死给苹果、微软等 12 家合作伙伴做漏洞挖掘,普通用户和 API 都用不上。我会先打个折:帖子本身是 X 上的二手总结,没贴官方公告链接,也没列全 12 家名单,所以重要性停在 84 不往上提。但 SWE-bench 93.9%、USAMO 97.6% 和 244 页系统卡这些数字够具体,1 亿美元额度和 400 万美元捐赠也说明 Anthropic 在安全分发上下了本钱。对从业者来说,真正该盯的是高危能力被封闭分发这件事,而不是又一个 benchmark 冠军。

X · @AnthropicAI

Anthropic 启动 Glasswing 项目,用新模型 Claude Mythos Preview 找关键软件漏洞

Anthropic 发了个新项目叫 Project Glasswing,专门盯着最关键的软件做安全加固。背后用的是他们最新的前沿模型 Claude Mythos Preview,官方说它找漏洞的能力仅次于最顶尖的人类专家。不过正文没给出具体跑分、测试范围、怎么申请试用,也没说什么时候正式开放,所以实际效果还得等可复现的评测出来再看。

推荐理由:这篇 Anthropic 一手公告,标题和摘要确认了 Project Glasswing 和 Claude Mythos Preview 两个名字,说能力仅次于顶尖人类专家,但正文没披露任何可复现的评测数据、软件范围或接入细节。我会先打个折:真正该盯的是他们后续会不会放出基准分数和第三方验证,现在只能当个方向性信号看。