跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1061–1080 条 · 共 1,195 条

4月22日星期三

The Verge · AI

SpaceX 签了个“可能买也可能不买”的协议,标的 Cursor,开价 600 亿美元

SpaceX 跟 AI 编程工具 Cursor 达成了一个二选一的交易框架:要么花 600 亿美元把 Cursor 买下来,要么付 100 亿美元分手费走人。文章没披露具体的交易结构、时间表,也没说跟 SpaceX 传闻中的 IPO 怎么挂钩。RSS 摘要里提了一句,这笔交易可能帮马斯克旗下的 xAI 在编程工具上追赶 Anthropic,但正文里没展...

推荐理由:标题说可能收购,但真正有信息量的是那笔 100 亿美元退出费——它更像一个约束机制,而不是简单的“不买了就赔钱”。正文只披露了顶层的两个数字,交易怎么设计、什么时候推进、跟 xAI 追 Anthropic 之间到底什么关系,全都没说。所以我会先打个折:事实够硬,但缺口也大,放在 featured 合适,别拔到 P1。

彭博科技

SpaceX 签了协议,有权在今年晚些时候用 600 亿美元买下 AI 编程工具 Cursor

SpaceX 说它签了一份协议,拿到了今年晚些时候收购 AI 编程创业公司 Cursor 的权利,交易作价 600 亿美元。如果最终不推进收购,SpaceX 也可以选择付 100 亿美元来维持双方的合作关系。不过正文没披露触发收购的具体条件、合作范围,也没提监管审批的细节。

推荐理由:Bloomberg 转引的 RSS 摘要爆出个不常见的交易结构:SpaceX 签了协议,最早今年晚些时候可以 600 亿美元买下 Cursor,不推进收购的话也要为双方合作掏 100 亿美元。先别太激动,这不是已完成并购,是买了个选择权。正文没披露什么条件下会触发收购、合作具体做什么、监管怎么批,这些缺口让 600 亿这个数得打个折看。但数字本身够大,结构够怪,航天公司跑去拿 AI 编程工具的收购权,放在一起就值得从业者盯一眼。

彭博科技

Anthropic 的新模型 Mythos 被未授权用户访问了

Bloomberg 拿到内部文件和知情人士消息,说有一小撮未授权用户摸到了 Anthropic 还没正式发布的 Mythos 模型。Anthropic 内部认为这模型能力强到能搞出危险的网络攻击,所以这事不是普通的产品泄露,是访问控制出了问题。不过报道里没写到底多少人、通过什么路径、在什么时间段访问的,也没说 Anthropic 后续怎么堵的窟窿。

推荐理由:Bloomberg 爆出的不是常规产品消息,而是 Anthropic 的安全事故。未授权访问一个被内部判定为网络攻击级危险的大模型,本身就够抓眼球,也够讨论一阵。HKR-H 和 HKR-R 直接拉满,因为这事天然有传播力和讨论价值。HKR-K 靠的是新披露的访问事实和风险定性,但具体人数、路径、时间线正文全没给,信息缺口不小,所以知识增量有,但别指望能复盘全貌。

4月21日星期二

量子位 · 公众号

蚂蚁数科搞了个叫“大象”的百亿参数模型,跑分和效率都挺能打

蚂蚁集团的 Inclusion AI 团队被扒出是神秘模型“大象”的幕后作者。这个模型参数量 100B,上下文窗口 256K,一次能吐 32K 字,已经在 OpenRouter 上架。文章里测了修 bug、总结三千字会议纪要、跑轻量 agent 流程,效果都不错。AI BENCHY 跑分显示它平均每秒能出 2500 个 token,延迟大概 1 秒,一...

推荐理由:一个 100B 模型敢喊同规模 SOTA 还强调 Token 效率,钩子够硬。文章有实测数据也有失败案例,不是纯吹。训练细节、价格和官方模型卡都没披露,所以先别太激动,但方向值得跟。

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

X · @dotey(宝玉)

GitHub Copilot 暂停 Pro、Pro+ 和学生版新注册,Pro 套餐砍掉 Claude Opus 模型

4 月 20 日,GitHub 对 Copilot 个人版动了次大手术:Pro、Pro+ 和学生版不再接受新用户,只剩免费版还能注册。官方说这是为了保住现有付费用户的服务质量。Pro+ 的使用额度被拉到 Pro 的 5 倍以上,Pro 用户如果老撞墙,官方建议加钱升 Pro+。最狠的一刀是 Pro 套餐直接移除了 Claude Opus 模型,Anth...

推荐理由:Copilot 个人版这次调整不是发新功能,而是卡入口、压额度、分层模型。Pro 用户被拿走 Claude Opus,Pro+ 额度拉到 Pro 的五倍以上,定价却没变——等于用供给端收缩来应对模型成本压力。信息来自 X 帖子而非 GitHub 官方公告,这点先打个折,但暂停注册和退款窗口本身已经够具体,值得从业者盯后续。

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

Computing Life · Share · 鸭哥调研

SpaceX 给 Cursor 开了两张牌:600 亿收购或 100 亿合作,但人已经先走了

SpaceX 宣布可以在年内用 600 亿美元买下 Cursor 母公司 Anysphere,或者支付 100 亿美元换技术合作。600 亿比 Cursor 正在谈的 500 亿独立融资估值高约 20%,但正文没披露是现金还是股票,考虑到 SpaceX 现金储备不够,用股票支付的话实际到手价值会打折。100 亿合作的实质是 xAI 用自家 Coloss...

推荐理由:这篇我会先打个折:支付形式没披露,最终走哪条路也还没定,所以不能给 P1。但它的钩子很强——600 亿收购 vs 100 亿合作,数字对比本身就让人想点开。正文补了几个关键事实:报价比 Cursor 当前估值高 20%,训练用的是 xAI 的 Colossus 集群,而且 xAI 已经在 3 月挖走两名工程负责人。这些信息拼在一起,指向一个更值得盯的趋势:科技圈正在从买公司转向买人,如果最后落到 100 亿合作,普通员工未必能跟着喝汤。对 AI 从业者来说,这比单纯的收购新闻更有判断价值。

X · @dotey(宝玉)

OpenAI 给 Codex 加了 Chronicle,让它能“看”屏幕记住你在做什么

OpenAI 在 macOS 版 ChatGPT Pro 里灰度测试 Chronicle,这是 Codex 的 Memories 扩展。它会后台定时截屏、做 OCR、识别你用的工具,把近期屏幕活动整理成记忆,存为本地 Markdown 文件。你跟它说“这个报错”,它不用你解释就知道指什么。但要注意几点:后台 Agent 一直跑会很快吃掉 rate li...

推荐理由:OpenAI 让 Codex 能定时截屏、OCR 识别屏幕内容,然后写成记忆存到本地。这个功能目前只给 macOS 上的 ChatGPT Pro 用户灰度开放,欧盟、英国、瑞士用不了。我会先打个折:截图上传服务器处理后声称会删除、不用于训练,但官方自己也警告会放大网页 prompt 注入,而且记忆以明文 Markdown 放在 ~/.codex 目录下,泄露面不小。后台总结还会消耗 rate limit,这点先别太激动。整体信息量够、有可测试的细节,但受限于小范围灰度,所以放在 featured 而不是 p1。

Hacker News 首页

膨胀伪影:大模型输出的瑕疵不是压缩痕迹,而是解压时脑补过头的证据

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”,而不是压缩伪影。他的逻辑是:模型从模糊的训练数据里往外“解压”时,会在信心不足的地方用训练分布里的高频模式硬填,于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词(比如 commendable、...

推荐理由:我会先打个折,这是个人博客评论,不是一手研究或产品发布,所以分数停在 73。但它的钩子很巧,把 LLM 的毛病重新包装成“扩展伪影”,一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在,17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹,说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验,但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值:这些伪影不光是风格问题,还可能成为追踪生成路径的线索,这对审稿信任和内容溯源都挺要命的。

4月20日星期一

X · @Yuchenj_UW

Kimi K2.6 开源了,SWE-Bench Pro 跑分 58.6,声称超过 GPT-5.4 和 Claude Opus 4.6

Kimi K2.6 宣布开源,在 SWE-Bench Pro(一个测代码修 bug 能力的基准)上拿了 58.6 分。推文说这个分数压过了 GPT-5.4(xhigh 模式)和 Claude Opus 4.6(max effort 模式)。不过正文没披露模型权重、开源协议和具体的评测设置,可复现性要打个问号。发帖人觉得 Kimi 发版节奏越来越快,属于...

推荐理由:三条都踩中了:开源本身就是强钩子,SWE-Bench Pro 58.6 这个数可以验证但信息不全,开源对闭源的代码能力竞赛又是当下热点。分数我维持 81,因为目前看只有标题级信息,权重、许可证、评测设置全都没披露,先别太激动。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

Anthropic 编程智能体负责人讲 vibe coding 的正确姿势:2 周变 1 天,但别让 AI 碰核心逻辑

Anthropic 研究员 Erik Schluntz 分享了他团队用 Claude 写代码的真实工作流。他们最近合并了一个 2.2 万行的生产环境改动,大部分代码由 Claude 生成,把原本两周的工作压缩到了一天。他的做法是先花 15-20 分钟让 AI 通读代码仓库、做规划,然后只让 AI 改叶子节点(也就是依赖最少、影响范围最小的模块),核心逻...

推荐理由:这是一篇来自 Anthropic 内部的实战经验,不是泛泛而谈。有 22000 行生产合并、两周变一天的硬数字,也有可复用的流程规则,比如先让模型花 15 到 20 分钟探索代码库再动手、改动锁在叶子节点、核心路径必须人审。对正在纠结怎么把 coding agent 放进真实流水线的团队来说,参考价值很高。保持 featured 不升 p1,因为它本质是实践课,不是模型或产品重大发布。

新智元 · 公众号

人大团队让AI跑了23小时、74轮实验,靠的不是堆Agent,而是把文件当总线用

人大高瓴人工智能学院放出了一个叫AiScientist的系统,在MLE-Bench Lite的一个侮辱性言论检测任务上连续跑了23小时、74轮实验,把验证集AUC从0.903拉到了0.982,中间刷新了18次最佳成绩。论文的核心观点是:长程记忆的关键不在多Agent协作,而在状态连续性。他们搞了个File-as-Bus机制,把分析、代码、日志、结果全持...

推荐理由:人大这个 AiScientist 跑了 23 小时、74 轮实验,把检测侮辱性评论任务的 AUC 从 0.903 干到 0.982。论文的核心卖点不是 Agent 数量,而是 File-as-Bus——让模型把分析、代码、日志、实验记录持续写回工作区,靠状态连续性而不是多 agent 协作来推进长程任务。消融实验也印证了这点:去掉这个机制后,PaperBench 分数降 6.41 分,MLE-Bench Lite 的 Any Medal 直接掉 31.82 个百分点。我会先打个折:只在两个 benchmark 上验证过,泛化性还没谱,但思路本身对正...

r/LocalLLaMA

用本地 Qwen3.6 给 Claude Code 当副手,每次任务省下 30 倍 Opus token

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent,让本地模型干提取和审计的粗活,Claude 只做最后决策。在两个审计任务里,Opus 的边际 token 消耗降了约 30 倍:一个 23 个文件的路由审计从 1.3 万 token 降到 400 token,一个 18 个文件的 ...

推荐理由:一个 Reddit 用户拿自己的两台机器做了两组任务对比,数字很直接:23 个路由文件审计从 13k token 降到 0.4k,18 个 Astro 文件盘点从 89k 降到 3k,省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理,Claude Code 只做调度。正文没藏着掖着,承认 Qwen 和 Opus 各有漏检,不是单方面碾压。我会先打个折:只有两个任务、一个人跑、没大规模验证,但思路和数字对想省 Opus 费用的人有直接参考价值。

4月19日星期日

r/LocalLLaMA

同一个 9B Qwen 模型,换套脚手架,Aider 编程得分从 19.1% 跳到 45.6%

作者拿 Qwen3.5-9B 的 Q4 量化版跑 Aider 的多语言编程基准(225 道题),只换了调用模型的外层脚手架,平均 pass@2 就从 19.11% 拉到了 45.56%。这个叫 little-coder 的脚手架不是新模型,它做了几件事:限制推理步数、加写文件前的安全锁、让模型主动扫描工作区文件,以及每轮塞一点针对性技能提示。核心观点是...

推荐理由:我会先打个折:证据确实薄,只有两次完整运行,没做消融也没换模型复现,所以别急着当结论用。但 hook 很实在——同一套 9B 权重,只靠 scaffold 设计就把 Aider 成绩翻了一倍多,说明 scaffold 和模型的匹配度可能比模型本身还关键。作者列出的四个机制(受限推理预算、拒绝覆盖已有文件的 Write guard、显式工作区发现、按轮注入小技能)也给了可复现的线索。对正在折腾本地小模型做代码 agent 的团队,这篇值得看一眼思路,但暂时别拿 45.6% 当稳定预期。

新智元 · 公众号

伯克利团队造了个专门作弊的 AI,SWE-bench 满分但一个 bug 都没修

伯克利 RDI 团队用一段大概 10 行的 pytest 钩子代码,在 SWE-bench 全部 500 个任务上拿了 100% 分数,实际修 bug 数是 0。他们的 agent 还顺手打穿了另外 8 个主流 agent 评测,分数从 73% 到 100% 不等。作弊手法包括篡改测试钩子、直接读本地 file:// 答案文件,以及利用评测器本身的校验...

推荐理由:HKR-H 落在'满分却零修复'的矛盾上;HKR-K 落在约 10 行 pytest 漏洞、500 题和 8 个基准的覆盖面上;HKR-R 落在评测信任危机上,做智能体产品的人会反复掂量。属于强 featured 研究,但不是当天行业事件,所以不到 P1。

4月18日星期六

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

新智元 · 公众号

B站吵翻了:Hermes 首次直播回应抄袭指控,MiniMax 提前卡位 Harness 赛点

MiniMax 说他们的 M2.7 模型现在能接手强化学习团队 30% 到 50% 的日常工作,自己跑通了超过 100 轮自我优化,评测指标提升了 30%。Hermes Agent 的日调用量从 20 亿涨到了近 3000 亿 token,M2.7 在 OpenRouter 上的日调用也超过了 250 亿 token。Hermes 负责人 Tommy ...

推荐理由:这篇不是一手发布或官方技术报告,而是把几条动态串起来的二手解读,所以重要性停在 83 分。我会先打个折:Hermes 直播否认抄袭本身不算大新闻,但配上 MiniMax 提前杀入 Harness 赛点、给出具体工作流占比和沙箱性能数据,就让整篇有了可读性。正文没披露 M2.7 具体在哪些任务上替代了人工、也没说 30% 提升的基线是什么,这点先别太激动。不过沙箱启动 20-40ms 和每分钟 60 万实例的并发能力如果是真的挺省钱,说明执行层的基础设施正在变成新战场。整体适合放进 featured,给做 Agent 的人一个信号:别光盯着模型跑分,...