跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 261–280 条 · 共 1,195 条

8月14日星期五

AI HOT 精选

DeepSeek V4 Pro 上线硅基流动,支持 100 万 token 上下文,给了三档推理强度可选

硅基流动现在可以直接用 DeepSeek V4 Pro 了,首发当天就接入了。模型上下文窗口拉到 100 万 token,差不多能一次吞下三本《三体》的量。它把推理强度分成低、高、最大三档,你可以按任务复杂度自己选,主要面向写代码、调工具和让模型进业务流程干活的场景。模型还是 MIT 协议开源的。价格方面,输入每百万 token 1.32 美元,输出 ...

推荐理由:DeepSeek V4 Pro 首发当天硅基流动就接入了,100 万 token 上下文、三档推理强度、MIT 开源、输入每百万 token 1.32 美元,信息密度够高。没给 85 分以上是因为这只是平台上线公告,还没有实测跑分或用户反馈,先别太激动。

AI HOT 精选

有人让 Claude 接管了日常代码维护,几周自动开了 388 个 PR

Boris Cherny 把应用的日常维护丢给 Claude 去跑,通过 Slack 频道让它自动做崩溃模糊测试、重复代码统一、死代码清理这些活。几周内 Claude 开了 388 个 PR,其中 180 个经过它自己 Code Review 和人工审核后合进去了。大部分时候一次就改对,偶尔翻车的话,调一下例行任务的描述,第二天就能修正。

推荐理由:Boris Cherny 的第一手实验,有具体数字和可复现流程,不是公关稿。Claude 做维护不算行业地震,但 388 个 PR 的规模让它在同类实验里很突出。没给更高分是因为正文对失败案例的细节披露有限,只说'偶尔翻车调一下描述就能修正',没展开翻车类型和比例。

Hacker News 首页

理解成了新瓶颈:为什么你还是要读 agent 写的代码

Geoffrey Litt 在 AI Engineer 大会上的演讲里抛出一个观点:就算 agent 写代码越来越强,人还是得看懂它在干什么。不是为了挑错——agent 自己会越来越擅长验证——而是为了能继续参与创作。一个项目要跟 agent 来回好多轮,你对系统的理解直接决定你下一轮能不能想出好点子。他把这叫做“认知债”,跟技术债一样,短期不还没事,...

推荐理由:Geoffrey Litt 在 AI Engineer 大会上的演讲整理,不是产品发布或论文,所以上限给到 78。核心观点是 agent 写代码越强,人越需要看懂,不是为了挑错,是为了能继续想出新点子。他把这叫做“认知债”,跟技术债一样会累积。这个框架对天天用 agent 的开发者很实在,不是泛泛而谈。正文是个人博客转录,没有产品指标或实验数据,所以分数没往上拉。

AI HOT 精选

Google DeepMind 发布 Gemini 3.7 Flash,一个专为写代码和跑智能体任务设计的轻量模型

Gemini 3.7 Flash 是 Google DeepMind 新推出的轻量级模型,定位是给开发者当“干活主力”,主要用在代码生成、工具调用和长上下文任务上。官方说它在这些方面比前代有明显提升,延迟更低、成本也更友好。不过这篇公告没给出具体的跑分数据和定价,只说会通过 Google AI Studio 和 Vertex AI 开放。我会先打个折,...

推荐理由:Google DeepMind 发了个新轻量模型,定位清晰,但公告里缺了跑分和定价这些关键信息。产品更新本身值得关注,可数据不全,没法给更高分。

8月13日星期四

AI HOT 精选

阿里开源 Qwen3.8-2.4T-A95B,硅基流动当天就接上了

阿里放出了一个总参数 2.4T、激活参数 95B 的 MoE 模型,主要想干自主编程、深度研究和让模型直接跑完整业务流程这些事。硅基流动在发布当天就上线了 API,输入每百万 token 2 美元,输出 6 美元,缓存输入 0.25 美元。正文没给任何跑分或架构细节,所以性能到底怎么样还得等第三方评测,先别急着上头。

推荐理由:阿里把 Qwen3.8-2.4T-A95B 开源,硅基流动当天就接上了 API,动作很快。2.4T 总参、95B 激活的 MoE 架构,体量上直接对标 DeepSeek V4 Pro 那个级别,而且明确冲着自主编程和 agent 场景去,信号很强。价格也直接给了,输入 2 美元、输出 6 美元、缓存 0.25 美元,不算离谱。但正文没披露任何 benchmark 或架构细节,性能到底怎么样完全没底,这点先别太激动,等第三方跑完分再说。

AI HOT 精选

Cursor 推出 builds 功能:云智能体启动速度提升至 3 倍

Cursor 现在会每小时在后台自动把代码仓库克隆好、依赖装好,提前做成一个“就绪环境”。当你启动云智能体时,它直接从这个环境启动,不用再等几分钟的冷启动,响应速度最多能快 3 倍。如果某次构建因为依赖更新或配置错误失败了,系统会自动隔离这个坏版本,智能体会继续用上一次成功的环境,不影响干活。Faire 公司每周跑 2000 多次自动化智能体任务,大仓...

推荐理由:Cursor 把云智能体冷启动从分钟级压到秒级,靠的是后台预构建环境和自动回退,不是空喊口号。Faire 每周 2000 次任务给了具体锚点。没给 p1 是因为这属于体验优化,不是模型能力跃升,但确实解决了高频痛点。

AI 群聊日报

闭源模型的推理过程被批量扒光,Coze CLI 偷偷劫持本地 AI 工具

今天最值得看的是闭源模型的加密思维链被大规模提取。研究人员发现,把 Claude Opus 4.8 的加密推理块直接扔给同厂的 Haiku 4.5,后者就能逐字解码。这个方法在 Claude、GPT、Gemini 三家的 API 上都跑通了,用 Haiku 解码一万条轨迹的成本大概是 720 美元。另一篇论文更狠,说就算不接触加密块,光看模型公开输出的...

推荐理由:这条信息来自群聊日报,属于二手摘要,但信号很强:三篇论文指向同一个问题,且给出了可复现的方法和成本。我会先打个折,因为原文没披露具体实验细节和样本量,但核心判断——加密思维链可被跨模型解码——有足够的事实支撑。对从业者来说,这比一般的模型能力更新更值得警惕。

Latent Space

xAI 发布 Grok 4.6 和 Grok Bot,AI 同事赛道来了个狠角色

xAI 一口气发了两个东西:新模型 Grok 4.6,和一个能直接登你的工具、像人一样操作、最后交活儿的早期测试版 Grok Bot。Grok 4.6 是个 1.5 万亿参数的模型,在 AA-Briefcase 这个知识工作基准测试里,分数跟 GPT-5.6 Sol Max 差不多,但便宜一大截:输入每百万 token 2 美元,输出 6 美元。训练上...

推荐理由:Grok 4.6 在知识工作基准上追平 GPT-5.6 Sol Max,价格却砍到零头,这个性价比信号很强。同时发布的 Grok Bot 直接杀进 AI 队友战场,背后是前 Cursor 团队,早期口碑还行。没给更高分是因为 Bot 还在早期测试,正文没披露具体完成率和稳定性数据,实际干活能力得再观察。

Computing Life · Share · 鸭哥调研

DeepSeek 开源 DSH:把 agent 的控制循环做成了可热插拔的插件,为 AI 自进化铺路

DeepSeek 在 8 月 13 日开源了它的第一个 agent harness,叫 DSH。它跟 Codex、Claude Code 这些现有工具最大的不同,是把 agent 的核心控制循环(agent loop)本身做成了一个可以在运行中随时替换的插件。这意味着,AI 在干活时不仅能调用新工具,理论上还能给自己换一套全新的思考或协作流程。为了支撑...

推荐理由:DSH 把 agent 的控制循环做成了运行时可替换的插件,这确实是个架构层面的新想法,不是营销话术。但这篇文章是第三方分析,不是官方发布,DSH 目前也没有任何生产环境的验证记录,所以按规则先打个折,归到较低一档。

AI HOT 精选

AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

AutoGPT 项目现在超过 60% 的拉取请求来自 AI 工具。维护者 Reinier van der Leer 在仓库里放了一个 AGENTS.md 文件,给 AI 贡献者立规矩,还加了技能门控:只有通过代码格式检查和单元测试的 AI 代理才能提交代码。垃圾 PR 数量大幅下降,但正文没披露有多少人类贡献者被误拦了。

推荐理由:AutoGPT 维护者的一手经验,有硬数字(60% AI PR)和两套可复现的机制。缺点是正文没披露多少人类贡献者被误拦了,而且只是单个项目的案例,能不能推广到别的项目还不好说。

AI HOT 精选

阿里首次把 Qwen-Max 级别的模型权重放出来了,总参数 2.4 万亿,每次只激活 950 亿

阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B,这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构,总共 2.4 万亿参数,但每次计算只激活其中的 950 亿,所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文,能一口气处理整本小说,还能扩展到 101 万 token。训练时加入了多 to...

推荐理由:阿里第一次把云端旗舰模型完整开源,2.4T MoE、激活95B、原生256K上下文,这几个指标放在一起分量很重。三个维度都踩中了:头部大厂罕见动作、技术上有具体新东西、对国内开发者生态有直接拉动。没给更高分是因为目前只有公告,还没看到第三方实测跑分和实际部署反馈,我会先打个折,等社区验证了再往上调。

TechCrunch · AI

Lovable 完成 4 亿美元 C 轮融资,估值冲到 133 亿

Lovable 这家欧洲做“一句话生成应用”的初创公司,刚确认拿了 4 亿美元 C 轮,估值 133 亿美元,由 Menlo Ventures 和 Scaleup Europe Fund 领投。今年 6 月他们年化收入(ARR)刚摸到 5 亿美元,平台上现在挂着 6000 万个项目,每月访问量 9 亿。公司还自己训了个模型,不再只靠接别人的大模型,6 ...

推荐理由:Lovable 这轮 4 亿美元 C 轮、估值 133 亿,加上半年内 ARR 从零头翻到 5 亿,还亮出了自训模型这张牌,是个有料的融资故事。放在 featured 合适——数字够硬,自训模型也加了点区分度,但还没到炸裂到必须头条的程度。

8月12日星期三

Hacker News 首页

AI 正在抹掉软件工程师的“中产阶层”

作者用 2020 年休假回来代码库变乱,对比 2026 年一个普通周一早上就冒出 7 个 PR、其中一个改动 2.4 万行代码的场景,指出 AI 把做烂决策的速度限制彻底拆掉了。现在任何人都能对着智能体敲几小时提示词,产出一套看起来能跑的东西,但没人说得清数据从哪来、为什么加了 Kafka。修复一个烂摊子远比生成它难,而你还在修的时候又有五个新坑合进来...

推荐理由:一篇有具体场景和数字的一线工程观察,不是那种“AI 将取代开发者”的泛泛而谈。三个维度都踩中了,但本质是个人博客评论,不是产品发布或研究突破,所以分数落在 78 这个区间。没有跨源验证的需求。

AI HOT 精选

Nathan Lambert 写了本 AI 教科书,但模型至今写不好长篇技术内容

Nathan Lambert 刚写完他的后训练教材《从人类反馈中强化学习》。他用大模型帮忙排版、校对和画图,但一让模型写完整的技术章节,输出就混乱、组织差,还会犯随机的概念错误。他认为,即使模型在编程和数学上已经超人,长篇非虚构写作能力却停滞了。文章没给具体跑分,但 Lambert 指出,主要卡在缺乏好的训练数据,而且推理阶段的算力堆叠对写作帮助不大。...

推荐理由:Lambert 用自己的教材做了一手实验,给出了具体的失败案例和数据缺口诊断,三个维度都踩中了。扣分点在于:没有量化基准,是个人经验而非系统研究,后半段有点泛泛地聊能力。整体在 featured 档里算中等偏上。

AI HOT 精选

Meta 开源 30B 多模态模型 Muse Glimmer,主打本地跑 agent 任务

Meta 的超级智能实验室放出了第一个开放权重的模型 Muse Glimmer,现在可以在 OpenRouter 上调用。这是个 30B 参数的稠密模型,能同时处理文字和图片,用 Apache 2.0 协议开源,定位是给本地 agent 用的——也就是让模型在你自己电脑上干活,不依赖云端。跑分方面,MCP Atlas 拿了 75.5,SWE-Bench...

推荐理由:Meta 从“超级智能实验室”拿出的第一个开源 agent 模型,30B 稠密、图文双修、Apache 2.0,定位是让你在本地跑 agent,不依赖云端。跑分给了 MCP Atlas 75.5,SWE-Bench 提了但没展开具体数字,所以信息有料但缺一点细节。整体判断:对做本地 agent 和跟踪开源模型的人来说,这是个值得马上看一眼的发布。

TechCrunch · AI

AI 代码测试公司 Blacksmith 估值不到一年翻近 10 倍,到 5.5 亿美元

Blacksmith 刚拿了 4500 万美元的 B 轮融资,估值从不到一年前的 6000 万直接跳到 5.5 亿。它做的事是帮开发团队在上线前自动测试和验证代码——现在 AI 写代码太快了,测试反而成了新瓶颈。客户数从 700 多涨到 5000 多,包括 Mercury、Supabase 这些公司。CEO 说过去一年收入涨了超过 10 倍,不过正文没...

推荐理由:AI 写代码把测试变成了新卡点,Blacksmith 的估值跳涨正好把这个趋势钉进了一条融资新闻里。收入涨超 10 倍、客户从 700 多到 5000 多,数字够硬。扣分是因为正文没披露实际收入基数,而且话题本身偏窄,我会先打个折。

AI HOT 精选

xAI 发布 Grok 4.6,重点强化了让模型长时间自主干活的能力

Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...

推荐理由:xAI 发布 Grok 4.6,主打让模型处理长链条任务,比如做研究、跨代码库干活、把想法直接做成应用。在 AA 智能指数上和 GPT-5.6 Sol 并列 61 分,DeepSWE 1.1 得分从 54% 拉到 65.9%,进步明显。这是主流实验室的一次实质性更新,有具体跑分和直接竞品对比,所以给 featured。正文没提模型规模、推理成本和延迟,这些实际落地要看的指标还得等后续信息。

AI HOT 精选

Cursor 与 SpaceXAI 联合发布 Grok 4.6,专为长时间运行的智能体和交互式项目调优

Grok 4.6 在 Grok 4.5 基础上加了一轮补充训练,用模型自己生成的数据来强化推理和工程能力。它在综合 9 项基准的 Artificial Analysis 智能指数上追平了 GPT-5.6 Sol。这个模型更擅长把一个宽泛的产品想法直接做成能跑的第一版,在长任务里也开始出现自我检查、自己验证的行为。价格是每百万输入 token 2 美元、...

推荐理由:追平 GPT-5.6 Sol 是个硬信号,价格也透明。但正文只有摘要,没给出自我验证的具体案例或失败模式,所以分数压在 85 以下。Cursor 的用户基数和编程场景让这条值得上推荐位。

Hacker News 首页

Nvidia 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard:一个 300 亿参数的小模型,专跑多智能体系统里的专...

Nvidia 给 Nemotron 3 系列加了个新模型 Nemotron 3.5 Lightning,300 亿参数,用的是混合专家架构(MoE,把模型拆成多个小专家,每次只激活一部分,省算力)。它不负责统筹全局,而是在多智能体系统里干代码审查、安全告警监控这类专项高并发的活。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%。模型...

推荐理由:Nvidia 这次没走通用大模型的路子,而是发了个 30B 的 MoE 模型 Nemotron 3.5 Lightning,定位是多智能体系统里的专项工人,比如做代码审查、监控安全告警。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%,还开源了调度工具 NeMo Switchyard。我会先打个折——这些数字都来自 Nvidia 自己的博客,没有第三方实测,而且 Nvidia 的模型生态在开发者里的实际采用率远不如几家头部 lab。但“给智能体系统做专项加速”这个思路本身值得关注,对正在搭多智能体工作流的人是个可参考的选项。

8月11日星期二

Hacker News 首页

从加密的思考块里偷走大模型的推理过程

Anthropic、OpenAI 和 Google 返回给用户的加密思维链块可以在不同会话、用户和模型之间复用。研究人员把 Claude Opus 4 的加密推理痕迹塞进一个被越狱的 Claude Haiku 4.5,Haiku 就把 Opus 隐藏的思考过程一字不差地转录了出来,全程没有直接攻击强模型,也没触发反蒸馏保护。他们从 6,708 条公开的...

推荐理由:我会先打个折:论文里 6,708 条公开样本的规模不算大,但攻击路径清晰、可复现,而且没触发反蒸馏保护这点很要命。Claude Opus 4 的加密推理痕迹被塞进越狱后的 Haiku 4.5,Haiku 直接吐出原文,说明加密块本身没有绑定会话或用户身份。如果是真的,意味着 Anthropic、OpenAI 和 Google 的推理 API 在隐私隔离上存在结构性漏洞。正文没披露三家厂商的具体回应,这点先别太激动,但安全团队现在就该去验证自己的推理痕迹能不能跨会话复用。