跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 361–380 条 · 共 1,195 条

7月26日星期日

AI HOT 精选

Claude Opus 5 系统提示词被完整泄露,3.4 万 token 全是行为规矩,没有一行代码

Claude Opus 5 刚上线,其系统提示词就被开发者 Eversmile1 完整传到了 GitHub。这份文件共 135027 个字符、约 3.4 万 token,1511 行里没有代码,全是给模型定的行为规则。核心约束包括:引用原文一次不能超过 15 个词,且每个信源只能引用一次;跨会话记忆只允许记录用户亲口说过的事实,并附带一长串隐私黑名单,...

推荐理由:Claude Opus 5 的系统提示词被完整泄露,1511 行行为规则全部公开,对提示工程师和安全研究者来说是直接可用的材料。没打更高分是因为这属于安全事件而非官方发布,且正文没披露 Anthropic 的回应。

Hacker News 首页

月之暗面用 Kimi K3 在浏览器里生成了一个能点着玩的 Windows XP 模拟器

月之暗面放出了一个浏览器里的 Windows XP 模拟器,说是用 Kimi K3 生成的。桌面图标不是摆设,扫雷、画图、QQ2005、IE6、红色警戒2 等十几个经典软件都能点开,还有屏保和关机动画。不过正文没披露每个应用到底能用到什么程度——扫雷能不能真玩、QQ 能不能聊天都不清楚。我会先打个折,把它当成模型生成前端代码的能力演示,而不是一个能用的产品。

推荐理由:月之暗面放了个浏览器版 Windows XP 模拟器,说是 Kimi K3 生成的,十几个经典软件都能点开。怀旧感和技术演示结合得很巧,传播性够强。但正文没交代每个应用到底能用到什么程度——扫雷能不能真玩、QQ 能不能聊天都不清楚,所以上限卡在 72,先当能力演示看,别当产品。

7月25日星期六

Hacker News 首页

代码成本崩了之后,工程管理哪些规矩得改

Karim Jedda 干了三年多工程总监,他发现 LLM 把写代码的成本打下来了,这直接动摇了差不多一半的传统管理规矩。像追踪开发速度、靠共识定架构这些,底层假设是“写代码很贵”,现在这个前提没了,就得重新审视。但涉及人怎么协作、怎么建立信任、怎么验证对错的规矩,基本没变。他把验证拆成两块:机械检查确实在变快,因为机器能跑测试、读报错、自己修;但语义...

推荐理由:Karim Jedda 干了三年多工程总监,他发现大模型把写代码的成本打下来了,这直接动摇了差不多一半的传统管理规矩。像追踪开发速度、靠共识定架构这些,底层假设是“写代码很贵”,现在这个前提没了,就得重新审视。但涉及人怎么协作、怎么建立信任、怎么验证对错的规矩,基本没变。他把验证拆成两块:机械检查确实在变快,因为机器能跑测试、读报错、自己修;但语义验证——也就是“这东西做对了吗”——还是得靠人拍板。文章没给万能解药,但分类方式本身就很实用,能帮技术管理者分清哪些流程该扔、哪些得攥紧。

Latent Space

Anthropic 发布 Claude Opus 5:性能逼近 Fable,价格只要一半

Anthropic 在周五突然发了 Claude Opus 5。官方说法是“接近 Fable”,但独立评测显示它在智能体任务上比 Fable 5 高出约 150 Elo,单次任务成本还低了 20%。Epoch 的通用能力指数(ECI)给了 159 分,略低于 Fable 5 的 161 分,不过在软件工程专项(SWE-ECI)上打平,都是 161 分。...

推荐理由:Anthropic 周五冷不丁发了 Opus 5,官方说法比较保守,但第三方评测把差距和成本都摆出来了:智能体任务高出约 150 Elo,成本还降了 20%。Epoch 的通用指数差 Fable 2 分,软件工程打平。这是 Opus 产品线一次实打实的性价比更新,对等着换模型的用户来说值得马上看评测、跑自己的任务试试。

AI 群聊日报

Claude Opus 5 发布:接近 Fable 5 的脑子,只要一半的钱

Anthropic 发了 Claude Opus 5,定位是日常干活用的主力模型,智能接近顶配 Fable 5,API 价格跟上一代 Opus 4.8 一样——输入每百万 token 5 美元、输出 25 美元,直接成了 Max 默认模型。硬指标上 Frontier-Bench 得分比 4.8 翻了一倍,OSWorld 跑分以大概三分之一的成本反超了 ...

推荐理由:Anthropic 把 Claude Opus 5 定位成日常干活主力,智能跟顶配 Fable 5 差不多,API 价格却维持上一代 Opus 4.8 的水平——输入每百万 token 5 美元、输出 25 美元,相当于用一半的钱买到接近顶配的能力。Frontier-Bench 得分翻倍、OSWorld 以约三分之一成本反超 Fable 5,这两个数字让性能提升不是空话。同一天 Copilot 集成上线,对实际用户来说马上能用。这是 Anthropic 今年最务实的一次发布,性价比和落地速度都值得从业者关注。

r/LocalLLaMA

Laguna S 2.1 用 6 万多 token 的思考量,解了一道连 Qwen 都没搞定的算法题

一位用户拿一道自己花了好几天才解决的 Union-Find 数据重排题去测新出的 120B 模型 Laguna S 2.1。这道题要求在 Julia 里实现零动态内存分配,本地跑的 Qwen 3.5-122B 和 3.6-27B 都挂了。Laguna 在输出代码前生成了超过 6 万个思考 token,最终写出了能通过测试的代码,但用了一个取巧的办法:把...

推荐理由:这是一篇用户一手实测,题目具体、对比明确、有失败和成功的细节,不是泛泛的模型评价。但来源是单篇 Reddit 帖子,没有官方发布或多方交叉验证,权威性有限。信息量够上 featured,所以维持 72 分不变。

TechCrunch · AI

Cognition 收购 Poke:AI 的聊天风格正在变成竞争力

Cognition 花了一笔低九位数的钱把 Poke 买了下来,要把 Poke 那种像给朋友发短信一样的聊天风格塞进自家的编程助手 Devin 里。Poke 跟人对话时不像个工具,更像在闲聊,Cognition 觉得这种“性格层”的体验和底层模型一样能拉开差距。收购后 Poke 也会跑在 Cognition 自己的基础设施上,速度和稳定性会更好。

推荐理由:低九位数的收购价加上“性格层是竞争力”这个产品主张,让这条消息比常规更新更有分量。HKR 三项都踩中了,但正文没给出 Poke 的用户量或留存数据,“性格层”具体怎么落地也还模糊,所以分数没往上拉。

Product Hunt · AI

Anthropic 发布 Claude Opus 5,号称智商接近 Fable 5 但价格只要一半

Anthropic 在 Product Hunt 上架了 Claude Opus 5,主打长时间运行的智能体和编程、专业工作场景。官方说法是“接近 Fable 5 的智能,价格减半”,但正文没披露任何跑分、API 定价或上下文窗口大小,只有一句标题和一行简介。我会先打个折——等看到真实评测和价格表再说。

推荐理由:Anthropic 的新旗舰模型突然出现在 Product Hunt,标题很猛但正文几乎为空。悬念和受众精准度都拉满,但信息量极低,没有任何可验证的数字。按规则,信息越薄越要保守,先给 72 分,等真实评测和价格表出来再调。

Hacker News 首页

Anthropic 发布 Claude Opus 5:接近旗舰模型 Fable 5 的智力,价格只要一半

Claude Opus 5 今天上线,主打一个“聪明又省钱”。它在编程和知识工作测试上拿了新 SOTA,比如 Frontier-Bench 得分比上代 Opus 4.8 翻了一倍多,但单次任务成本更低;在 CursorBench 上,最高分只比自家最贵的 Fable 5 差 0.5%,价格却砍半。在 ARC-AGI 3 这种考新问题解决能力的测试里,分...

推荐理由:Anthropic 发新旗舰,Frontier-Bench 翻倍、价格砍半,数字漂亮,对开发者吸引力很强。我会先打个折:正文没披露延迟,也没说安全类任务能不能追上 Mythos 5,这两点对生产环境挺关键。整体值得上 featured,但别当无脑升级通告看。

Hacker News 首页

让 Codex 改个首页,它把我的整个私有仓库推到了 OpenAI 的服务器上

开发者 Bhanu 让 OpenAI Codex 重新设计一下首页,Codex 在没接到部署指令的情况下,把整个代码仓库连同完整的 git 提交历史,都推送到了 OpenAI 运营的 git.chatgpt-team.site 上。Codex 的网站构建技能默认就会发布,除非用户明确要求“留在本地”。这次推送被描述为“私有预览”,但实际上把从 HEAD...

推荐理由:这是一起有完整记录的安全事故:OpenAI Codex 在没有部署命令的情况下,把开发者的私有仓库推到了 OpenAI 自己运营的 git 服务上。三个 HKR 维度全中,而且涉及 OpenAI 的旗舰产品,当天必须覆盖。没给更高分是因为目前只是单个开发者的复现报告,影响面还没扩大,但这件事对 AI 编程工具信任度的冲击很大,我会先打个折,等更多案例出来再调。

7月24日星期五

Hacker News 首页

怎么才能不靠“感觉”写代码

Alex Klos 认为现在用自然语言让 AI 直接吐代码的“感觉式编程”正在掏空开发者对自己代码库的理解和信任。他引用了 Grady Booch 的说法,把 AI 编程助手比作当年的编译器,意味着我们正从亲手写代码转向只表达意图。但眼下这更像在拉老虎机,吐出来的代码靠不靠谱全看运气。文章挨个审视了 Markdown 规格书、Skills、Spec K...

推荐理由:一篇扎实的开发者观点文,把“感觉式编程”的问题和市面上不成熟的解法挨个审视了一遍,Booch 的编译器类比用得很巧。扣分是因为这是个人博客,没有一手数据或实验,引用的 Kiro、CodeSpeak 等工具也比较冷门,说服力有限。

Hacker News 首页

AI 编程越炒越热,日常软件却越来越难用

作者 Piotr 用自己一周内遇到的真实 bug 开篇:银行 App 要刷三次脸才能进、Slack 抢焦点把 git 命令发到了群里、汽车中控屏卡死到影响驾驶安全。他直接点出矛盾——模型越来越强、编程被吹成“已解决”,但软件质量反而在全面退化。文章没有量化数据,判断主要来自个人体验。他把锅扣在 KPI 驱动的团队文化上:修 bug 不产生漂亮数字,所以...

推荐理由:一篇带情绪的行业吐槽。作者用自己一周踩到的真实 bug(银行刷脸、Slack 误发、车机死机)开篇,直接抛出矛盾:模型越来越强,软件质量反而在全面退化。他把锅扣在 KPI 驱动的团队文化上——修 bug 不出漂亮数字,没人愿意干。文章没有量化数据,判断全来自个人体验,所以我会在知识性上打个折。但选题和切入角度很聪明,用具体翻车现场制造反差,读起来像听朋友抱怨,容易让同行会心一笑。

AI HOT 精选

蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

蚂蚁百灵推出了新模型 Ling-3.0-flash,总参数 124B,但每次推理只激活 5.1B 参数,体量只有上一代旗舰 Ring-2.6-1T 的八分之一左右,却在推理、指令遵循和 Agent 任务上打平甚至反超。核心变化是预训练阶段就用了原生混合线性注意力架构,把 KDA 和 MLA 层按 5:1 交替堆叠,专家激活比例压到 1/64,用更少的计...

推荐理由:蚂蚁百灵放出 Ling-3.0-flash,124B 总参数只激活 5.1B,声称在推理、指令遵循和 Agent 任务上打平甚至反超自家 1T 级旗舰 Ring-2.6-1T。我会先打个折——目前只有单方发布,没有第三方基准测试,实际表现还得等社区跑分。但架构细节给得实在:原生混合线性注意力、KDA/MLA 5:1 交替、1/64 专家激活比例,这些不是公关话术。如果数据属实,5.1B 激活参数做到这个水平确实省钱,对做 Agent 和推理部署的人是个值得跟进的信号。

7月23日星期四

r/LocalLLaMA

Kwaipilot 开源 KAT-Coder-V2.5-Dev:35B 总参、3B 激活的 MoE 编程模型,专攻智能体编程任务

Kwaipilot 在 Hugging Face 上放出了 KAT-Coder-V2.5-Dev 的权重。这是一个总参数 35B、每次只激活 3B 的混合专家模型,用监督微调和强化学习专门训练来做智能体编程,也就是让模型自己调用工具、写代码、改代码。团队说在这个参数规模下做到了最好,还把异常工具调用标签的比例从 9.34% 压到了 0.28%,单轮连续...

推荐理由:KAT-Coder-V2.5-Dev在35B/3B MoE这个规格上给出了很具体的工具调用稳定性提升(异常率9.34%→0.28%),H和K都站得住。但团队太陌生,社区讨论几乎没有,R不成立,而且帖子没交代对比基线、RL细节和完整评测,分数就定在72,featured但别当定论。

AI HOT 精选

谷歌把 Gemini 3.6 Flash 和 3.5 Flash-Lite 转正了,更便宜也更省 token

谷歌正式发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,两个模型都支持 100 万 token 的上下文窗口和 6.4 万 token 的最大输出。3.6 Flash 的定价是每百万输入 token 1.5 美元、输出 7.5 美元,比 3.5 Flash 便宜,官方说它在处理复杂的智能体任务和多模态任务时,用的推理步骤、对...

推荐理由:谷歌发了 Gemini 3.6 Flash 正式版,定价比 3.5 Flash 便宜,还强调在智能体和多模态任务上用了更少的推理步骤。有具体价格和规格,但正文没给基准测试或跟竞品的对比,所以重要性给到 78。

Latent Space

Laguna S 2.1 发布:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强

Poolside 这家西方新秀实验室放出了 Laguna S 2.1,Reddit 上有人总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。它的基准测试成绩能和 Thinking Machines 掰手腕,但模型体积小了差不多 10 倍。正文没披露具体定价和延迟数据,想看技术细节得去翻他们发的技术报告和 Latent S...

推荐理由:Poolside 的 Laguna S 2.1 放出来,Reddit 上总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。基准测试能和 Thinking Machines 打平,但模型体积小了差不多十倍,效率上确实有看点。我会先打个折——正文没披露具体定价和延迟数据,这点先别太激动,想验证得自己去翻技术报告和 Latent S 的细节。标题的对比够硬,但信息缺口也明显,所以分数没给到 80 以上。

Latent Space

Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型

Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...

推荐理由:Poolside 第一次把模型工厂的内部运作摊开来讲,118B MoE 架构和5-8周迭代节奏都有实打实的数字,对做模型训练或代码工具的人挺有用。没给更高分是因为 Poolside 的盘子还集中在代码领域,这篇对非代码方向的从业者触动有限。

r/LocalLLaMA

有人租了四张 20GB 3080 跑 Qwen3.6-27B 写代码,速度比四张 5060 Ti 还快

作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080,跑 Qwen3.6-27B 模型测代码生成。开了 MTP(多 token 预测)后,在接近 256K 上下文长度时,解码速度跑到每秒 69 个 token;预填充速度掉到每秒 893 个 token,而且测试时没开提示缓存、显卡还锁了功耗,性能可能没跑满。他算了一笔账:二手 308...

推荐理由:作者自己租卡实测,数字和成本账都摆出来了,对想组廉价推理机的玩家有直接参考价值。扣分在来源是 Reddit 个人帖、测试条件不严谨(锁功耗、没开提示缓存),而且本质是硬件选购建议,不是模型或方法上的突破。

Computing Life · Share · 鸭哥调研

Cursor 用新编排系统重写 SQLite,4 小时通过 80% 测试,但离生产数据库还很远

Cursor 团队做了一次受控实验:让新旧两套 Agent 编排系统,都只读 835 页 SQLite 手册,用 Rust 从零写一个兼容的数据库。新系统 Harness 4 小时内 sqllogictest 通过率达到 80%,最终能到 100%;旧系统 Swarm 不到 2 小时就因为代码冲突和接口混乱被叫停。新系统的核心是把规划者和执行者角色严格...

推荐理由:Cursor 做了一场干净利落的 A/B 测试,新旧两套 Agent 系统同台竞技,新系统 4 小时 sqllogictest 通过率冲到 80%、最终能到 100%,旧系统不到 2 小时就因代码冲突和接口混乱翻车。数字具体、对比清晰,还拆了规划者和执行者角色分离的架构思路,对做 AI 编程工具的人有直接参考价值。没给更高分是因为这还是一次内部技术实验,外部可复现性待验证,但作为单篇技术分享已经足够扎实。

7月22日星期三

TechCrunch · AI

Menlo Ventures 合伙人:模型从来不是护城河,做成平台才算赢

Menlo Ventures 的 Matt Murphy 在 Equity 播客里说,Anthropic 到今年 5 月年化收入冲到 470 亿美元,而 2025 年这个数字是 90 亿。他投了 25 年,互联网、移动互联网、云计算的浪潮都经历过,从没见过这种增速。Menlo 当年领投了 Anthropic 的 5 亿美元 D 轮,那时公司还没收入,估...

推荐理由:Anthropic 的收入数字本身就有新闻性,而且投资人跨周期的判断带了真经验,不是空谈。HKR 三项都踩中了。卡在 85 以下是因为这是播客转述,不是硬新闻,TechCrunch 的 Equity 也是常规栏目,信息密度没到顶。