跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 381–400 条 · 共 1,195 条

7月22日星期三

Hacker News 首页

Codeberg 修改服务条款,禁止上传 vibe coding 项目

Codeberg 会员投票通过了一项服务条款修订,禁止在平台上分享“主要由大模型生成且未经人工审核”的代码项目。提案给出的理由是这类项目版权归属模糊、缺乏基本的安全保障。我会先打个折:条款里没定义什么叫“主要由大模型生成”,也没说清楚“分享”是仅指公开仓库还是也包括私有仓库和 Pull Request,执行时间表同样没提。有成员在讨论中指出了这些模糊点...

推荐理由:Codeberg 会员投票修改服务条款,禁止分享未经人工审核的大模型生成代码。这事有实质性的治理动作,冲突感和新鲜度都够,但正文没给出“主要由大模型生成”的具体判定标准,也没说清私有仓库和 PR 是否在限制范围内,执行细节全是空白,所以分数没拉满。

Hacker News 首页

Fireworks 实测 Kimi K3 对战 Fable:单挑打平,但让两个模型分工干活准确率冲到 93%,成本最多砍掉 50 倍

Fireworks 用约 1030 个真实编程 agent 任务跑了一遍 Kimi K3 和 Fable 5。单看 SWE 这类修 bug 的基准,K3 正确率 92.4%,Fable 92.6%,几乎没差别。但拆开看,K3 擅长符号数学和开发工具链,Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”,根据任务类型把活分给最合适的模型,准...

推荐理由:Fireworks 拿约 1030 个真实 agent 任务跑了 K3 和 Fable,给了具体数字和任务类型拆解。发现按任务类型做路由、把活分给最合适的模型,效果比单用任何一个都好,这个结论可复现、可验证。分数定在 78 没往上拉,因为这是单一厂商的博客测试,不是独立第三方评测,我会先打个折。

Hacker News 首页

Poolside 发布 Laguna S 2.1:一个 118B 参数的 MoE 编程模型,在长周期任务上以小博大

Poolside 今天放出了 Laguna S 2.1,一个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,上下文窗口能到 100 万 token。它在 Terminal-Bench 2.1 长周期编程测试上拿了 70.2%,压过了 DeepSeek-V4-Pro Max(64.0%)和 Inkling(63.8%),只比 2950 ...

推荐理由:Poolside 发了 Laguna S 2.1,一个激活参数只有 80 亿的混合专家编程模型,在长周期编程测试上跑赢了 DeepSeek-V4-Pro Max。我会先打个折,因为 Poolside 还不是一线玩家,而且缺少第三方复现报告,但 70.2% 这个分数和 100 万 token 的上下文窗口,对做 AI 编程工具的人来说是个值得跟进的信号。

AI HOT 精选

Google 发了三款新 Gemini 模型,但旗舰 3.5 Pro 还是没影

Google DeepMind 一口气放出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。3.6 Flash 是新的主力,写代码和处理多模态任务更强,token 消耗最多能降 17%,比上一代 3.5 Flash 更便宜。3.5 Flash-Lite 主打极致低成本,3.5 Flash Cyber ...

推荐理由:Google DeepMind 一次放出三款 Gemini 模型,3.6 Flash 当新主力,写代码和多模态能力有提升,token 消耗最多能降 17%,比 3.5 Flash 更便宜——这对开发者是实打实的成本信号。3.5 Flash-Lite 走极致低价路线,3.5 Flash Cyber 加了安全防护,定位清楚。但正文没提 3.5 Pro,缺了大家最想比的那块拼图。分数没给满,因为 TechCrunch 这篇信息量有限,很多技术细节和实测对比没展开。

7月21日星期二

Hacker News 首页

Claude 不是编译器,它比编译器强在哪

作者推翻了自己 2025 年的疑问,说把 Claude 叫编译器是个分类错误——编译器只管把源码变成二进制,但 Claude 能跨层级干活,从战略、产品、架构一路聊到机器码。他拿 exe.dev 做分布式 DNS 服务器举例:多个 agent 循环同时开工,实现同一个设计,却在很多没问过的问题上做出了完全不同的选择。他通过回答问题、回滚烂决定,慢慢把踩...

推荐理由:作者拿自己的产品案例说话,把 Claude 从编译器重新定位成跨层级决策者,有具体代码行为对比,不是纯观点输出。但这是个人博客,没有同行验证或基准测试,说服力要打个折,所以放在 72 分 featured 档刚好。

Ben's Bites

Kimi K3 前端编程跑分超 Fable,但 token 浪费让价格优势归零

月之暗面发了新模型 Kimi K3,在 Arena 前端编程榜上压过 Fable 和 GPT-5.6-Sol,其他跑分也咬得很紧。模型很大,有 2.8 万亿参数,支持图片输入,上下文窗口 100 万 token,权重会在 7 月 27 号开源。但它的 token 效率很差——每个 token 的价格只有 Sol 的一半,实际干活却要多用一倍的 toke...

推荐理由:月之暗面扔出 Kimi K3,在 Arena 前端编程榜上把 Fable 和 GPT-5.6-Sol 都挤下去了,其他跑分也咬得很紧。模型体量很大,2.8 万亿参数,支持图片输入,上下文窗口拉到 100 万 token,还定了 7 月 27 号开源权重,这几个信号都挺硬。但有个明显的坑:token 效率差。单价标得便宜,只有 Sol 的一半,实际干活却要多烧一倍的 token,算总账并不省钱。这个反差让整件事更有讨论价值,不是纯吹捧。分数没给到 85 以上,是因为正文只提了 Arena 前端编程榜这一个具体成绩,其他跑分只说“咬得很紧”,没给具体数...

AI HOT 精选

Anthropic 团队:Claude Tag 已承担 65% 的产品工程 PR,系统提示词砍掉 80%

Anthropic 的 Cat Wu 和 Thariq Shihipar 在 AI 工程师大会上跟 Simon Willison 聊了聊 Claude Code 团队的内部玩法。他们做的 Slack 协作工具 Claude Tag,现在包揽了团队 65% 的产品工程 PR。团队发现,给 Fable 5 和 Opus 4.8 的系统提示词里塞一堆例子或者...

推荐理由:这是 Claude Code 团队第一次公开 Claude Tag 的内部采用率(65% 产品 PR)和一个具体的 prompt 工程转向(系统提示词缩减 80%)。信息来自一场炉边谈话,没有可复现的评测或脚本,所以分数定在 82——信号很强,但还不是论文级别的证据。

7月20日星期一

Hacker News 首页

Kimi K3 和 Qwen 3.8 开源夹击,Anthropic 的昂贵生意快撑不住了

这周 Moonshot 的 Kimi K3 和阿里的 Qwen 3.8 都发了,性能号称接近 Anthropic 的 Fable 5,而且模型权重马上要公开。文章算了笔账:Anthropic 自己不建数据中心也不发电,用的是租来的算力和电,所以推理成本会跟着用量涨。Fable 5 每完成一个任务,成本差不多是对手的 3 倍。开源模型追上来之后,这种高价...

推荐理由:K3 和 Qwen 3.8 发模型本身不算最大新闻,真正值钱的是那笔成本账:Fable 5 跑一次任务比对手贵三倍,而且 Anthropic 没自建机房,用的全是租来的算力和电,用量越大成本越高。文章把这个结构劣势讲得很清楚,等于给开源追上来提供了一个实打实的经济理由,不是空谈性能。我会先打个折,因为成本对比的细节正文没完全展开,但逻辑链条够硬,值得放进 featured。

Hacker News 首页

实测 Kimi K3 写代码:一次跑通 Rust 优化,提速 2%,花了 1 美元

作者拿自己手调过的 Rust 函数去考 Kimi K3,让它“随便怎么优化都行”。模型自己选了 SWAR 方案,把 64 位寄存器当 8 个 u8 用,15 分钟给出代码,零报错直接跑通,最终程序快了 2%。通过 OpenRouter 调用,token 费用大概 1 美元。作者觉得这表现确实摸到了前沿模型的边。

推荐理由:一次干净的第一人称实验:作者把自己调过的 Rust 函数丢给 Kimi K3,模型自己选了 SWAR 方案,15 分钟给出代码,零报错直接跑通,最终快了 2%,token 费大概 1 美元。数字和方案名都摆出来了,不是公关稿。我会先打个折——单次测试说明不了整体水平,但就这次表现来说,确实摸到了前沿模型的边。

Import AI

开源模型网络攻击力追近闭源,Kimi K3 发布,Hassabis 提 AGI 监管方案

英国 AI 安全研究所(AISI)的测试显示,开源模型在网络安全任务上与闭源前沿模型的差距已从 2025 年的 6 到 10 个月,缩短到现在的 4 到 7 个月。具体来说,GLM-5.2 在 70 项细分网络能力评估中,表现接近 4.3 个月前发布的 Claude Opus 4.6;但在需要把多种能力串起来完成完整黑客操作的长时间任务上,差距会拉大,...

推荐理由:AISI第一次公开量化开源与闭源模型在网络能力上的时间差,有具体模型和月份数字,虽然只是网络安全这一个维度,但数据本身够硬,值得从业者关注。

AI HOT 精选

Cursor 把 AI 智能体拆成“规划者+执行者”两队,用 Rust 重写 SQLite,4 小时跑通 80% 的测试

Cursor 重新设计了他们的 AI 智能体集群,把任务拆成树状结构:由最强模型当“规划者”负责拆解目标,便宜快速的模型当“执行者”负责具体干活。他们用这个新架构挑战了旧集群搞不定的任务——只靠文档,用 Rust 从零写一个 SQLite。结果新集群在所有模型组合下都赢了旧集群。用 Grok 4.5 时,新集群 4 小时内通过了 80% 的 SQL 测...

推荐理由:这是 Cursor 自己做的工程实验,不是公关稿。规划者-执行者的树状分工有具体数字(4 小时、80% 通过率),直接回答了 agent 架构怎么省钱又能打的问题。没给 85 以上是因为这只是单次实验,不是产品发布,而且正文没披露失败用例的具体分布和成本明细。

Computing Life · Share · 鸭哥调研

Coding Agent 需要沙箱,不只是为了拦命令

审批只能决定一条命令要不要开始跑,管不了包管理器启动后加载的脚本和子进程。文章顺着一次修 bug 的任务走了一遍:Agent 克隆仓库、跑 npm install、改代码、执行测试、最后推分支。这个过程中,操作系统隔离(比如 macOS 的 Seatbelt 或 Linux 的 bubblewrap)负责限制进程能碰哪些文件和网络,不管风险来自模型判断...

推荐理由:我会先打个折:文章没有给出任何性能数据或安全测试结果,更像一篇概念科普,所以重要性停在 72 分。但它的好处是把一个容易被当成「默认开启就行」的功能拆开了讲——审批只管命令启动前,管不了 npm install 之后拉进来的脚本和子进程,这个点对做 agent 安全的人有提醒价值。标题的提问方式和修 bug 的完整走读让可读性很高,三个维度都踩中了,只是深度偏浅,没到必读级别。

7月19日星期日

彭博科技

月之暗面计划六个月内上市,刚靠 Kimi K2 模型追平了 OpenAI 和 DeepSeek 的旗舰

月之暗面(Moonshot AI)放出消息,打算在六个月内 IPO,直接原因是新模型 Kimi K2 在数学和编程跑分上追平了 OpenAI o3 和 DeepSeek V4 Pro。公司目前估值约 30 亿美元,2025 年靠 Kimi 聊天机器人的订阅和 API 费用做到了大概 1.5 亿美元收入。在哪上市、找谁承销,正文都没提。这个六个月的时间表...

推荐理由:月之暗面放出六个月内 IPO 的消息,直接原因是 Kimi K2 跑分追平了 o3 和 DeepSeek V4 Pro,技术对标一线后立刻推商业化节点。估值约 30 亿美元,2025 年收入约 1.5 亿美元,数字摆出来了。不过在哪上市、找谁承销正文都没提,六个月时间表能不能兑现还得看后续。Bloomberg 独家,信源靠谱,但关键信息有缺口,所以重要性先打个折,给 82 分。

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

Hacker News 首页

Kimi K3 在写代码上跟 Claude 打平了,价格却便宜一大截

作者把 Kimi K3 和 Claude 放在日常写代码里对比,发现输出质量和消耗的 token 数几乎一样,分不出区别。但价格差很远:K3 API 每百万输入/输出 token 收 3 美元和 15 美元,Claude 是 10 美元和 50 美元。订阅更夸张,Kimi 39 美元的编程套餐比 Claude 同价位大方得多,而 Claude 20 美...

推荐理由:一个开发者拿 Kimi K3 和 Claude 在日常写代码里实测,结论是输出质量和 token 消耗几乎没区别,但价格差了三倍多。还顺手扒了 Claude 订阅缩水的事,信息量扎实。因为是个人博客而非官方公告,分数压在 85 以下。

7月18日星期六

Hacker News 首页

Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?

作者拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal ...

推荐理由:作者自己动手跑了一个未公开的光纤网络优化问题,三轮 30 分钟测试,数字摆得很清楚。Fable 5 普通模式稳得离谱但分数略输 Sol,开了 /goal 反而崩了,这个反直觉的点是全文最有价值的地方。扣一点分是因为问题领域窄,且来源是个人博客而非官方发布,但实验设计和结论对从业者有参考意义。

Computing Life · Share · 鸭哥调研

给大模型建一个更小的可执行世界:DSL、FastAPI 与上下文基础设施

作者从自己放弃 DSL 的经历说起,指出 AI 大幅降低了设计语言、写解析器和准备示例的成本,让团队可以先建领域边界,再根据实际使用决定它的寿命。核心思路是把 FastAPI 当作原子操作层,DSL 负责描述完整计划,上下文基础设施保存过去的判断和纠正。文章引用了 Unmesh Joshi 的 DSL 文章和 Tickloom 演示,但指出 Tickl...

推荐理由:标题角度新鲜,架构思路具体,直击 agent 工程的核心痛点,三条 HKR 都踩中了。分数定在 72 是因为它来自个人博客的观点文章,没有可复现的实验或生产环境案例,思考质量高但不是硬实证,所以不往上调。

AI HOT 精选

Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...

推荐理由:Cursor 的评估负责人跑到 Anthropic 博客上发文章,本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字,而且测试设计针对的是连真人都头疼的长尾编程问题,不是那种刷分的通用榜。我会先打个折:正文没披露上一代的基线分、测试集大小和具体题目,所以这个 72.9% 只能当个相对进步的参考,不能直接换算成绝对能力。但考虑到是第一手工程评估,对日常重度依赖 Cursor 的开发者来说,这条信息比一般的模型发布博文更有实际意义,给 82 分合理。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

Hacker News 首页

Claude Code 偷偷加了个 60 秒自动继续功能,没写更新日志,两天后才修掉

Olaf Alders 发现 Claude Code v2.1.198 在 7 月 1 日悄悄塞进一个行为:当 agent 向你要指令时,如果你 60 秒内没回复,它就自己拿主意继续跑。这个改动没出现在更新日志里,也没有独立的开关能关掉。作者用 Claude 自己去反编译压缩后的 JS 代码,确认逻辑就埋在里头,没有单独的功能标记。Anthropic ...

推荐理由:一篇扎实的逆向工程博客:作者定位到 Claude Code v2.1.198 在 7 月 1 日静默加入的 60 秒超时自动执行逻辑,更新日志没提,也没有独立开关。H、K、R 全中,但毕竟只是个人博客而非官方公告,上限给到 78 分。