跳到正文

#编码

今日 10 条

7月23日星期四

Computing Life · Share · 鸭哥调研

Cursor 用新编排系统重写 SQLite,4 小时通过 80% 测试,但离生产数据库还很远

Cursor 团队做了一次受控实验:让新旧两套 Agent 编排系统,都只读 835 页 SQLite 手册,用 Rust 从零写一个兼容的数据库。新系统 Harness 4 小时内 sqllogictest 通过率达到 80%,最终能到 100%;旧系统 Swarm 不到 2 小时就因为代码冲突和接口混乱被叫停。新系统的核心是把规划者和执行者角色严格...

推荐理由:Cursor 做了一场干净利落的 A/B 测试,新旧两套 Agent 系统同台竞技,新系统 4 小时 sqllogictest 通过率冲到 80%、最终能到 100%,旧系统不到 2 小时就因代码冲突和接口混乱翻车。数字具体、对比清晰,还拆了规划者和执行者角色分离的架构思路,对做 AI 编程工具的人有直接参考价值。没给更高分是因为这还是一次内部技术实验,外部可复现性待验证,但作为单篇技术分享已经足够扎实。

7月22日星期三

TechCrunch · AI

Menlo Ventures 合伙人:模型从来不是护城河,做成平台才算赢

Menlo Ventures 的 Matt Murphy 在 Equity 播客里说,Anthropic 到今年 5 月年化收入冲到 470 亿美元,而 2025 年这个数字是 90 亿。他投了 25 年,互联网、移动互联网、云计算的浪潮都经历过,从没见过这种增速。Menlo 当年领投了 Anthropic 的 5 亿美元 D 轮,那时公司还没收入,估...

推荐理由:Anthropic 的收入数字本身就有新闻性,而且投资人跨周期的判断带了真经验,不是空谈。HKR 三项都踩中了。卡在 85 以下是因为这是播客转述,不是硬新闻,TechCrunch 的 Equity 也是常规栏目,信息密度没到顶。

Hacker News 首页

Codeberg 修改服务条款,禁止上传 vibe coding 项目

Codeberg 会员投票通过了一项服务条款修订,禁止在平台上分享“主要由大模型生成且未经人工审核”的代码项目。提案给出的理由是这类项目版权归属模糊、缺乏基本的安全保障。我会先打个折:条款里没定义什么叫“主要由大模型生成”,也没说清楚“分享”是仅指公开仓库还是也包括私有仓库和 Pull Request,执行时间表同样没提。有成员在讨论中指出了这些模糊点...

推荐理由:Codeberg 会员投票修改服务条款,禁止分享未经人工审核的大模型生成代码。这事有实质性的治理动作,冲突感和新鲜度都够,但正文没给出“主要由大模型生成”的具体判定标准,也没说清私有仓库和 PR 是否在限制范围内,执行细节全是空白,所以分数没拉满。

Hacker News 首页

Fireworks 实测 Kimi K3 对战 Fable:单挑打平,但让两个模型分工干活准确率冲到 93%,成本最多砍掉 50 倍

Fireworks 用约 1030 个真实编程 agent 任务跑了一遍 Kimi K3 和 Fable 5。单看 SWE 这类修 bug 的基准,K3 正确率 92.4%,Fable 92.6%,几乎没差别。但拆开看,K3 擅长符号数学和开发工具链,Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”,根据任务类型把活分给最合适的模型,准...

推荐理由:Fireworks 拿约 1030 个真实 agent 任务跑了 K3 和 Fable,给了具体数字和任务类型拆解。发现按任务类型做路由、把活分给最合适的模型,效果比单用任何一个都好,这个结论可复现、可验证。分数定在 78 没往上拉,因为这是单一厂商的博客测试,不是独立第三方评测,我会先打个折。

Hacker News 首页

Poolside 发布 Laguna S 2.1:一个 118B 参数的 MoE 编程模型,在长周期任务上以小博大

Poolside 今天放出了 Laguna S 2.1,一个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,上下文窗口能到 100 万 token。它在 Terminal-Bench 2.1 长周期编程测试上拿了 70.2%,压过了 DeepSeek-V4-Pro Max(64.0%)和 Inkling(63.8%),只比 2950 ...

推荐理由:Poolside 发了 Laguna S 2.1,一个激活参数只有 80 亿的混合专家编程模型,在长周期编程测试上跑赢了 DeepSeek-V4-Pro Max。我会先打个折,因为 Poolside 还不是一线玩家,而且缺少第三方复现报告,但 70.2% 这个分数和 100 万 token 的上下文窗口,对做 AI 编程工具的人来说是个值得跟进的信号。

AI HOT 精选

Google 发了三款新 Gemini 模型,但旗舰 3.5 Pro 还是没影

Google DeepMind 一口气放出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。3.6 Flash 是新的主力,写代码和处理多模态任务更强,token 消耗最多能降 17%,比上一代 3.5 Flash 更便宜。3.5 Flash-Lite 主打极致低成本,3.5 Flash Cyber ...

推荐理由:Google DeepMind 一次放出三款 Gemini 模型,3.6 Flash 当新主力,写代码和多模态能力有提升,token 消耗最多能降 17%,比 3.5 Flash 更便宜——这对开发者是实打实的成本信号。3.5 Flash-Lite 走极致低价路线,3.5 Flash Cyber 加了安全防护,定位清楚。但正文没提 3.5 Pro,缺了大家最想比的那块拼图。分数没给满,因为 TechCrunch 这篇信息量有限,很多技术细节和实测对比没展开。

7月21日星期二

Hacker News 首页

Claude 不是编译器,它比编译器强在哪

作者推翻了自己 2025 年的疑问,说把 Claude 叫编译器是个分类错误——编译器只管把源码变成二进制,但 Claude 能跨层级干活,从战略、产品、架构一路聊到机器码。他拿 exe.dev 做分布式 DNS 服务器举例:多个 agent 循环同时开工,实现同一个设计,却在很多没问过的问题上做出了完全不同的选择。他通过回答问题、回滚烂决定,慢慢把踩...

推荐理由:作者拿自己的产品案例说话,把 Claude 从编译器重新定位成跨层级决策者,有具体代码行为对比,不是纯观点输出。但这是个人博客,没有同行验证或基准测试,说服力要打个折,所以放在 72 分 featured 档刚好。

Ben's Bites

Kimi K3 前端编程跑分超 Fable,但 token 浪费让价格优势归零

月之暗面发了新模型 Kimi K3,在 Arena 前端编程榜上压过 Fable 和 GPT-5.6-Sol,其他跑分也咬得很紧。模型很大,有 2.8 万亿参数,支持图片输入,上下文窗口 100 万 token,权重会在 7 月 27 号开源。但它的 token 效率很差——每个 token 的价格只有 Sol 的一半,实际干活却要多用一倍的 toke...

推荐理由:月之暗面扔出 Kimi K3,在 Arena 前端编程榜上把 Fable 和 GPT-5.6-Sol 都挤下去了,其他跑分也咬得很紧。模型体量很大,2.8 万亿参数,支持图片输入,上下文窗口拉到 100 万 token,还定了 7 月 27 号开源权重,这几个信号都挺硬。但有个明显的坑:token 效率差。单价标得便宜,只有 Sol 的一半,实际干活却要多烧一倍的 token,算总账并不省钱。这个反差让整件事更有讨论价值,不是纯吹捧。分数没给到 85 以上,是因为正文只提了 Arena 前端编程榜这一个具体成绩,其他跑分只说“咬得很紧”,没给具体数...

AI HOT 精选

Anthropic 团队:Claude Tag 已承担 65% 的产品工程 PR,系统提示词砍掉 80%

Anthropic 的 Cat Wu 和 Thariq Shihipar 在 AI 工程师大会上跟 Simon Willison 聊了聊 Claude Code 团队的内部玩法。他们做的 Slack 协作工具 Claude Tag,现在包揽了团队 65% 的产品工程 PR。团队发现,给 Fable 5 和 Opus 4.8 的系统提示词里塞一堆例子或者...

推荐理由:这是 Claude Code 团队第一次公开 Claude Tag 的内部采用率(65% 产品 PR)和一个具体的 prompt 工程转向(系统提示词缩减 80%)。信息来自一场炉边谈话,没有可复现的评测或脚本,所以分数定在 82——信号很强,但还不是论文级别的证据。

7月20日星期一

Hacker News 首页

Kimi K3 和 Qwen 3.8 开源夹击,Anthropic 的昂贵生意快撑不住了

这周 Moonshot 的 Kimi K3 和阿里的 Qwen 3.8 都发了,性能号称接近 Anthropic 的 Fable 5,而且模型权重马上要公开。文章算了笔账:Anthropic 自己不建数据中心也不发电,用的是租来的算力和电,所以推理成本会跟着用量涨。Fable 5 每完成一个任务,成本差不多是对手的 3 倍。开源模型追上来之后,这种高价...

推荐理由:K3 和 Qwen 3.8 发模型本身不算最大新闻,真正值钱的是那笔成本账:Fable 5 跑一次任务比对手贵三倍,而且 Anthropic 没自建机房,用的全是租来的算力和电,用量越大成本越高。文章把这个结构劣势讲得很清楚,等于给开源追上来提供了一个实打实的经济理由,不是空谈性能。我会先打个折,因为成本对比的细节正文没完全展开,但逻辑链条够硬,值得放进 featured。

Hacker News 首页

实测 Kimi K3 写代码:一次跑通 Rust 优化,提速 2%,花了 1 美元

作者拿自己手调过的 Rust 函数去考 Kimi K3,让它“随便怎么优化都行”。模型自己选了 SWAR 方案,把 64 位寄存器当 8 个 u8 用,15 分钟给出代码,零报错直接跑通,最终程序快了 2%。通过 OpenRouter 调用,token 费用大概 1 美元。作者觉得这表现确实摸到了前沿模型的边。

推荐理由:一次干净的第一人称实验:作者把自己调过的 Rust 函数丢给 Kimi K3,模型自己选了 SWAR 方案,15 分钟给出代码,零报错直接跑通,最终快了 2%,token 费大概 1 美元。数字和方案名都摆出来了,不是公关稿。我会先打个折——单次测试说明不了整体水平,但就这次表现来说,确实摸到了前沿模型的边。

Import AI

开源模型网络攻击力追近闭源,Kimi K3 发布,Hassabis 提 AGI 监管方案

英国 AI 安全研究所(AISI)的测试显示,开源模型在网络安全任务上与闭源前沿模型的差距已从 2025 年的 6 到 10 个月,缩短到现在的 4 到 7 个月。具体来说,GLM-5.2 在 70 项细分网络能力评估中,表现接近 4.3 个月前发布的 Claude Opus 4.6;但在需要把多种能力串起来完成完整黑客操作的长时间任务上,差距会拉大,...

推荐理由:AISI第一次公开量化开源与闭源模型在网络能力上的时间差,有具体模型和月份数字,虽然只是网络安全这一个维度,但数据本身够硬,值得从业者关注。

AI HOT 精选

Cursor 把 AI 智能体拆成“规划者+执行者”两队,用 Rust 重写 SQLite,4 小时跑通 80% 的测试

Cursor 重新设计了他们的 AI 智能体集群,把任务拆成树状结构:由最强模型当“规划者”负责拆解目标,便宜快速的模型当“执行者”负责具体干活。他们用这个新架构挑战了旧集群搞不定的任务——只靠文档,用 Rust 从零写一个 SQLite。结果新集群在所有模型组合下都赢了旧集群。用 Grok 4.5 时,新集群 4 小时内通过了 80% 的 SQL 测...

推荐理由:这是 Cursor 自己做的工程实验,不是公关稿。规划者-执行者的树状分工有具体数字(4 小时、80% 通过率),直接回答了 agent 架构怎么省钱又能打的问题。没给 85 以上是因为这只是单次实验,不是产品发布,而且正文没披露失败用例的具体分布和成本明细。

Computing Life · Share · 鸭哥调研

Coding Agent 需要沙箱,不只是为了拦命令

审批只能决定一条命令要不要开始跑,管不了包管理器启动后加载的脚本和子进程。文章顺着一次修 bug 的任务走了一遍:Agent 克隆仓库、跑 npm install、改代码、执行测试、最后推分支。这个过程中,操作系统隔离(比如 macOS 的 Seatbelt 或 Linux 的 bubblewrap)负责限制进程能碰哪些文件和网络,不管风险来自模型判断...

推荐理由:我会先打个折:文章没有给出任何性能数据或安全测试结果,更像一篇概念科普,所以重要性停在 72 分。但它的好处是把一个容易被当成「默认开启就行」的功能拆开了讲——审批只管命令启动前,管不了 npm install 之后拉进来的脚本和子进程,这个点对做 agent 安全的人有提醒价值。标题的提问方式和修 bug 的完整走读让可读性很高,三个维度都踩中了,只是深度偏浅,没到必读级别。

7月19日星期日

彭博科技

月之暗面计划六个月内上市,刚靠 Kimi K2 模型追平了 OpenAI 和 DeepSeek 的旗舰

月之暗面(Moonshot AI)放出消息,打算在六个月内 IPO,直接原因是新模型 Kimi K2 在数学和编程跑分上追平了 OpenAI o3 和 DeepSeek V4 Pro。公司目前估值约 30 亿美元,2025 年靠 Kimi 聊天机器人的订阅和 API 费用做到了大概 1.5 亿美元收入。在哪上市、找谁承销,正文都没提。这个六个月的时间表...

推荐理由:月之暗面放出六个月内 IPO 的消息,直接原因是 Kimi K2 跑分追平了 o3 和 DeepSeek V4 Pro,技术对标一线后立刻推商业化节点。估值约 30 亿美元,2025 年收入约 1.5 亿美元,数字摆出来了。不过在哪上市、找谁承销正文都没提,六个月时间表能不能兑现还得看后续。Bloomberg 独家,信源靠谱,但关键信息有缺口,所以重要性先打个折,给 82 分。

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

Hacker News 首页

Kimi K3 在写代码上跟 Claude 打平了,价格却便宜一大截

作者把 Kimi K3 和 Claude 放在日常写代码里对比,发现输出质量和消耗的 token 数几乎一样,分不出区别。但价格差很远:K3 API 每百万输入/输出 token 收 3 美元和 15 美元,Claude 是 10 美元和 50 美元。订阅更夸张,Kimi 39 美元的编程套餐比 Claude 同价位大方得多,而 Claude 20 美...

推荐理由:一个开发者拿 Kimi K3 和 Claude 在日常写代码里实测,结论是输出质量和 token 消耗几乎没区别,但价格差了三倍多。还顺手扒了 Claude 订阅缩水的事,信息量扎实。因为是个人博客而非官方公告,分数压在 85 以下。

7月18日星期六

Hacker News 首页

Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?

作者拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal ...

推荐理由:作者自己动手跑了一个未公开的光纤网络优化问题,三轮 30 分钟测试,数字摆得很清楚。Fable 5 普通模式稳得离谱但分数略输 Sol,开了 /goal 反而崩了,这个反直觉的点是全文最有价值的地方。扣一点分是因为问题领域窄,且来源是个人博客而非官方发布,但实验设计和结论对从业者有参考意义。

Computing Life · Share · 鸭哥调研

给大模型建一个更小的可执行世界:DSL、FastAPI 与上下文基础设施

作者从自己放弃 DSL 的经历说起,指出 AI 大幅降低了设计语言、写解析器和准备示例的成本,让团队可以先建领域边界,再根据实际使用决定它的寿命。核心思路是把 FastAPI 当作原子操作层,DSL 负责描述完整计划,上下文基础设施保存过去的判断和纠正。文章引用了 Unmesh Joshi 的 DSL 文章和 Tickloom 演示,但指出 Tickl...

推荐理由:标题角度新鲜,架构思路具体,直击 agent 工程的核心痛点,三条 HKR 都踩中了。分数定在 72 是因为它来自个人博客的观点文章,没有可复现的实验或生产环境案例,思考质量高但不是硬实证,所以不往上调。

AI HOT 精选

Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...

推荐理由:Cursor 的评估负责人跑到 Anthropic 博客上发文章,本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字,而且测试设计针对的是连真人都头疼的长尾编程问题,不是那种刷分的通用榜。我会先打个折:正文没披露上一代的基线分、测试集大小和具体题目,所以这个 72.9% 只能当个相对进步的参考,不能直接换算成绝对能力。但考虑到是第一手工程评估,对日常重度依赖 Cursor 的开发者来说,这条信息比一般的模型发布博文更有实际意义,给 82 分合理。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

Hacker News 首页

Claude Code 偷偷加了个 60 秒自动继续功能,没写更新日志,两天后才修掉

Olaf Alders 发现 Claude Code v2.1.198 在 7 月 1 日悄悄塞进一个行为:当 agent 向你要指令时,如果你 60 秒内没回复,它就自己拿主意继续跑。这个改动没出现在更新日志里,也没有独立的开关能关掉。作者用 Claude 自己去反编译压缩后的 JS 代码,确认逻辑就埋在里头,没有单独的功能标记。Anthropic ...

推荐理由:一篇扎实的逆向工程博客:作者定位到 Claude Code v2.1.198 在 7 月 1 日静默加入的 60 秒超时自动执行逻辑,更新日志没提,也没有独立开关。H、K、R 全中,但毕竟只是个人博客而非官方公告,上限给到 78 分。

Hacker News 首页

月之暗面发布 2.8 万亿参数 Kimi K3,自称首个开源 3T 级模型,API 定价看齐 Claude Sonnet

月之暗面推出了 Kimi K3,一个 2.8 万亿参数的模型,他们把它四舍五入叫成“首个开源 3T 级模型”。这个模型 API 定价是输入每百万 token 3 美元、输出 15 美元,跟 Anthropic 的 Claude Sonnet 系列一个价,是目前中国 AI 实验室里最贵的模型。它自己公布的跑分大多超过了 Claude Opus 4.8 和...

推荐理由:月之暗面发了 Kimi K3,一个 2.8 万亿参数的模型,他们管它叫“首个开源 3T 级模型”,API 定价输入每百万 token 3 美元、输出 15 美元,跟 Claude Sonnet 一个价,是目前中国 AI 实验室里最贵的。自己公布的跑分大多超过 Claude Opus 4.8 和 GPT-5.5 high,但输给 Claude Fable 5 和 GPT-5.6 Sol。Simon Willison 的测试里 K3 在长周期知识任务上比前代 K2.6 涨了 732 Elo,输出 token 数少了 21%,成本降了 27%,说明模型在...

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

AI HOT 精选

OpenAI 给 CFO 们画了张新账本:别盯着每个 token 多少钱,要看“每块钱干成了多少活”

OpenAI 发了一篇面向 CFO 的指南,核心就一句话:算 AI 账不能只看 token 单价,得算完成一件合格任务的综合成本。文章提了个“有用智能每美元”的框架,拆成四个问题:AI 到底干成了多少有用的活、每件成功的活实际花了多少钱、结果靠不靠谱、以及用得越多是不是每块钱买的活也越多。拿刚发的 GPT-5.6 三个档位(Sol、Terra、Luna...

推荐理由:OpenAI 这篇给 CFO 的指南把 AI 成本从 token 单价拉回到“完成一件合格任务花了多少钱”,提了个四维记分卡,还拿自家新模型和 Claude Fable 5 比了一圈。框架和对比数据都有,对企业算账的人挺实在,所以给了 featured。

彭博科技

月之暗面发布新 Kimi 模型,跑分追上 OpenAI o3 和 Claude Sonnet 4.5,英伟达盘前跌超 3%

月之暗面在 7 月 17 日推出了新一代 Kimi 模型,在 MATH、HumanEval 等基准测试里,成绩跟 OpenAI o3 和 Anthropic Claude Sonnet 4.5 打平甚至略高。现在通过 Kimi 聊天机器人就能试,API 也已经上线。市场反应很直接——英伟达盘前跌了超过 3%,大家担心这会压降美国 AI 公司的定价空间。...

推荐理由:月之暗面这次发模型,跑分直接叫板 o3 和 Claude Sonnet 4.5,而且不是论文阶段,是已经能用的产品。我会先打个折——没看到模型大小和实际推理成本,光看跑分容易高估。但市场反应很诚实,英伟达股价先跌为敬,说明大家认真在考虑这会不会压降美国公司的定价空间。对国内从业者来说,这至少是个值得上手测一下的信号。

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

Latent Space

月之暗面发布 Kimi K3:2.8 万亿参数开源模型,前端编程能力冲上第一

月之暗面发布了 Kimi K3,一个总参数量 2.8 万亿的模型,这也是目前公开权重里最大的一个。模型权重承诺在 7 月 27 日前放出。它支持 100 万 token 的上下文和原生的多模态输入,已经在 Kimi.com、Kimi Code 和 API 上线。在 Artificial Analysis 的智能指数上,K3 拿了 57 分,跟 Clau...

推荐理由:月之暗面扔出了 Kimi K3,2.8万亿参数,是目前公开权重里最大的模型。我会先打个折:权重还没放出来,承诺是 7 月 27 日前,这点先别太激动。性能上,Artificial Analysis 给了 57 分,说是 Opus 4.8 级别,但定价压到 Sonnet 5 那档,如果是真的挺省钱。支持 100 万 token 上下文和原生多模态输入,已经在 Kimi.com、Kimi Code 和 API 上线,可以直接用。正文没披露训练成本、推理延迟和具体 benchmark 细节,这些缺口让性价比判断还缺几块拼图。

Hacker News 首页

人肉把关员已经累了

Pydantic 的 Laura Summers 聊了用大模型写代码的真实疲惫感:代码生成没问题,但人得不停地审查、纠错、把持方向,精力很快被榨干。她的同事 Douwe 每天醒来面对 30 个 AI 生成的 PR,很想把审查也丢给 AI,但反问自己“那我还在这干嘛”。她管这叫监督疲劳,并指出 AI 让你能同时开很多头,但能认真收尾的事一件没多。文章还引...

推荐理由:Pydantic 的开发者从一线视角讲了大模型写代码的真实困境:代码能生成,但人得不停审查纠错,精力很快被榨干。她管这叫“监督疲劳”,并指出 AI 让你能同时开很多头,但能认真收尾的事一件没多。观点来自真实体验,比纯技术文章更打动人。分数没给更高是因为这是一篇观点文,没有新数据或工具发布,但观点本身足够犀利。

Computing Life · Share · 鸭哥调研

BackendForge 让 AI 编程评测从笔试变面试,同一份代码通过率直接腰斩

BackendForge 先给 56 个后端任务写了 7,250 项测试,再让 Agent 专门找这套题库漏了什么,最后补了 640 项。测试只多了 8.8%,但 GPT-5.5 全部通过的任务从 31 个掉到 16 个,Claude Opus 4.7 从 33 个掉到 10 个。代码没变,变的是评分方式:新题专挑权限、脏数据、连带影响这些第一版没覆盖...

推荐理由:BackendForge 这件事有意思在它不拼模型,拼的是出题方式。先拿 56 个后端任务写了 7,250 项测试,再让 Agent 自己找题库的盲区,补了 640 项。测试量只涨了 8.8%,但 GPT-5.5 和 Claude Opus 4.7 的满分率直接腰斩。代码没变,变的是评分标准——新题专挑权限、脏数据、连带影响这些第一版没覆盖的角落。这对做 AI 编码工具的人是个实在提醒:模型能跑通任务不代表真靠谱,评测得学会追问。数字清晰,结论有冲击力,而且没吹模型,吹的是方法论,值得放 featured。

Hacker News 首页

德国团队发布开源模型 Soofi S,30B 参数跑出 3B 成本,德语英语跑分双杀

Soofi S 是一个 31.6B 参数的混合专家模型,每次生成只激活 3.2B 参数,推理成本压得很低。它用了 Mamba 加 Transformer 的混合架构,处理长文本时速度几乎不掉,这点比很多同尺寸模型强。训练数据故意向德语倾斜,结果在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。模型在德国电信的慕尼黑...

推荐理由:德国 AI 联盟放出的 Soofi S,一个 31.6B 参数的混合专家模型,每次只激活 3.2B 参数,推理成本压得很低。它用 Mamba 加 Transformer 的混合架构,长文本处理不掉速,在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。虽然德语优先的定位会限制它在中文圈的传播,但开源 30B 级别模型做到这个性能和成本,对从业者来说值得看一眼。

AI HOT 精选

Anthropic 公开了用 Claude Code 做大规模代码迁移的实操手册,拿 Bun 的百万行 Zig 转 Rust 当案例,两周搞定

Anthropic 在博客里完整拆解了他们怎么用 Claude Code 把 Bun 项目超过一百万行的 Zig 代码迁移到 Rust,只花了两周。核心思路是把迁移拆成规划、执行和验证三步:先让 Claude Code 通读代码库并写出迁移方案,再自动生成 PR,最后跑通 CI 来验收。文章附了完整的工作流和提示词模板,给想用 AI 做内部重构的团队参...

推荐理由:Anthropic 官方博客拆解了一次真实的大规模迁移,有数字、有流程、有模板,不是公关稿。分数没给更高是因为这本质上是一篇案例分享而非产品更新,而且 Bun 不是 Anthropic 的项目,更像一次对外演示。

7月16日星期四

Hacker News 首页

批评大模型的人说得都对,但我还是在用

作者在柏林 Local-First Conf 上发现一种普遍的矛盾:台上演讲者批评大模型,台下观众一边鼓掌一边开着 Claude Code。他承认所有批评都成立——产出大量信息垃圾、破坏开源社区的信任基础、打乱资深与初级工程师之间的带教循环、存在地缘政治断供风险——但自己依然重度使用。文章没有试图化解这种矛盾,而是把这种集体性的别扭感摊开来讲,并邀请大...

推荐理由:这篇文章没打算讲道理,就是把开发者圈子里那种'边骂边用'的集体拧巴摊开给你看。柏林会议上 Armin Ronacher 的回复是个好钩子,但全文没有数据支撑,也没有解决方案,就是一次诚实的自我暴露。我会给 featured,因为共鸣够强、传播力够好,但别指望从这里学到什么新东西。

Hacker News 首页

Roc 语言的编译器用 Zig 重写后,首次追平了原 Rust 版的功能

Roc 团队花了 487 天,把 30 万行 Rust 编译器用 Zig 重写了一遍,最近刚做到功能追平。一个叫 Rocci Bird 的演示小游戏现在能编译成 31KB 的 wasm 文件,体积不到原来的一半。新编译器在开发时会自动热加载代码,改完不用重启;发布时能交叉编译出可复现的静态二进制文件。团队强调这次是重新设计,不是直接搬运,所以没法拿 R...

推荐理由:Roc 团队花了 487 天把 30 万行 Rust 编译器用 Zig 重写,刚追平功能。31KB wasm(不到原来一半)、热加载、可复现静态二进制都是实打实的改进。和 Bun 从 Zig 切 Rust 的报道天然形成对照,增加了话题性。但正文没给出 Rust 版本的直接性能对比,团队也承认是重新设计而非搬运,所以实际提升幅度要打个折。上限给到 72,因为缺乏严格的 A/B 数据支撑。

Latent Space

Thinky 发布 Inkling:9750 亿参数、410 亿活跃的多模态开源模型,目前美国最强 Apache 2.0 基座

Thinky 推出了 Inkling,一个总参数量 9750 亿、每次推理激活 410 亿参数的混合专家模型。它能直接处理文字、图片、音频和视频,支持最长 100 万 token 的上下文窗口。模型用 45 万亿个多模态 token 训练,采用 Apache 2.0 协议开源,发布当天就得到了 vLLM、Hugging Face 等工具链的支持。团队明...

推荐理由:Thinky 第一个完整模型发布,975B MoE 架构、Apache 2.0 开源,填补了美国开源阵营的空缺。Mira Murati 的团队背景、100 万 token 上下文和原生多模态能力同时打中了热度、硬核度和身份认同三个点。没给到 90 分以上是因为目前只有团队自己公布的跑分数字,正文没披露独立第三方的验证结果,这点先别太激动。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

7月15日星期三

Hacker News 首页

StyleSeed:给 AI 编程助手装一套设计规范引擎,别让它再生成千篇一律的界面

bitjaru 开源了一个叫 StyleSeed 的项目,专门给 Claude Code、Cursor 这类 AI 编程工具用。它不直接生成代码,而是教模型做设计判断。项目里打包了 74 条设计规则、48 个组件、7 套品牌皮肤(像 Stripe、Linear、Vercel 这些),还有一套命名过的动效系统和 15 个快捷指令。目前 MIT 协议开源,...

推荐理由:给 AI 编程工具加设计约束这事确实戳中刚需,74 条规则加品牌皮肤让项目不止于概念 demo。分数没给更高是因为刚在 Show HN 亮相,没有用户反馈和实际落地效果,目前只能按工具完整度打分。

Hacker News 首页

Martin Fowler 博客:用领域特定语言给大模型套上缰绳,让代码生成更靠谱

Unmesh Joshi 在 Martin Fowler 的博客里说,靠一份详细需求文档就让大模型一把梭出整个系统不现实——需求只是假设,真正的设计是在实现过程中一点点摸出来的。他提出用领域特定语言(DSL,也就是为特定业务定制的“小语言”)和领域抽象给大模型画好边界,这样模型生成的代码才不会跑偏。文章举了 Tickloom 的例子:这是一个给分布式系...

推荐理由:一篇扎实的工程实践文章,发在 Martin Fowler 的博客上,用 DSL 给大模型代码生成画边界,有具体例子支撑。没给更高分是因为它属于观点/模式文章,不是产品发布或模型发布,受众更偏后端架构师。

Computing Life · Share · 鸭哥调研

Codex 仍然开源,但父 agent 给子 agent 派了什么任务,现在被加密了

OpenAI 在 6 月 5 日合并了一个 PR,把 Codex 里主 agent 派给子 agent 的任务指令从明文改成了密文。以前你在本地日志里能看到类似“Review the authentication changes”这样的具体任务,现在只剩一串 <ciphertext>。子 agent 调用了什么工具、跑了什么命令、改了哪些代码,这些执行...

推荐理由:这是一条有具体技术细节的产品变动报道,不是公关稿。PR 号、issue 链接、改动前后对比都给出来了。扣分是因为这属于功能调整而非新能力发布,影响范围也局限在 Codex 用户。我会先打个折:虽然对开发者体验的冲击不小,但本质上是一次安全加固,不是模型能力或架构的突破。

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。