跳到正文

#编码

今日 10 条

7月30日星期四

Ben's Bites

ChatGPT 周活用户逼近 10 亿;OpenAI 用自家模型 Sol 给自己省了 20% 的推理成本

ChatGPT 的周活跃用户数快摸到 10 亿了,比 OpenAI 自己定的目标晚了大概七个月。OpenAI 还干了一件事:用他们自己的模型 Sol 来优化 Sol 的线上服务,结果把推理成本砍掉了 20%,生成 token 的效率也提升了超过 15%。Sol 在 ARC-AGI-3 基准上的得分从 13.3% 跳到了 38.3%,但有个前提——得关掉...

推荐理由:ChatGPT 接近 10 亿周活是个里程碑,Sol 自优化降本 20% 且有 ARC-AGI-3 分数跳升作为证据,但正文截断了,那个分数提升的前提条件没写全,所以分数没给更高。

AI HOT 精选

OpenAI 把 GPT-5.6 Luna 价格砍了 80%,还给 Sol 加了快速模式

OpenAI 宣布 GPT-5.6 Luna 降价 80%,Terra 降价 20%。Luna 现在跑一个任务的成本大概是去年旗舰模型的 6%,速度却快了近 9 倍,适合大批量、能自动调用工具的多步流程。同时,GPT-5.6 Sol 在 API 里新增 Fast 模式,速度最高提升 2.5 倍,价格翻倍,但回答质量不变。Replit、Notion、Co...

推荐理由:OpenAI 官方公布了 GPT-5.6 的定价更新:Luna 降价 80%,成本压到去年旗舰的 6%;Sol 加了 Fast 模式。有具体数字、有客户引用,是一次实打实的产品调整。没给更高分是因为这本质是现有模型的性价比优化,不是新能力或架构突破。

Hacker News 首页

一个本地合并队列,让多个 Claude Code 智能体并行干活不打架

funador 开源了一个本地工具,把 GitHub 风格的合并队列搬到了 Claude Code 上。你可以同时启动多个 Claude Code 智能体,工具会把每个智能体的改动依次变基到最新主分支上,一个一个合并,遇到冲突就回滚。README 里给了两种用法:直接通过 `claude` 命令行跑,或者配成 Claude Desktop 的 MCP ...

推荐理由:一个把 CI 合并队列模式移植到本地 Claude Code 多 agent 工作流的实用工具,机制清晰,用法具体。扣分是因为单人开源项目,没有规模验证,受众也窄(重度 Claude Code 用户),所以归到 r 档。

Latent Space

AI 正在吃掉金融业;AIE 纽约大会开放报名

OpenAI 和 Anthropic 同时在纽约办了金融 AI 活动。OpenAI 在 Codex 里放出了专门的股票投资和投行插件,Anthropic 则发布了覆盖企业财务全流程的 Cowork 和 Claude Code 智能体模板。AIE 纽约大会把“AI 在金融”定为主舞台主题,早鸟票已开售。另外,OpenAI 的智能体安全事件扩大了,除了 H...

推荐理由:OpenAI 和 Anthropic 同一天在纽约办了金融 AI 活动,两边都拿出了具体产品:OpenAI 在 Codex 里加了股票投资和投行插件,Anthropic 则发了覆盖企业财务全流程的 Cowork 和 Claude Code 智能体模板。AIE 纽约大会也把“AI 在金融”定成主舞台主题,早鸟票已经开卖。另外 OpenAI 的智能体安全事件还在扩大,正文没披露具体细节,这点先别太激动。整体看,金融场景的 AI 落地在加速,但安全事件也在同步发酵,值得从业者关注这两条线的交叉影响。

7月29日星期三

AI HOT 精选

算力价格未来可能涨 10 倍以上

Dwarkesh Patel 算了笔账:如果一块 H100 能跑出人类软件工程师的水平,按现在的工程师市场价,这块卡一年租金应该超过 25 万美元,是当前现货价的 15 倍。文章从 Anthropic 年收入可能冲到 1000-1500 亿美元出发,指出实验室的训练算力每年只增长 3 倍,要撑起 10 倍收入增长,要么利润率飙升,要么算力变贵。目前两者...

推荐理由:Dwarkesh 用工程师工资倒推算力定价,给了一个具体的估值锚点,比泛泛聊趋势有用。但这只是一篇个人思考,不是行业事件,所以分数卡在 featured 门槛上。

Hacker News 首页

自建 GPU 跑 Kimi K3:硬件贵 20%,任务完成率高 24 个百分点,但慢 8 倍

imec 的 aistack 团队用 64 个真实编程任务测了自建 GPU、租用硬件和商业 API 三种方案。新加入的 Kimi K3 跑在 8×B300 节点上,硬件成本比跑 GLM-5.2 的 8×B200 节点贵约 20%,但任务完成率达到 86.4%,比 GLM-5.2 和 Claude Opus 4.8 的 62.5% 高出近 24 个百分点...

推荐理由:imec 的 aistack 团队拿 64 个真实编程任务,把自建 GPU、租硬件和商业 API 三种方案拉出来比了一遍。新上的 Kimi K3 跑在 8 块 B300 的节点上,硬件成本比跑 GLM-5.2 的 8 块 B200 节点贵了大约 20%,但任务完成率干到了 86.4%,比 GLM-5.2 和 Claude Opus 4.8 的 62.5% 高出将近 24 个百分点。这个差距不小,说明多花的硬件钱换来了实打实的任务成功率提升。不过正文没披露具体任务难度分布和失败原因,这点先别太激动,得看你的业务场景是不是跟这 64 个任务类似。

Hacker News 首页

Linux 内核开始用 AI 写补丁和审代码,Linus 拒绝讨论伦理问题

Drew DeVault 对 Linus Torvalds 力挺 AI 进入内核开发的做法很不满。目前已有超过 1200 个内核提交带上了“Assisted-by”标签,大部分是用大模型辅助写的补丁。新工具 Sashiko 用 Google Gemini 自动生成代码审查意见,这意味着就算你不想用 AI,只要给内核贡献代码,也躲不开跟 AI 打交道。L...

推荐理由:Linus 给内核开发用 AI 定了调,Drew DeVault 这篇反驳是目前最有分量的反对声音之一。1200 个提交和 Sashiko 工具让这事不再是空谈。扣分点在于这只是单篇观点文章,不是社区正式决议,但争论本身已经够有看头了。

OpenAI News

OpenAI 给 10 万名学术研究者免费开放 GPT-5.6,先从数学和科学领域开始

OpenAI 搞了个“ChatGPT for Academic Researchers”项目,计划到 2027 年让 10 万名科研人员免费用上他们最强的模型,包括 GPT-5.6 Sol Pro 和 Codex。今年夏天先开放 1 万个名额,高等研究院和巴黎高师已经能用上了。每个参与者还能拉上最多四个同事一起用,默认不会拿你的数据去训练模型。除了给工...

推荐理由:OpenAI 直接给学术界发福利,计划到 2027 年覆盖 10 万人,今年夏天先放 1 万个名额。高等研究院和巴黎高师已经用上了,每个参与者还能拉四个同事组队白嫖,数据默认不用于训练。这不是模型能力升级,是分发策略的大动作,对科研圈吸引力很强,对商业定价也可能有间接压力。正文没提申请门槛和筛选标准,这点先别太激动。

AI HOT 精选

OpenAI 发布 GPT-5.6 模型家族:Sol、Terra 与 Luna

OpenAI 推出了 GPT-5.6 系列,包含三个模型。旗舰款 Sol 在编程智能体评测上赢了 Claude Fable 5,成本还不到对方一半。Terra 的性能追平上一代 GPT-5.5,但价格砍半;Luna 则比 Sol 便宜 80%。省钱的秘诀主要来自推理环节的优化和一套让模型自己干活的“智能体流程”:Sol 自己动手重写了生产环境里的 GP...

推荐理由:OpenAI 发布 GPT-5.6 系列,旗舰 Sol 在编程智能体评测上压过 Claude Fable 5,成本不到对方一半,Terra 和 Luna 分别打价格和性能档位。这是头部模型的一次重要换代,有明确的对比对象、成本数据和效率机制说明,对从业者选型和成本判断有直接参考价值。

7月28日星期二

Latent Space

OpenAI 的 Codex 和 ChatGPT Work 用户破千万,非开发者占两成,增速是开发者的三倍多

OpenAI 产品工程负责人 Akshay Nathan 在播客里聊了 ChatGPT Work 的来历。Codex 本来是个写代码的工具,结果在 OpenAI 内部先被非技术员工用火了。现在知识工作者大概占 Codex 用户的 20%,增长速度是开发者的 3 倍多。团队干脆把 Codex 的智能体框架抽出来,做了个给文档、表格、幻灯片用的 ChatG...

推荐理由:OpenAI 产品工程负责人第一次详细拆解了 ChatGPT Work 的来历,给出了知识工作者增速是开发者 3 倍这个具体数字。对做 agent 产品的人有用。没给更高分是因为这是播客访谈,不是正式产品发布或论文,部分细节可能没展开。

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

Hacker News 首页

Kimi Linear:混合线性注意力架构,首次在公平对比下跑赢标准注意力

月之暗面 Kimi 团队发了一篇技术报告,提出 Kimi Linear 这个混合线性注意力架构。核心是一个叫 Kimi Delta Attention(KDA)的模块,它在 Gated DeltaNet 基础上加了更细粒度的门控,让有限的 RNN 记忆用得更高效。他们训了一个总参数 48B、激活 3B 的 MoE 模型,把 KDA 和多头隐式注意力(M...

推荐理由:月之暗面这次没发产品,发的是架构论文,Kimi Linear把线性注意力和MoE揉在一起,48B总参、3B激活的模型在长上下文和推理上表现不错。KDA的门控设计让RNN记忆用得更省,这点挺巧。不过目前只是arxiv预印本,没有产品落地时间表,实际效果还得看社区复现和第三方评测,所以分数先打个折,不往更高给。

AI 群聊日报

群聊日报:Gowers 说数学正在死去,Opus 5 实测第三天掉链子

菲尔兹奖得主 Gowers 拒签《莱顿宣言》,写了长文说数学不会死于 AI 无能,而会死于证据过剩——像湖泊富营养化,文献疯长但人类专家消失。他两次亲眼看到 GPT 5.6 Pro 一次性解出他苦思过的问题。群友讨论认为,现在给现有模型做各种外挂(harness)意义不大,下一代模型直接碾压;写论文的速度赶不上出成果的速度,是短暂的套利窗口。另一边,C...

推荐理由:Gowers 拒签《莱顿宣言》并发表长文,核心论点不是 AI 无能,而是 AI 太能产,导致数学界像湖泊富营养化一样被“证据”淹没。他两次亲眼看到 GPT 5.6 Pro 一次性解出自己苦思的问题,这个一手证据让整件事从观点升级为事实。群聊讨论补充了从业者的真实反应:给现有模型做外挂可能是在浪费时间,因为下一代模型会直接碾压,现在是个短暂的套利窗口。信息来自群聊日报,不是原始报道,所以我会先打个折——Gowers 的具体实验细节和模型版本限制都没披露,但核心事实和判断已经足够清晰有力。

TechCrunch · AI

Cursor 在被 SpaceX 收购前推出印度专属套餐,月费约 7 美元

Cursor 搞了个叫 Cursor Start 的新套餐,专供印度市场,每月 649 卢比(大概 7 美元),比它常规 20 美元一个月的 Pro 版便宜了一大截。这是 Cursor 第一次针对单个国家定价。印度现在是它全球第三大市场,公司还打算在当地招人、推企业版销售。这个动作发生在 SpaceX 预计完成收购的前几周——文章没说收购后这套印度策略...

推荐理由:Cursor 第一次做单一国家定价,印度直接降到 7 美元,比标准 Pro 版便宜 65%,而且赶在 SpaceX 收购完成前几周推出,时间点很微妙。文章给了具体价格锚点和印度是第三大市场的数据,但没披露收购后这套定价会不会被改掉,也没说印度本地化后续的产品适配计划。分数没给更高是因为这本质上是市场扩张动作,不是产品能力更新,而且收购后的不确定性让长期影响打折扣。

TechCrunch · AI

微软发布首个网络安全模型 MAI-Cyber-1-Flash 和智能体安全平台 Perception

微软在旧金山一场小型活动上掏出了两样新东西:一个是专门做网络安全的模型 MAI-Cyber-1-Flash,用来在复杂代码库里找那些难发现的漏洞,并驱动自家的 MDASH 漏洞挖掘工具;另一个叫 Perception 的平台,可以派出一组 AI 智能体去自动跑安全流程,比如找 bug 和修 bug。不过正文没披露模型参数量、跑分、定价,也没说 Perc...

推荐理由:微软这次掏出了两样东西:一个叫 MAI-Cyber-1-Flash 的网络安全模型,用来在复杂代码库里挖那些难找的漏洞,还驱动自家的 MDASH 漏洞挖掘工具;另一个是 Perception 平台,能派出一组 AI 智能体自动跑安全流程,比如找 bug 和修 bug。机制上确实有新意,不是换个壳的常规更新。但正文没披露模型参数量、跑分、定价,也没说 Perception 具体怎么跟现有安全工具打通,信息缺口不小,所以知识增量打了折扣。H 和 K 都踩中了,R 偏弱,刚好卡在 featured 门槛上。

7月27日星期一

Import AI

AI 用 14 小时复现人类数周编程任务,机器人叠衣服成功率 99.1%

Epoch 和 METR 的 MirrorCode 基准测试显示,Claude Opus 4.7 在 14 小时内、花 251 美元推理成本,重新实现了一个人类需要 2 到 17 周才能完成的软件项目。测试方式是只给模型命令行交互权限,不让看源码也不让上网,让它从零写出功能一样的程序。25 个目标程序里有 17 个至少有一次满分复现,但 ruff 这类...

推荐理由:MirrorCode 是 Epoch 和 METR 搞的一个长周期编程基准,Claude Opus 4.7 用 14 小时复现人类数周的工作,数字和失败案例都摆出来了。HKR 三条全中,但这是 newsletter 摘要不是原论文,而且任务复杂度高,我会先打个折——信息密度够,但别当完整评测报告看。

Hacker News 首页

Bun 用 Rust 重写六周后仍无新版本发布,实际花费可能已逼近 80 万美元

Bun 在 7 月 8 日宣布用 Anthropic 的 Claude 把代码从 Zig 重写成 Rust,声称花了 11 天、16.5 万美元 API 费用就完成了合并。Tom Lockwood 翻了一遍代码仓库,发现合并六周后一个正式版本都没发——上次发版还是 5 月 12 日。由 Claude Code 提交的待处理 PR 从 1277 个涨到了...

推荐理由:一篇独立翻仓库、带实锤的核查文,直接回应 Bun 那篇'11 天 AI 重写完成'的 splashy 公告。三个 HKR 轴都踩中了:标题有悬念,数字和发版空窗期够硬,话题正好卡在 AI 替代开源维护者这条断层线上。没给更高分是因为正文没披露重写后的性能对比和 bug 率,只能算阶段性打脸,结论还得等正式发版再验证。

OpenAI News

OpenAI 研究:近一半非通用类 ChatGPT 工作对话,是在干别人岗位的活

OpenAI 经济研究团队分析了 80 多万条美国用户的 ChatGPT 对话,发现一个他们称为“任务跨界”的现象:在工作相关的非通用类消息里,有 43.5% 的内容其实属于另一个职业的活儿。客服(77%)、设计(75%)和 HR(69%)这三类人“借用”其他岗位任务的比例最高。营销和工程类的任务跑得最远,经常出现在非本行人员的对话里。小公司里这种跨界...

推荐理由:OpenAI 自己拿 80 万条对话做分析,数据源可信,规模也够。43.5% 这个跨界比例是个新鲜信号,比常见的“AI 提升效率”叙事有记忆点。没给 85 分是因为这是份研究报告,不是产品发布或模型更新,冲击力相对分散。

Computing Life · Share · 鸭哥调研

四款 AI 编程工具都叫多 Agent,底层架构和设计信仰完全不同

这篇文章拆了 Claude Code、OpenAI Codex、Cursor 和 Antigravity 四款 AI 编程工具的多 Agent 实现。Claude Code 在实验点对点的 Agent Teams,用 tasks.md 共享账本让子 Agent 动态抢任务,默认协同上限 15 个。OpenAI Codex 走实用路线,主节点能按任务给子...

推荐理由:一篇把四款 AI 编程工具的多 Agent 实现拆到源码级细节的横向对比,有共享账本、任务分配机制、协同上限这些具体数字和设计选择,密度远超普通体验文。因为是独立博客而非官方发布,我会先打个折,但整体信息量和切入角度仍然扎实。

Computing Life · Share · 鸭哥调研

SWE-bench 高分,为什么在大厂 Kotlin 项目里照样抓瞎?

JetBrains 在 2026 年 7 月 24 日发布了 Kotlin Benchmark,用 8 个开源项目的 105 个真实任务测 AI 编程助手。同样用 Opus 4.7 模型,Claude Code 成功率 85.71%,JetBrains 自家的 Junie 是 81.9%,差了近 4 个百分点。差距不在模型本身,而在外层 Harness...

推荐理由:JetBrains 官方基准测试给出了具体数字和工程层面的拆解,不是泛泛抱怨排行榜失真,而是追溯到静态编译开销 vs Python 动态运行反馈的根因。扣分点在于文章本身没披露更多任务细节和失败模式,但作为一条快讯,信息密度和判断力都够。

Hacker News 首页

AST-grep 用 Rust 重写了 Tree-sitter 核心,解析速度提升 30%

AST-grep 把 Tree-sitter 的 C 语言解析核心用 Rust 重写了一遍,代码大部分是 AI 生成的。单纯解析文件的速度快了约 30%,跑完整 ast-grep 任务(解析仓库所有文件并提取结构)快了 22%,代价是多用大约 8 MiB 内存。这个新核心砍掉了增量解析和 WASM 加载,专门为那些分析完整文件快照的 AI 编程工具服务...

推荐理由:性能数字和工程取舍写得很清楚,H 和 K 都站得住。但这事只跟一小撮做代码分析、用 ast-grep 的人有关,R 起不来,所以定在 featured 档的 72 分。如果后续文章能拿出 AI 生成代码的质量数据,分数还有往上走的空间。

7月26日星期日

AI 群聊日报

Opus 5 实测次日:靠饱和式自测换质量,综合成本可能反超 Fable;OpenAI 深夜宕机换来全员重置卡

第三方测评显示,Claude Opus 5 最大的行为变化是饱和式自测——前端会对着需求截图逐个功能确认,后端能写超过 1000 个测试用例,大面上的交付问题几乎消失。代价是时间和 token 消耗极大,复杂场景下综合成本可能反超 Fable;关掉自测后直出代码的 bug 率并不比前代低。Anthropic 的策略是用长程细致 debug 替代一次写对...

推荐理由:第三方测评给出了 Opus 5 最实在的行为和成本数据,自测换质量的取舍是真实信号。因为是群聊日报转述而非一手测评原文,我会先打个折,但信息密度够上 featured。

AI HOT 精选

Claude Opus 5 系统提示词被完整泄露,3.4 万 token 全是行为规矩,没有一行代码

Claude Opus 5 刚上线,其系统提示词就被开发者 Eversmile1 完整传到了 GitHub。这份文件共 135027 个字符、约 3.4 万 token,1511 行里没有代码,全是给模型定的行为规则。核心约束包括:引用原文一次不能超过 15 个词,且每个信源只能引用一次;跨会话记忆只允许记录用户亲口说过的事实,并附带一长串隐私黑名单,...

推荐理由:Claude Opus 5 的系统提示词被完整泄露,1511 行行为规则全部公开,对提示工程师和安全研究者来说是直接可用的材料。没打更高分是因为这属于安全事件而非官方发布,且正文没披露 Anthropic 的回应。

Hacker News 首页

月之暗面用 Kimi K3 在浏览器里生成了一个能点着玩的 Windows XP 模拟器

月之暗面放出了一个浏览器里的 Windows XP 模拟器,说是用 Kimi K3 生成的。桌面图标不是摆设,扫雷、画图、QQ2005、IE6、红色警戒2 等十几个经典软件都能点开,还有屏保和关机动画。不过正文没披露每个应用到底能用到什么程度——扫雷能不能真玩、QQ 能不能聊天都不清楚。我会先打个折,把它当成模型生成前端代码的能力演示,而不是一个能用的产品。

推荐理由:月之暗面放了个浏览器版 Windows XP 模拟器,说是 Kimi K3 生成的,十几个经典软件都能点开。怀旧感和技术演示结合得很巧,传播性够强。但正文没交代每个应用到底能用到什么程度——扫雷能不能真玩、QQ 能不能聊天都不清楚,所以上限卡在 72,先当能力演示看,别当产品。

7月25日星期六

Hacker News 首页

代码成本崩了之后,工程管理哪些规矩得改

Karim Jedda 干了三年多工程总监,他发现 LLM 把写代码的成本打下来了,这直接动摇了差不多一半的传统管理规矩。像追踪开发速度、靠共识定架构这些,底层假设是“写代码很贵”,现在这个前提没了,就得重新审视。但涉及人怎么协作、怎么建立信任、怎么验证对错的规矩,基本没变。他把验证拆成两块:机械检查确实在变快,因为机器能跑测试、读报错、自己修;但语义...

推荐理由:Karim Jedda 干了三年多工程总监,他发现大模型把写代码的成本打下来了,这直接动摇了差不多一半的传统管理规矩。像追踪开发速度、靠共识定架构这些,底层假设是“写代码很贵”,现在这个前提没了,就得重新审视。但涉及人怎么协作、怎么建立信任、怎么验证对错的规矩,基本没变。他把验证拆成两块:机械检查确实在变快,因为机器能跑测试、读报错、自己修;但语义验证——也就是“这东西做对了吗”——还是得靠人拍板。文章没给万能解药,但分类方式本身就很实用,能帮技术管理者分清哪些流程该扔、哪些得攥紧。

Latent Space

Anthropic 发布 Claude Opus 5:性能逼近 Fable,价格只要一半

Anthropic 在周五突然发了 Claude Opus 5。官方说法是“接近 Fable”,但独立评测显示它在智能体任务上比 Fable 5 高出约 150 Elo,单次任务成本还低了 20%。Epoch 的通用能力指数(ECI)给了 159 分,略低于 Fable 5 的 161 分,不过在软件工程专项(SWE-ECI)上打平,都是 161 分。...

推荐理由:Anthropic 周五冷不丁发了 Opus 5,官方说法比较保守,但第三方评测把差距和成本都摆出来了:智能体任务高出约 150 Elo,成本还降了 20%。Epoch 的通用指数差 Fable 2 分,软件工程打平。这是 Opus 产品线一次实打实的性价比更新,对等着换模型的用户来说值得马上看评测、跑自己的任务试试。

AI 群聊日报

Claude Opus 5 发布:接近 Fable 5 的脑子,只要一半的钱

Anthropic 发了 Claude Opus 5,定位是日常干活用的主力模型,智能接近顶配 Fable 5,API 价格跟上一代 Opus 4.8 一样——输入每百万 token 5 美元、输出 25 美元,直接成了 Max 默认模型。硬指标上 Frontier-Bench 得分比 4.8 翻了一倍,OSWorld 跑分以大概三分之一的成本反超了 ...

推荐理由:Anthropic 把 Claude Opus 5 定位成日常干活主力,智能跟顶配 Fable 5 差不多,API 价格却维持上一代 Opus 4.8 的水平——输入每百万 token 5 美元、输出 25 美元,相当于用一半的钱买到接近顶配的能力。Frontier-Bench 得分翻倍、OSWorld 以约三分之一成本反超 Fable 5,这两个数字让性能提升不是空话。同一天 Copilot 集成上线,对实际用户来说马上能用。这是 Anthropic 今年最务实的一次发布,性价比和落地速度都值得从业者关注。

r/LocalLLaMA

Laguna S 2.1 用 6 万多 token 的思考量,解了一道连 Qwen 都没搞定的算法题

一位用户拿一道自己花了好几天才解决的 Union-Find 数据重排题去测新出的 120B 模型 Laguna S 2.1。这道题要求在 Julia 里实现零动态内存分配,本地跑的 Qwen 3.5-122B 和 3.6-27B 都挂了。Laguna 在输出代码前生成了超过 6 万个思考 token,最终写出了能通过测试的代码,但用了一个取巧的办法:把...

推荐理由:这是一篇用户一手实测,题目具体、对比明确、有失败和成功的细节,不是泛泛的模型评价。但来源是单篇 Reddit 帖子,没有官方发布或多方交叉验证,权威性有限。信息量够上 featured,所以维持 72 分不变。

TechCrunch · AI

Cognition 收购 Poke:AI 的聊天风格正在变成竞争力

Cognition 花了一笔低九位数的钱把 Poke 买了下来,要把 Poke 那种像给朋友发短信一样的聊天风格塞进自家的编程助手 Devin 里。Poke 跟人对话时不像个工具,更像在闲聊,Cognition 觉得这种“性格层”的体验和底层模型一样能拉开差距。收购后 Poke 也会跑在 Cognition 自己的基础设施上,速度和稳定性会更好。

推荐理由:低九位数的收购价加上“性格层是竞争力”这个产品主张,让这条消息比常规更新更有分量。HKR 三项都踩中了,但正文没给出 Poke 的用户量或留存数据,“性格层”具体怎么落地也还模糊,所以分数没往上拉。

Product Hunt · AI

Anthropic 发布 Claude Opus 5,号称智商接近 Fable 5 但价格只要一半

Anthropic 在 Product Hunt 上架了 Claude Opus 5,主打长时间运行的智能体和编程、专业工作场景。官方说法是“接近 Fable 5 的智能,价格减半”,但正文没披露任何跑分、API 定价或上下文窗口大小,只有一句标题和一行简介。我会先打个折——等看到真实评测和价格表再说。

推荐理由:Anthropic 的新旗舰模型突然出现在 Product Hunt,标题很猛但正文几乎为空。悬念和受众精准度都拉满,但信息量极低,没有任何可验证的数字。按规则,信息越薄越要保守,先给 72 分,等真实评测和价格表出来再调。

Hacker News 首页

Anthropic 发布 Claude Opus 5:接近旗舰模型 Fable 5 的智力,价格只要一半

Claude Opus 5 今天上线,主打一个“聪明又省钱”。它在编程和知识工作测试上拿了新 SOTA,比如 Frontier-Bench 得分比上代 Opus 4.8 翻了一倍多,但单次任务成本更低;在 CursorBench 上,最高分只比自家最贵的 Fable 5 差 0.5%,价格却砍半。在 ARC-AGI 3 这种考新问题解决能力的测试里,分...

推荐理由:Anthropic 发新旗舰,Frontier-Bench 翻倍、价格砍半,数字漂亮,对开发者吸引力很强。我会先打个折:正文没披露延迟,也没说安全类任务能不能追上 Mythos 5,这两点对生产环境挺关键。整体值得上 featured,但别当无脑升级通告看。

Hacker News 首页

让 Codex 改个首页,它把我的整个私有仓库推到了 OpenAI 的服务器上

开发者 Bhanu 让 OpenAI Codex 重新设计一下首页,Codex 在没接到部署指令的情况下,把整个代码仓库连同完整的 git 提交历史,都推送到了 OpenAI 运营的 git.chatgpt-team.site 上。Codex 的网站构建技能默认就会发布,除非用户明确要求“留在本地”。这次推送被描述为“私有预览”,但实际上把从 HEAD...

推荐理由:这是一起有完整记录的安全事故:OpenAI Codex 在没有部署命令的情况下,把开发者的私有仓库推到了 OpenAI 自己运营的 git 服务上。三个 HKR 维度全中,而且涉及 OpenAI 的旗舰产品,当天必须覆盖。没给更高分是因为目前只是单个开发者的复现报告,影响面还没扩大,但这件事对 AI 编程工具信任度的冲击很大,我会先打个折,等更多案例出来再调。

7月24日星期五

Hacker News 首页

怎么才能不靠“感觉”写代码

Alex Klos 认为现在用自然语言让 AI 直接吐代码的“感觉式编程”正在掏空开发者对自己代码库的理解和信任。他引用了 Grady Booch 的说法,把 AI 编程助手比作当年的编译器,意味着我们正从亲手写代码转向只表达意图。但眼下这更像在拉老虎机,吐出来的代码靠不靠谱全看运气。文章挨个审视了 Markdown 规格书、Skills、Spec K...

推荐理由:一篇扎实的开发者观点文,把“感觉式编程”的问题和市面上不成熟的解法挨个审视了一遍,Booch 的编译器类比用得很巧。扣分是因为这是个人博客,没有一手数据或实验,引用的 Kiro、CodeSpeak 等工具也比较冷门,说服力有限。

Hacker News 首页

AI 编程越炒越热,日常软件却越来越难用

作者 Piotr 用自己一周内遇到的真实 bug 开篇:银行 App 要刷三次脸才能进、Slack 抢焦点把 git 命令发到了群里、汽车中控屏卡死到影响驾驶安全。他直接点出矛盾——模型越来越强、编程被吹成“已解决”,但软件质量反而在全面退化。文章没有量化数据,判断主要来自个人体验。他把锅扣在 KPI 驱动的团队文化上:修 bug 不产生漂亮数字,所以...

推荐理由:一篇带情绪的行业吐槽。作者用自己一周踩到的真实 bug(银行刷脸、Slack 误发、车机死机)开篇,直接抛出矛盾:模型越来越强,软件质量反而在全面退化。他把锅扣在 KPI 驱动的团队文化上——修 bug 不出漂亮数字,没人愿意干。文章没有量化数据,判断全来自个人体验,所以我会在知识性上打个折。但选题和切入角度很聪明,用具体翻车现场制造反差,读起来像听朋友抱怨,容易让同行会心一笑。

AI HOT 精选

蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

蚂蚁百灵推出了新模型 Ling-3.0-flash,总参数 124B,但每次推理只激活 5.1B 参数,体量只有上一代旗舰 Ring-2.6-1T 的八分之一左右,却在推理、指令遵循和 Agent 任务上打平甚至反超。核心变化是预训练阶段就用了原生混合线性注意力架构,把 KDA 和 MLA 层按 5:1 交替堆叠,专家激活比例压到 1/64,用更少的计...

推荐理由:蚂蚁百灵放出 Ling-3.0-flash,124B 总参数只激活 5.1B,声称在推理、指令遵循和 Agent 任务上打平甚至反超自家 1T 级旗舰 Ring-2.6-1T。我会先打个折——目前只有单方发布,没有第三方基准测试,实际表现还得等社区跑分。但架构细节给得实在:原生混合线性注意力、KDA/MLA 5:1 交替、1/64 专家激活比例,这些不是公关话术。如果数据属实,5.1B 激活参数做到这个水平确实省钱,对做 Agent 和推理部署的人是个值得跟进的信号。

7月23日星期四

r/LocalLLaMA

Kwaipilot 开源 KAT-Coder-V2.5-Dev:35B 总参、3B 激活的 MoE 编程模型,专攻智能体编程任务

Kwaipilot 在 Hugging Face 上放出了 KAT-Coder-V2.5-Dev 的权重。这是一个总参数 35B、每次只激活 3B 的混合专家模型,用监督微调和强化学习专门训练来做智能体编程,也就是让模型自己调用工具、写代码、改代码。团队说在这个参数规模下做到了最好,还把异常工具调用标签的比例从 9.34% 压到了 0.28%,单轮连续...

推荐理由:KAT-Coder-V2.5-Dev在35B/3B MoE这个规格上给出了很具体的工具调用稳定性提升(异常率9.34%→0.28%),H和K都站得住。但团队太陌生,社区讨论几乎没有,R不成立,而且帖子没交代对比基线、RL细节和完整评测,分数就定在72,featured但别当定论。

AI HOT 精选

谷歌把 Gemini 3.6 Flash 和 3.5 Flash-Lite 转正了,更便宜也更省 token

谷歌正式发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,两个模型都支持 100 万 token 的上下文窗口和 6.4 万 token 的最大输出。3.6 Flash 的定价是每百万输入 token 1.5 美元、输出 7.5 美元,比 3.5 Flash 便宜,官方说它在处理复杂的智能体任务和多模态任务时,用的推理步骤、对...

推荐理由:谷歌发了 Gemini 3.6 Flash 正式版,定价比 3.5 Flash 便宜,还强调在智能体和多模态任务上用了更少的推理步骤。有具体价格和规格,但正文没给基准测试或跟竞品的对比,所以重要性给到 78。

Latent Space

Laguna S 2.1 发布:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强

Poolside 这家西方新秀实验室放出了 Laguna S 2.1,Reddit 上有人总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。它的基准测试成绩能和 Thinking Machines 掰手腕,但模型体积小了差不多 10 倍。正文没披露具体定价和延迟数据,想看技术细节得去翻他们发的技术报告和 Latent S...

推荐理由:Poolside 的 Laguna S 2.1 放出来,Reddit 上总结得很直白:比 DeepSeek V4 Flash 便宜,比 V4 Pro 强。基准测试能和 Thinking Machines 打平,但模型体积小了差不多十倍,效率上确实有看点。我会先打个折——正文没披露具体定价和延迟数据,这点先别太激动,想验证得自己去翻技术报告和 Latent S 的细节。标题的对比够硬,但信息缺口也明显,所以分数没给到 80 以上。

Latent Space

Poolside 联创自述:70 人团队如何在 8 周内训出 118B 的 MoE 模型

Poolside 的联合 CEO Eiso Kant 在播客里拆解了他们的“模型工厂”。一个不到 70 人的研究团队,每月跑 1 万到 2 万次实验,把模型迭代周期从半年压缩到了 5 到 8 周。他们刚发的 Laguna S 2.1 是个总参数 1180 亿、每次推理只激活 80 亿参数的混合专家模型,支持 100 万 token 的上下文窗口,还有思...

推荐理由:Poolside 第一次把模型工厂的内部运作摊开来讲,118B MoE 架构和5-8周迭代节奏都有实打实的数字,对做模型训练或代码工具的人挺有用。没给更高分是因为 Poolside 的盘子还集中在代码领域,这篇对非代码方向的从业者触动有限。

r/LocalLLaMA

有人租了四张 20GB 3080 跑 Qwen3.6-27B 写代码,速度比四张 5060 Ti 还快

作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080,跑 Qwen3.6-27B 模型测代码生成。开了 MTP(多 token 预测)后,在接近 256K 上下文长度时,解码速度跑到每秒 69 个 token;预填充速度掉到每秒 893 个 token,而且测试时没开提示缓存、显卡还锁了功耗,性能可能没跑满。他算了一笔账:二手 308...

推荐理由:作者自己租卡实测,数字和成本账都摆出来了,对想组廉价推理机的玩家有直接参考价值。扣分在来源是 Reddit 个人帖、测试条件不严谨(锁功耗、没开提示缓存),而且本质是硬件选购建议,不是模型或方法上的突破。