跳到正文

#编码

今日 0 条

9月28日星期一

9月25日星期五

Simon Willison

Simon Willison:编码智能体让软件工程变得更难

Simon Willison 表示,与编码智能体协作越久,越确信它们让软件工程变得更难。借助智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。

9月23日星期三

9月21日星期一

Simon Willison

工程师爆料:大公司团队全靠 Claude Code 写代码,无人阅读任何产出

一名新入职大公司的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。团队无人喜欢这种方式,却被高层要求尽可能多地产出,因为高层认为推送代码不是瓶颈;人们每天工作 12 到 13 小时,只是为了按回车,没有人阅读任何内容。

9月18日星期五

GitHub Blog · AI & ML

GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,可组合使用;RAG 并未死亡,它为模型提供训练数据之外的相关信息,减少 token 浪费并让回答更有依据。

6月10日星期三

AI HOT 精选

Claude Code 团队成员 Thariq 的十条效率建议:从检查它做没做对,转向检查它做没做对的事

Thariq 的核心观点是换个思路用 Claude Code:别老盯着输出结果挑错,先确保它接对了任务。他给了十条具体做法。第一,一上来就把项目背景、限制条件全丢给它,把它当能跟你讨论的同事,而不是个补丁工具。第二,用一份简短的需求文档引导 Claude 反问你细节,把模糊想法聊清楚。第三,让它同时探索几个方案,直接生成 HTML 原型给你看,比看文字...

推荐理由:这篇是 Claude Code 的实战教程,干货密度高。Thariq 没讲大道理,而是给了十条能立刻上手的操作,比如先把项目背景全丢给模型、用需求文档引导它反问细节、让它同时跑几个方案出 HTML 原型对比。核心思路是把 Claude 当能讨论的同事,而不是补丁工具,这个视角切换本身就值回票价。内部人士分享加上三条 HKR 全中,放在 featured 没问题。

6月9日星期二

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

6月7日星期日

新智元 · 公众号

Anthropic 联创说 Claude 现在写了公司 80% 的合并代码,两年内可能到 100%

Anthropic 联合创始人 Jack Clark 公开说,Claude 目前产出了公司里 80% 被合并进主干的代码,他预计两年内这个比例会到 100%。另外文章提到,2026 年第二季度 Anthropic 工程师人均每天合并的代码量是 2024 年的 8 倍。不过原文因为微信环境验证问题,正文没抓到,这些数字的具体口径和统计方式没法核实,先打个折看。

推荐理由:HKR 三项都成立:Jack Clark 亲口说的代码占比数字是个硬钩子,事实点够具体,而且对从业者的职业焦虑和效率想象都有触动。这不是模型发布或重大产品更新,所以分数留在 78–84 区间合理。正文没抓到,统计口径没法核实,我会先打个折看。

6月5日星期五

新智元 · 公众号

Anthropic 警告 AI 研发已进入自我加速期,OpenAI 被指跨过可靠性门槛

这篇文章本身因为微信环境验证没抓到正文,只能根据已有的英文标题和摘要来还原。核心信息是两条:一是 Yann Dubois 在采访里说 OpenAI 大概在去年 12 月跨过了一个“可靠性阈值”,具体指什么、怎么验证的,正文没披露;二是 Anthropic 内部数据显示,到 2026 年第二季度,公司里每人每季度的代码贡献量已经是 2024 年第一季度的...

推荐理由:我会先打个折,因为这是二手采访分析,不是官方发布或可复现的测试。但三条理由都站得住:标题里的“可靠性阈值”是个悬念钩子,正文抛出了两个带时间或倍数的具体说法,而且讨论的是中美从业者都在盯的算力差距和效率竞赛。所以给到 82 分,放在 featured 位置,不往上拔了。

AI HOT 精选

腾讯汤道生说今年大部分代码是 AI 写的,工程师转向架构设计和纠偏

汤道生在腾讯云 AI 大会上说,今年腾讯大部分代码都由 AI 生成,工程师主要精力放在架构设计,定期指导、修正 AI 的输出。这个“大部分”具体指什么口径(行数、提交次数还是项目占比),正文没披露,所以先打个折听。另外,腾讯去年在 AI 新产品上投了 180 亿元,总裁刘炽平说今年投入至少翻倍,同时 Q1 财报提到他们重构了 AI 基础设施,搭了 Hy...

推荐理由:HKR 三项都过:有明确的访问对象和事件,有 180 亿投入和翻倍计划这两个硬数字,话题也踩在从业者关心的中美算力效率竞赛上。但“大部分代码”的口径没公开,属于高管自述,不是产品发布或独立评测,所以卡在 featured 门槛上方,不给更高。

AI HOT 精选

共存:当 AI 不再只是你的副驾驶

Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版。他认为过去那种把 AI 当聊天机器人、你来我往的“协同智能”正在过时。AI 公司的目标一直是造出能自己干活的智能体,而 2025 年底出现的编程智能体让这个目标变近了。他引用了两项数据:一项研究显示代码产出量翻了 17 倍,Anthropic 也声称自家 80...

推荐理由:Mollick 这篇更像一篇立场文章加新书预告,不是模型发布或可复现实验。他引的两组数据——代码产出 17 倍和 Anthropic 的 80%——都来自外部或厂商自述,原文没给出验证细节。判断“协同智能过时”主要挂在他对 2025 年底编程智能体的观察上,但法案文本和执行时间表都缺失,所以冲击力强但信息有缺口,放在 featured 合适。

6月3日星期三

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

AI HOT 精选

智能体工程实战窍门全录

@mvanhorn 分享了一套让 AI 智能体干活的工程方法,核心是把开发流程从“人写代码”扭成“人定方向、智能体执行”,工作台从 IDE 搬到了终端和一份 plan.md 计划文件。整体走 Research → Plan → Work 循环,用 plan.md 来约束智能体行为。帖子总结了 22 条实战技巧,覆盖规划、并行执行、输入方式、远程控制这些...

推荐理由:这是一篇从业者的方法总结,不是模型发布或产品上线。正文没披露完整工具栈清单,所以我会先打个折。但 Research→Plan→Work 循环和 plan.md 约束的思路很具体,22条技巧也给了可操作的抓手,对正在折腾智能体工程的人有直接参考价值,放在 featured 档刚好。

AI HOT 精选

Claude Code 团队自述:把编程工作默认交给智能体后,我们的流程和分工全变了

Claude Code 的工程主管在 Code w/ Claude SF 2026 活动上分享了团队内部的变化。他们把智能体编程(让模型直接写代码、改代码)设为默认工作方式后,砍掉了传统的详细需求文档,改成“即时规划”——在动手前先让 Claude 收集上下文、理清任务。代码审查环节,Claude 会先过一遍代码风格和测试覆盖,人则把精力集中在法律合规...

推荐理由:这是 Anthropic 自家团队在 Code w/ Claude SF 2026 上的分享,不是模型发布或重大产品更新,所以分数压在 80 分左右。亮点在于他们公开了内部怎么用 Claude Code 干活:规划从提前设计改成即时按需,写代码前先让 Claude 把上下文理一遍,审查环节把风格和测试甩给 Claude,人只做法律和安全判断。这些机制写得实在,没有画饼,对工程团队有直接参考价值。但正文没披露具体效率数据或量化对比,所以别当性能报告看。

6月2日星期二

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

6月1日星期一

AI HOT 精选

开源与闭源模型,正走在两条不同的增长曲线上

作者 Nathan Lambert 的核心判断是:在编程智能体这类对智商极度敏感的场景里,用户会一直为最聪明的闭源模型付高价,他自己就愿意每月掏 2000 美元。闭源实验室会逐渐把最好的模型藏起来,不在 API 里轻易放出,以保护利润和防止被蒸馏。他预测 5 到 10 年内,OpenAI 和 Anthropic 的估值会到 2 万亿到 10 万亿美元,...

推荐理由:我会先打个折,这是一篇个人评论,不是系统研究,所以重要性停在 featured 门槛附近是合理的。但它的 HKR 三项都站得住:观点有明确的冲突框架(h),给出了可引用的价格和估值数字(k),讨论的议题正好是当下圈子里吵得最凶的那几个(r)。正文没披露这些估值模型的具体假设,所以数字本身先别太激动,但它们作为讨论的引子够用了。

5月29日星期五

阮一峰的网络日志

Token 费用难以负担

OpenAI 员工晒出自己一个月的 Token 用量:760 万次请求,6030 亿 Token,按公开费率算价值 130 万美元。虽然他是内部员工不用掏钱,但这个量级让外界看清了一件事——如果放开让程序员用顶级模型,一个人一年光 Token 费就可能上亿人民币。换成国内便宜的开源模型,也要两三百万。Uber 今年头四个月就烧完了全年 34 亿美元的 ...

推荐理由:Peter Steinberger的CodexBar使用数据把Token费用问题算成了一笔明账:一个月760万次请求、6030亿Token,按预设费率估算价值130万美元。这个数字够具体,也够吓人,直接点出了AI编程工具在规模化使用时的成本压力。文章不是产品发布或模型评测,而是从业者的真实账单分享,对正在评估AI工具成本的团队来说,比任何公关稿都实在。

Computing Life · Share · 鸭哥调研

Claude Code 动态工作流:把确定性边界画在了控制流、执行和验证之间

Anthropic 给 Claude Code 加了个动态工作流功能,本质是用一段 JS 脚本接管控制流,让脚本决定先做什么、后做什么、什么时候并行,但具体干活还是交给多个子 agent 各自在自己的上下文窗口里跑。这么设计是因为 agent 跑久了会忘事、自己验自己也不靠谱,所以把不会忘的控制流交给代码,把需要灵活探索的执行交给 agent,把验证拆...

推荐理由:这篇文章不是 Anthropic 官方发布,也没有实验数据,但它的价值在于把 Claude Code 动态工作流里“哪里该写死、哪里可以放手让模型跑”这个边界问题讲透了。三层机制拆得干净,对正在踩坑的从业者来说,比泛泛讲 agent 靠谱多了。我会先打个折,因为正文没披露具体验证指标,判断更多是架构层面的分析,所以放在 featured 里偏中上的位置。

Latent Space

异步 Agent 时代来了:Cognition 的 Walden Yan 和 OpenInspect 的 Cole Murray 聊背景干活、从需求直接到...

这期播客聊的是 AI 编程工具正在从“在编辑器里帮你补全代码”转向“在后台独立完成整个任务”。Cognition 的首席产品官 Walden Yan 和 OpenInspect 的 Cole Murray 分享了他们看到的趋势:Devin 合并的 PR 数量涨了 7 倍,Cognition 自家仓库里由 AI 生成的提交占比从 16% 飙升到了 80%...

推荐理由:H、K、R 三项都站得住:Cognition 自家仓库的数据让这篇访谈不只是 agent 口号。分数留在 78 分,因为它本质还是访谈和趋势观察,不是重大模型或产品发布。

5月28日星期四

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

AI HOT 精选

Anthropic 和 OpenAI 把编程助手从包月套餐改成按量收费,我觉得他们终于找到赚钱的感觉了

Simon Willison 发现,从 2026 年 4 月起,Anthropic 和 OpenAI 悄悄把企业版编程助手(Claude Code/Cowork 和 Codex)的收费方式从固定座位费改成了按 API 调用量计费,跟直接买 token 一个价。他自己一个月用这些工具烧掉的 token 折合 2180 美元,但个人套餐只要 200 美元,...

推荐理由:这篇不是官方公告,是一篇行业评论,但它抓的点很实在:Anthropic 和 OpenAI 在 2026 年 4 月前后把编程智能体的收费从打折卖席位改成按 API 调用量算钱。我会先打个折——正文没给出具体定价数字或客户迁移数据,所以“找到产品市场契合点”更多是作者基于计费模式转向的判断,不是有财报支撑的结论。但这点本身对从业者有用,因为它直接关系到采购和用量评估。整体属于有观点、有信息缺口、但不虚的评论,放在 featured 档位合理。

5月26日星期二

The Verge · AI

Uber 总裁说 AI 的钱越来越难花得值

Uber 总裁 Andrew Macdonald 公开说,公司 2026 年的 AI 预算四个月就烧完了,但 Claude Code 的 token 消耗量涨上去之后,并没有看到能交付给用户的实际功能跟着明显变多。他原话是“很难在 AI 花销和产品产出之间画一条线”。正文没披露具体花了多少钱,也没说哪些功能是 AI 驱动的,所以这个“没产出”的判断目前...

推荐理由:这条消息的价值不在技术本身,而在于一个每年花大钱买 AI 工具的大公司总裁公开说“账越来越难算”。我会先打个折:正文没披露具体预算金额,也没给出 token 消耗和功能交付的对照数据,所以不能当定量证据用。但“4 个月花光全年预算”这个事实本身已经足够说明成本压力,加上 Claude Code 用量还在上升,说明不是砍预算而是产出没跟上。对 AI 从业者来说,这比任何 benchmark 都更真实地反映了当前工具链的 ROI 焦虑。

5月24日星期日

Computing Life · Share · 鸭哥调研

你编程十年,但在 AI 面前还是个新手

Flask 作者 Armin Ronacher 用 Pi 开发 Pi 时发现,项目 issue 里 83% 被自动关闭,因为大量 AI 生成的报告虽然行文专业、推理自洽,但结论是错的。问题不在 AI 代码质量差,而在于很多老手还在用过去的直觉判断 AI 输出——人类的错误有迹可循,AI 却会在一个错误假设上推导出一整套看似滴水不漏的方案,老手的经验识别...

推荐理由:这篇不是模型发布或产品上线,而是围绕 Armin Ronacher 用自家工具 Pi 开发 Pi 这件事的评论。我会先打个折,因为争议本身不算新,但 issue tracker 的数据让讨论落到了可查证的事实上,不是纯嘴炮。对天天跟 AI 结对编程的人来说,这种“老手翻车”的案例比 benchmark 更有说服力,所以给到 featured。

5月23日星期六

r/LocalLLaMA

Agent 里的调度模型能做多小?有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

这篇帖子来自一个叫 HomoAgens1 的本地部署实验,他把 Agent 的调度模型和写代码的大模型拆开看,专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型,实际干活时只激活约 3B 参数,跑在一块 12GB 显存的 GPU 上,关了 30 个专家做 offload,生成速度能到每秒 40 个 token。实验发现...

推荐理由:我会先打个折:这是 Reddit 上的单人实验,不是正式发布,结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排,3B 激活参数就能在 12GB 显卡上跑到 40 t/s,成本够低。更小的模型不是推理先崩,而是工具调用纪律先坏,这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字,对想在家用显卡上折腾 agent 的人是一手好参考。

AI HOT 精选

智能体工作负载正在改写推理成本账本

SemiAnalysis 扒了 43.2 万条真实编码智能体的请求记录,输入 token 的中位数不是大家常说的 3.2 万或 6.4 万,而是 9.6 万。这个量级意味着模型在接到你的问题之前,已经吞下了比《了不起的盖茨比》全书还长的上下文。正文没披露用了哪些模型、成本曲线、采样方式和统计时间窗口,所以这个数字先当个参考,别急着拿它算账。

推荐理由:HKR 三项都过:SemiAnalysis 拿出了一个 43.2 万条编码智能体请求的数据集,中位输入 9.6 万 token,这个数据点本身够硬。但模型、成本曲线、采样方法全都没说,所以只能算强数据点,到不了必写级别。

5月21日星期四

AI HOT 精选

Cursor 复盘云端智能体踩坑史:环境没配好,模型再强也白搭

Cursor 团队把云端智能体从本地搬到服务器上跑了一年,最大的教训是:开发环境本身就是产品。本地跑的时候,模型直接继承你电脑上的全套工具链,但云端得从零重建,缺个依赖、少个配置,模型不会报错,只会悄悄变笨。他们后来把任务调度迁到 Temporal 上,可靠性从 99% 拉到了 99.9% 以上,现在平台每天处理超过 5000 万次操作。文章还聊了怎么...

推荐理由:HKR 三项都成立:Cursor 在编程 agent 圈子里是核心玩家,文章给出了 Temporal 迁移、99.9%+ 可靠性和 5000 万次日操作量这些实打实的数据。不是产品发布,所以放在 featured 低段位。

r/LocalLLaMA

用 API 原生结构约束替代提示词校验,Claude 输出解析成功率从 65% 跳到 90%+

一位 Reddit 用户对比了两种让 Claude 稳定输出结构化数据的方法。靠提示词描述格式再事后用正则或 JSON 解析(方案 A),首次解析成功率只有 65%–70%;换成直接调用 tool_use 功能,用强类型 schema、枚举值约束和分步校验(方案 B),成功率拉到 90%–95% 以上。方案 B 的原理是让 API 在模型生成前就卡死输...

推荐理由:我会先打个折:数据来自 Reddit 个人测试,样本量和具体任务都没披露,不能当正式基准看。但 hook 很清晰——从提示词正则校验换成 schema 强制输出,首轮解析率从 65–70% 拉到 90–95%+,说明让模型按类型 schema 直接吐结果比事后用正则捞靠谱得多。这点先别太激动,正文没交代测试条件,但方向对工程选型有参考价值,所以给 featured 低档。

5月20日星期三

r/LocalLLaMA

Cursor 和 Claude Code 没变笨,是它们的 agent 循环在盲目翻文件,把上下文窗口撑爆了

有 Reddit 用户扒了 API 日志,发现 Cursor 和 Claude Code 的 agent 干活时,会在上万行的代码库里反复用 grep 搜大约 40 个文件,有时为了改 5 行代码就把整个 2000 行的文件塞进上下文。更夸张的是,在真正开始写代码前,光工具定义和操作日志就先吃掉大约 3 万个 token。帖子认为工具本身没降智,是这种...

推荐理由:这篇 Reddit 帖子没走“模型降智”的老路,而是从 API 日志里挖出一个更扎心的解释:agent 在工作时自己把上下文窗口塞满了。我会先打个折——这只是单帖爆料,没附原始日志,也没第三方复现,所以不能当定论。但它的价值在于把模糊的“变慢变蠢”翻译成了可排查的结构性问题:仓库一大,递归检索就失控,工具描述和日志占掉大量 token,留给真正写代码的空间反而不多。对正在用这类工具的从业者来说,这比猜模型更新管用,因为它指向了可以动手优化的地方,比如裁剪工具定义、限制检索深度。正文没披露具体复现步骤,这点先别太激动,但作为一线信号已经够格上 fea...

5月19日星期二

AI HOT 精选

用 Claude Code 两分钟生成一个项目计划页,比 Notion 快了近 20 倍

作者给 Claude Code 下了一段精确的提示词,两分钟就吐出一个单文件 HTML 页面,暗色主题、时间线、可折叠表格全都有,没有外部依赖,拿来就能用。他以前在 Notion 里搭同样的模板要花 30 到 40 分钟,效率差了近 20 倍。核心是把视觉、内容结构和交互细节一次性写进提示词里,让模型直接交付成品。正文没披露具体提示词全文,也没说生成后...

推荐理由:HKR 三项全中:有具体的 Claude Code 实操钩子,有 2 分钟 vs 30-40 分钟的硬数字对比,对一线干活的人直接有用。范围虽小,但信息密度够,放在 featured 没问题。

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

5月17日星期日

机器之心 · 公众号

龙虾之父自曝月烧130万美元token,账单OpenAI全包

Peter Steinberger 晒出后台数据,30天里跑了760万次请求,烧掉6030亿个token,账单超过130万美元。他提到关掉“快速模式”后费用直接砍了七成,而且这笔钱目前由 OpenAI 承担,他自己不用掏。

推荐理由:我会先打个折:这是个人晒账单,不是 OpenAI 官方调价,但 130 万美元这个数本身就够从业者心里咯噔一下。文章给了很实的用量——6030 亿 token、760 万次请求,还点出关掉快速模式能砍掉七成费用,对正在跑 agent 的团队有直接参考价值。不过正文没披露他具体跑了什么任务、模型怎么选的,也没说 OpenAI 为什么免单,这点先别太激动。整体更像一条带数据的成本警示,不是产品发布,所以放在 featured 刚好。

AI HOT 精选

Anthropic CEO 说 AI 可能把 GDP 拉高 5%–10%,但失业和不平等也会跟着涨

Dario Amodei 给了两个数字:AI 可能推高 GDP 增速到 5%–10%,同时失业率会上升、贫富差距拉大。他的核心判断是软件成本会降到接近零,传统靠卖软件授权的商业模式会被打穿。现在工程师还能去做编辑或升级工作,但 AI 模型会不断吃掉更多任务,很多干了几十年的职业会慢慢消失。他担心社会还没意识到这场变化的规模和冲击有多大,自己既兴奋又发愁...

推荐理由:Dario Amodei 这次把话说得很直:AI 可能带来 5% 到 10% 的 GDP 增长,同时推高失业和不平等,软件成本会便宜到近乎免费。我会先打个折,因为原文是 X 上的摘要,不是完整访谈实录,没法确认他有没有给限定条件。但即便只是方向性判断,也足够让做 AI 的人重新掂量自己的位置——增长是你的机会,免费软件可能先吃掉你的老业务。

AI HOT 精选

Eric Jang 从零复现 AlphaGo:2026 年训练强围棋 AI 只要几千美元算力

Eric Jang 花了几个月从零实现 AlphaGo,并把过程写成教程和代码放了出来。他原本的理解是“用自我对弈训练的搜索增强神经网络”,但亲手做一遍后对细节有了更深体会。他给出一条关键判断:前沿研究仍然很贵,但特定能力的落地成本掉得很快——到 2026 年,训练一个能打的围棋 AI 租算力只要几千美元,不再需要 DeepMind 级别的资源。他自称...

推荐理由:我会先打个折:这是个人分享,不是论文或模型发布,所以信息密度有限。但亮点很明确——Eric Jang 一个人花几个月从零把 AlphaGo 做出来,还给了个具体成本判断:2026 年租算力训强围棋 AI 只要几千美元。这个数字直接说明当年需要大团队、大预算的系统,现在个人和小团队也能碰了。正文没披露具体训练配置和模型强度验证,所以“强”到什么程度还不好说,这点先别太激动。整体适合当一条有话题、有数字、对从业者有参考价值的动态来推。

5月16日星期六

AI HOT 精选

Anthropic 内部手册:AI 反而会让创业失败率变高

Anthropic 发了份内部手册叫《Founder's Playbook》,结论挺反直觉:像 Claude Code 这类 AI 工具,不是让创业更容易成功,而是会把失败率推高。手册把创业拆成想法、原型、发布、扩张四个阶段,逐个拆解 AI 放大风险的方式。最核心的问题是,AI 能几分钟跑出一个能用的原型,创始人很容易把“能跑通”当成“市场需要”,再用...

推荐理由:Anthropic 这份创始人手册没在吹自家工具多好用,而是警告 Claude Code 这类 AI 会让创业者在四个阶段更容易踩坑。我会先打个折:正文没给出具体数据或可复现的测试,更像经验总结。但“降低建造成本却放大判断错误”这个角度确实少见,对正在用 AI 加速开发的团队是个清醒提醒。

5月14日星期四

AI HOT 精选

杨植麟发 40 分钟视频拆解 Kimi K2:训练花了 460 万美元,编程跑分压过 GPT-5.5

杨植麟在视频里把 Kimi K2 的训练账本摊开了:总花费 460 万美元,靠线性注意力等架构上的极致优化,在编程任务上跑赢了 GPT-5.5 等对手。这个数字说明他们用远低于大厂的预算,靠设计把资源差距抹平了。不过视频是创始人自述,没有第三方验证,跑分对比的具体基准和测试条件也没展开,这点先别太激动。

推荐理由:杨植麟用40分钟视频把Kimi K2的训练账本摊开来看,460万美元的成本在同类模型里算低,编程任务上敢直接叫板GPT-5.5,这个对比本身就有传播力。不过视频是单一信源,具体用了哪些基准测试、对比条件是什么,正文没披露,所以分数卡在84不往上走。我会先打个折,等看到独立复现或更多技术细节再调整。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

5月13日星期三

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

5月12日星期二

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。