跳到正文

全部动态

今日 3 条

6月3日星期三

Hacker News 首页

Uber 给每个员工的 AI 编程工具设了每月 1500 美元上限,这给企业 AI 工具定价提供了一个参考锚点

Uber 发言人向彭博社确认,公司最近几个月开始限制每位员工每月在单个 AI 编程工具上的 token 花费不超过 1500 美元,这个限制只针对 Cursor、Claude Code 这类能自主写代码的智能体工具,不同工具之间的额度互不影响。Simon Willison 认为这个政策比搞排行榜鼓励员工拼命用 AI 要理性得多。他算了一笔账:假设一个工...

推荐理由:HKR 三项都过了,但正文其实只给了一个硬数字:每月 1500 美元。适用工具、员工范围、执行方式全都没提,Simon Willison 的转发和 HN 讨论只是把这条信息推到了值得关注的及格线。

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

AI HOT 精选

智能体工程实战窍门全录

@mvanhorn 分享了一套让 AI 智能体干活的工程方法,核心是把开发流程从“人写代码”扭成“人定方向、智能体执行”,工作台从 IDE 搬到了终端和一份 plan.md 计划文件。整体走 Research → Plan → Work 循环,用 plan.md 来约束智能体行为。帖子总结了 22 条实战技巧,覆盖规划、并行执行、输入方式、远程控制这些...

推荐理由:这是一篇从业者的方法总结,不是模型发布或产品上线。正文没披露完整工具栈清单,所以我会先打个折。但 Research→Plan→Work 循环和 plan.md 约束的思路很具体,22条技巧也给了可操作的抓手,对正在折腾智能体工程的人有直接参考价值,放在 featured 档刚好。

纽约时报中文网

科技公司大裁员,AI是原因还是借口?

Meta、Coinbase 和 Block 最近各自砍了至少 10% 的人,三家加起来约 1.3 万个岗位没了,高管们把一部分理由推给了 AI。但文章指出,这些裁员发生时,公司本身也在经历业务震荡:Meta 在元宇宙上烧了约 800 亿美元后大幅收缩,Coinbase 赶上加密市场低迷,Block 承认疫情期间招人太多。今年已有超过 150 家科技公司...

推荐理由:这篇纽约时报的报道没在讲模型或产品,而是把三家科技公司合计1.3万人的裁员和今年全行业11.5万人的数字摆出来,追问管理层到底是真的用AI省了人力,还是借AI的名义砍成本。对做AI的人来说,这比技术论文更扎心——它直接关系到岗位安全感和行业叙事。信息量够,角度也够锐,所以放在featured。

AI HOT 精选

Claude Code 团队自述:把编程工作默认交给智能体后,我们的流程和分工全变了

Claude Code 的工程主管在 Code w/ Claude SF 2026 活动上分享了团队内部的变化。他们把智能体编程(让模型直接写代码、改代码)设为默认工作方式后,砍掉了传统的详细需求文档,改成“即时规划”——在动手前先让 Claude 收集上下文、理清任务。代码审查环节,Claude 会先过一遍代码风格和测试覆盖,人则把精力集中在法律合规...

推荐理由:这是 Anthropic 自家团队在 Code w/ Claude SF 2026 上的分享,不是模型发布或重大产品更新,所以分数压在 80 分左右。亮点在于他们公开了内部怎么用 Claude Code 干活:规划从提前设计改成即时按需,写代码前先让 Claude 把上下文理一遍,审查环节把风格和测试甩给 Claude,人只做法律和安全判断。这些机制写得实在,没有画饼,对工程团队有直接参考价值。但正文没披露具体效率数据或量化对比,所以别当性能报告看。

6月2日星期二

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

Computing Life · Share · 鸭哥调研

Google 推出后台常驻 AI 助手 Spark,Agent 产品形态从聊天窗口转向守护进程

Google 向美国 AI Ultra 用户推送了 Gemini Spark,一个能 24 小时在后台监控邮箱、日历和云盘,并按你设定的规则自动干活的 AI 助手。它和之前聊天式 AI 最大的区别是:你不用打开它,它也会在条件满足时自己行动。The Verge 的评测显示,Spark 在查开支、写邮件这类简单任务上表现惊人,但面对复杂任务会编造信息,结...

推荐理由:我会先打个折:正文没披露 Gemini Spark 的具体上线时间、推送范围,也没有实测数据,所以这更像一篇概念梳理,不是产品首发。但它的价值在于把“后台常驻 agent”这个方向讲明白了——从聊天窗口到守护进程,四代演化加上 periodic 和 reactive 两种模式,对正在做 agent 产品的人有参考意义。信息密度够,判断也克制,放在 featured 低分段合适。

AI HOT 精选

开放模型吃掉七成用量,OpenRouter 上开源阵营的领头羊一直在换

OpenRouter 的统计显示,从 2025 年到现在,开源权重模型拿走了平台上 69.1% 的 token 用量,闭源模型只占 30.9%。每次有新模型扎堆发布,用量就会跳上一个新台阶。领跑的模型换得很快:DeepSeek 早期领先,随后被 MiniMax 和 Kimi 接棒,接着 MiMo、Qwen、阿里开源系列、腾讯混元 Hy3 和 DeepS...

推荐理由:我会先打个折:OpenRouter 的数据只反映开发者调用偏好,不代表企业实际部署比例,这点先别太激动。但 69.1% 这个数字确实说明开放模型在开发者圈子里已经成了默认选项,闭源模型反而像备胎。文章没披露样本量和统计口径,所以没法判断这个份额波动是真实迁移还是噪音。整体是一篇有数据支撑的行业观察,不是公关稿,值得从业者扫一眼。

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

6月1日星期一

The Verge · AI

AI 正在搅乱音乐圈,格莱美打算怎么接招?

流媒体平台 Deezer 的数据显示,每天有超过 5 万首 AI 生成的歌曲被上传,这个数字还在涨。格莱美主办方录音学院的 CEO Harvey Mason Jr. 说,他最近参与的每一场录音 session 里都有 AI 工具的身影,AI 在音乐制作里已经“无处不在”了。不过,格莱美目前的规则仍然禁止纯 AI 音乐角逐最高奖项。Harvey 还聊了格...

推荐理由:这篇更像播客式的政策讨论,不是模型发布、产品更新或有约束力的法规。最实在的信息就两个:Deezer 每天 5 万首 AI 歌的数字,以及格莱美最高奖的资格冲突。我会先打个折,因为正文没给出具体的规则修改时间表或技术方案,更多是抛出一个行业正在吵的问题。

AI HOT 精选

开源与闭源模型,正走在两条不同的增长曲线上

作者 Nathan Lambert 的核心判断是:在编程智能体这类对智商极度敏感的场景里,用户会一直为最聪明的闭源模型付高价,他自己就愿意每月掏 2000 美元。闭源实验室会逐渐把最好的模型藏起来,不在 API 里轻易放出,以保护利润和防止被蒸馏。他预测 5 到 10 年内,OpenAI 和 Anthropic 的估值会到 2 万亿到 10 万亿美元,...

推荐理由:我会先打个折,这是一篇个人评论,不是系统研究,所以重要性停在 featured 门槛附近是合理的。但它的 HKR 三项都站得住:观点有明确的冲突框架(h),给出了可引用的价格和估值数字(k),讨论的议题正好是当下圈子里吵得最凶的那几个(r)。正文没披露这些估值模型的具体假设,所以数字本身先别太激动,但它们作为讨论的引子够用了。

AI HOT 精选

用 Claude Opus 4.8 把一本书做成 AI 技能,45 分钟、不到 20 块钱

作者拿《非暴力沟通》试了一遍,用 Claude Opus 4.8 把整本书拆成可调用的 AI 技能。流程分六步:先喂全书文本,让模型分析结构,再提炼框架、原则、技法、反模式和作者语气这五类内容,接着生成技能,最后做一轮自检。技能保留了书里的原始命名,比如 OFNR 四要素和“长颈鹿语言”,但触发词换成了“怎么提意见不像在指责”这种日常说法。全程花了约 ...

推荐理由:这是一篇带编号步骤的第一人称Claude实操教程,成本和token数据都摆出来了。因为属于个人教程而非Anthropic官方发布或模型更新,所以放在featured低位。

5月31日星期日

r/LocalLLaMA

我花 6400 美元搭了一台本地大模型服务器,一年下来比用 API 便宜了 700 多

作者晒了一台自组的本地大模型服务器,总花费 6406.45 美元,核心配置是 4 张 AMD MI100 显卡,主要跑 Qwen3.6 27B 模型。这台机器每天处理约 2040 万个输入 token 和 132 万个输出 token。他拿 OpenRouter 的 API 价格算了一笔账:第一年本地总成本(含电费)是 2992.72 美元,而调用同等...

推荐理由:这是一篇个人实测帖,不是厂商通稿。作者把账单摊开算:硬件折旧、电费、OpenRouter 比价,结论是首年能省 700 多美元。我会先打个折——这个结论绑定了他的特定负载(日处理 2000 多万 token)和二手 MI100 价格,换个人未必复现。但文章的价值不在普适性,而在把“自建推理服务器到底划不划算”这笔账算得清楚、可复现,对正在纠结买卡还是调 API 的人有参考意义。信息密度和话题性都够,放在 featured 低位合理。

5月30日星期六

r/LocalLLaMA

把一块 RTX Pro 6000 塞进 2016 年的戴尔 R730 服务器,跑 65 万 token 上下文

作者想把一块最新的 RTX Pro 6000 Blackwell 显卡装进一台 2016 年的戴尔 PowerEdge R730 服务器里,目标是搭一台能跑 65 万 token 上下文的本地 AI 盒子。过程不顺利:先要切掉风扇导流罩才能把卡塞进去,接着用双 riser 卡解决供电,然后系统卡在 PCIe BAR 分配上,根本认不到全部显存。后面就是...

推荐理由:HKR 三项都站得住:老服务器配新显卡跑 650K 上下文,玩法新鲜、细节扎实、对想省钱自建 AI 机器的人有参考价值。不过它终究是一次个人硬件折腾,不是产品发布或模型更新,所以重要性我给 72 分,放在 featured 里。

AI HOT 精选

公司对 AI 上瘾过头,会发生什么?

Box 创始人 Aaron Levie 把一种现象叫“AI 精神病”:决定用 AI 替换员工的人,往往最不了解那些员工到底在干什么。ClickUp 最近为了部署 AI 智能体,裁掉了 22% 的人。2026 年还没过半,科技行业的裁员人数已经快赶上 2025 年全年了。

推荐理由:这篇文章不是讲模型或产品,而是讲用人决策翻车。我会先打个折,因为 ClickUp 裁 22% 这个数字正文没展开说裁的是哪些岗位、AI 智能体具体顶了什么活,但“AI上瘾”这个判断本身有信息量,能让人停下来想一下:老板是不是把 AI 想得太神了,连员工实际在干什么都没搞清。对从业者来说,这比单纯报裁员人数更有刺痛感,所以放在 featured 门槛上没问题。

5月29日星期五

AI HOT 精选

谷歌 DeepMind 老大说 AGI 可能三年内到,但社会还没准备好

哈萨比斯判断,通用人工智能(AGI)最快 2029 到 2030 年就会出现,比之前想的快很多。他说的 AGI 不是只会干一件活的专用 AI,而是能像人一样跨领域学习、推理和创造的系统。现在那些能独立干活的 AI 智能体,在他看来就是 AGI 的预演。不过他也把话说得很清楚:AGI 不会突然蹦出来,而是一段持续加速的升级过程。他更担心的是,各国政府和社...

推荐理由:哈萨比斯这次把 AGI 时间线压到 2029-2030,比很多人的预期要快。他点出多模态和自主决策是硬指标,但正文没展开讲现在卡在哪、验证标准是什么,所以这个预测更像个人判断而非有数据支撑的路线图。我会先打个折:方向值得关注,但别当倒计时看。

阮一峰的网络日志

Token 费用难以负担

OpenAI 员工晒出自己一个月的 Token 用量:760 万次请求,6030 亿 Token,按公开费率算价值 130 万美元。虽然他是内部员工不用掏钱,但这个量级让外界看清了一件事——如果放开让程序员用顶级模型,一个人一年光 Token 费就可能上亿人民币。换成国内便宜的开源模型,也要两三百万。Uber 今年头四个月就烧完了全年 34 亿美元的 ...

推荐理由:Peter Steinberger的CodexBar使用数据把Token费用问题算成了一笔明账:一个月760万次请求、6030亿Token,按预设费率估算价值130万美元。这个数字够具体,也够吓人,直接点出了AI编程工具在规模化使用时的成本压力。文章不是产品发布或模型评测,而是从业者的真实账单分享,对正在评估AI工具成本的团队来说,比任何公关稿都实在。

Computing Life · Share · 鸭哥调研

Claude Code 动态工作流:把确定性边界画在了控制流、执行和验证之间

Anthropic 给 Claude Code 加了个动态工作流功能,本质是用一段 JS 脚本接管控制流,让脚本决定先做什么、后做什么、什么时候并行,但具体干活还是交给多个子 agent 各自在自己的上下文窗口里跑。这么设计是因为 agent 跑久了会忘事、自己验自己也不靠谱,所以把不会忘的控制流交给代码,把需要灵活探索的执行交给 agent,把验证拆...

推荐理由:这篇文章不是 Anthropic 官方发布,也没有实验数据,但它的价值在于把 Claude Code 动态工作流里“哪里该写死、哪里可以放手让模型跑”这个边界问题讲透了。三层机制拆得干净,对正在踩坑的从业者来说,比泛泛讲 agent 靠谱多了。我会先打个折,因为正文没披露具体验证指标,判断更多是架构层面的分析,所以放在 featured 里偏中上的位置。

AI HOT 精选

技能提炼:让大模型写操作手册,小模型照着干活

作者 Tomasz Tunguz 分享了他用“技能提炼”让本地小模型跑个人工作流的做法。他会让 Opus 4.7、GPT-5.1 或 Gemini 3 Pro 这类顶尖模型,把处理邮件、管投资 pipeline、发博客等任务写成标准化的 SKILL.md 步骤文件,然后由本地运行的 Qwen 35B 或 Gemma 26B 一步步执行。这套系统基于 P...

推荐理由:这个技能提炼模式把大模型当教练、本地模型当执行者,思路清楚,对控制成本有实际意义。我会先打个折,因为文章没披露任何量化结果——不知道本地模型执行时会不会翻车,也不知道到底省了多少钱。这点先别太激动,等有数据再说。

Latent Space

异步 Agent 时代来了:Cognition 的 Walden Yan 和 OpenInspect 的 Cole Murray 聊背景干活、从需求直接到...

这期播客聊的是 AI 编程工具正在从“在编辑器里帮你补全代码”转向“在后台独立完成整个任务”。Cognition 的首席产品官 Walden Yan 和 OpenInspect 的 Cole Murray 分享了他们看到的趋势:Devin 合并的 PR 数量涨了 7 倍,Cognition 自家仓库里由 AI 生成的提交占比从 16% 飙升到了 80%...

推荐理由:H、K、R 三项都站得住:Cognition 自家仓库的数据让这篇访谈不只是 agent 口号。分数留在 78 分,因为它本质还是访谈和趋势观察,不是重大模型或产品发布。

5月28日星期四

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

AI HOT 精选

Anthropic 和 OpenAI 把编程助手从包月套餐改成按量收费,我觉得他们终于找到赚钱的感觉了

Simon Willison 发现,从 2026 年 4 月起,Anthropic 和 OpenAI 悄悄把企业版编程助手(Claude Code/Cowork 和 Codex)的收费方式从固定座位费改成了按 API 调用量计费,跟直接买 token 一个价。他自己一个月用这些工具烧掉的 token 折合 2180 美元,但个人套餐只要 200 美元,...

推荐理由:这篇不是官方公告,是一篇行业评论,但它抓的点很实在:Anthropic 和 OpenAI 在 2026 年 4 月前后把编程智能体的收费从打折卖席位改成按 API 调用量算钱。我会先打个折——正文没给出具体定价数字或客户迁移数据,所以“找到产品市场契合点”更多是作者基于计费模式转向的判断,不是有财报支撑的结论。但这点本身对从业者有用,因为它直接关系到采购和用量评估。整体属于有观点、有信息缺口、但不虚的评论,放在 featured 档位合理。

5月27日星期三

阿里技术 · 公众号

阿里吕若凡聊 Agent Room:让多个 AI 共享上下文和任务账本,从跑流程进化到协作判断

这篇文章讲的是阿里技术专家吕若凡提出的 Agent Room 模型。核心想法是不再让 AI 智能体各干各的,而是把它们放进一个共享上下文、任务账本、记忆和产物的“房间”里协作。文章用两个软件工程案例做了验证,说明这套系统不是简单地把任务分发给不同模型,而是让它们能基于共享信息做出协作判断。不过正文因为微信环境验证问题没能加载出来,具体的技术细节、实验数...

推荐理由:这是一篇方法论文章,不是模型发布或开源框架,但 Agent Room 的机制和两个研发现场让它有干货。HKR 三项都踩中了,我会给到 76 分,放在 featured 里。

Computing Life · 鸭哥

用好AI的第二步:先写Skill再执行

作者提出一个反直觉但关键的工作习惯:让AI干活前,先把成功标准、踩过的坑和固定工具写成一个Skill文档。因为AI没有记忆,每次新对话都是白纸一张,不把经验外化落盘,它下次还会犯同样的错。文章解释了为什么程序员反而容易掉进“只有代码才能复用”的陷阱,并给出Skill的三个要素:描述最终想要什么而不是微操步骤、只记录AI真正犯过的错、提供确定性的工具调用...

推荐理由:这篇文章没讲新模型或产品能力,也没给实验数据,但“先写 Skill”这个动作把 agent 工作流从一次性尝试变成了可积累的资产,对日常用 Claude Code 或类似工具的人有直接参考价值。三个 Skill 要素讲得清楚,复用方式也具体,所以放在 featured 档。

Computing Life · 鸭哥

用好 AI 的第二步:先写“技能说明书”,再让 AI 干活

作者王咏刚提出一个反直觉的习惯:别上来就让 AI 直接做事,先把怎么做写成一个可复用的“技能文档”。他用 Outlook 收邮件举例,第一次花半小时把用户名、手机端批准、客户端选择这些坑都记下来,下次 AI 读这个文件就能跳过所有陷阱。核心逻辑是,AI 没有记忆,不把经验外化成文档,它就会反复踩同一个坑。程序员容易觉得只有代码才值得复用,但文章指出,研...

推荐理由:这是一篇工作流教程,不是产品或模型发布。技能文档化的机制和 Outlook 示例够实在,能上 featured;但来源权威性一般,所以定在 72 分。

5月26日星期二

Import AI

直面未来,或从当下撤退:一份 AI 进展的眩晕感与一个奇点故事

这是 Jack Clark 在牛津大学讲座的文字版,外加一篇他写的科幻小说。讲座的核心是一张让他感到眩晕的图——Epoch 能力指数,它用 40 多个基准测试画出了 AI 能力的陡峭爬升曲线。Clark 认为,AI 不是普通技术,它更像一片在加速生长的森林,而我们现在看到的通过律师资格考试、拿下国际数学奥赛金牌、发现软件新漏洞,都只是这片森林里的几棵树...

推荐理由:Jack Clark 这篇不是技术报告,更像一篇行业随笔。他拿 ECI 的 40 多项基准当引子,核心抛出一个具体判断:两年内可能出现能开发后继系统的 AI。这个说法把模糊的“奇点”变成了一个有明确时限的猜想,所以我会给高重要性。正文没给出两年预测的严格推导过程,更像基于趋势的直觉,这点先别太激动,但它确实把 AGI 时间线、安全和就业这些老话题拧成了一根引线,值得从业者读一读并自己判断。

MIT Technology Review · AI

给 AI 抢工作论泼盆冷水

美国劳工数据没看到 AI 造成大规模失业。AI 接触多的职业,失业率反而比接触少的职业更低,也没出现白领大批转行干体力活的迹象。但斯坦福一份研究发现,生成式 AI 普及后,年轻人在 AI 相关岗位的就业明显下滑,说明初级岗位可能正在被悄悄替代。文章认为就业市场确实不好,但锅不能全甩给 AI。

推荐理由:标题和摘要都指向一个反常识判断:AI 还没造成大规模失业,高暴露职业失业率反而更低。这个点够直接,也够戳人,HKR 三项都踩中了。但正文没披露具体样本时间窗口、失业率数值和统计口径,所以事实硬度要打个折,只能给 featured 里的低位。

The Verge · AI

Uber 总裁说 AI 的钱越来越难花得值

Uber 总裁 Andrew Macdonald 公开说,公司 2026 年的 AI 预算四个月就烧完了,但 Claude Code 的 token 消耗量涨上去之后,并没有看到能交付给用户的实际功能跟着明显变多。他原话是“很难在 AI 花销和产品产出之间画一条线”。正文没披露具体花了多少钱,也没说哪些功能是 AI 驱动的,所以这个“没产出”的判断目前...

推荐理由:这条消息的价值不在技术本身,而在于一个每年花大钱买 AI 工具的大公司总裁公开说“账越来越难算”。我会先打个折:正文没披露具体预算金额,也没给出 token 消耗和功能交付的对照数据,所以不能当定量证据用。但“4 个月花光全年预算”这个事实本身已经足够说明成本压力,加上 Claude Code 用量还在上升,说明不是砍预算而是产出没跟上。对 AI 从业者来说,这比任何 benchmark 都更真实地反映了当前工具链的 ROI 焦虑。

纽约时报中文网

中美共同的 AI 焦虑:怕被未来收割

作者在中美两头跑,发现两边的普通人都在被同一种不安笼罩:技术跑太快,红利不一定轮到自己。文章用滴滴司机钻算法空子、美国送餐员抢单的例子开场,指出 AI 在两国都加剧了职场监控、情感孤独和无力感。美国超七成青少年拿聊天机器人当陪伴,中国预计到 2030 年独居人口达 2 亿,AI 伴侣成了孤独的速效解药。科技精英忙着追逐风口和 AGI,普通人却用“社畜”...

推荐理由:这篇不是产品发布或模型论文,是一篇评论,但两个社会数据点和一个中美对照的框架让它有信息量。我会先打个折,因为正文没披露具体调查方法和样本量,数字的可靠性没法验证。不过它把技术趋势和人的孤独感直接挂钩,对从业者理解应用场景有启发,放在 featured 里当一篇有观点的解读是合适的。

5月25日星期一

r/LocalLLaMA

小模型做智能体流程不流行,不是能力不行,是商业账算不过来

这篇帖子直接点破:小模型搭的智能体方案没成为主流,跟技术能不能跑通关系不大,核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率,DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一,单看指标和成本都挺能打。但问题...

推荐理由:这篇文章的切入点挺刁钻——小模型 agent 栈没普及,不是性能不行,是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事,数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时,一半到三分之二的正确答案推理链其实有缺陷,这个发现直接动摇了用小模型兜底的信心。来源是 Reddit,权威性要打个折,所以分数没给到顶,但话题本身对做 agent 落地的人很解渴。

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

Hacker News 首页

AI 芯片成本结构变了:内存开销已占到近三分之二

Epoch AI 估算,从 2024 年第一季度到 2025 年第四季度,高带宽内存(HBM)在 AI 芯片物料成本里的占比从 52% 涨到了 63%。这个数字是拿英伟达、AMD、谷歌和亚马逊四家的 AI 芯片按出货量加权平均算出来的。同期逻辑芯片的成本占比基本没动,在 13% 左右;先进封装从 19% 降到 15%,其他辅助部件从 15% 降到 9%...

推荐理由:这个标题本身就是一个有冲击力的结论,我会先打个折——因为正文只给了链接、68 分和 71 条评论,完全没写这个“近三分之二”是怎么算出来的、统计的是哪种芯片、在什么时间点。如果是真的,那意味着内存成本已经压过计算单元,对推理优化和硬件定价影响很大;但信息缺口太大,现在只能当一个值得追问的信号,不能当定论。

5月24日星期日

AI HOT 精选

格雷格·布罗克曼亲述:差点让 OpenAI 散伙的那 72 小时

OpenAI 联合创始人兼总裁格雷格·布罗克曼在这期播客里,第一次详细讲了公司最惊险的一次内部危机。他回忆了 Sam Altman 被董事会解雇后,自己接到电话时的场景、当天就辞职的原因,以及第二天在 Sam 家里策划“凤凰”备份公司的经过。转折点出现在 Ilya Sutskever 发了一条推文之后。除了这场风波,他还聊了 OpenAI 早期在纳帕谷...

推荐理由:我会先打个折:标题很抓人,Brockman 作为内部人出来讲“差点覆灭”的故事,天然有传播力,所以 H 和 R 都过了。但正文没披露任何实质内容——时间线、谁做了什么、怎么收场的,全都没说,K 完全站不住。整体只能放在 featured 底线,等后续有细节再升级。

新智元 · 公众号

AI 写的文章数量已经超过人类了,但正文被微信验证页挡住了

这篇来自新智元的文章标题说 AI 生成的文章数量碾压人类,但正文被微信环境异常验证页完全挡住,看不到任何具体内容。从已有的英文摘要看,研究方 Graphite 从 CommonCrawl 里抽了 4.3 万篇文章做检测,发现从 2024 年 11 月起 AI 写的英文文章数量超过了人类写的。他们用的检测器自称误判率约 4.2%、漏判率约 0.6%,也就...

推荐理由:这篇评论性文章用一个抽样数据把“AI 内容淹没人类内容”这个模糊焦虑变成了一个有时间点的判断。43000 篇样本不算大,但误报率和漏报率都给了,说明检测工具本身不是绝对可靠,这点先别太激动。文章没披露抽样方法和检测模型细节,所以交叉点的精确度要打个折。对从业者的实际提醒是:公开网页数据正在被 AI 生成内容快速稀释,做预训练或外挂资料库的人得把数据溯源和过滤当成硬需求。整体信息量够、有数据支撑,但单一信源且缺乏平台级影响分析,所以分数没再往上走。

Computing Life · Share · 鸭哥调研

你编程十年,但在 AI 面前还是个新手

Flask 作者 Armin Ronacher 用 Pi 开发 Pi 时发现,项目 issue 里 83% 被自动关闭,因为大量 AI 生成的报告虽然行文专业、推理自洽,但结论是错的。问题不在 AI 代码质量差,而在于很多老手还在用过去的直觉判断 AI 输出——人类的错误有迹可循,AI 却会在一个错误假设上推导出一整套看似滴水不漏的方案,老手的经验识别...

推荐理由:这篇不是模型发布或产品上线,而是围绕 Armin Ronacher 用自家工具 Pi 开发 Pi 这件事的评论。我会先打个折,因为争议本身不算新,但 issue tracker 的数据让讨论落到了可查证的事实上,不是纯嘴炮。对天天跟 AI 结对编程的人来说,这种“老手翻车”的案例比 benchmark 更有说服力,所以给到 featured。

5月23日星期六

AI HOT 精选

微软自己算了一笔账:有些活交给 AI 干,比雇人还贵

微软在一份报告里直接对比了两种成本:用 token 计费调用模型、用 agent 跑业务流程,以及雇人干同样的活。结论是,在这些特定场景下,AI 的综合开销已经超过了人工工资。报告没展开讲具体是什么任务、人力成本按哪个市场算的,但至少说明现在企业上 AI,不是闭着眼就能省钱。

推荐理由:我会先打个折:微软没公布具体是哪些任务、工资怎么算、对比口径是什么,所以这个结论不能直接套到所有场景。但它的价值在于,把 agent 和 token 计费的总成本摆上台面,提醒大家别只盯着单次调用价格。正文没披露具体金额和岗位,如果是真的,对靠堆 agent 降本的项目是个冷水。

AI HOT 精选

奥纬咨询调查:74%的科技公司CEO在冻结或缩减招聘,AI正在吃掉初级岗位

奥纬咨询这份全球CEO调查里,科技行业被AI冲击得最狠。74%的CEO说正在冻结或减少招聘,比去年又高了7个百分点。大公司下手更重,39%的“超大规模”企业计划裁员,小公司这个比例是28%。最惨的是初级岗位:打算在未来一两年砍掉入门级职位的CEO比例,从去年的17%直接翻到43%。只有17%的CEO说会多招新人。报告把这叫“把人才金字塔削成了钻石”——...

推荐理由:标题和摘要里的数字够硬,74%和17%到43%的涨幅能让人直观感受到冲击。但正文没披露样本量和方法论,所以我会先打个折,不把它当定论看。整体更像一份行业观察,适合放在精选里当信号,但别急着下结论。

Computing Life · Share · 鸭哥调研

AI 正在分裂成两个市场,你选哪一边

AI 的 token 单价每年暴跌 10 倍,但企业的 AI 账单却在暴涨,因为市场正在分裂成两个经济逻辑完全不同的世界。低端市场被中国开源模型(如 DeepSeek V4 Flash、Qwen 3.5)杀到了地板价,输入成本最低只要 5 美分,靠的是推理效率提升和系统性低价策略;高端市场如 Claude Opus 4.7 依然卖到 15 美元,价格几...

推荐理由:这篇文章不是产品发布或一手测试,是一篇行业评论,但把 token 降价和企业账单膨胀这对矛盾讲得很清楚。我会先打个折:300 倍价差这个数正文没展开算细账,但作为趋势判断是成立的。对正在选模型、算成本的 AI 从业者来说,这篇能帮他们意识到便宜不一定等于省钱,锁定的隐性成本和 Agent 带来的负载增长才是大头。

AI HOT 精选

黄仁勋说 AI 基建年开支会冲到 4 万亿美元,比华尔街共识高了四倍

黄仁勋在英伟达财报电话会上抛出一个数字:超大规模云厂商的 AI 基建年开支会从现在的 1 万亿美元涨到 3 到 4 万亿,CFO 给的时间线是 2030 年前。华尔街分析师原本的共识是 2028 年才到 1.03 万亿,老黄直接翻了四倍。一季度谷歌、亚马逊、微软三家资本开支加起来已经超过 1100 亿美元,Meta 更是把全年预算拉到 1450 亿,结...

推荐理由:黄仁勋说的 3-4 万亿美元是 CEO 预测,不是已发生的模型发布或产品落地,所以分数压在 78-84 这个区间。数字本身有信号价值——它把云厂商的烧钱速度量化了,也间接给英伟达的营收预期撑腰。但正文没披露这个 4 万亿是怎么算出来的,也没说时间节点,这点先别太激动。

r/LocalLLaMA

Agent 里的调度模型能做多小?有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

这篇帖子来自一个叫 HomoAgens1 的本地部署实验,他把 Agent 的调度模型和写代码的大模型拆开看,专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型,实际干活时只激活约 3B 参数,跑在一块 12GB 显存的 GPU 上,关了 30 个专家做 offload,生成速度能到每秒 40 个 token。实验发现...

推荐理由:我会先打个折:这是 Reddit 上的单人实验,不是正式发布,结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排,3B 激活参数就能在 12GB 显卡上跑到 40 t/s,成本够低。更小的模型不是推理先崩,而是工具调用纪律先坏,这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字,对想在家用显卡上折腾 agent 的人是一手好参考。