跳到正文

#大佬观点

今日 1 条

5月30日星期六

AI HOT 精选

公司对 AI 上瘾过头,会发生什么?

Box 创始人 Aaron Levie 把一种现象叫“AI 精神病”:决定用 AI 替换员工的人,往往最不了解那些员工到底在干什么。ClickUp 最近为了部署 AI 智能体,裁掉了 22% 的人。2026 年还没过半,科技行业的裁员人数已经快赶上 2025 年全年了。

推荐理由:这篇文章不是讲模型或产品,而是讲用人决策翻车。我会先打个折,因为 ClickUp 裁 22% 这个数字正文没展开说裁的是哪些岗位、AI 智能体具体顶了什么活,但“AI上瘾”这个判断本身有信息量,能让人停下来想一下:老板是不是把 AI 想得太神了,连员工实际在干什么都没搞清。对从业者来说,这比单纯报裁员人数更有刺痛感,所以放在 featured 门槛上没问题。

5月29日星期五

AI HOT 精选

谷歌 DeepMind 老大说 AGI 可能三年内到,但社会还没准备好

哈萨比斯判断,通用人工智能(AGI)最快 2029 到 2030 年就会出现,比之前想的快很多。他说的 AGI 不是只会干一件活的专用 AI,而是能像人一样跨领域学习、推理和创造的系统。现在那些能独立干活的 AI 智能体,在他看来就是 AGI 的预演。不过他也把话说得很清楚:AGI 不会突然蹦出来,而是一段持续加速的升级过程。他更担心的是,各国政府和社...

推荐理由:哈萨比斯这次把 AGI 时间线压到 2029-2030,比很多人的预期要快。他点出多模态和自主决策是硬指标,但正文没展开讲现在卡在哪、验证标准是什么,所以这个预测更像个人判断而非有数据支撑的路线图。我会先打个折:方向值得关注,但别当倒计时看。

阮一峰的网络日志

Token 费用难以负担

OpenAI 员工晒出自己一个月的 Token 用量:760 万次请求,6030 亿 Token,按公开费率算价值 130 万美元。虽然他是内部员工不用掏钱,但这个量级让外界看清了一件事——如果放开让程序员用顶级模型,一个人一年光 Token 费就可能上亿人民币。换成国内便宜的开源模型,也要两三百万。Uber 今年头四个月就烧完了全年 34 亿美元的 ...

推荐理由:Peter Steinberger的CodexBar使用数据把Token费用问题算成了一笔明账:一个月760万次请求、6030亿Token,按预设费率估算价值130万美元。这个数字够具体,也够吓人,直接点出了AI编程工具在规模化使用时的成本压力。文章不是产品发布或模型评测,而是从业者的真实账单分享,对正在评估AI工具成本的团队来说,比任何公关稿都实在。

Computing Life · Share · 鸭哥调研

Claude Code 动态工作流:把确定性边界画在了控制流、执行和验证之间

Anthropic 给 Claude Code 加了个动态工作流功能,本质是用一段 JS 脚本接管控制流,让脚本决定先做什么、后做什么、什么时候并行,但具体干活还是交给多个子 agent 各自在自己的上下文窗口里跑。这么设计是因为 agent 跑久了会忘事、自己验自己也不靠谱,所以把不会忘的控制流交给代码,把需要灵活探索的执行交给 agent,把验证拆...

推荐理由:这篇文章不是 Anthropic 官方发布,也没有实验数据,但它的价值在于把 Claude Code 动态工作流里“哪里该写死、哪里可以放手让模型跑”这个边界问题讲透了。三层机制拆得干净,对正在踩坑的从业者来说,比泛泛讲 agent 靠谱多了。我会先打个折,因为正文没披露具体验证指标,判断更多是架构层面的分析,所以放在 featured 里偏中上的位置。

AI HOT 精选

技能提炼:让大模型写操作手册,小模型照着干活

作者 Tomasz Tunguz 分享了他用“技能提炼”让本地小模型跑个人工作流的做法。他会让 Opus 4.7、GPT-5.1 或 Gemini 3 Pro 这类顶尖模型,把处理邮件、管投资 pipeline、发博客等任务写成标准化的 SKILL.md 步骤文件,然后由本地运行的 Qwen 35B 或 Gemma 26B 一步步执行。这套系统基于 P...

推荐理由:这个技能提炼模式把大模型当教练、本地模型当执行者,思路清楚,对控制成本有实际意义。我会先打个折,因为文章没披露任何量化结果——不知道本地模型执行时会不会翻车,也不知道到底省了多少钱。这点先别太激动,等有数据再说。

Latent Space

异步 Agent 时代来了:Cognition 的 Walden Yan 和 OpenInspect 的 Cole Murray 聊背景干活、从需求直接到...

这期播客聊的是 AI 编程工具正在从“在编辑器里帮你补全代码”转向“在后台独立完成整个任务”。Cognition 的首席产品官 Walden Yan 和 OpenInspect 的 Cole Murray 分享了他们看到的趋势:Devin 合并的 PR 数量涨了 7 倍,Cognition 自家仓库里由 AI 生成的提交占比从 16% 飙升到了 80%...

推荐理由:H、K、R 三项都站得住:Cognition 自家仓库的数据让这篇访谈不只是 agent 口号。分数留在 78 分,因为它本质还是访谈和趋势观察,不是重大模型或产品发布。

5月28日星期四

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

AI HOT 精选

Anthropic 和 OpenAI 把编程助手从包月套餐改成按量收费,我觉得他们终于找到赚钱的感觉了

Simon Willison 发现,从 2026 年 4 月起,Anthropic 和 OpenAI 悄悄把企业版编程助手(Claude Code/Cowork 和 Codex)的收费方式从固定座位费改成了按 API 调用量计费,跟直接买 token 一个价。他自己一个月用这些工具烧掉的 token 折合 2180 美元,但个人套餐只要 200 美元,...

推荐理由:这篇不是官方公告,是一篇行业评论,但它抓的点很实在:Anthropic 和 OpenAI 在 2026 年 4 月前后把编程智能体的收费从打折卖席位改成按 API 调用量算钱。我会先打个折——正文没给出具体定价数字或客户迁移数据,所以“找到产品市场契合点”更多是作者基于计费模式转向的判断,不是有财报支撑的结论。但这点本身对从业者有用,因为它直接关系到采购和用量评估。整体属于有观点、有信息缺口、但不虚的评论,放在 featured 档位合理。

5月27日星期三

阿里技术 · 公众号

阿里吕若凡聊 Agent Room:让多个 AI 共享上下文和任务账本,从跑流程进化到协作判断

这篇文章讲的是阿里技术专家吕若凡提出的 Agent Room 模型。核心想法是不再让 AI 智能体各干各的,而是把它们放进一个共享上下文、任务账本、记忆和产物的“房间”里协作。文章用两个软件工程案例做了验证,说明这套系统不是简单地把任务分发给不同模型,而是让它们能基于共享信息做出协作判断。不过正文因为微信环境验证问题没能加载出来,具体的技术细节、实验数...

推荐理由:这是一篇方法论文章,不是模型发布或开源框架,但 Agent Room 的机制和两个研发现场让它有干货。HKR 三项都踩中了,我会给到 76 分,放在 featured 里。

Computing Life · 鸭哥

用好AI的第二步:先写Skill再执行

作者提出一个反直觉但关键的工作习惯:让AI干活前,先把成功标准、踩过的坑和固定工具写成一个Skill文档。因为AI没有记忆,每次新对话都是白纸一张,不把经验外化落盘,它下次还会犯同样的错。文章解释了为什么程序员反而容易掉进“只有代码才能复用”的陷阱,并给出Skill的三个要素:描述最终想要什么而不是微操步骤、只记录AI真正犯过的错、提供确定性的工具调用...

推荐理由:这篇文章没讲新模型或产品能力,也没给实验数据,但“先写 Skill”这个动作把 agent 工作流从一次性尝试变成了可积累的资产,对日常用 Claude Code 或类似工具的人有直接参考价值。三个 Skill 要素讲得清楚,复用方式也具体,所以放在 featured 档。

Computing Life · 鸭哥

用好 AI 的第二步:先写“技能说明书”,再让 AI 干活

作者王咏刚提出一个反直觉的习惯:别上来就让 AI 直接做事,先把怎么做写成一个可复用的“技能文档”。他用 Outlook 收邮件举例,第一次花半小时把用户名、手机端批准、客户端选择这些坑都记下来,下次 AI 读这个文件就能跳过所有陷阱。核心逻辑是,AI 没有记忆,不把经验外化成文档,它就会反复踩同一个坑。程序员容易觉得只有代码才值得复用,但文章指出,研...

推荐理由:这是一篇工作流教程,不是产品或模型发布。技能文档化的机制和 Outlook 示例够实在,能上 featured;但来源权威性一般,所以定在 72 分。

5月26日星期二

Import AI

直面未来,或从当下撤退:一份 AI 进展的眩晕感与一个奇点故事

这是 Jack Clark 在牛津大学讲座的文字版,外加一篇他写的科幻小说。讲座的核心是一张让他感到眩晕的图——Epoch 能力指数,它用 40 多个基准测试画出了 AI 能力的陡峭爬升曲线。Clark 认为,AI 不是普通技术,它更像一片在加速生长的森林,而我们现在看到的通过律师资格考试、拿下国际数学奥赛金牌、发现软件新漏洞,都只是这片森林里的几棵树...

推荐理由:Jack Clark 这篇不是技术报告,更像一篇行业随笔。他拿 ECI 的 40 多项基准当引子,核心抛出一个具体判断:两年内可能出现能开发后继系统的 AI。这个说法把模糊的“奇点”变成了一个有明确时限的猜想,所以我会给高重要性。正文没给出两年预测的严格推导过程,更像基于趋势的直觉,这点先别太激动,但它确实把 AGI 时间线、安全和就业这些老话题拧成了一根引线,值得从业者读一读并自己判断。

MIT Technology Review · AI

给 AI 抢工作论泼盆冷水

美国劳工数据没看到 AI 造成大规模失业。AI 接触多的职业,失业率反而比接触少的职业更低,也没出现白领大批转行干体力活的迹象。但斯坦福一份研究发现,生成式 AI 普及后,年轻人在 AI 相关岗位的就业明显下滑,说明初级岗位可能正在被悄悄替代。文章认为就业市场确实不好,但锅不能全甩给 AI。

推荐理由:标题和摘要都指向一个反常识判断:AI 还没造成大规模失业,高暴露职业失业率反而更低。这个点够直接,也够戳人,HKR 三项都踩中了。但正文没披露具体样本时间窗口、失业率数值和统计口径,所以事实硬度要打个折,只能给 featured 里的低位。

The Verge · AI

Uber 总裁说 AI 的钱越来越难花得值

Uber 总裁 Andrew Macdonald 公开说,公司 2026 年的 AI 预算四个月就烧完了,但 Claude Code 的 token 消耗量涨上去之后,并没有看到能交付给用户的实际功能跟着明显变多。他原话是“很难在 AI 花销和产品产出之间画一条线”。正文没披露具体花了多少钱,也没说哪些功能是 AI 驱动的,所以这个“没产出”的判断目前...

推荐理由:这条消息的价值不在技术本身,而在于一个每年花大钱买 AI 工具的大公司总裁公开说“账越来越难算”。我会先打个折:正文没披露具体预算金额,也没给出 token 消耗和功能交付的对照数据,所以不能当定量证据用。但“4 个月花光全年预算”这个事实本身已经足够说明成本压力,加上 Claude Code 用量还在上升,说明不是砍预算而是产出没跟上。对 AI 从业者来说,这比任何 benchmark 都更真实地反映了当前工具链的 ROI 焦虑。

纽约时报中文网

中美共同的 AI 焦虑:怕被未来收割

作者在中美两头跑,发现两边的普通人都在被同一种不安笼罩:技术跑太快,红利不一定轮到自己。文章用滴滴司机钻算法空子、美国送餐员抢单的例子开场,指出 AI 在两国都加剧了职场监控、情感孤独和无力感。美国超七成青少年拿聊天机器人当陪伴,中国预计到 2030 年独居人口达 2 亿,AI 伴侣成了孤独的速效解药。科技精英忙着追逐风口和 AGI,普通人却用“社畜”...

推荐理由:这篇不是产品发布或模型论文,是一篇评论,但两个社会数据点和一个中美对照的框架让它有信息量。我会先打个折,因为正文没披露具体调查方法和样本量,数字的可靠性没法验证。不过它把技术趋势和人的孤独感直接挂钩,对从业者理解应用场景有启发,放在 featured 里当一篇有观点的解读是合适的。

5月25日星期一

r/LocalLLaMA

小模型做智能体流程不流行,不是能力不行,是商业账算不过来

这篇帖子直接点破:小模型搭的智能体方案没成为主流,跟技术能不能跑通关系不大,核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率,DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一,单看指标和成本都挺能打。但问题...

推荐理由:这篇文章的切入点挺刁钻——小模型 agent 栈没普及,不是性能不行,是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事,数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时,一半到三分之二的正确答案推理链其实有缺陷,这个发现直接动摇了用小模型兜底的信心。来源是 Reddit,权威性要打个折,所以分数没给到顶,但话题本身对做 agent 落地的人很解渴。

AI HOT 精选

Hugging Face 发了一篇术语辨析,把智能体的模型、脚手架和线束三层结构讲清楚了

这篇博客把智能体拆成了三层:模型(就是大语言模型本身)、脚手架(通过提示词和工具描述来定义模型的行为逻辑)和线束(负责实际跑模型调用、工具调用和控制循环的代码)。作者认为现在行业里这些词被混用得厉害,比如有人把整个智能体叫脚手架,有人把执行层叫线束,这篇就是想给个实用的参照,不是要定死标准。文章还顺带理了上下文工程、策略、技能、子智能体这些常被模糊使用...

推荐理由:Hugging Face 这篇把 agent 拆成三层:模型本身、Scaffolding(定义行为)和 Harness(管工具调用与控制循环)。这个分法解决了一个很实际的痛点——现在聊 agent 的人经常把“怎么调用工具”和“谁在控制循环”搅在一起,文章直接划了条线。我会先打个折:正文没给出具体的实现案例或性能对比,更像概念梳理,所以重要性停在 72 分。对正在搭 agent 架构的从业者来说,这篇能当一张参考图用,但别指望它直接告诉你代码怎么写。

Hacker News 首页

AI 芯片成本结构变了:内存开销已占到近三分之二

Epoch AI 估算,从 2024 年第一季度到 2025 年第四季度,高带宽内存(HBM)在 AI 芯片物料成本里的占比从 52% 涨到了 63%。这个数字是拿英伟达、AMD、谷歌和亚马逊四家的 AI 芯片按出货量加权平均算出来的。同期逻辑芯片的成本占比基本没动,在 13% 左右;先进封装从 19% 降到 15%,其他辅助部件从 15% 降到 9%...

推荐理由:这个标题本身就是一个有冲击力的结论,我会先打个折——因为正文只给了链接、68 分和 71 条评论,完全没写这个“近三分之二”是怎么算出来的、统计的是哪种芯片、在什么时间点。如果是真的,那意味着内存成本已经压过计算单元,对推理优化和硬件定价影响很大;但信息缺口太大,现在只能当一个值得追问的信号,不能当定论。

5月24日星期日

AI HOT 精选

格雷格·布罗克曼亲述:差点让 OpenAI 散伙的那 72 小时

OpenAI 联合创始人兼总裁格雷格·布罗克曼在这期播客里,第一次详细讲了公司最惊险的一次内部危机。他回忆了 Sam Altman 被董事会解雇后,自己接到电话时的场景、当天就辞职的原因,以及第二天在 Sam 家里策划“凤凰”备份公司的经过。转折点出现在 Ilya Sutskever 发了一条推文之后。除了这场风波,他还聊了 OpenAI 早期在纳帕谷...

推荐理由:我会先打个折:标题很抓人,Brockman 作为内部人出来讲“差点覆灭”的故事,天然有传播力,所以 H 和 R 都过了。但正文没披露任何实质内容——时间线、谁做了什么、怎么收场的,全都没说,K 完全站不住。整体只能放在 featured 底线,等后续有细节再升级。

新智元 · 公众号

AI 写的文章数量已经超过人类了,但正文被微信验证页挡住了

这篇来自新智元的文章标题说 AI 生成的文章数量碾压人类,但正文被微信环境异常验证页完全挡住,看不到任何具体内容。从已有的英文摘要看,研究方 Graphite 从 CommonCrawl 里抽了 4.3 万篇文章做检测,发现从 2024 年 11 月起 AI 写的英文文章数量超过了人类写的。他们用的检测器自称误判率约 4.2%、漏判率约 0.6%,也就...

推荐理由:这篇评论性文章用一个抽样数据把“AI 内容淹没人类内容”这个模糊焦虑变成了一个有时间点的判断。43000 篇样本不算大,但误报率和漏报率都给了,说明检测工具本身不是绝对可靠,这点先别太激动。文章没披露抽样方法和检测模型细节,所以交叉点的精确度要打个折。对从业者的实际提醒是:公开网页数据正在被 AI 生成内容快速稀释,做预训练或外挂资料库的人得把数据溯源和过滤当成硬需求。整体信息量够、有数据支撑,但单一信源且缺乏平台级影响分析,所以分数没再往上走。

Computing Life · Share · 鸭哥调研

你编程十年,但在 AI 面前还是个新手

Flask 作者 Armin Ronacher 用 Pi 开发 Pi 时发现,项目 issue 里 83% 被自动关闭,因为大量 AI 生成的报告虽然行文专业、推理自洽,但结论是错的。问题不在 AI 代码质量差,而在于很多老手还在用过去的直觉判断 AI 输出——人类的错误有迹可循,AI 却会在一个错误假设上推导出一整套看似滴水不漏的方案,老手的经验识别...

推荐理由:这篇不是模型发布或产品上线,而是围绕 Armin Ronacher 用自家工具 Pi 开发 Pi 这件事的评论。我会先打个折,因为争议本身不算新,但 issue tracker 的数据让讨论落到了可查证的事实上,不是纯嘴炮。对天天跟 AI 结对编程的人来说,这种“老手翻车”的案例比 benchmark 更有说服力,所以给到 featured。

5月23日星期六

AI HOT 精选

微软自己算了一笔账:有些活交给 AI 干,比雇人还贵

微软在一份报告里直接对比了两种成本:用 token 计费调用模型、用 agent 跑业务流程,以及雇人干同样的活。结论是,在这些特定场景下,AI 的综合开销已经超过了人工工资。报告没展开讲具体是什么任务、人力成本按哪个市场算的,但至少说明现在企业上 AI,不是闭着眼就能省钱。

推荐理由:我会先打个折:微软没公布具体是哪些任务、工资怎么算、对比口径是什么,所以这个结论不能直接套到所有场景。但它的价值在于,把 agent 和 token 计费的总成本摆上台面,提醒大家别只盯着单次调用价格。正文没披露具体金额和岗位,如果是真的,对靠堆 agent 降本的项目是个冷水。

AI HOT 精选

奥纬咨询调查:74%的科技公司CEO在冻结或缩减招聘,AI正在吃掉初级岗位

奥纬咨询这份全球CEO调查里,科技行业被AI冲击得最狠。74%的CEO说正在冻结或减少招聘,比去年又高了7个百分点。大公司下手更重,39%的“超大规模”企业计划裁员,小公司这个比例是28%。最惨的是初级岗位:打算在未来一两年砍掉入门级职位的CEO比例,从去年的17%直接翻到43%。只有17%的CEO说会多招新人。报告把这叫“把人才金字塔削成了钻石”——...

推荐理由:标题和摘要里的数字够硬,74%和17%到43%的涨幅能让人直观感受到冲击。但正文没披露样本量和方法论,所以我会先打个折,不把它当定论看。整体更像一份行业观察,适合放在精选里当信号,但别急着下结论。

Computing Life · Share · 鸭哥调研

AI 正在分裂成两个市场,你选哪一边

AI 的 token 单价每年暴跌 10 倍,但企业的 AI 账单却在暴涨,因为市场正在分裂成两个经济逻辑完全不同的世界。低端市场被中国开源模型(如 DeepSeek V4 Flash、Qwen 3.5)杀到了地板价,输入成本最低只要 5 美分,靠的是推理效率提升和系统性低价策略;高端市场如 Claude Opus 4.7 依然卖到 15 美元,价格几...

推荐理由:这篇文章不是产品发布或一手测试,是一篇行业评论,但把 token 降价和企业账单膨胀这对矛盾讲得很清楚。我会先打个折:300 倍价差这个数正文没展开算细账,但作为趋势判断是成立的。对正在选模型、算成本的 AI 从业者来说,这篇能帮他们意识到便宜不一定等于省钱,锁定的隐性成本和 Agent 带来的负载增长才是大头。

AI HOT 精选

黄仁勋说 AI 基建年开支会冲到 4 万亿美元,比华尔街共识高了四倍

黄仁勋在英伟达财报电话会上抛出一个数字:超大规模云厂商的 AI 基建年开支会从现在的 1 万亿美元涨到 3 到 4 万亿,CFO 给的时间线是 2030 年前。华尔街分析师原本的共识是 2028 年才到 1.03 万亿,老黄直接翻了四倍。一季度谷歌、亚马逊、微软三家资本开支加起来已经超过 1100 亿美元,Meta 更是把全年预算拉到 1450 亿,结...

推荐理由:黄仁勋说的 3-4 万亿美元是 CEO 预测,不是已发生的模型发布或产品落地,所以分数压在 78-84 这个区间。数字本身有信号价值——它把云厂商的烧钱速度量化了,也间接给英伟达的营收预期撑腰。但正文没披露这个 4 万亿是怎么算出来的,也没说时间节点,这点先别太激动。

r/LocalLLaMA

Agent 里的调度模型能做多小?有人用 3B 激活参数的 MoE 跑通了本地 ReAct 循环

这篇帖子来自一个叫 HomoAgens1 的本地部署实验,他把 Agent 的调度模型和写代码的大模型拆开看,专门测调度环节能缩到多小。他用的 Qwen3.6-35B-A3B 是个 MoE 模型,实际干活时只激活约 3B 参数,跑在一块 12GB 显存的 GPU 上,关了 30 个专家做 offload,生成速度能到每秒 40 个 token。实验发现...

推荐理由:我会先打个折:这是 Reddit 上的单人实验,不是正式发布,结论别当定论。但它的发现很实在——用 Qwen3.6-35B-A3B 跑 ReAct 编排,3B 激活参数就能在 12GB 显卡上跑到 40 t/s,成本够低。更小的模型不是推理先崩,而是工具调用纪律先坏,这个失败模式对选型很有参考价值。显存、速度和故障点都给了具体数字,对想在家用显卡上折腾 agent 的人是一手好参考。

AI HOT 精选

智能体工作负载正在改写推理成本账本

SemiAnalysis 扒了 43.2 万条真实编码智能体的请求记录,输入 token 的中位数不是大家常说的 3.2 万或 6.4 万,而是 9.6 万。这个量级意味着模型在接到你的问题之前,已经吞下了比《了不起的盖茨比》全书还长的上下文。正文没披露用了哪些模型、成本曲线、采样方式和统计时间窗口,所以这个数字先当个参考,别急着拿它算账。

推荐理由:HKR 三项都过:SemiAnalysis 拿出了一个 43.2 万条编码智能体请求的数据集,中位输入 9.6 万 token,这个数据点本身够硬。但模型、成本曲线、采样方法全都没说,所以只能算强数据点,到不了必写级别。

5月22日星期五

Dwarkesh Patel 播客

从逻辑门到 AI 芯片:Reiner Pope 的芯片设计黑板课

MatX 的 CEO Reiner Pope 从最底层的与、或、非逻辑门讲起,一步步拆解 AI 芯片到底怎么工作。他先用一个 4 比特乘 4 比特、再用 8 比特累加的例子,演示了乘法累加(MAC)运算在电路里长什么样——这其实就是矩阵乘法的基本动作,AI 芯片绝大部分时间都在干这个。接着聊到数据搬运比计算还贵,所以芯片里要用多路复用器(mux)来省连...

推荐理由:Dwarkesh 这次访谈没讲空话,Reiner Pope 从最底层的门电路开始,一步步解释怎么为 AI 推理专门设计芯片。我会先打个折:这不是产品发布或行业爆料,更像一堂硬核科普,所以分数不会给到新闻级。但内容密度很高,把脉动阵列、数据流和 ASIC 的取舍都讲透了,对做推理优化的人有实际参考价值。正文没披露 MatX 芯片的具体性能指标,这点先别太激动。

AI HOT 精选

大模型在生产环境会“说胡话”,但大部分跑分测试根本不查这个

Dharma-AI 在 Hugging Face 发了篇博文,说现在的大语言模型上线后经常出现文本退化——输出内容来回重复、前言不搭后语或者逻辑崩掉。这种故障直接影响用户体感和模型能不能用,但主流基准测试基本没把这类问题纳入评分。文章呼吁业界在评估体系里加上对文本退化的系统追踪和量化指标,正文没披露具体的指标设计或实验数据。

推荐理由:HKR 三项都过了,但这篇帖子只披露了故障模式和基准盲区,没给样本量、具体指标或复现方法,信息密度偏低,放在 featured 里靠下的位置比较合适。

最佳拍档

英伟达 2026 财年 Q1 营收 816 亿,数据中心涨 92%,股价反跌 2%

英伟达发了 2026 财年第一季度财报,营收 816 亿,利润 583 亿,数据中心业务同比暴增 92%。但股价盘后还是跌了 2%,说明市场对它的预期已经拉得很高,光超预期不够,得超很多才行。正文没披露货币单位和利润口径,这点先别太激动,如果是真的挺省钱,但缺信息没法判断。

推荐理由:我会先打个折:正文只给了标题级数字,没披露币种、利润口径和业绩指引,所以判断只能基于标题。数据中心业务涨92%说明AI算力需求还在猛跑,但股价跌2%说明市场早就把更夸张的预期打进去了。这点先别太激动,正文没给毛利率趋势和后续指引,没法判断增速能不能撑住现在的估值。

AI HOT 精选

可塑界面:AI 让软件界面按需变形,不再只有一种固定样子

Salesforce 已经“砍掉”了传统界面,销售不用登录网站就能通过 AI 更新交易记录。作者把这种趋势叫做“可塑界面”——AI 能根据你当下在干嘛,动态生成最适合的交互形式,比如开车时给你念邮件摘要、审文案时弹出网页应用、做预算时直接给个带图表的表格。文章引用了 Airbnb CEO 和 Anthropic 工程师的观点,认为纯文本对话不够用,电商...

推荐理由:我会先打个折:这篇是软件形态的展望,没有上线时间、用户数据或可复现的测试,所以放在评论类里刚好。正文说 Salesforce 已经用无头架构让销售靠 AI 直接改数据,界面不再写死,而是按场景动态生成 HTML、音频甚至网页。这点先别太激动——正文没披露这套动态生成在 Salesforce 里的实际覆盖范围、延迟和出错率,也没说 MCP 具体怎么接。但思路本身对做 B 端产品的人有用,因为它把“界面”从设计稿变成了模型输出,省不省开发成本另说,至少交互逻辑要重想。

5月21日星期四

AI HOT 精选

Cursor 复盘云端智能体踩坑史:环境没配好,模型再强也白搭

Cursor 团队把云端智能体从本地搬到服务器上跑了一年,最大的教训是:开发环境本身就是产品。本地跑的时候,模型直接继承你电脑上的全套工具链,但云端得从零重建,缺个依赖、少个配置,模型不会报错,只会悄悄变笨。他们后来把任务调度迁到 Temporal 上,可靠性从 99% 拉到了 99.9% 以上,现在平台每天处理超过 5000 万次操作。文章还聊了怎么...

推荐理由:HKR 三项都成立:Cursor 在编程 agent 圈子里是核心玩家,文章给出了 Temporal 迁移、99.9%+ 可靠性和 5000 万次日操作量这些实打实的数据。不是产品发布,所以放在 featured 低段位。

阿里技术 · 公众号

从零搭一个 Agent:原理拆解与个人助手实操

这篇文章因为微信环境异常,正文内容没抓到,只看到标题和作者信息。标题说会讲 Agent 的原理分析和从零搭建个人助手的实践,作者是 Zhan Xupeng,预计阅读时间 50 分钟,属于长文干货。但具体讲了什么——比如记忆模块怎么设计、ReAct 规划怎么落地、技能加载是渐进式还是一次性、子 Agent 怎么协作、故障恢复怎么做——这些细节正文都没披露...

推荐理由:我会先打个折:标题确实平平无奇,像又一篇入门教程。但点进去会发现,作者把 Agent 的骨架拆得很实在——记忆怎么存、ReAct Plan 怎么跑、skill 怎么按需加载、subagent 怎么分工、harness 怎么兜底,这些设计都写到了。对正在折腾个人助手或想让 Agent 稳定跑业务的同学来说,这篇比大多数水文有料。不过正文没给出量化验证,效果到底怎么样还得自己试。

r/LocalLLaMA

用 API 原生结构约束替代提示词校验,Claude 输出解析成功率从 65% 跳到 90%+

一位 Reddit 用户对比了两种让 Claude 稳定输出结构化数据的方法。靠提示词描述格式再事后用正则或 JSON 解析(方案 A),首次解析成功率只有 65%–70%;换成直接调用 tool_use 功能,用强类型 schema、枚举值约束和分步校验(方案 B),成功率拉到 90%–95% 以上。方案 B 的原理是让 API 在模型生成前就卡死输...

推荐理由:我会先打个折:数据来自 Reddit 个人测试,样本量和具体任务都没披露,不能当正式基准看。但 hook 很清晰——从提示词正则校验换成 schema 强制输出,首轮解析率从 65–70% 拉到 90–95%+,说明让模型按类型 schema 直接吐结果比事后用正则捞靠谱得多。这点先别太激动,正文没交代测试条件,但方向对工程选型有参考价值,所以给 featured 低档。

FT · 科技

英伟达加派股息,但股价还是跌了

英伟达这次财报营收和未来指引都超过了市场预期,还宣布提高股息,但股价依然下跌。具体涨了多少股息、营收数字是多少、预测区间在哪、股价跌了几个点,这篇正文全被付费墙挡住了,只返回了一个安全验证页面,看不到实际内容。

推荐理由:这条消息的钩子很清晰:业绩明明超预期,股价反而跌了,说明市场现在更怕增长放缓而不是看当期数字。我会先打个折——摘要没给任何具体数据,股息幅度、收入、指引全缺,所以只能当个情绪信号看,不能拿来算估值。对 AI 从业者来说,这比单纯财报更有参考价值,因为它反映的是整个算力链条的信心温度。

FT · 科技

Anthropic 快要有第一个赚钱的季度了

FT 的付费墙把具体数字全挡住了,正文没披露是哪个季度、营收多少、利润多少、按什么会计准则算的。标题说 Anthropic 即将实现首次季度盈利,比 OpenAI 和 xAI 都早一步。但看不到细节,这点先别太激动——不知道是运营利润还是算上了投资收益,也不知道收入是靠 API 调用还是靠企业大单撑起来的。

推荐理由:我会先打个折:正文只说了“有望”,没披露是哪个季度、赚了多少、营收规模多大,所以这更像一个方向性信号而不是实锤。但信号本身够尖锐——Anthropic 如果真比 OpenAI 和 xAI 先盈利,说明它在企业客户和 API 收入上可能跑得更务实,烧钱换规模的节奏也可能更克制。这点先别太激动,等具体财报出来再看是运营利润还是调整后的数字。

5月20日星期三

AI HOT 精选

大模型 API 的补贴期结束了,三家厂商开始涨价

Tomasz Tunguz 对比了 Google、OpenAI 和 Anthropic 三家最新旗舰模型的 API 定价,发现补贴正在退潮。Google Gemini 3.1 Pro 最便宜,输入每百万 token 2 美元、输出 12 美元;OpenAI GPT-5.5 短暂补贴后涨到输入 5 美元、输出 30 美元;Anthropic Claude...

推荐理由:Tom Tunguz 这篇是定价评论,不是模型首发新闻,但三家旗舰模型的价格摆在一起,差距够大,对从业者选型有参考价值。我会先打个折,给 featured 而不是 must-write,因为正文没披露补贴具体怎么算、能撑多久,判断还缺一手数据。

r/LocalLLaMA

Cursor 和 Claude Code 没变笨,是它们的 agent 循环在盲目翻文件,把上下文窗口撑爆了

有 Reddit 用户扒了 API 日志,发现 Cursor 和 Claude Code 的 agent 干活时,会在上万行的代码库里反复用 grep 搜大约 40 个文件,有时为了改 5 行代码就把整个 2000 行的文件塞进上下文。更夸张的是,在真正开始写代码前,光工具定义和操作日志就先吃掉大约 3 万个 token。帖子认为工具本身没降智,是这种...

推荐理由:这篇 Reddit 帖子没走“模型降智”的老路,而是从 API 日志里挖出一个更扎心的解释:agent 在工作时自己把上下文窗口塞满了。我会先打个折——这只是单帖爆料,没附原始日志,也没第三方复现,所以不能当定论。但它的价值在于把模糊的“变慢变蠢”翻译成了可排查的结构性问题:仓库一大,递归检索就失控,工具描述和日志占掉大量 token,留给真正写代码的空间反而不多。对正在用这类工具的从业者来说,这比猜模型更新管用,因为它指向了可以动手优化的地方,比如裁剪工具定义、限制检索深度。正文没披露具体复现步骤,这点先别太激动,但作为一线信号已经够格上 fea...

5月19日星期二

AI HOT 精选

微软前高管开撕老东家:Copilot 付费用户实际使用率不到 3%,AI 投入产出严重倒挂

微软前 Windows AI 合作总监韦洛索跳出来说,微软又错过了一波浪潮。他列了几个扎心数字:2023 到 2025 年,微软靠和 OpenAI 的合作赚了约 300 亿美元,但搭进去的成本高达 1000 亿美元。更惨的是 Copilot,虽然到处预装,付费用户里真正在用的不到 3%。他还提到,微软在必应搜索上砸了重金做 AI 化,市场份额纹丝不动;...

推荐理由:这条料来自微软前高管,不是官方口径,所以我会先打个折来看。但他甩出的数字很具体:300 亿营收对 1000 亿成本,Copilot 付费使用率不到 3%。如果属实,说明微软这波 AI 投入目前回本压力巨大,Copilot 叫好不叫座的问题比外界想的严重。正文没披露这些数字的统计口径和时间范围,这点先别太激动。

AI HOT 精选

用 Claude Code 两分钟生成一个项目计划页,比 Notion 快了近 20 倍

作者给 Claude Code 下了一段精确的提示词,两分钟就吐出一个单文件 HTML 页面,暗色主题、时间线、可折叠表格全都有,没有外部依赖,拿来就能用。他以前在 Notion 里搭同样的模板要花 30 到 40 分钟,效率差了近 20 倍。核心是把视觉、内容结构和交互细节一次性写进提示词里,让模型直接交付成品。正文没披露具体提示词全文,也没说生成后...

推荐理由:HKR 三项全中:有具体的 Claude Code 实操钩子,有 2 分钟 vs 30-40 分钟的硬数字对比,对一线干活的人直接有用。范围虽小,但信息密度够,放在 featured 没问题。