跳到正文

#大佬观点

今日 1 条

5月10日星期日

新智元 · 公众号

硅谷顶尖 AI 甩开世界一年?这篇正文其实没给实锤

这篇文章的标题抛出一个很猛的判断,说硅谷最前沿的 AI 比外界领先一年,我们用的都是“技术余晖”。但点进去后,页面直接显示“环境异常,完成验证后即可继续访问”,正文内容完全没加载出来。所以,标题里提到的投资人 Elad Gil 的时间差说法(顶尖实验室员工领先硅谷 3-4 个月,硅谷又领先纽约 3-6 个月),以及 Mythos 在专家级网络攻击模拟中...

推荐理由:我会先打个折:这篇是二手评论,不是模型或产品发布,所以分数压在72–77这个区间。HKR三项都成立——“技术余晖”的钩子够抓人,时间差和73%成功率给了具体数字,地域焦虑感也拉满了。正文没披露Mythos测试的具体条件和样本量,这点先别太激动,但作为一篇制造FOMO的评论,它完成了任务。

5月9日星期六

AI HOT 精选

用 Codex 并行调试验证修复

作者查 bug 时会让 Codex 在临时沙盒里重建出问题现场,先确认 bug 能复现,再修,修完再验证一遍。本地环境不会被搞乱,因为所有操作都在隔离的临时环境里跑;速度也不掉,因为他同时开 10 个会话并行处理。正文没披露具体修复成功率或单次耗时。

推荐理由:这是一篇第一人称的工作流笔记,不是产品发布或基准测试,但 10 个 Codex 会话并行修 bug 的实操信号很强。我会先打个折——正文没披露修复成功率、单会话耗时和资源消耗,所以实用性还缺几块拼图。不过它把“临时沙盒 + 并行验证”这套打法讲清楚了,对想用 AI agent 干活的开发者有直接参考价值,放在 featured 里偏低的位置合理。

Latent Space

Anthropic 一年翻十倍,其他公司却在裁掉超过一成的人

Anthropic 现在被二级市场估到 1 万亿到 1.2 万亿美元,已经超过 OpenAI,排进全球前 15 大公司。这个估值背后有实打实的收入支撑:他们刚经历了一个“奇迹般”的第一季度,年化收入增速达到 80 倍,一个月内年化收入又跳涨了 150 亿美元。另一边,Block 裁了 40% 的人,Coinbase 裁了 14%,Cloudflare ...

推荐理由:这条不是官方融资或产品发布,属于行业评论,但信息密度高。Anthropic的10倍年增长和1万亿以上估值数字很扎眼,旁边又列了一串裁员百分比,对比强烈。我会先打个折:估值和增长数据正文没交代来源,是转述的说法,不能当实锤用。但即便保守看,它也点出了AI行业资金和人才在向头部集中的趋势,对从业者判断方向有参考价值。

AI HOT 精选

让 Claude 直接输出 HTML,效果比 Markdown 好得多

Anthropic 的 Thariq Shihipar 提出一个反直觉的建议:让 Claude 输出 HTML 而不是 Markdown。Simon Willison 过去一直默认用 Markdown,因为 GPT-4 时代 8192 token 的上下文限制让 Markdown 更省 token。但 Thariq 的文章让他重新考虑这件事——HTML...

推荐理由:HKR 三项都踩中了,但本质是个工作流技巧,不是 Claude 本身的功能更新。作为一篇质量在线的 Claude Code 教程,放在 72–77 分段合理,加上 Simon Willison 的转发背书,进 featured 没问题。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。

阿里技术 · 公众号

阿里许晓斌内部访谈:工程师用 AI 后,写代码时间从 30% 降到 5%,端到端交付效率提升 2-3 倍

许晓斌在内部访谈里给了几个数:工程师重度用 AI 后,写代码占工作时间从 30% 掉到 5%,跟 Agent 对话的时间从 5% 涨到 60%,端到端交付效率提升 2 到 3 倍,纯编码效率提升 10 倍。这些数字来自内部访谈,不是大规模统计,样本量和统计口径正文没披露,所以我会先打个折看。核心变化不是代码写得更快,而是工程师的时间分配被彻底打散重排—...

推荐理由:阿里技术这篇是内部访谈整理的组织方法论,不是产品发布或模型更新,但给出的数字很具体,能让人直观感受到 AI 把工程师的工作重心从写代码拽到了指挥 Agent 上。我会先打个折:效率提升 2 到 3 倍这个说法正文没交代是怎么算出来的,样本量和统计口径都不清楚,这点先别太激动。不过 HKR 三项都踩中了,放在 featured 门槛上刚好。

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

FT · 科技

科技巨头砸了7250亿美元搞AI基建,自由现金流跌到十年最低

FT这篇付费文章正文被锁了,只从标题和摘要片段能看出几个关键信息:硅谷大厂们过去在AI基础设施上累计花掉了7250亿美元,这个数字直接把它们的自由现金流压到了近十年的最低点。以前这些公司是轻资产、现金牛的玩法,现在被迫转型成重资产的基建投资者。但文章没披露具体是哪几家公司、统计的时间跨度、以及自由现金流是按什么会计准则算的,这些缺口让数字的横向可比性打...

推荐理由:标题把 7250 亿 AI 基建投入和十年最低自由现金流绑在一起,冲突感很强,成本与回报的账本焦虑一下就出来了。正文没披露具体公司名单、统计周期和会计口径,所以数字的精确边界还不清楚,我会先打个折。但即便口径模糊,这个量级的支出对比已经足够让从业者关注基建烧钱能不能回血,时效性和话题性都在。

阮一峰的网络日志

软件开发的第三种方式:像老太太盖神秘屋一样用 AI 写代码

阮一峰这期周刊把 AI 辅助编程比作“神秘屋”式开发——没有整体规划,想到哪写到哪,代码层层堆叠,充满个性但外人看不懂。这种开发方式可能取代传统的大教堂和集市模式,成为个人和小团队的主流。另外介绍了一个叫 HN SOTA 的大模型人气榜,通过扫描 Hacker News 每天最热的 200 个帖子里对模型的讨论和好评来排名,本周前三名是 Claude ...

推荐理由:阮一峰这期周刊把 AI 编程总结成“第三种方式”,核心是“神秘屋”——你给需求,模型直接出结果,中间过程你看不到。这个说法比“低代码”或“辅助编程”更直白,也更容易让人理解为什么开发者会又爱又怕。HN SOTA 的榜单用每天 200 个 HN 热门话题来量模型人气,不是跑分,而是看社区讨论热度,算是一种接地气的 benchmark。整篇是评论性质,没有新模型或产品发布,所以重要性停在 72。HKR 三项都过:比喻够新、方法够简单、情绪够普遍。

AI HOT 精选

ChatGPT 中文回复老说“我会稳稳地接住你”,WIRED 拆解了原因

ChatGPT 在中文对话里反复蹦出“我会稳稳地接住你”这类怪话,已经成了梗。WIRED 把这归因于模式坍缩——模型在后训练中被奖励机制带偏,逮住几个讨好人的短语使劲用。一个直接原因是翻译错位:英文口语“I've got you”被生硬直译成煽情长句,再被 RLHF 强化成“用户爱听”的固定套路。类似问题还有无故冒出“砍一刀”这种营销话术。这事不是 O...

推荐理由:我会先打个折——正文没给样本量,所以“频现”到底多频繁说不清。但这条信息对做对齐和中文产品的团队有提醒价值:模式坍缩和翻译错位会让模型输出变得油腻,RLHF 讨好奖励又容易把这种表达固化下来。Claude 和 DeepSeek 新版本也出现类似表达,说明这不只是 OpenAI 一家的问题。不过,缺少数据支撑让判断只能停在“值得留意”这个级别。

AI HOT 精选

AI 代理生成的 PR 到处都是,GitHub 发了份审查指南

GitHub 这篇博客直接给了一套审查 AI 代理提交的 Pull Request 的方法。核心就三点:先看代码改了什么,别被大段生成代码吓住;再查逻辑漏洞和安全问题,因为模型容易写出看起来对但实际有坑的代码;最后在合并前把技术债清掉,别让自动提交把代码库搞乱。文章没给出具体的自动化检查工具,更多是人工审查的思路。

推荐理由:GitHub 这篇博客没推新模型或新功能,而是给了一份审查 AI 代理生成的 PR 的实操指南。我会先打个折:它更像经验总结,不是严格验证过的规范。但 3 个审查关注点——代码变更、逻辑/安全漏洞、合并前技术债——确实把“怎么审”拆成了能落地的步骤。对天天被 AI 提 PR 的工程师来说,这篇直接回应了“审不审得动”的问题,所以放在 featured 档位是合适的。

5月7日星期四

AI HOT 精选

中国 AI 实验室内部笔记:学生军团、快跟文化和被压缩的算力

作者走访了国内几家头部 AI 实验室,发现一个明显特点:核心贡献者里学生占比很高,他们没包袱、上手快,愿意做那些不炫但能让模型变好的脏活累活。这种文化让中国团队在追赶大模型、做智能体工作流时效率很高,但也被一些技术负责人认为会抑制从 0 到 1 的原创研究。文章提到,国内实验室在百亿级基础模型和十亿级垂直模型上都有布局,部分中文任务表现已超过 GPT-...

推荐理由:H/K/R 全过:一手实验室访问、具体的能力对比和模型规模信息、算力与部署的行业共鸣都很扎实。这不是模型发布或融资事件,属于强分析类内容,放在 78–84 分段合理。正文说“只看图片就能学压缩”和“压缩 90% 精度不掉”,这两个点如果后续有更细的消融实验或复现报告,价值还会更高。

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

5月6日星期三

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

Computing Life · Share · 鸭哥调研

AI 时代,复核不等于独立判断

别人拿 AI 输出来压你,你一眼就能看出他没动脑子。但轮到自己用 AI 写分析、回邮件时,那条线就模糊了:你读一遍觉得通顺,就发出去了,这到底算独立判断,还是只做了个熟悉度检测?沃顿的 Shaw 和 Nave 用实验把这事量化了。一千三百多人做认知反射测试,AI 给错误答案时,仍有八成的人照单全收。更要命的是,用了 AI 的人对自己答案的信心反而高出 ...

推荐理由:我会先打个折:正文只给了 Shaw 和 Nave 两个实验线索,没放任何数字,所以知识深度有限。但它的钩子很准——复核不等于独立判断,检查容易滑成“看着眼熟就放行”,高验证复杂度的任务得先自己建个参考点再交叉比对。这点先别太激动,因为实验证据没亮出来,不过对天天跟 AI 输出打交道的从业者来说,这个提醒够直接、够有用。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

Latent Space

GPT-5 用 11 分钟复现了物理学家的硬核论文,OpenAI 开始正经搞科研了

理论物理学家 Alex Lupsasca 聊了他怎么用 GPT-5 做研究。他先让模型做了道课本里的热身题,然后 GPT-5 只花了 11 分钟就复现了他一篇获奖级别的论文,这篇论文的发表日期在模型训练数据截止之后。后来,他加入 OpenAI 的科学团队,用 GPT-5.2 去算一个以前被认为不可能手算的胶子振幅公式,模型真给出了非零结果,团队花了三周...

推荐理由:Alex Lupsasca 在访谈里说,他们拿教材给 GPT-5 预热后,模型 11 分钟就复现了他论文里的结果;ChatGPT 又在一天内产出 110 页引力子计算,团队花了三周才验证完。我会先打个折:这是单人访谈,没有第三方复现,而且理论物理这个领域太窄,换到其他任务能不能跑通还不清楚。正文没披露验证过程中改了多少轮 prompt,也没说那 110 页里有多少是废话。所以先给 84 分,放在 featured 里,等有更硬的基准测试出来再调。

5月5日星期二

MIT Technology Review · AI

一份用 AI 加固民主的蓝图

Andrew Sorota 和 Josh Hendler 提出了一套三层架构,把 AI 塞进知识获取、个人代理和制度运行里,想让它帮民主续命。他们引用了 X 平台上的实地测试:AI 写的事实核查被不同政治立场的人认为比人类写的更有用,不过这篇论文还没经过同行评审,这点先别太激动。文章说,现在大家越来越靠 AI 来了解真相、形成观点,未来的个人 AI 代...

推荐理由:这篇文章没推新产品或新模型,而是搭了一个三层民主基础设施的框架:认知层帮人辨别信息,代理层让 AI 参与协商,制度层把 AI 嵌进治理流程。我会先打个折,因为正文没披露 X 平台事实核查的准确率、误判率这些硬指标,也没说地方协商平台到底覆盖多少用户、效果如何。但框架本身有干货,两个落地案例让讨论没飘在天上,对做 AI 治理和安全的人算一份有用的参考。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

5月4日星期一

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

5月2日星期六

TechCrunch · AI

Replit 创始人聊 Cursor 收购传闻、跟苹果较劲,以及他为什么不想卖公司

Replit 的 CEO Amjad Masad 在 StrictlyVC 活动上回应了几个尖锐问题。首先是竞争对手 Cursor 被传要以 600 亿美元卖给 SpaceX,他怎么看。Masad 没直接评价这个价格,但明确表示自己不想卖 Replit,更想独立发展。文章还提到 Replit 的收入从 2024 年全年的 280 万美元,猛增到现在年化...

推荐理由:TechCrunch 这篇截出来的部分,核心钩子是 Cursor 的 600 亿美元收购传闻和 Masad 的不卖表态,反差够强。信息增量上,Replit 从 280 万到十亿年化目标的跨度、Cursor 的天价传闻,都是圈内会盯着看的数字。不过正文没展开 Masad 对 Apple 争议和出售意向的完整说法,所以重要性我打个折,放在 72–77 这个区间。

5月1日星期五

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

量子位 · 公众号

他用 AI 办了场音乐节,主题是“别读博”

B站UP主“混沌皮切总”用 AI 生成了 42 首“劝退读博”的歌,全网播放量超过 5000 万。一首歌要跑上百次生成,同时用 Suno、MiniMax 音乐、心模拉和 ACE-Step 几个工具来回试。正文没披露具体技术细节,但能看出现在 AI 做歌最花时间的不是生成,而是人得一首首听、一首首挑,这个筛选成本很高。

推荐理由:HKR 三项都站得住:梗本身够怪、传播数据和工作流细节都给了、最后落点卡在“AI 放大产出但人工筛选成本没降”这个创作者的真实焦虑上。这不是模型或平台发布,是实打实的案例拆解,分数放在 78-84 区间合理。

彭博科技

音频行业开始头疼了:39% 的新播客可能是 AI 生成的“播客垃圾”

Podcast Index 抓了九天的新播客数据,发现 39% 很可能是 AI 生成的,行业管这叫“podslop”(播客垃圾)。文章没披露他们用什么方法检测、样本总量多大、以及这些节目分布在哪些平台。这个比例看着挺高,但先别太激动——如果检测手段比较糙,可能会把一些只是用了 AI 辅助的节目也算进去。对听众来说,最直接的影响是以后找真人聊出来的好节目...

推荐理由:标题和摘要都指向一个清晰的信号:音频圈开始正视 AI 批量生产低质内容的问题。39% 这个比例挺扎眼,但正文没交代他们怎么判断“疑似 AI 生成”、样本量多大、主要出现在哪些平台,所以这个数字我先打个折看。Bloomberg 的报道加上 Podcast Index 的数据来源,够得上 featured,但算不上行业级大事件,更像一个值得关注的早期警报。

彭博科技

Meta 砸钱搞 AI 像云厂商一样猛,但没看到对应的云收入

Dave Lee 直接批评 Meta 的 AI 资本支出太离谱,最高可能冲到 1450 亿美元。他的核心质疑是:亚马逊和谷歌敢这么花钱,是因为有云业务带来的销售增长做支撑,Meta 没有这块收入,花大钱却看不到能匹配的回报。视频里没展开讲 Meta 具体把预算烧在了哪些模型或基建上,但点出了这种支出节奏不可持续。

推荐理由:这篇不是产品发布或技术论文,而是对 Meta 花钱逻辑的评论。我会先打个折:它没有新模型或新工具,但把 capex 和收入错配这件事讲得很直白。1450 亿这个数字够大,大到让人想问钱花哪儿了;正文又明确说 Meta 的财报电话会口径偏谨慎,没有云收入来兜底。对在看 AI 投入产出比的人来说,这个提醒是及时的。信息密度不算高,但判断清晰,所以放在 featured 里没问题。

4月30日星期四

r/LocalLLaMA

实测:用小模型跑编程 agent,哪些环节会崩

作者花了几周时间,用 7B 以下的本地小模型和免费云端模型跑多文件编程任务,发现结构化输出很不靠谱。崩得最多的地方有三个:模型在回复里乱加 markdown 代码块标记,把编辑内容写到错误的文件里,以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤,但正文没披露具体用哪些模型、测试了多少任务,也没给出量化的成功率,所以这些结论只能当经...

推荐理由:这篇 Reddit 帖子不是论文,是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折:它只是单人经验,没有系统对比实验,所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住,Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水,直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量,这点让结论的普适性弱一些,但对想用本地模型搭 coding agent 的人,这些失败模式比 benchmark...

新智元 · 公众号

陶哲轩说数学界从缺证明变成证明太多,AI 生成的“生肉证明”堆满 GitHub

陶哲轩最近公开说,数学研究的瓶颈已经从“找不到证明”变成了“证明太多看不过来”。在一个关于 Erdős 问题的 GitHub 页面上,已经有 20 多个 AI 生成的解法等着人去评估。文章提到 GPT-5.4 Pro 用 80 分钟就给出了 Erdős #1196 的一个思路,陶哲轩自己在 24 小时内验证了核心部分。现在真正头疼的不是 AI 能不能解...

推荐理由:这篇东西不是模型发布,但把陶哲轩的发言和 GitHub 上的 AI 证明积压摆在一起,信息量够硬。我会先打个折,因为正文没给出那 20 多份解法的具体通过率或质量分布,只能看到数量堆上去了。真正值得盯的是陶哲轩说的验证与消化工作流——证明便宜了,判断力反而更贵,这个转向对从业者比裸看模型跑分更有参考价值。

FT · 科技

Google 在 AI 军备竞赛中跑赢对手,科技巨头们计划砸下 7250 亿美元

这篇付费文章只露了个头,正文没披露具体的时间范围和各家花钱的明细。从摘要看,Google 在云计算增速上超过了亚马逊和微软,而 Meta 因为大幅上调资本支出,股价承压。7250 亿美元这个数字是几家巨头 AI 投资计划的总额,但具体怎么算出来的、覆盖几年,文章没给。这点先别太激动,关键细节都锁在付费墙后面。

推荐理由:这篇 FT 报道扔出一个 7250 亿美元的 AI 支出预期,说 Google 跑得比同行快,Alphabet 云业务增速也压过 Amazon 和 Microsoft。我会先打个折——正文没披露这数字怎么拆到各家公司、覆盖哪几年、投在模型还是基础设施上,所以别急着拿它当精确坐标。但即便模糊,这个量级和竞争格局对从业者判断算力成本、云厂商选择和资本热度还是有参考价值。

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

OpenAI News

GPT-5 模型为什么满嘴都是“小妖精”

OpenAI 自己出来解释了 GPT-5.1 之后模型爱用“哥布林”“小妖精”打比方的怪癖是怎么来的。根子出在“书呆子”这个个性定制选项上:训练时给这个风格打分的奖励模型,对带幻想生物词汇的输出格外偏爱,76.2% 的数据集里都给更高分。虽然选“书呆子”的用户只占 2.5%,但贡献了 66.7% 的“哥布林”出现次数。更麻烦的是,强化学习没把这种口癖锁...

推荐理由:我会先打个折:正文就一段 RSS 摘要,触发条件、时间线和修复机制都没披露,所以没法做太硬的判断。但标题已经把传播点、根因和修复方向列出来了,GPT-5 输出“哥布林”这件事本身就够怪,从业者会立刻联想到模型人格化行为是怎么跑进输出链路的。这点先别太激动,因为信息缺口太大,但安全对齐和上线事故这两个话题叠加,确实值得放进 featured 里提醒大家留意后续。

Dwarkesh Patel 播客

Reiner Pope 黑板讲座:大模型训练和推理背后的数学账本

Dwarkesh 把采访间改成了黑板教室,请来芯片公司 MatX 的 CEO Reiner Pope,用公式和粉笔把大模型从训练到服务的成本结构拆了一遍。讲座从批处理大小讲起:没有批处理,服务成本会直接差出 1000 倍,这也是为什么各家 API 定价和快速模式差价巨大的根源。接着讲了 MoE 模型怎么跨 GPU 机柜摆放、流水线并行如何把模型层切分到...

推荐理由:这是一堂黑板课,不是新闻事件,所以分数没往上拉。但内容确实扎实:Pope 把训练和推理里几个关键的成本开关——尤其是批处理对经济性的影响——用数字讲清楚了。我会先打个折,因为正文没给具体实验数据,更多是经验推演,但“1000 倍”这个量级足够让人重新审视自己的服务设计。

4月28日星期二

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

彭博科技

WSJ 称 OpenAI 没达到自己定的用户和销售目标

《华尔街日报》拿到内部消息,说 OpenAI 没完成自己设的新用户和销售额目标。公司内部开始担心在 AI 基础设施上砸的钱是不是太多了。不过这篇报道正文被 Bloomberg 的付费墙挡住了,具体目标数字、差了多少、时间范围和花了多少钱都没披露,所以没法判断缺口有多大。

推荐理由:我会先打个折,因为 WSJ 这篇正文没披露具体数字,缺口多大、哪个季度、花了多少钱全不清楚,所以信息密度其实偏薄。但选题本身够直接:OpenAI 自己定的增长目标没完成,内部已经在担心基础设施的高支出扛不住。对从业者来说,这不是公关稿里的增速放缓,而是实打实的成本焦虑——如果连 OpenAI 都踩刹车,整个行业靠烧钱换用户的逻辑就更值得怀疑了。这点先别太激动,等具体数据出来再下重注。

Latent Space

Applied Intuition 十年做成 150 亿美元估值,他们想把所有会动的机器都塞进同一个 AI 操作系统

Applied Intuition 的 CEO 和 CTO 聊了他们从 YC 时期的自动驾驶工具链,一路做到估值 150 亿美元实体 AI 公司的完整路径。公司现在有 30 多款产品,全球非中国车企前 20 名里 18 家是他们的客户,L4 级无人卡车已经在日本跑起来了。他们反复强调,实体 AI 真正的瓶颈不是模型不够聪明,而是怎么把模型塞进车里:车载...

推荐理由:这篇复盘把 Physical AI 从融资故事拉到了实车部署层面,信息量够硬——估值、客户覆盖、L4 落地都有数字撑着。我会先打个折:正文没披露具体模型架构或安全验证的实测数据,所以重要性停在 80 这个区间是合理的。对做车端推理和自动驾驶落地的人,这篇值得一看,但别指望有技术白皮书级别的细节。

X · @dotey(宝玉)

西方忘了怎么造东西,现在也快忘了怎么写代码

作者拿国防工业的教训来比软件行业:美国重启毒刺导弹生产线要4年,因为会造的人早退休了,图纸还是卡特时代的;欧洲承诺100万发炮弹,晚了9个月才凑齐,因为发射药停产17年、TNT只剩一家厂。核心不是没钱,是知识断了。软件业现在也在走这条路——METR的对照实验发现,资深开发者用AI写代码反而慢了19%,但很多人已经离不开AI。Salesforce今年不招...

推荐理由:标题类比够尖锐,正文用军工交付延迟和 METR 的 19% 降速给了硬数字,最后把焦点从 AI 速度拉回到人才断层,对 AI 从业者来说比单纯吹或黑 AI 编程更有讨论价值。因为是转译加评论,权威性打折扣,但信息量和话题度都够,放在 featured 里合适。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。