跳到正文

#大佬观点

今日 1 条

5月19日星期二

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

AI 群聊日报

AI21裁员六成停卖模型,GPT-5.4被假共识带偏后准确率从100%暴跌到23%

AI21 Labs裁员60%并停止独立销售模型,文章判断纯卖模型访问权限这条路已经走不通了——token价格两年跌了100倍,过去16个月里有六家独立模型公司以几乎相同的方式被大厂吸收。Meta内部文件也曝出要裁10%约8000人,同时强征7000人转AI岗。滑铁卢大学一篇论文测出GPT-5.4在注入虚假同伴共识后,准确率从100%掉到23%,模型内部...

推荐理由:我会先打个折:来源是群聊日报,不是官方公告或论文,所以细节可能不全。但两条信息都直接给数字——AI21 砍掉六成人、不再卖模型,说明这家实验室在收缩;GPT-5.4 被注入虚假同伴共识后准确率从全对掉到只剩两成多,暴露了模型在群体压力下的脆弱。这两件事放在一起,既有行业动态又有安全风险,对从业者来说值得扫一眼。

r/LocalLLaMA

2026 年 Hermes Agent 替代品实测:11 款工具谁值得折腾

作者团队里有人搞不定 Hermes 的部署,加上自托管 agent 的安全问题越来越复杂,于是把市面上 11 款替代品拉出来测了一遍。开源这边,OpenClaw 有 34.7 万 GitHub 星标和 24 个以上的平台集成,但安全记录很差,3 月曾 4 天内爆出 9 个 CVE 漏洞,独立审计发现 ClawHub 上约 20% 的包是恶意的,要用得先...

推荐理由:这是一篇 Reddit 用户做的 Hermes Agent 替代品横评,11 个选项分开源和托管两档,OpenClaw 的数据(347k stars、24+ 集成、9 个 CVE)让对比有抓手。我会先打个折:单帖来源,没披露测试方法和版本,结论不能当权威报告用。但“替你试完”这个角度确实省时间,安全漏洞数量也提醒选型时别光看 star 数。整体对正在搭 Agent 的人有参考价值,所以放在 featured 档。

5月18日星期一

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

5月17日星期日

AI HOT 精选

微软AI CEO放话:18个月内AI能接手所有白领工作

微软AI负责人Mustafa Suleyman在《财富》采访里给了一个很激进的时间表——18个月内AI会达到人类水平,把会计、法律、营销、项目管理这些坐在电脑前干的活全自动化。他的原话是“所有白领工作都会被完全取代”。Suleyman还说自己的目标是搞出“超级智能”,以后建一个新AI模型会像录播客或写博客一样简单。不过正文没给出支撑这个18个月判断的具...

推荐理由:我会先打个折:这是 CEO 的预测,不是实测结果或论文数据。Mustafa Suleyman 说 18 个月内 AI 能到人类水平,把会计、法律、营销、项目管理这些专业任务全自动化,但正文没给出支撑这个时间线的基准测试或产品落地证据。对从业者来说,这个判断更像风向标,提醒你关注微软在 agent 和工作流自动化上的动作,而不是一个可以拿来排工期的承诺。

FT · 科技

FT 称中国 AI 公司在视频生成上反超美国对手,但正文被付费墙挡住,没看到具体模型和评测数据

FT 这篇文章的标题说字节跳动和快手等中国 AI 公司在视频生成领域已经领先美国对手,在广告和娱乐场景里效果更好。但点进去只看到安全验证页面,正文完全没加载出来,所以不知道他们拿什么模型比的、用的什么评测标准、样本量多大、延迟和成本怎么样。我会先打个折——标题里的“领先”目前只能当个信号看,等看到具体数据再下判断。

推荐理由:FT 这篇标题很猛,说中国公司在视频生成上反超美国,但正文信息很薄。只提到字节和快手在广告、娱乐视频质量上领先西方对手,具体怎么比、用什么标准、样本多少全没写。我会先打个折:标题的“领先”目前只能当个信号看,别急着当定论。不过视频生成确实是现在中美模型竞赛里最卷的一条线,这条消息对关注多模态落地的人有提醒价值,所以给了 featured 门槛分。

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

机器之心 · 公众号

龙虾之父自曝月烧130万美元token,账单OpenAI全包

Peter Steinberger 晒出后台数据,30天里跑了760万次请求,烧掉6030亿个token,账单超过130万美元。他提到关掉“快速模式”后费用直接砍了七成,而且这笔钱目前由 OpenAI 承担,他自己不用掏。

推荐理由:我会先打个折:这是个人晒账单,不是 OpenAI 官方调价,但 130 万美元这个数本身就够从业者心里咯噔一下。文章给了很实的用量——6030 亿 token、760 万次请求,还点出关掉快速模式能砍掉七成费用,对正在跑 agent 的团队有直接参考价值。不过正文没披露他具体跑了什么任务、模型怎么选的,也没说 OpenAI 为什么免单,这点先别太激动。整体更像一条带数据的成本警示,不是产品发布,所以放在 featured 刚好。

AI HOT 精选

Anthropic CEO 说 AI 可能把 GDP 拉高 5%–10%,但失业和不平等也会跟着涨

Dario Amodei 给了两个数字:AI 可能推高 GDP 增速到 5%–10%,同时失业率会上升、贫富差距拉大。他的核心判断是软件成本会降到接近零,传统靠卖软件授权的商业模式会被打穿。现在工程师还能去做编辑或升级工作,但 AI 模型会不断吃掉更多任务,很多干了几十年的职业会慢慢消失。他担心社会还没意识到这场变化的规模和冲击有多大,自己既兴奋又发愁...

推荐理由:Dario Amodei 这次把话说得很直:AI 可能带来 5% 到 10% 的 GDP 增长,同时推高失业和不平等,软件成本会便宜到近乎免费。我会先打个折,因为原文是 X 上的摘要,不是完整访谈实录,没法确认他有没有给限定条件。但即便只是方向性判断,也足够让做 AI 的人重新掂量自己的位置——增长是你的机会,免费软件可能先吃掉你的老业务。

AI HOT 精选

Anthropic CEO 说软件会变得几乎免费,很多职业会消失

Dario Amodei 在《华尔街日报》的 YouTube 采访里给了两个判断:软件成本会跌到接近免费,过去那种“靠百万用户摊薄成本”的逻辑会失效;几十年积累下来的很多工作岗位和职业可能直接没了。他觉得社会能适应,但补了一句——现在大家完全没意识到这场变化有多大、来得多快。

推荐理由:Dario Amodei 在《华尔街日报》采访里扔了两个挺狠的判断:软件成本会急降到基本免费,靠百万用户分摊成本的老逻辑要崩。我会先打个折——目前看到的只是二手摘要,正文没披露具体时间线、数据支撑和完整论证,所以别太激动。但这两个点本身够直接,对做 AI 产品、定价和看人力结构的人都有触动,值得放进精选,只是信息缺口明显,分数压在中低段。

TechCrunch · AI

AI 淘金热的“有产者”和“无产者”

Menlo Ventures 的合伙人 Deedy Das 算了笔账,说现在 OpenAI、Anthropic、英伟达这类公司的创始人和员工里,大概有 1 万人已经靠股权攒下了超过 2000 万美元的退休级财富。与此同时,其他软件工程师正面临裁员,年薪天花板卡在 50 万美元以下,还焦虑自己练了一辈子的编程手艺在市场上越来越不值钱。有人吐槽,这轮热潮里...

推荐理由:这篇文章不是讲模型、产品或融资,就是一篇评论。HKR 三项都踩中了:财富差距的标题够抓人,1 万人、2000 万美元这个估算有料,工程师对裁员和技能贬值的焦虑也很真实。我会先打个折,它没有新数据或一手信源,就是转述一个估算,所以放在 featured 这个档位刚好。

Dwarkesh Patel 播客

别把“聪明”和“权力”混为一谈

Dwarkesh Patel 在这篇博客里聊了一个挺常见的误解:我们总把 AI 的智力等同于它能掌握的权力。他上来就举了个例子,如果按“在多种领域达成目标的能力”来定义智力,那斯大林可能是史上最聪明的人,但这显然不是我们讨论超级 AI 时脑子里想的那个东西。文章的核心观点是,现在 AI 变强的方式,主要是被训练去干好编程这类有经济价值的活儿,这和现实世...

推荐理由:Dwarkesh 这篇是观点评论,不是新实验或数据报告。他把“智能”和“权力”拆开来看,提醒大家别把模型在编程任务上的进步,直接当成它能掌控现实资源。这个区分对做安全的人有用,但正文没给出实证案例,所以分数停在优质评论这一档,没往上走。

Dwarkesh Patel 播客

预训练并行策略与翻车训练笔记

这篇笔记聊了两件事:预训练为什么容易跑崩,以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择(expert choice)分配 token,会让 token n 的去向依赖 token n+k 的路由结果,训练时看到了推理时看不到的信息;token 丢弃也会让后面的 token 影响前面的处...

推荐理由:Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲:expert choice 和 token dropping 会破坏因果性,FP16 集体通信能把一万次累加算偏,这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换,不是系统性的技术报告,但给的数字(6ND、288GB、参数量×3)对算成本和排故障都有用。正文没展开具体实验验证,所以别当定量结论用。

AI HOT 精选

RLVR 在科学领域可能格外不灵光

Dwarkesh Patel 聊了一个很要命的问题:用 RLVR(靠可验证奖励信号做强化学习)去搞科学发现,可能比我们想的难得多。文章没给实验数据,纯靠科学史案例来推演。核心矛盾是,科学理论的验证周期动不动就是几十年甚至上百年,而且当时看起来更准的模型,未必是更对的理论。比如哥白尼的日心说刚出来时,预测精度还不如托勒密打磨了上千年的地心说,连模型本身都...

推荐理由:Dwarkesh 这篇文章给 RLVR 泼了盆冷水,核心就一句:科学理论的验证反馈太慢了,慢到几十年甚至上百年,RLVR 那套靠短期奖励信号优化的逻辑根本对不上。我会先打个折,正文没给出实验数据,纯属观点评论,但问题提得准——如果验证周期拉长到人的一辈子都等不到,那“可验证”这个前提在科学场景下就悬了。这点先别太激动,但它确实戳到了 AI for Science 路线的一个软肋。

AI HOT 精选

Eric Jang 从零复现 AlphaGo:2026 年训练强围棋 AI 只要几千美元算力

Eric Jang 花了几个月从零实现 AlphaGo,并把过程写成教程和代码放了出来。他原本的理解是“用自我对弈训练的搜索增强神经网络”,但亲手做一遍后对细节有了更深体会。他给出一条关键判断:前沿研究仍然很贵,但特定能力的落地成本掉得很快——到 2026 年,训练一个能打的围棋 AI 租算力只要几千美元,不再需要 DeepMind 级别的资源。他自称...

推荐理由:我会先打个折:这是个人分享,不是论文或模型发布,所以信息密度有限。但亮点很明确——Eric Jang 一个人花几个月从零把 AlphaGo 做出来,还给了个具体成本判断:2026 年租算力训强围棋 AI 只要几千美元。这个数字直接说明当年需要大团队、大预算的系统,现在个人和小团队也能碰了。正文没披露具体训练配置和模型强度验证,所以“强”到什么程度还不好说,这点先别太激动。整体适合当一条有话题、有数字、对从业者有参考价值的动态来推。

5月16日星期六

AI HOT 精选

Anthropic 内部手册:AI 反而会让创业失败率变高

Anthropic 发了份内部手册叫《Founder's Playbook》,结论挺反直觉:像 Claude Code 这类 AI 工具,不是让创业更容易成功,而是会把失败率推高。手册把创业拆成想法、原型、发布、扩张四个阶段,逐个拆解 AI 放大风险的方式。最核心的问题是,AI 能几分钟跑出一个能用的原型,创始人很容易把“能跑通”当成“市场需要”,再用...

推荐理由:Anthropic 这份创始人手册没在吹自家工具多好用,而是警告 Claude Code 这类 AI 会让创业者在四个阶段更容易踩坑。我会先打个折:正文没给出具体数据或可复现的测试,更像经验总结。但“降低建造成本却放大判断错误”这个角度确实少见,对正在用 AI 加速开发的团队是个清醒提醒。

AI HOT 精选

黄仁勋对 CMU 计算机毕业生说:电工水管工比你们更有前景

黄仁勋在卡内基梅隆大学 2026 届计算机科学毕业典礼上直接说,技工的前景比计算机毕业生好。Randstad 的数据显示技工需求增速是白领的三倍,机器人技术员岗位涨了 107%,而斯坦福研究发现 AI 相关职位的早期就业反而降了 16%。顶级电工年薪能超过 10.6 万美元,还不用背学费贷款。另一边,科技公司今年砸了 7000 亿美元建数据中心,全球到...

推荐理由:黄仁勋在毕业典礼上劝 CS 学生考虑技工,这话本身就够抓眼球。Randstad 给了两个数字:技工需求增速是白领 3 倍,机器人技术员岗位涨 107%,说明动手修机器、调设备的人越来越抢手。对做 AI 的人来说,这等于在问:写代码和管机器人,哪个饭碗更稳。不过这只是 X 上的评论,不是产品发布或政策变动,所以放在低 featured 就够了。

彭博科技

美国 AI 暴露岗位开始出现大规模裁员,客服、秘书、销售首当其冲

彭博拿到的一份数据显示,2025 年是美国连续第二年出现 AI 暴露岗位明显裁员。重灾区是客服代表、部分秘书岗和销售岗。报道没披露具体裁员人数,也没说清楚“AI 暴露岗位”是怎么归因的——到底是因为直接换上 AI 工具,还是企业以 AI 为由砍人,这点先别太激动。但连续两年掉数字,说明这不是一次性的波动,而是结构性收缩。

推荐理由:Bloomberg 这篇评论点出美国一些被 AI 盯上的岗位在 2025 年又丢了一大批,客服、秘书、销售都被点名。我会先打个折:正文没披露具体流失数字和统计方法,所以没法判断“大量”到底多大。但连续两年这个趋势本身够直接,对关心 AI 抢饭碗的人来说是个实打实的信号,值得放进 featured。

AI HOT 精选

杨立昆播客访谈:LLM 走不远,他离开 Meta 去赌世界模型

杨立昆在 Unsupervised Learning 播客里把大语言模型的底牌翻了个遍。他直接说 LLM 这条路有天花板,劝博士生别再往里扎。他预测到 2027 年,纯靠堆语言数据做不出真正的智能。他离开 Meta 后创立的 AMI 公司,核心押注在“世界模型”上——让 AI 像人一样通过观察和互动去理解物理世界,而不是只读文本。访谈里他还跟老搭档 H...

推荐理由:我会先打个折:这是播客访谈,不是论文或产品发布,信息密度高但验证性弱。杨立昆的核心判断是当前大语言模型路线走不到人类级 AI,他把宝押在世界模型和 AMI 上,还给了 2027 这个时间点——这点先别太激动,正文没披露他具体依据什么数据或实验得出这个年份。他离开 Meta 的原因和与 Hinton、Bengio 的分歧是这次的新料,尤其是安全观上的对立,直接关系到行业资源往哪投。整体看,这篇访谈把一位关键人物的技术判断、职业选择和路线分歧打包在一起,对从业者判断风向有帮助,但很多结论还缺公开验证。

AI HOT 精选

Eric Jang:从零手搓 AlphaGo,聊聊搜索、自对弈和 AI 研究的自动化

Eric Jang 在播客里拆解了他休假期间的项目——用现代工具从零复现 AlphaGo。他解释了 AlphaGo 为什么至今仍是理解智能系统的好范本:它把蒙特卡洛树搜索、从经验里学习和自我对弈这三件事结合得很干净。节目里聊到,这种搜索加自对弈的强化学习方式,能直接给每一步棋一个更优解,绕开了现在训大语言模型时常遇到的“功劳归谁”难题。Jang 还试了...

推荐理由:这是一篇机制拆解加评论,不是模型或产品发布。Eric Jang 把 AlphaGo 掰成三块讲,对做推理和智能体的同学有参考价值,但别当新成果看——正文没披露任何新指标,就是一次高质量的技术复盘。

5月15日星期五

The Verge · AI

AI 写的论文越来越像真的,同行评审快扛不住了

The Verge 报道了一个具体案例:研究员 Peter Degen 发现一篇 2017 年的论文引用量突然暴增,从过去几年总共几十次,变成每隔几天就被引用一次。他怀疑这些引用来自 AI 生成的论文,因为 AI 写手会从训练数据里随机抓取看起来相关的文献塞进参考文献列表。文章指出,这种“看起来挺像回事”的 AI 论文正在大量涌入学术期刊的审稿流程,审...

推荐理由:这篇 The Verge 的报道抓到了一个很具体的信号——Peter Degen 发现一篇老论文的引用曲线突然反常飙升,但正文没披露他到底查了多少样本,所以这个异常有多普遍还不好说。我会先打个折,把它放在 featured 里偏低的位置,而不是必读。它好就好在用一个可查证的引用异常,把“AI 论文变好看了反而让审稿更难”这个矛盾讲清楚了,对做研究和搞评审的人都挺有触动。

彭博科技

OpenAI 首席营收官说,企业客户现在贡献了四成收入,年底要冲到一半

OpenAI 的首席营收官 Denise Dresser 在彭博的采访里透露,企业业务(就是卖给公司的 ChatGPT 和 API 服务)已经占到总收入的 40%,预计到今年年底会涨到 50%。这组数字说明 OpenAI 的生意重心在往企业端靠,不再只靠个人订阅。不过,彭博的片段里没提 OpenAI 的总收入到底是多少,所以这 40% 对应的具体金额还...

推荐理由:这是一段 Bloomberg 的简短采访,CRO 只给了收入占比,没给总收入、利润率或客户规模。数字本身有料,但信息量有限,所以放在 featured 而不是更高档。我会先打个折:40% 这个比例挺好看,但不知道分母多大,别急着把它当成全面盈利的信号。

AI HOT 精选

推理的一阶导数:不直接卖算力,但靠 AI 用量暴增的公司

Tom Tunguz 把 Datadog 和 Twilio 这类公司叫做“推理的一阶导数”——它们不直接卖模型推理算力,但客户跑 AI 跑得越猛,它们就赚得越多。Datadog 的 LLM 监控数据量一个季度几乎翻倍,6500 个 AI 客户只占总客户数的 20%,却贡献了约 80% 的年化收入。Twilio 则因为 AI 原生公司和传统企业都在用语音...

推荐理由:Tom Tunguz 把推理增长和 Datadog 的用量、收入集中度数据绑在一起讲,比纯评论多了数据支撑。文章是评论性质,没有新模型或产品发布,所以分数停在 72–77 这个区间。我会先打个折,因为 2500 亿这个数字正文没给具体测算逻辑,只能当方向性判断看。

AI HOT 精选

Claude API 提示预缓存:先预热系统提示,再让真实请求直接命中缓存,首 token 生成更快

一个减少长提示首 token 延迟的实用技巧。在用户请求到达前,先单独发一次系统提示给 Claude,让它把提示写进缓存,但跳过输出。等真实请求进来时,缓存已经热好,直接命中,省掉重复处理长提示的时间。正文没披露具体提速多少,但思路很直接,适合系统提示固定、用户提示多变的场景。

推荐理由:Claude API 搞了个提示预缓存,相当于提前把系统提示塞进缓存里热着,真实请求一来就能省掉首令牌的等待。正文没给出具体能省多少毫秒,也没说缓存能热多久、会不会额外计费,所以省钱效果先打个折看。整体是个实用的推理优化小更新,不是模型能力或大版本发布,放在 featured 里当个中等权重的消息刚好。

r/LocalLLaMA

网友追踪欧盟 15 家店 50 多天显卡价格:只有 RTX 5090 没降价,还涨了 3%

Reddit 用户 egudegi 用脚本每 6 小时抓一次欧盟 15 家店的显卡价格,攒了约 12.6 万条数据。结果显示 RTX 5090 均价从 3392 欧元涨到 3487 欧元,涨了 3%,是唯一没降价的型号。帖子正文被 Reddit 安全策略拦截,看不到更细的型号对比和店铺来源,所以没法判断涨价是普遍缺货还是个别渠道在抬价。

推荐理由:这篇是一个Reddit用户自己爬了15家欧盟商店50多天的GPU价格,总共抓了约12.6万条记录,然后发现RTX 5090是唯一没降价的卡,均价还从3392欧元涨到了3487欧元,涨了3%。我会先打个折:数据源是个人帖子,不是机构报告,样本也只覆盖欧盟线上标价,不代表实际成交价或全球行情。但它的好处是给了很具体的数字和时间跨度,不是随口说“感觉涨价了”。对想买卡跑本地模型的人来说,这个信号挺直接——5090不仅贵,还在变贵,其他卡在跌,说明供需关系确实不一样。这点先别太激动,正文没披露每家店的库存和销量,价格涨可能是货少,也可能是需求硬,没法下结论...

彭博科技

美国最大电网一季度电费暴涨76%,数据中心是主因

PJM 电网(覆盖美国东部 13 个州和华盛顿特区)刚公布的报告显示,今年一季度批发电价同比涨了 76%,直接把原因指向数据中心扩建带来的用电需求。报告没披露具体新增了多少数据中心负荷,也没说电网容量缺口有多大,但 76% 这个涨幅说明供需已经非常紧张。对 AI 从业者来说,这是个实打实的成本信号——训练和推理用的算力,最终会反映在电费账单上。如果是真...

推荐理由:我会先打个折:正文没点名是哪个电网运营商,也没说容量缺口多大,所以不能当完整调查报告看。但 76% 这个涨幅太扎眼,而且直接归因到数据中心扩建,对关注 AI 基建成本的人来说是个硬提醒——算力扩张正在推高真实世界的电费。Bloomberg 的牌子让可信度加分,信息缺口主要在具体电网和供需数据上,所以重要性停在 75 合理。

r/LocalLLaMA

RTX 5000 PRO 48GB 实跑测试:27B 模型跑到 80 tok/s,200k 上下文全精度缓存

一位完全没装过机的 Reddit 用户花了 5600 美元攒了一台 RTX 5000 PRO 48GB 的机器,单卡跑 Qwen3.6-27B-FP8 模型。他自己说装机全靠问 LLM,配 vLLM 时烧掉了 Claude Code 一半的周额度才搞定。实测下来,生成速度最高能到每秒 80 个 token,提示很长时掉到 50–60 tok/s,但提示...

推荐理由:这篇来自 Reddit 的个人装机实测,把价格和跑分都摆出来了,对想自己攒机跑大模型的人参考价值很高。我会先打个折:只有单卡、单模型、单人测试,没对比其他卡,也没提散热和长期稳定性,所以不能直接当采购指南。但 48GB 显存能跑 27B 模型还这么快,确实让人对本地推理的成本和体验更有信心。

5月14日星期四

AI HOT 精选

杨植麟发 40 分钟视频拆解 Kimi K2:训练花了 460 万美元,编程跑分压过 GPT-5.5

杨植麟在视频里把 Kimi K2 的训练账本摊开了:总花费 460 万美元,靠线性注意力等架构上的极致优化,在编程任务上跑赢了 GPT-5.5 等对手。这个数字说明他们用远低于大厂的预算,靠设计把资源差距抹平了。不过视频是创始人自述,没有第三方验证,跑分对比的具体基准和测试条件也没展开,这点先别太激动。

推荐理由:杨植麟用40分钟视频把Kimi K2的训练账本摊开来看,460万美元的成本在同类模型里算低,编程任务上敢直接叫板GPT-5.5,这个对比本身就有传播力。不过视频是单一信源,具体用了哪些基准测试、对比条件是什么,正文没披露,所以分数卡在84不往上走。我会先打个折,等看到独立复现或更多技术细节再调整。

AI HOT 精选

AI 替你处理邮件,一个月要花多少钱?

作者拿主流大模型算了一笔账:让 AI 帮你读、写、整理邮件,每月推理成本在 22 到 130 美元之间,中位数 26 美元。如果做成 SaaS 产品,按 75% 毛利率定价,一年大概要收 500 美元,比 Google 企业版贵一倍。想省钱的话,换小模型能把成本压到十分之一甚至二十分之一;更狠的做法是直接在用户自己的 GPU 上跑,边际成本趋近于零。文...

推荐理由:这篇文章没发布新模型或产品,就是一篇成本算账的评论。我会先打个折:它把顶尖模型、小模型和本地部署三条路径的月费摆在一起,22–130 美元对比近零成本,数字直观,对正在掂量 AI 邮件代理是否划算的团队有参考价值。正文没披露测试用的具体模型名和邮件量,所以这些数字只能当量级参考,别直接套进预算表。整体是一篇有用的观点分析,不是重大发布,所以重要性给 73 分。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

5月13日星期三

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

5月12日星期二

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。

Computing Life · 鸭哥

我用 AI 治好了 AI 造成的失眠

作者在 2026 年 3 月左右开始严重失眠,每晚只能睡两三个小时。他让 AI 写了个工具,把 Apple Watch 和 iPhone 里的健康数据全导出来,再让 AI 跑多元回归分析,结果发现最影响睡眠的变量是晚饭后使用 AI 的时间——用得越晚,睡得越差。咖啡因、酒精这些反而没表现出明显关联。原因可能是用 AI 时人一直在高强度阅读、思考和并行处...

推荐理由:HKR 三项都成立:个人反转有传播力,HealthKit 加回归分析给了可验证的细节,睡眠损失直接打在 AI 从业者的痛点上。不过这只是单篇 Reddit 帖子,没有独立复现或论文/代码公开,所以保持在 featured 档的 72 分。

r/LocalLLaMA

Reddit 网友用英特尔傲腾持久内存攒了一台机器,本地跑 1 万亿参数模型,速度超过 4 token/秒

Reddit 用户 APFrisco 分享了一套硬件方案:用 768GB 英特尔傲腾持久内存(Optane PMem)当主存储,搭配 192GB DDR4 ECC 内存和一张 12GB 显存的 RTX 3060 显卡,通过 llama.cpp 的混合推理(CPU+GPU),在本地跑起了 Kimi K2.5 这个 1 万亿参数模型的 Q2_K_XL 量化...

推荐理由:HKR 三项都成立:标题的反差感足够抓人,正文把硬件型号、量化版本和速度都列清楚了,而且对本地推理圈子的成本敏感用户有直接参考价值。不过这只是单个 Reddit 用户的分享,复现细节和稳定性都没展开说,所以分数就压在 featured 门槛上。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Karpathy 聊人机交互下一步:别只让模型吐 Markdown,试试让它直接写 HTML

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了,他建议直接让模型生成带排版、图形和交互的 HTML,界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面,但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边,光靠语音、文字或视频不够,得加上手势指点这类更自然的交互。在脑机接口到来之前,输...

推荐理由:Karpathy 这条推文没给数据,就是个人判断,所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线:从纯文本到带格式的 Markdown,再到能直接渲染的 HTML,最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到,正文也没说怎么解决,这点先别太激动。不过对做 AI 产品的人来说,这个框架确实能帮他们想清楚下一步该把界面做成什么样。

5月11日星期一

量子位 · 公众号

菲尔兹奖得主实测 ChatGPT 5.5 Pro,17 分钟跑出论文级数学结果

陶哲轩的同事、菲尔兹奖得主 Timothy Gowers 拿 ChatGPT 5.5 Pro 试了一道加法数论里的难题,模型在 17 分 05 秒内给出了一个最优的二次上界构造,相当于直接产出了一篇小论文的核心证明。之后他又让模型把整个过程写成 LaTeX 预印本,总共花了 47 分钟。Gowers 把结果发在了自己博客上,因为 arXiv 目前拒收 ...

推荐理由:三条都过:Gowers 的第一人称实测、17 分 5 秒和 47 分钟预印本都是可讨论的硬信息。不是模型发布,但有名有姓的实验和数学推理冲击让它必须写。

5月10日星期日

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。