跳到正文

#部署/工程

今日 3 条

5月3日星期日

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

r/LocalLLaMA

有人复现了 TurboQuant,结果跟论文对不上

一位 Reddit 用户自己实现了 TurboQuant 这篇 KV 缓存量化方法,发现 PROD 变体在 4-bit 下跟原始精度结果的相关性大约 95.8%,远低于论文宣称的 99% 以上。作者还做了一个简单模拟,注意力质量的 top-1 准确率掉到了 67% 左右,说明量化后模型在“该关注哪个 token”这件事上退化明显。核心矛盾在于:论文用相...

推荐理由:这是 Reddit 上的单次复现,不是正式论文或官方发布,但 95.8% 的相关性和约 67% 的 top-1 准确率这两个数字挺具体,对正在掂量 KV cache 量化方案的人有参考价值。我会先打个折,因为样本量和测试条件正文没披露,结论不能直接当定论。

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

r/LocalLLaMA

OpenAI 隐私过滤器与 GLiNER 在 600 条 PII 样本上的实测对比

Reddit 上有用户拿 OpenAI 的隐私过滤器(privacy-filter)和 GLiNER large-v2.1 在 600 条含个人身份信息(PII)的样本上跑了一轮。纯 CPU 推理速度,OpenAI 模型每秒处理 2.8 条,GLiNER 是 1.1 条,前者快了一倍多。英文边界识别的宏观 F1 分数,OpenAI 模型 0.498,G...

推荐理由:Reddit 上一个测试用 600 条含姓名、邮箱、电话的样本,把 OpenAI 刚发的 privacy-filter 和 GLiNER large-v2.1 放在 CPU 上跑。宽松边界匹配时,OpenAI 的 macro F1 是 0.498,GLiNER 是 0.416,速度上 OpenAI 每秒 2.8 条,GLiNER 1.1 条,看起来 OpenAI 小胜。但一切到严格匹配,OpenAI 的分数直接掉到 0.155,原因是 tokenizer 切词偏移导致边界对不齐,很多实体只抓到半截。这个坑比速度差距更值得注意,说明实际部署时如果要求...

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

FT · 科技

华为 AI 芯片在中国大卖,英伟达却卡住了

这篇是付费墙后面的文章,正文没披露具体订单金额、芯片型号和交付时间。从标题看,核心信息是华为接到了国内科技公司的大笔 AI 处理器订单,而英伟达因为出口管制在中国市场动弹不得。这背后反映的是中国算力供应链正在被迫转向国产替代,但文章本身没给出更多细节来支撑这个判断,先别太激动。

推荐理由:FT 的信源和华为 vs Nvidia 的中国市场角力,让 H 和 R 都站得住。但 K 这边确实虚:金额、型号、交付节点一概没给,所以分数只能压在 78–84 这个区间,别因为标题冲高。

r/LocalLLaMA

32 块 AMD MI50 老卡跑 Kimi K2.6 模型,生成速度 9.7 token/秒

Reddit 用户 ai-infos 用 32 块 AMD MI50 32GB 显卡(分两台机器,每台 16 卡,走 10G 网线)跑 Kimi K2.6 的 int4 量化版。处理 1.4 万多字的输入时,预处理速度能到 264 token/秒;生成 136 个字的回答时,速度掉到 9.7 token/秒。空载功耗 640W,跑推理时峰值 4,800...

推荐理由:这条帖子本身是个 Reddit 上的野路子基准测试,不是官方发布,所以分数不会给太高。但它的钩子很强——用 32 张二手 MI50 攒出一台能跑 Kimi K2.6 的机器,还给出了吞吐、功耗和网络拓扑的实测数据,对想低成本自建推理集群的人有直接参考价值。我会先打个折,因为正文没披露精度损失的具体对比、延迟抖动和长时间稳定性,这些对生产环境很关键。不过就凭它把 AMD 老卡 + vLLM 分布式栈的可行性摆上台面,加上功耗和 PCIe 带宽这两个真实痛点,74 分放在 featured 里是合理的。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

The Verge · AI

马斯克在法庭上承认 xAI 用 OpenAI 的模型训练了 Grok

马斯克在加州联邦法院作证时,承认 xAI“部分”使用了 OpenAI 的模型来改进自家聊天机器人 Grok。用的方法是模型蒸馏,也就是让一个更聪明的大模型当老师,把知识“教”给一个更小、更省钱的模型。不过报道没说他具体用了 OpenAI 的哪个模型、喂了多少数据、跑了多少次训练。这点先别太激动,正文没披露细节,没法判断这到底是一次常规操作还是越界行为。

推荐理由:HKR 三项全中:马斯克法庭自曝用 OpenAI 模型训 Grok,机制是蒸馏,但模型名、规模、轮次都缺,信息有硬缺口,所以重要性停在 84 而不是更高。

4月30日星期四

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

彭博科技

三星芯片部门利润暴增 48 倍,全靠 AI 数据中心抢内存

三星电子芯片部门在 2026 年第一季度利润同比翻了 48 倍,创下历史新高并超出市场预期。这波增长直接来自 AI 数据中心对内存的疯狂采购,导致供应紧张。不过正文没披露具体的利润金额、是哪种内存(比如 HBM 还是普通 DRAM)以及主要客户是谁。

推荐理由:三星半导体部门一个季度利润翻了48倍,这个涨幅放在任何行业都算炸裂。我会先打个折:正文没写具体赚了多少钱,也没说是哪类内存(HBM还是普通DRAM)在拉动,客户是谁也一概没提。所以这条消息的价值在于信号——AI数据中心在疯狂下单,内存供给可能进一步收紧。如果是真的,对做推理优化和硬件采购的团队来说,成本压力会更大。Bloomberg的报道本身可信度不低,但信息缺口明显,我维持74分,不往上调。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

Dwarkesh Patel 播客

Reiner Pope 黑板讲座:大模型训练和推理背后的数学账本

Dwarkesh 把采访间改成了黑板教室,请来芯片公司 MatX 的 CEO Reiner Pope,用公式和粉笔把大模型从训练到服务的成本结构拆了一遍。讲座从批处理大小讲起:没有批处理,服务成本会直接差出 1000 倍,这也是为什么各家 API 定价和快速模式差价巨大的根源。接着讲了 MoE 模型怎么跨 GPU 机柜摆放、流水线并行如何把模型层切分到...

推荐理由:这是一堂黑板课,不是新闻事件,所以分数没往上拉。但内容确实扎实:Pope 把训练和推理里几个关键的成本开关——尤其是批处理对经济性的影响——用数字讲清楚了。我会先打个折,因为正文没给具体实验数据,更多是经验推演,但“1000 倍”这个量级足够让人重新审视自己的服务设计。

4月29日星期三

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

FT · 科技

OpenAI 那个 5000 亿美元的 Stargate 数据中心计划,已经变了好几次样

这篇 FT 文章正文被付费墙挡住了,只看到标题和摘要片段。从现有信息看,Sam Altman 在基础设施上搞得很灵活,这种灵活让合作伙伴不太踏实,但确实帮 OpenAI 在算力上跑到了前面。至于 Stargate 具体怎么变了、现在是什么结构、有哪些合作方、时间表怎么排,正文没披露,没法细说。

推荐理由:我会先打个折,因为正文没给结构、伙伴和时间表,信息密度撑不起更高分。但 5000 亿这个数字和合作方不安的信号,对关注算力基建的人来说是实打实的信号弹,所以 H 和 R 都站得住。整体放在 76 分、featured 是合理的,更像一条值得盯后续的线索,而不是一篇能直接引用的硬稿。

r/LocalLLaMA

双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B,vLLM 下跑到约 60 tok/s,支持 204K 上下文

一位用户用两张 RTX 5060 Ti 16GB 显卡,通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s,两张卡共占用 32GB 显存。配置上开了张量并行(TP=2)、fp8 KV 缓存、多 token 预测(MTP 一次猜 3 个 token),并把上下文窗口拉到了 204800。显存是瓶...

推荐理由:H、K、R 全中。帖子是一手实测,硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚,对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖,没有更多交叉验证,所以分数停在 76 不进 78–84 那档。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

Sinocism · 比尔·毕晓普

政治局四月会议提“AI+”全面落地,Manus 收购被叫停后 Meta 准备认赔拆伙

政治局四月会议读完通稿,没看到新刺激政策,但“AI+”从口号变成“全面实施”,还点名要发展智能经济新形态、完善 AI 治理。算力网被列入和水网、电网并列的六大基础设施,信号很明确:以后建算力会像修路修电网一样推。同时会议专门提了“深入整治内卷式竞争”,去年四月通稿里没这句,说明上面要对价格战和重复建设下更重的手。另外,Meta 收购 Manus 被中国...

推荐理由:我会先打个折:正文没给预算数字、时间表和具体牵头部门,所以不是那种必须立刻写的突发新闻。但政治局把算力网塞进“六张网”基建清单,等于给算力基础设施发了张长期饭票,做国产供应链和算力生意的团队该盯紧后续细则。整治“内卷式”竞争这条也值得留意,可能影响模型定价和toB项目的补贴逻辑。整体是方向性信号,不是操作手册,重要性给76分,放在featured位置提醒一下就够了。

r/LocalLLaMA

小米放出 MiMo-V2.5:3100 亿总参数,每次只激活 150 亿的稀疏 MoE 模型

Reddit 上有人贴了小米 MiMo-V2.5 的 Hugging Face 链接,不是 Pro 版。架构是稀疏 MoE,总参数量 310B,每次推理只激活 15B 参数,相当于用 150 亿参数模型的计算量去撬动一个 3100 亿参数的知识容量。发帖人说它比更大的兄弟模型用了更“人性化”的配置,但正文没展开什么叫人性化,也没给显存需求、量化方案或跑...

推荐理由:这条消息的钩子很实在:310B 总参数但每次只激活 15B,意味着理论上比同体量稠密模型省资源,官方也说它比更大版本更适合普通配置跑。我会先打个折——正文只贴了个 Hugging Face 地址,没给显存占用、量化方式、任何基准测试,所以“普通配置”到底指什么配置完全不清楚。这点先别太激动,等实测数据出来再判断值不值得本地部署。

4月28日星期二

机器之心 · 公众号

华为泰勒实验室等提出 SHAPE,给大模型推理加一道“推理税”,答得更准还能少写废话

华为泰勒实验室、北大和上海财大在 ACL 2026 发了一篇论文,提出 SHAPE 方法,核心思路是给模型的长篇推理加一道“推理税”。具体做法是:先用熵值把推理过程切成段,再用短距离试探估算每段的潜力,然后对后期又长又没带来实质进展的段落做动态长度打折,最后把奖励分配到每个 token 上。结果平均准确率涨了约 3%,同时 token 用量砍了约 30...

推荐理由:这篇论文最抓人的地方不是那 3% 的准确率提升,而是它把“模型靠啰嗦刷分”这件事直接拎出来收税。SHAPE 用熵值把推理过程切成段,拿短 rollout 估算每段的“势能”,高势能的后期长段落会被长度折扣重罚,逼着模型别在确认步骤上浪费 token。结果就是数学题答得更准,输出还短了约三成。我会先打个折:正文没披露这 30% 的 token 节省是在哪些模型和数据集上测的,也没说短 rollout 本身的计算开销有多大,所以实际部署省不省钱还得看具体场景。但思路本身很直接,把推理效率问题从“事后裁剪”挪到了“训练时就定价”,对做推理优化的团队来说是...

Latent Space

Applied Intuition 十年做成 150 亿美元估值,他们想把所有会动的机器都塞进同一个 AI 操作系统

Applied Intuition 的 CEO 和 CTO 聊了他们从 YC 时期的自动驾驶工具链,一路做到估值 150 亿美元实体 AI 公司的完整路径。公司现在有 30 多款产品,全球非中国车企前 20 名里 18 家是他们的客户,L4 级无人卡车已经在日本跑起来了。他们反复强调,实体 AI 真正的瓶颈不是模型不够聪明,而是怎么把模型塞进车里:车载...

推荐理由:这篇复盘把 Physical AI 从融资故事拉到了实车部署层面,信息量够硬——估值、客户覆盖、L4 落地都有数字撑着。我会先打个折:正文没披露具体模型架构或安全验证的实测数据,所以重要性停在 80 这个区间是合理的。对做车端推理和自动驾驶落地的人,这篇值得一看,但别指望有技术白皮书级别的细节。

4月27日星期一

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。

Mistral AI

Mistral AI 发布 Workflows 公开预览版

Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。

推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

Hacker News 首页

TurboQuant 走读:把 AI 向量压到每个数 2–4 比特,还不怎么掉精度

这篇交互式文章把 TurboQuant 的核心思路拆了一遍。它要解决的是怎么把模型里的高维向量(比如 KV 缓存、嵌入向量)压到每个坐标只占 2 到 4 个比特。做法很取巧:先给向量随机转个方向,转完之后每个坐标的数值分布就固定了,近似一个钟形曲线。接着用一套提前算好的通用码本去套所有输入,省掉了给每组数据单独算缩放因子的开销,也不需要训练或校准。文章...

推荐理由:我会先打个折:这不是模型或产品发布,只是一篇技术走读,所以重要性停在 76。但 HKR 三项都站得住——钩子够具体,机制解释有新东西,成本角度也切中当前推理优化的刚需。正文没给大规模验证数据,这点先别太激动,但思路本身值得一看。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

FT · 科技

谷歌计划向 Anthropic 投资最高 400 亿美元,钱主要用来买算力

谷歌要给 Anthropic 投一笔钱,上限是 400 亿美元。这笔钱不是单纯的财务投资,核心目的是给 Anthropic 的模型增加计算资源,也就是买更多服务器和芯片来跑模型。这更像是一种算力绑定——Anthropic 拿了钱,但得花在谷歌的云服务或算力上。不过,正文被付费墙挡住了,具体的交易结构、投资时间表、Anthropic 的最新估值,以及算力...

推荐理由:FT 的消息说 Google 计划向 Anthropic 投最多 400 亿美元,用途是增加跑模型需要的算力。我会先打个折——具体怎么投、分几批到账、估值多少、算力从哪来,正文都没写。但光这个数字和算力绑定的方向,就值得从业者盯着看,因为这比单纯财务投资更能锁死合作关系。

4月24日星期五

TechCrunch · AI

Meta 签下数百万颗亚马逊自研 CPU,这次不是 GPU,是给 AI 智能体跑业务用的

Meta 和亚马逊达成了一笔大单,要采购数百万颗亚马逊自研的 Graviton CPU,专门用来跑 AI 智能体(agentic AI)的工作负载。注意,这里说的是 CPU,不是训练大模型常用的 GPU。这信号挺有意思:以前大家抢 GPU,现在连 CPU 都开始为 AI 智能体这种新任务大量铺货了。不过正文没披露具体是 Graviton 哪款芯片、单价...

推荐理由:这条消息我会先打个折,因为正文没披露具体型号和金额,没法算性价比。但“几百万颗 AI CPU”这个量级本身就在说一件事:agent 负载开始推高非 GPU 芯片的采购。Meta 这种体量的公司用 Amazon 的 CPU 跑 agent,至少说明他们在认真找 GPU 之外的推理方案,而且敢下大单。这点先别太激动,毕竟没看到实测数据,但如果后续有部署细节和性能对比,这条线值得一直盯着。

机器之心 · 公众号

复旦等团队提出 HERMES:把 KV 缓存当分层记忆用,流式视频理解首 token 延迟最高降 10 倍

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES,一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存(你可以理解成模型在推理时记下的“草稿纸”)重新组织成三层记忆:当前帧的短期记忆、最近几帧的中期记忆,以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号,让模型读这段压缩历史时不会因为位置...

推荐理由:我会先打个折:这是学术研究,不是产品发布,所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子,68% token 削减和 27-29ms TTFT 是能拿来算账的数字,而且方案免训练、开源,对做流式视频落地的团队来说,省 token 就是省钱,低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果,这点先别太激动,但现有数据已经够让做实时视频 agent 的人认真看一遍。