跳到正文

#部署/工程

今日 3 条

4月24日星期五

r/LocalLLaMA

DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文

DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...

推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

X · @op7418(歸藏)

DeepSeek V4 发了公告:Pro 版 1.6T 总参数量但只激活 49B,Flash 版更轻量,预训练都喂了 32T 数据

DeepSeek 放出了 V4 的官方说明。这次分两个版本:Pro 版总参数量 1.6 万亿,实际干活时只激活 490 亿参数;Flash 版总参数量 2840 亿,激活 130 亿参数,两个版本预训练都用了 32 万亿 token。网页和 App 里的“专家模式”对应 Pro,“快速模式”对应 Flash。官方说多项跑分跟 Opus 4.6 打平,A...

推荐理由:这是 DeepSeek 的旗舰发布,分量跟美国头部实验室发新模型看齐。HKR 三项都站得住:公告里参数规模、训练数据量、新注意力机制这些硬信息都有,也直接拿 Opus 4.6 做对比,对从业者选模型和算成本都有参考价值。不过摘要没提评测具体怎么跑的、定价和 API 开放时间,这些缺口让我对 benchmark 那部分先打个折。

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

4月23日星期四

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

FT · 科技

特斯拉把资本支出计划提到 250 亿美元,马斯克在 AI 上继续加注

特斯拉把资本支出计划上调到 250 亿美元,马斯克要把更多钱砸向 AI 相关项目。从 RSS 片段看,这些项目包括自动驾驶出租车、卡车、机器人以及芯片工厂,增幅被形容为“非常显著”。不过正文被付费墙挡住,没披露这笔钱覆盖的时间范围、具体怎么分项,也没提模型细节。能确定的一个信号是:特斯拉在投的不只是训练模型,而是从芯片到终端产品的整套体系。

推荐理由:FT报了一个具体的资本支出跳升数字,直接关联自动驾驶出租车、卡车、机器人和芯片工厂。我会先打个折:时间范围和分项花销都没给,模型细节也缺,所以不是必写级别。但250亿这个数够大,而且投向的是车、机器人和芯片产能整条链,不是只训模型,战略意义摆在那。HKR三项都踩中了,只是信息缺口让它停在featured中段。

4月22日星期三

r/LocalLLaMA

ServiceNow 放出一个 15B 模型,一个权重包能切出 8 种速度档位,最快解码吞吐量翻 10 倍

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct,一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计:48 层解码器里,每层都塞了 4 种不同的注意力机制(全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention),运行时可以像换挡一样选不同组...

推荐理由:一个 15B 模型靠单一检查点覆盖 8 档推理速度,吞吐跨度超过 10 倍,对实际部署的吸引力很强,H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关,而不是让你换模型。不过这只是推理优化方向的发布,不是前沿实验室的旗舰更新,影响范围偏窄,所以 76 分、featured 合理。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

机器之心 · 公众号

苹果把 Transformer 改成了 Mamba,推理成本从平方级压到线性

苹果发了一篇技术文章,讲怎么把一个训好的 Transformer 模型(Pythia-1B)蒸馏成 Mamba 架构,让推理时的计算量从平方级降到线性。他们没直接硬蒸,因为直接蒸效果会崩(困惑度直接飙到 100 以上)。实际分了两步:先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力,让模型适应线性计算;再把这个中间模型映...

推荐理由:我会先打个折:这还是个论文结果,不是已经落地的产品。但路线本身有意思——不是从头训 Mamba,而是把现成的 Transformer 蒸馏过去,省了大量训练成本。正文给出的下游任务(ARC、PIQA、BoolQ 等)说接近教师,但没放具体数字,这点先别太激动。如果真能在长上下文场景把推理成本压到线性,对需要处理长文档或长对话的产品是实打实的省钱。

机器之心 · 公众号

荣耀在 MagicBook 上预装 YOYO 爪,管它叫全球首款“智能体笔记本”

荣耀把 YOYO 智能体直接做进了 MagicBook 系统里,出厂自带 5 个主智能体和 23 个子智能体。官方说这套方案比外接 OpenClaw 省一半的 token 消耗,还加了本地处理、二次确认和内核级加密。说白了就是把智能体打包成笔记本默认功能,不用自己折腾部署。但正文没提具体用了哪个模型、硬件配置、卖多少钱、什么时候开卖,这些关键信息都缺着...

推荐理由:荣耀把 YOYO Claw 直接预装进 MagicBook,等于把智能体做成出厂能力,这点比跑分更有意思。文章列了 5 个主智能体、23 个子智能体,覆盖教育到内容创作,还提到本地处理、二次确认和内核级加密,信息量够硬。词元消耗降 50% 这个数我会先打个折,因为没给对比基准和测试条件。真正让我把分停在 76 的原因是正文没披露模型、硬件配置、价格和上市时间——缺了这些,没法判断实际成本和落地节奏。

4月21日星期二

FT · 科技

Anthropic 和亚马逊谈了个 1000 亿美元的算力基建大单

Anthropic 跟亚马逊达成了一项总规模 1000 亿美元的 AI 基础设施协议,核心是锁定芯片和算力供应。今年 Anthropic 出过几次服务中断,这次合作主要是为了把计算容量提前占住,而不是普通的战略合作。不过正文被付费墙挡住了,具体的合同期限、钱怎么付、芯片从哪来、交付规模这些关键信息都没披露。

推荐理由:FT 报了一条 Anthropic 与 Amazon 的 1000 亿美元 AI 基础设施协议,金额大到今天必须写。H 端靠千亿数字和算力绑定撑起点击欲;K 端有新事实,但期限、资金来源、芯片来源、交付规模全都没披露,我会先打个折;R 端踩中了模型厂对云和硬件的依赖这个活神经,不是空泛合作,是把供给瓶颈写进了合同。

X · @AnthropicAI

Anthropic 跟亚马逊扩大合作,给 Claude 锁定了最多 5 吉瓦的算力

Anthropic 宣布加深与亚马逊的合作,为训练和部署 Claude 锁定了最高 5 吉瓦的算力。这批算力从这个季度开始陆续到位,到 2026 年底预计先上线近 1 吉瓦。5 吉瓦是个什么概念?大概相当于几个大型数据中心的满负荷运转,说明他们接下来要把模型规模或服务量再往上拉一个台阶。不过正文没披露合同金额、具体用什么芯片、数据中心建在哪,所以实际成...

推荐理由:标题里的 5 吉瓦别直接信,那是远期上限,真正有谱的是今年底先到 1 吉瓦。正文没提合同金额、用什么芯片、数据中心在哪,所以成本结构和实际性能都还是问号。我会先打个折看交付节奏,但能在这个时间点锁产能,对 Anthropic 的训练和部署确实是颗定心丸。

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

彭博科技

Google 本周要发新一代 TPU,专做推理

Bloomberg 的视频预告说 Google 这周会公布新的定制芯片,定位是 AI 推理任务。正文被付费墙挡了,没拿到具体型号、性能、功耗和价格。我会先打个折:重点不是又发芯片了,而是这批 TPU 能不能把推理成本打下来、供货稳不稳。

推荐理由:标题说新芯片,但正文其实只给了两个信息:本周发布、面向推理。我会先打个折——型号、性能、功耗、价格一概没披露,现在激动还太早。之所以还放在 featured 里,是因为 Google 把新 TPU 直接框在推理上,这对算力成本和供给是个实打实的信号,AI 团队会追。但信息缺口太大,重要性停在 74 是合理的。

4月20日星期一

Import AI

华为搞了个 HiFloat4 训练格式,在自家昇腾芯片上跑赢了西方主导的 MXFP4

华为的研究员在自家昇腾 NPU 上测试了一种叫 HiFloat4 的 4 比特训练格式,跟西方主导的 MXFP4 格式比,HiFloat4 的精度损失更小。具体来说,在 Llama 和 Qwen 模型上,HiFloat4 跟全精度 BF16 基准的误差能控制在 1% 左右,而 MXFP4 即使加了随机舍入等一堆稳定技巧,误差也有 1.5%。这背后可能跟...

推荐理由:Jack Clark用三件事拼出一期:Anthropic拿Claude Opus 4.6做自动化对齐研究,800小时花约1.8万美元把PGR从人类基线0.23提到0.97,说明小团队也能跑对齐实验;HiFloat4在华为昇腾NPU上推理损失约1.0%,比MXFP4的约1.5%好,但正文没披露更多硬件细节;中国模型安全研究部分给出了安全评估框架,但具体模型名和测试集没展开。整体是研究评论而非一手发布,信息密度够,适合放进精选。

r/LocalLLaMA

用一张 RTX 4090 跑 Gemma 4 26B,从 2400 份财报电话会里挖交易信号,一个有效,一个差点骗过我

一位 Reddit 用户用 800 份标注过的财报电话会记录微调了 Gemma 4 26B,然后在一张 RTX 4090 上花了约 14 小时,推理了 3 年内共 2400 份记录。在 600 份样本外数据上,一个信号显示:CFO 指引越含糊,公司股价在 5 天内相对板块平均跑输约 1.8%,信息系数(IC)为 0.04。另一个信号更强,与板块回报的相...

推荐理由:这是一篇第一人称的实战记录,不是公关稿。作者把 Gemma 4 26B 塞进一张 4090,用 800 份人工标注的财报电话会微调,然后让模型在 2400 份近三年转录上提取交易信号,整批跑完 14 小时。结果里有一个信号站住了:CFO 把业绩指引从具体数字改成模糊表述后,股价 5 日内相对行业落后约 1.8%,IC 0.04,不算强但能用。另一个信号和行业回报相关性高达 0.85,作者直接判定为幽灵信号,提醒读者因子去重比标题里的赚钱故事重要得多。全文没有吹模型多强,反而在讲怎么排雷,信息密度和诚实度都够,适合 featured 位置。

4月19日星期日

r/LocalLLaMA

Cloudflare 开源 Unweight:把大模型权重压缩 22%,输出结果一个字节都不差

Cloudflare 发了一个叫 Unweight 的压缩方案,专门解决大模型在 GPU 上跑时被显存带宽卡脖子的问题。它只压缩 BF16 格式里的指数位,不碰尾数,所以解压后能还原出完全一致的输出。实测一个 8B 模型能省下约 3GB 显存,压缩率在 15% 到 22% 之间。原理是模型某一层里超过 99% 的权重只用到 16 种指数值,Unweig...

推荐理由:Cloudflare 这篇 Unweight 的卖点很直:不改模型输出,把权重无损压缩 15% 到 22%。他们盯的是 BF16 里浪费的指数字节,发现大部分层的指数值就那么几个,所以只压这部分。8B 模型能省出 3GB 显存,对跑 H100 的人来说是实打实的成本优化。我会先打个折——正文没给吞吐实测数字,也没说哪些模型能用,片上解压和动态执行管线听起来有料但细节没展开。这点先别太激动,等他们补上实测再判断实际收益。

机器之心 · 公众号

内存不够用这件事,可能要持续到2030年

日经亚洲引用供应链数据说,到2027年底全球DRAM产能可能只能满足六成需求。SK集团会长崔泰源更直接,认为短缺会拖到2030年。核心原因是产能规划跟不上:2026到2027年AI数据中心需要的DRAM年产量得增长12%,但厂商实际只安排了7.5%的扩产计划,而且新增产能优先给了高带宽内存(HBM),消费级内存被挤到一边。这不是短期涨价,是产能结构被A...

推荐理由:这条消息的钩子很硬——内存短缺可能持续到 2030 年,不是一次性涨价。正文用 Nikkei Asia 的 60% 需求满足率和扩产缺口把问题量化了,而且点出 AI 数据中心抢产能这个结构原因。对从业者来说,这直接影响算力成本和硬件排期,所以我会先打个折:它不是模型或产品发布,但作为供应链预警,信息密度和时效性都够,放在 featured 里合理。

TechCrunch · AI

AI 芯片公司 Cerebras 提交上市申请

Cerebras 已经向 SEC 交了招股书,准备在五月中旬上市。这家公司做的是巨型 AI 芯片,主打训练和推理速度。文章只披露了两笔大单:一是 AWS 会在自家数据中心用 Cerebras 的芯片;二是跟 OpenAI 签了合同,报道说价值超过 100 亿美元。CEO 放话称从英伟达手里抢走了 OpenAI 的快速推理业务。财务方面,2025 年营收...

推荐理由:Cerebras 提交 IPO 申请是当天能聊的新闻,因为它把芯片竞争和资本市场绑在了一起。HKR 三项都站得住:IPO 申请本身有话题性,AWS 部署和 OpenAI 百亿美元级合同是新信息,对从业者判断基础设施走向也有参考价值。不过正文没披露估值、募资额和时间表,所以分数没给到 90 以上。

r/LocalLLaMA

Moonshot 说 Kimi Linear 能让 KV 缓存跨数据中心传输,实测吞吐量提升 1.54 倍、首 token 延迟降 64%

Moonshot 提出一种叫“预填充即服务”的玩法,把大模型推理拆成预填充和解码两个阶段,分别跑在不同数据中心甚至不同硬件上。核心靠的是他们 Kimi Linear 模型,KV 缓存体积小到可以跨机房传。用放大 20 倍的模型测,吞吐量提到 1.54 倍,P90 首 token 延迟降了 64%。不过帖子本身被 Reddit 安全策略挡了,正文没披露具...

推荐理由:HKR 三项都站得住:跨数据中心传 KV Cache 这个点够新,文章也拿出了 1.54 倍吞吐和 P90 TTFT 降 64% 的具体数字,预填充与解码解耦的机制也交代了。我只给 80 分,因为目前还是二手摘要,成本基准、确切规模和复现细节正文都没披露,得等 arXiv 论文出来再看。

4月18日星期六

Hacker News 首页

rtrvr.ai 把浏览器操作录成脚本,重放零 token 成本,还能让 AI 直接调用

rtrvr.ai 做了一个叫 AI Subroutines 的功能,核心思路是把你在浏览器里的一次操作录下来,变成一个可重复调用的工具脚本。重放时脚本直接在当前网页里跑,cookie、CSRF token、签名头这些认证信息全都不用手动处理,浏览器自己就带上了。录制时会从几百个网络请求里自动筛出真正有用的那几条,遇到 GraphQL 那种一更新就失效的...

推荐理由:rtrvr.ai 这个 Show HN 放出了一个叫 AI Subroutines 的功能,核心是把录过一次的浏览器操作存成可重复调用的工具,直接在当前标签页里执行,复用登录态和请求签名,省掉了反复调大模型的成本和延迟。我会先打个折——这是单家公司的产品更新,不是行业级事件,所以放在 featured 中段。但它的技术细节够实在:录制时把约 300 个请求压缩到约 5 个,GraphQL operation ID 不稳定就退回纯 DOM 操作,还支持一次调用批量分发 500 行参数。这些数字说明它在成本和延迟上确实有想法,不是空画饼。正文没披露多标...

彭博科技

AI 芯片公司 Cerebras 再次公开提交赴美上市申请

Cerebras 又向美国监管机构交了公开版的 IPO 申请文件。正文没披露这次打算融多少钱、估值多少、由哪几家投行承销,也没说具体上市时间表,所以这还只是提交申请,不等于已经获批上市。

推荐理由:Cerebras 又公开交表了,这次是冲着美国 IPO 去的。标题说得很清楚,但正文是空的,所以别把“再次申请”当成“已经获批上市”。我会先打个折:募资规模、估值、承销商、上市时间这些关键数字一概没披露,现在只能当个信号看。不过 AI 芯片公司在这个节点冲上市,本身就踩中了基础设施需求和资本市场对 AI 硬件的胃口,如果是真的挺省钱——但前提是它能顺利过关。

4月17日星期五

Hacker News 首页

AI 算力开始不够用了

Nvidia Blackwell GPU 的租赁价两个月内从每小时 2.75 美元涨到 4.08 美元,涨了 48%。CoreWeave 也把价格上调了 20%,最低租期从一年拉长到三年。OpenAI 的 CFO 说他们已经在砍项目,因为算力跟不上。Anthropic 最新的模型只给了大约 40 家机构用。作者判断,AI 算力随便用的阶段结束了,接下来...

推荐理由:这篇文章用一个涨价 48% 的数字开场,把算力稀缺从概念变成账单,读起来像朋友发来一条消息说“显卡租金涨了,注意一下”。它没有停留在感叹,而是把 Blackwell 租金、CoreWeave 提价和 Anthropic 限流三件事摆在一起,指向一个判断:稀缺已经开始改写前沿模型的获取门槛。正文没给更细的供需数据或各家采购策略,所以我会先打个折,不把它当一手情报,但作为提醒从业者盯紧成本与容量的信号,已经够用了。

r/LocalLLaMA

Qwen3.6 新增 preserve_thinking 开关,修了上一代多轮对话“失忆”的 bug

Qwen3.6 模型页面上多了一个 preserve_thinking 参数,默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里,而不是像 Qwen3.5 那样每次重新序列化,导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试:先让模型想两个 20 位数字,只说出第一个;下一轮再问第二个。开关关掉时模型会说自己没生成过...

推荐理由:这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折,因为这不是官方发布说明,而是社区踩坑分享,但信息密度够高:有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说,知道 preserve_thinking 能让推理上下文跨轮保留,比看十篇通稿都实在。

X · @dotey(宝玉)

xAI 开始出租闲置 GPU,第一个客户是估值 500 亿美元的编程工具 Cursor

xAI 把数万块 GPU 租给 Cursor 训练编程模型 Composer 2.5,自己从模型公司变成了半个云服务商。总裁在内部备忘录里承认,公司 20 万块 GPU 的模型算力利用率只有 11%,远低于行业 35% 到 45% 的水平,大部分算力在空转,出租是为了回血。两家关系有点微妙:xAI 刚挖走 Cursor 两位产品工程负责人,转头又卖算力...

推荐理由:这条消息的看点不是又一家公司买卡,而是 xAI 开始把闲置算力变现。正文给出的 11% 利用率远低于行业常见的 35%–45%,说明内部训练任务根本吃不满 20 万块 GPU,出租是止损也是探路。Cursor 作为第一个客户,拿这些卡去训 Composer 2.5,同时自己还在谈 500 亿美元估值,等于用外部算力撑估值故事。我会先打个折:正文没披露租约价格、时长和具体 GPU 型号,所以省钱程度还不好判断。但这件事本身比单纯堆卡更值得盯,因为它可能把算力过剩问题直接摆上台面,也逼其他大厂重新算自己 GPU 集群的账。

4月16日星期四

Hacker News 首页

Darkbloom:用闲置 Mac 跑加密推理,号称比 OpenRouter 便宜七成

Eigen Labs 搞了个叫 Darkbloom 的去中心化推理网络,把一亿多台苹果芯片 Mac 的闲置算力攒起来卖。它提供兼容 OpenAI 的 API,主打端到端加密和硬件验证,说操作节点的人看不到你的数据。价格表上列出的 token 费用比 OpenRouter 低 50%,不是标题里的 70%,这点先打个折。正文没披露独立安全审计的具体范围,...

推荐理由:HKR 三条全中:闲置 Mac 组网做推理的玩法有新鲜感,文章也把规模、接口、加密和价格都摆出来了。我先打个折,维持在 80 分——这还只是团队自己发的预览,审计范围、网络稳定性、攻击面边界都没经过第三方验证,论文出来之前别太激动。

Dwarkesh Patel 访谈

黄仁勋回怼芯片禁令:别把 AI 芯片比作浓缩铀,放弃中国市场是输家心态

黄仁勋在这段视频里直接反驳了美国对华芯片出口限制的几个常见论点。他先质疑,为什么不能制定更平衡的规则,让英伟达在全球竞争,而不是主动放弃世界市场。接着他点名批评了 Dario 把卖 AI 芯片比作“波音给朝鲜核弹造导弹外壳”的说法,直言把 AI 比作浓缩铀是“糟糕且不合逻辑的类比”。最后他驳斥了“中国市场反正会输”的前提,强调计算平台不像汽车或手机,用...

推荐理由:黄仁勋这段视频回应的是美国对华芯片禁令,但他没谈具体政策条款、时间点或受限型号,所以重要性我给 75 分。真正值得看的是他抛出的机制判断:计算平台一旦形成使用习惯就很难替换,主动退出等于把生态位拱手让人。他用两组类比来撑这个观点——否定把 AI 芯片比作浓缩铀,也反驳“反正会输掉中国市场”的前提。视频本身信息量有限,正文没披露更多细节,但观点够直接,对从业者有提醒价值。

Dwarkesh Patel 访谈

黄仁勋谈英伟达护城河:不是芯片设计,是把电子变成 token 的那一整条供应链

黄仁勋把英伟达的生意概括成一句话:输入电子,输出 token,中间是英伟达。他认为护城河不在某颗芯片的设计,而在于把电子变成有价值的 token 这件事本身极其复杂,涉及大量科学和工程,短期内很难被商品化。他举了两个具体机制:一是上游的显性和隐性采购承诺,财报里披露了近 1000 亿美元的承诺,SemiAnalysis 估算实际规模可能到 2500 亿...

推荐理由:黄仁勋亲自下场解释护城河,不是讲芯片设计,而是讲从电子到 token 的全栈优化和上下游组织能力。文章给出了接近 1000 亿美元的采购承诺数字,SemiAnalysis 还报过 2500 亿的可能,上游用大额显性和隐性承诺锁晶圆、HBM 和封装,下游把模型方、整机厂和开发者拉进同一个生态。他还提到 agent 数量会指数增长,工具软件实例跟着涨。这些判断直接打在算力成本、供应安全和生态依赖上,对从业者判断供应链和选型有参考价值。不过正文没给出 2500 亿的具体来源和验证方式,这点先别太激动。整体是强观点评论,不是新品发布、财报或研究论文,所以分...

4月14日星期二

X · @dotey(宝玉)

Claude Code 关掉遥测后缓存从 1 小时掉到 5 分钟,工程师解释是实验开关失效,不是故意惩罚

开发者 Can Vardar 发现 Claude Code 关闭遥测后,提示缓存时间从 1 小时骤降到 5 分钟,他算了一笔账说这是用隐私换 12 倍性能。Anthropic 工程师 Boris Cherny 回应说,1 小时缓存写入成本高、读取成本低,不是无条件更好,如果你只跑一次查询就走,1 小时缓存反而浪费钱。关遥测导致缓存变短,是因为客户端的实...

推荐理由:这条信息对Claude Code用户很实用,把隐私开关和缓存成本的关系讲清楚了。我会先打个折:来源是X上的工程师回复,不是正式公告,但机制解释和后续计划都来自Anthropic员工,可信度够。正文没披露环境变量什么时候上线,这点先别太激动。

4月13日星期一

最佳拍档

谷歌CEO皮查伊:2027年是企业AI落地爆发年,搜索不会死,会变成替你干活的管家

谷歌CEO皮查伊在2026年4月的一次专访里,把家底和判断都摊开了。他说明年(2027年)会是企业AI agent workflow(让模型进业务流程干活)的爆发点,AI将从程序员提效工具变成非技术岗位的智能核心。关于搜索,他认为不会被聊天机器人取代,而是会进化成一个“Agentic Manager”,能直接帮你规划旅行、处理多线程任务,他自己已经在用...

推荐理由:这不是产品发布,而是高管在访谈里给出的判断和内部数据,信号密度很高。Pichai 把 2027 年定为 Agent 爆发点,配合千亿级资本开支和毫秒级延迟管控,让这个判断比一般预测更有分量。搜索演进和算力稀缺这两条线也直接关联从业者当下的决策。分数没给到 P1,因为信息来自二手转述而非一手访谈原文,但 H、K、R 三项都扎实成立。

4月10日星期五

X · @dotey(宝玉)

Anthropic 新 API 让便宜模型干活、贵模型当军师,Haiku 配 Opus 在 BrowseComp 分数翻倍,成本只要 Sonnet 的 15%

Anthropic 推出了“顾问工具”API,让 Sonnet 或 Haiku 作为执行者跑任务,遇到难决策时把上下文递给 Opus 出主意,Opus 不碰工具、不直接输出,只当幕后军师。这跟常见的“大模型拆任务、小模型执行”反过来了,好处是大部分 token 烧在便宜模型上。Sonnet 配 Opus 在多语言 SWE-bench 上比单干高 2.7...

推荐理由:Anthropic 这次 API 更新挺实在,不是画饼。核心就是让 Sonnet 或 Haiku 当执行者跑任务,卡壳时再问 Opus,而且是在同一次 API 请求里完成模型切换,Token 分开算钱。给的数字也清楚:Sonnet+Opus 在多语言 SWE-bench 上比单用 Sonnet 高了 2.7 个百分点,单任务成本还降了 11.9%;Haiku+Opus 在 BrowseComp 上从 19.7% 跳到 41.2%,成本只要 Sonnet 的 15%。我会先打个折,毕竟还在 beta,但这条路子对控制推理成本确实有用,值得关注。

4月8日星期三

MIT Technology Review · AI

微软 AI 老大苏莱曼:AI 发展离撞墙还早,算力暴涨是核心

这是微软 AI 的 CEO 苏莱曼在《麻省理工科技评论》上发的评论文章,不是独立研究,立场上我会先打个折。他的核心论点是:AI 训练用的算力从 2010 年到现在涨了 1 万亿倍,从 10 的 14 次方次浮点运算涨到 10 的 26 次方,所以短期内不会撞墙。他给了几个具体数字:英伟达芯片六年里单颗性能翻了 7 倍多;HBM3 这种堆叠式高带宽内存把...

推荐理由:HKR 三项都站得住:Suleyman 在扩展争论里立场很硬,并且甩出了 10^26 flops、7 倍芯片提升、3 倍带宽和 8 个月效率减半这些数字。分数定在 82,因为这是高管观点文,不是独立研究,而且 2030 年每年新增 200GW 算力那个数怎么算出来的正文没交代。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

4月6日星期一

X · @dotey(宝玉)

小米罗福莉:Agent 时代算力跟不上 Token 烧法,出路不是降价而是省 Token

小米 MiMo 团队负责人罗福莉指出,现在 Agent 干活时反复带着超过 10 万 Token 的长上下文去调工具,请求次数是 Claude Code 自身框架的好几倍,真实 API 成本可能冲到订阅价的几十倍,全球算力根本扛不住。她认为短期阵痛反而是好事,第三方框架被 API 付费逼着去改进上下文管理、提高缓存命中率、砍掉无效消耗。同时她呼吁大模型...

推荐理由:小米 MiMo 负责人罗福莉这次发言没绕弯子,直接拿 OpenClaw 和 Claude Code 的请求次数做对比,把 Agent 多轮工具调用带来的 Token 消耗和成本膨胀讲得很清楚。10 万 Token 上下文反复携带、请求量高出数倍、API 计费后成本翻几十倍,这些数字让“算力跟不上”的判断有了抓手。正文没给具体定价方案,也没公开测试环境,所以结论先打个折,但方向对做推理优化和框架选型的人有参考价值。

4月4日星期六

X · @dotey(宝玉)

DeepSeek V4 推迟发布,重写底层代码,就为了跑在华为昇腾 950PR 上

V4 跳票了几个月,原因是 DeepSeek 把模型底层模块重写了一遍,专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上,预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍,有 112GB 显存,带宽 1.4TB/s,还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用,一个原本...

推荐理由:这条消息 H、K、R 都站得住:华为芯片部署是强钩子,底层重写和芯片规格有料,国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道,模型规模、价格和实测性能都没披露,我会先打个折。

3月31日星期二

Mistral AI

Mistral AI 推出 Spaces:一款为人类与智能体打造的 CLI

Mistral AI 发布 Spaces CLI,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令快速搭建多服务项目,并为每个交互式提示提供对应的 flag 与 `-y` 选项,使智能体可自主完成配置与部署。每次 init 还会生成 context.json 和 AGENTS.md,为智能体提供项目上下文与操作规则。

3月26日星期四

硅谷101 播客

E230|1万亿收入预期背后:英伟达的巅峰与软肋

黄仁勋在GTC上说,到2027年底,Blackwell和Vera Rubin两个平台的累计订单预计至少1万亿美元,而2024年全球半导体产业总销售额也就6000多亿美元。这期节目请了投资人、前英伟达芯片设计负责人和芯片架构师,一起拆解这个数字能不能落地。讨论认为,需求端确实旺盛,推理成本正在追上训练成本,未来Agent智能体铺开后Token消耗会更大。...

推荐理由:这篇不是照搬GTC通稿,而是把1万亿订单这个标题往回拉,提醒真正该盯的是封装、显存和供电。对从业者来说,知道成本能降多少、瓶颈在哪,比看销售数字有用。我会先打个折:正文没给出1万亿订单的具体构成和交付节奏,这点先别太激动。

3月24日星期二

Lex Fridman 播客

黄仁勋对谈 Lex Fridman:英伟达如何从单卡竞争转向整机柜、整数据中心的极端协同设计

黄仁勋在播客里解释了英伟达现在为什么要搞“极端协同设计”——因为单颗 GPU 已经不够用了。你想让一万台计算机跑出百万倍的加速,就不能只堆硬件,得把算法拆开、把模型和数据切碎(分片),让网络、交换、存储、供电、散热全部配合起来。否则受制于阿姆达尔定律,计算部分再快,整体也只快一点点。他还提到自己直接管 60 多个人,几乎全是工程背景,分别盯着内存、CP...

推荐理由:这是一手访谈,黄仁勋把 NVIDIA 的竞争逻辑讲得很清楚:不再拼单卡,而是拼整机柜甚至数据中心的协同设计。他提到 60 多个直接下属、1 万台计算机的扩展目标,以及 Amdahl 定律带来的实际限制,信息密度高。我会先打个折,因为这是播客分析,不是新产品发布或人事变动,但作为理解 NVIDIA 战略的入口,值得从业者花时间看。