跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 401–420 条 · 共 455 条

4月18日星期六

彭博科技

AI 芯片公司 Cerebras 再次公开提交赴美上市申请

Cerebras 又向美国监管机构交了公开版的 IPO 申请文件。正文没披露这次打算融多少钱、估值多少、由哪几家投行承销,也没说具体上市时间表,所以这还只是提交申请,不等于已经获批上市。

推荐理由:Cerebras 又公开交表了,这次是冲着美国 IPO 去的。标题说得很清楚,但正文是空的,所以别把“再次申请”当成“已经获批上市”。我会先打个折:募资规模、估值、承销商、上市时间这些关键数字一概没披露,现在只能当个信号看。不过 AI 芯片公司在这个节点冲上市,本身就踩中了基础设施需求和资本市场对 AI 硬件的胃口,如果是真的挺省钱——但前提是它能顺利过关。

4月17日星期五

Hacker News 首页

AI 算力开始不够用了

Nvidia Blackwell GPU 的租赁价两个月内从每小时 2.75 美元涨到 4.08 美元,涨了 48%。CoreWeave 也把价格上调了 20%,最低租期从一年拉长到三年。OpenAI 的 CFO 说他们已经在砍项目,因为算力跟不上。Anthropic 最新的模型只给了大约 40 家机构用。作者判断,AI 算力随便用的阶段结束了,接下来...

推荐理由:这篇文章用一个涨价 48% 的数字开场,把算力稀缺从概念变成账单,读起来像朋友发来一条消息说“显卡租金涨了,注意一下”。它没有停留在感叹,而是把 Blackwell 租金、CoreWeave 提价和 Anthropic 限流三件事摆在一起,指向一个判断:稀缺已经开始改写前沿模型的获取门槛。正文没给更细的供需数据或各家采购策略,所以我会先打个折,不把它当一手情报,但作为提醒从业者盯紧成本与容量的信号,已经够用了。

r/LocalLLaMA

Qwen3.6 新增 preserve_thinking 开关,修了上一代多轮对话“失忆”的 bug

Qwen3.6 模型页面上多了一个 preserve_thinking 参数,默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里,而不是像 Qwen3.5 那样每次重新序列化,导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试:先让模型想两个 20 位数字,只说出第一个;下一轮再问第二个。开关关掉时模型会说自己没生成过...

推荐理由:这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折,因为这不是官方发布说明,而是社区踩坑分享,但信息密度够高:有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说,知道 preserve_thinking 能让推理上下文跨轮保留,比看十篇通稿都实在。

X · @dotey(宝玉)

xAI 开始出租闲置 GPU,第一个客户是估值 500 亿美元的编程工具 Cursor

xAI 把数万块 GPU 租给 Cursor 训练编程模型 Composer 2.5,自己从模型公司变成了半个云服务商。总裁在内部备忘录里承认,公司 20 万块 GPU 的模型算力利用率只有 11%,远低于行业 35% 到 45% 的水平,大部分算力在空转,出租是为了回血。两家关系有点微妙:xAI 刚挖走 Cursor 两位产品工程负责人,转头又卖算力...

推荐理由:这条消息的看点不是又一家公司买卡,而是 xAI 开始把闲置算力变现。正文给出的 11% 利用率远低于行业常见的 35%–45%,说明内部训练任务根本吃不满 20 万块 GPU,出租是止损也是探路。Cursor 作为第一个客户,拿这些卡去训 Composer 2.5,同时自己还在谈 500 亿美元估值,等于用外部算力撑估值故事。我会先打个折:正文没披露租约价格、时长和具体 GPU 型号,所以省钱程度还不好判断。但这件事本身比单纯堆卡更值得盯,因为它可能把算力过剩问题直接摆上台面,也逼其他大厂重新算自己 GPU 集群的账。

4月16日星期四

Hacker News 首页

Darkbloom:用闲置 Mac 跑加密推理,号称比 OpenRouter 便宜七成

Eigen Labs 搞了个叫 Darkbloom 的去中心化推理网络,把一亿多台苹果芯片 Mac 的闲置算力攒起来卖。它提供兼容 OpenAI 的 API,主打端到端加密和硬件验证,说操作节点的人看不到你的数据。价格表上列出的 token 费用比 OpenRouter 低 50%,不是标题里的 70%,这点先打个折。正文没披露独立安全审计的具体范围,...

推荐理由:HKR 三条全中:闲置 Mac 组网做推理的玩法有新鲜感,文章也把规模、接口、加密和价格都摆出来了。我先打个折,维持在 80 分——这还只是团队自己发的预览,审计范围、网络稳定性、攻击面边界都没经过第三方验证,论文出来之前别太激动。

Dwarkesh Patel 访谈

黄仁勋回怼芯片禁令:别把 AI 芯片比作浓缩铀,放弃中国市场是输家心态

黄仁勋在这段视频里直接反驳了美国对华芯片出口限制的几个常见论点。他先质疑,为什么不能制定更平衡的规则,让英伟达在全球竞争,而不是主动放弃世界市场。接着他点名批评了 Dario 把卖 AI 芯片比作“波音给朝鲜核弹造导弹外壳”的说法,直言把 AI 比作浓缩铀是“糟糕且不合逻辑的类比”。最后他驳斥了“中国市场反正会输”的前提,强调计算平台不像汽车或手机,用...

推荐理由:黄仁勋这段视频回应的是美国对华芯片禁令,但他没谈具体政策条款、时间点或受限型号,所以重要性我给 75 分。真正值得看的是他抛出的机制判断:计算平台一旦形成使用习惯就很难替换,主动退出等于把生态位拱手让人。他用两组类比来撑这个观点——否定把 AI 芯片比作浓缩铀,也反驳“反正会输掉中国市场”的前提。视频本身信息量有限,正文没披露更多细节,但观点够直接,对从业者有提醒价值。

Dwarkesh Patel 访谈

黄仁勋谈英伟达护城河:不是芯片设计,是把电子变成 token 的那一整条供应链

黄仁勋把英伟达的生意概括成一句话:输入电子,输出 token,中间是英伟达。他认为护城河不在某颗芯片的设计,而在于把电子变成有价值的 token 这件事本身极其复杂,涉及大量科学和工程,短期内很难被商品化。他举了两个具体机制:一是上游的显性和隐性采购承诺,财报里披露了近 1000 亿美元的承诺,SemiAnalysis 估算实际规模可能到 2500 亿...

推荐理由:黄仁勋亲自下场解释护城河,不是讲芯片设计,而是讲从电子到 token 的全栈优化和上下游组织能力。文章给出了接近 1000 亿美元的采购承诺数字,SemiAnalysis 还报过 2500 亿的可能,上游用大额显性和隐性承诺锁晶圆、HBM 和封装,下游把模型方、整机厂和开发者拉进同一个生态。他还提到 agent 数量会指数增长,工具软件实例跟着涨。这些判断直接打在算力成本、供应安全和生态依赖上,对从业者判断供应链和选型有参考价值。不过正文没给出 2500 亿的具体来源和验证方式,这点先别太激动。整体是强观点评论,不是新品发布、财报或研究论文,所以分...

4月14日星期二

X · @dotey(宝玉)

Claude Code 关掉遥测后缓存从 1 小时掉到 5 分钟,工程师解释是实验开关失效,不是故意惩罚

开发者 Can Vardar 发现 Claude Code 关闭遥测后,提示缓存时间从 1 小时骤降到 5 分钟,他算了一笔账说这是用隐私换 12 倍性能。Anthropic 工程师 Boris Cherny 回应说,1 小时缓存写入成本高、读取成本低,不是无条件更好,如果你只跑一次查询就走,1 小时缓存反而浪费钱。关遥测导致缓存变短,是因为客户端的实...

推荐理由:这条信息对Claude Code用户很实用,把隐私开关和缓存成本的关系讲清楚了。我会先打个折:来源是X上的工程师回复,不是正式公告,但机制解释和后续计划都来自Anthropic员工,可信度够。正文没披露环境变量什么时候上线,这点先别太激动。

4月13日星期一

最佳拍档

谷歌CEO皮查伊:2027年是企业AI落地爆发年,搜索不会死,会变成替你干活的管家

谷歌CEO皮查伊在2026年4月的一次专访里,把家底和判断都摊开了。他说明年(2027年)会是企业AI agent workflow(让模型进业务流程干活)的爆发点,AI将从程序员提效工具变成非技术岗位的智能核心。关于搜索,他认为不会被聊天机器人取代,而是会进化成一个“Agentic Manager”,能直接帮你规划旅行、处理多线程任务,他自己已经在用...

推荐理由:这不是产品发布,而是高管在访谈里给出的判断和内部数据,信号密度很高。Pichai 把 2027 年定为 Agent 爆发点,配合千亿级资本开支和毫秒级延迟管控,让这个判断比一般预测更有分量。搜索演进和算力稀缺这两条线也直接关联从业者当下的决策。分数没给到 P1,因为信息来自二手转述而非一手访谈原文,但 H、K、R 三项都扎实成立。

4月10日星期五

X · @dotey(宝玉)

Anthropic 新 API 让便宜模型干活、贵模型当军师,Haiku 配 Opus 在 BrowseComp 分数翻倍,成本只要 Sonnet 的 15%

Anthropic 推出了“顾问工具”API,让 Sonnet 或 Haiku 作为执行者跑任务,遇到难决策时把上下文递给 Opus 出主意,Opus 不碰工具、不直接输出,只当幕后军师。这跟常见的“大模型拆任务、小模型执行”反过来了,好处是大部分 token 烧在便宜模型上。Sonnet 配 Opus 在多语言 SWE-bench 上比单干高 2.7...

推荐理由:Anthropic 这次 API 更新挺实在,不是画饼。核心就是让 Sonnet 或 Haiku 当执行者跑任务,卡壳时再问 Opus,而且是在同一次 API 请求里完成模型切换,Token 分开算钱。给的数字也清楚:Sonnet+Opus 在多语言 SWE-bench 上比单用 Sonnet 高了 2.7 个百分点,单任务成本还降了 11.9%;Haiku+Opus 在 BrowseComp 上从 19.7% 跳到 41.2%,成本只要 Sonnet 的 15%。我会先打个折,毕竟还在 beta,但这条路子对控制推理成本确实有用,值得关注。

4月8日星期三

MIT Technology Review · AI

微软 AI 老大苏莱曼:AI 发展离撞墙还早,算力暴涨是核心

这是微软 AI 的 CEO 苏莱曼在《麻省理工科技评论》上发的评论文章,不是独立研究,立场上我会先打个折。他的核心论点是:AI 训练用的算力从 2010 年到现在涨了 1 万亿倍,从 10 的 14 次方次浮点运算涨到 10 的 26 次方,所以短期内不会撞墙。他给了几个具体数字:英伟达芯片六年里单颗性能翻了 7 倍多;HBM3 这种堆叠式高带宽内存把...

推荐理由:HKR 三项都站得住:Suleyman 在扩展争论里立场很硬,并且甩出了 10^26 flops、7 倍芯片提升、3 倍带宽和 8 个月效率减半这些数字。分数定在 82,因为这是高管观点文,不是独立研究,而且 2030 年每年新增 200GW 算力那个数怎么算出来的正文没交代。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

4月6日星期一

X · @dotey(宝玉)

小米罗福莉:Agent 时代算力跟不上 Token 烧法,出路不是降价而是省 Token

小米 MiMo 团队负责人罗福莉指出,现在 Agent 干活时反复带着超过 10 万 Token 的长上下文去调工具,请求次数是 Claude Code 自身框架的好几倍,真实 API 成本可能冲到订阅价的几十倍,全球算力根本扛不住。她认为短期阵痛反而是好事,第三方框架被 API 付费逼着去改进上下文管理、提高缓存命中率、砍掉无效消耗。同时她呼吁大模型...

推荐理由:小米 MiMo 负责人罗福莉这次发言没绕弯子,直接拿 OpenClaw 和 Claude Code 的请求次数做对比,把 Agent 多轮工具调用带来的 Token 消耗和成本膨胀讲得很清楚。10 万 Token 上下文反复携带、请求量高出数倍、API 计费后成本翻几十倍,这些数字让“算力跟不上”的判断有了抓手。正文没给具体定价方案,也没公开测试环境,所以结论先打个折,但方向对做推理优化和框架选型的人有参考价值。

4月4日星期六

X · @dotey(宝玉)

DeepSeek V4 推迟发布,重写底层代码,就为了跑在华为昇腾 950PR 上

V4 跳票了几个月,原因是 DeepSeek 把模型底层模块重写了一遍,专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上,预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍,有 112GB 显存,带宽 1.4TB/s,还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用,一个原本...

推荐理由:这条消息 H、K、R 都站得住:华为芯片部署是强钩子,底层重写和芯片规格有料,国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道,模型规模、价格和实测性能都没披露,我会先打个折。

3月26日星期四

硅谷101 播客

E230|1万亿收入预期背后:英伟达的巅峰与软肋

黄仁勋在GTC上说,到2027年底,Blackwell和Vera Rubin两个平台的累计订单预计至少1万亿美元,而2024年全球半导体产业总销售额也就6000多亿美元。这期节目请了投资人、前英伟达芯片设计负责人和芯片架构师,一起拆解这个数字能不能落地。讨论认为,需求端确实旺盛,推理成本正在追上训练成本,未来Agent智能体铺开后Token消耗会更大。...

推荐理由:这篇不是照搬GTC通稿,而是把1万亿订单这个标题往回拉,提醒真正该盯的是封装、显存和供电。对从业者来说,知道成本能降多少、瓶颈在哪,比看销售数字有用。我会先打个折:正文没给出1万亿订单的具体构成和交付节奏,这点先别太激动。

3月24日星期二

Lex Fridman 播客

黄仁勋对谈 Lex Fridman:英伟达如何从单卡竞争转向整机柜、整数据中心的极端协同设计

黄仁勋在播客里解释了英伟达现在为什么要搞“极端协同设计”——因为单颗 GPU 已经不够用了。你想让一万台计算机跑出百万倍的加速,就不能只堆硬件,得把算法拆开、把模型和数据切碎(分片),让网络、交换、存储、供电、散热全部配合起来。否则受制于阿姆达尔定律,计算部分再快,整体也只快一点点。他还提到自己直接管 60 多个人,几乎全是工程背景,分别盯着内存、CP...

推荐理由:这是一手访谈,黄仁勋把 NVIDIA 的竞争逻辑讲得很清楚:不再拼单卡,而是拼整机柜甚至数据中心的协同设计。他提到 60 多个直接下属、1 万台计算机的扩展目标,以及 Amdahl 定律带来的实际限制,信息密度高。我会先打个折,因为这是播客分析,不是新产品发布或人事变动,但作为理解 NVIDIA 战略的入口,值得从业者花时间看。

3月17日星期二

NVIDIA 博客

GTC 上 NVIDIA 用 RTX 电脑和 DGX Spark 跑本地 AI 助手,还发了新模型

NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...

推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。

3月13日星期五

MIT Technology Review · AI

未来的 AI 芯片,可能会用玻璃来造

韩国公司 Absolics 计划今年在美国工厂量产一种玻璃基板,专门给 AI 数据中心的芯片封装用。简单说,就是把多块小芯片拼在一块玻璃上,而不是传统的有机材料上。玻璃更耐热、不容易变形,能让工程师在每毫米内塞进 10 倍的连接点,同样面积下能多放 50% 的硅片,散热也更好,整体功耗有望降低。英特尔也展示了能跑 Windows 的玻璃基板样品,但正文...

推荐理由:HKR-H 落在“AI 芯片上玻璃”这个钩子上。HKR-K 落在 10 倍互连密度、同面积多塞 50% 芯片和 1.2 万平方米年产能这三组数字上。HKR-R 是因为封装瓶颈会卡 AI 基础设施的成本和供应,但正文没披露大规模良率与成本,判断得打个折。

3月10日星期二

NVIDIA 博客

NVIDIA 和 Thinking Machines Lab 签了份长期大单,起步就是 1 吉瓦的算力

NVIDIA 和 Thinking Machines Lab 宣布了一项多年合作,核心是部署至少 1 吉瓦的 NVIDIA Vera Rubin 系统,目标明年年初上线,用来训练前沿模型和搭建可定制的 AI 平台。1 吉瓦这个数字很夸张,相当于一个大型核电站的发电量,说明这不是普通的云服务采购,而是直接锁定了一整座“算力电厂”的产能。合作还涉及基于 N...

推荐理由:1 吉瓦 Vera Rubin 承诺把这条合作从普通公关稿里拎了出来:H 靠规模,K 靠具名系统和部署时间,R 靠前沿算力竞争。没给 P1 是因为来源是厂商博客,投资金额、算力归属、分阶段细节正文都没披露,我会先打个折。

3月7日星期六

彭博科技

甲骨文和 OpenAI 叫停了得州旗舰数据中心的扩建计划

双方谈崩了,不再一起扩建位于得州阿比林的那座旗舰 AI 数据中心。原因是融资进度拖后腿,加上 OpenAI 自己的需求变了。现在 Meta 在考虑从运营商 Crusoe 手里租下这个场地,英伟达也在中间帮忙牵线。这类项目的造价动辄上百亿美元,正文没披露具体的分手条款和后续时间表。

推荐理由:Oracle 和 OpenAI 在得州阿比林那个旗舰数据中心的扩建计划谈崩了,原因是融资没谈拢,加上 OpenAI 自己的需求也变了。Meta 正考虑从开发商 Crusoe 手里租下原本要扩建的那块地,Nvidia 在中间帮忙牵了线。项目总成本只说在几百亿美元级别,具体数字没披露。我会先打个折:这事说明超大集群先卡在资本结构和多方协同上,不是先卡在芯片,这点比标题本身更值得盯。