跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 161–180 条 · 共 455 条

5月23日星期六

量子位 · 公众号

DeepSeek V4 继续打价格战,缓存输入每百万 token 只要两分五;宁德时代、京东、网易在谈投资,梁文锋说目标是通用人工智能

DeepSeek-V4-Pro 的 API 从 6 月 1 日起维持促销价,缓存输入每百万 token 收 0.025 元人民币,这个价格在同类模型里算很低了。彭博社的消息说 DeepSeek 正在谈一轮 700 亿人民币的融资,投前估值 450 亿美元,宁德时代、京东、网易都有意参与。创始人梁文锋对外表态,公司的目标还是通用人工智能(AGI)。不过原...

推荐理由:这条消息把两件事串起来了:一是 DeepSeek V4 的 API 价格直接砍到促销价,输入缓存命中每百万 Token 只要 0.025 元,对用 API 做产品的团队来说成本降幅明显;二是彭博说宁德时代、京东、网易都在看这轮 700 亿融资,投前估值 450 亿美元,梁文锋还放了话目标是 AGI。价格数字和融资规模都够具体,没有模糊表述,对关注模型成本和资本动向的从业者来说信息密度高,所以给了 90 分。

r/LocalLLaMA

club-rdna16:一个在 16GB AMD 显卡上实测本地大模型的仓库

这个仓库用一张 RX 6900 XT(16GB 显存)跑 llama.cpp,后端是 ROCm/HIP,专门验证 AMD 卡在本地跑大模型的实际表现。目前放出的一个亮点是 Qwen3.6 35B-A3B 这个 MoE 模型,用 q8 格式缓存 KV 状态,能稳定撑到 131k 上下文窗口。正文没披露具体的推理速度、功耗和温度数据,所以性能上限和日常可用...

推荐理由:这是一条 Reddit 帖子,不是论文或官方报告。作者把测试仓库公开了,但正文只给了能跑起来的配置条件,没放推理速度、显存占用曲线或可复现的完整日志。我会先打个折:它证明了 16GB A 卡跑大上下文 MoE 模型可行,这点挺省钱,但别急着当生产参考,信息缺口还很大。HKR 三项都踩中了,作为一条给本地 LLM 玩家的实操线索,上 featured 没问题。

AI HOT 精选

黄仁勋说 AI 基建年开支会冲到 4 万亿美元,比华尔街共识高了四倍

黄仁勋在英伟达财报电话会上抛出一个数字:超大规模云厂商的 AI 基建年开支会从现在的 1 万亿美元涨到 3 到 4 万亿,CFO 给的时间线是 2030 年前。华尔街分析师原本的共识是 2028 年才到 1.03 万亿,老黄直接翻了四倍。一季度谷歌、亚马逊、微软三家资本开支加起来已经超过 1100 亿美元,Meta 更是把全年预算拉到 1450 亿,结...

推荐理由:黄仁勋说的 3-4 万亿美元是 CEO 预测,不是已发生的模型发布或产品落地,所以分数压在 78-84 这个区间。数字本身有信号价值——它把云厂商的烧钱速度量化了,也间接给英伟达的营收预期撑腰。但正文没披露这个 4 万亿是怎么算出来的,也没说时间节点,这点先别太激动。

AI HOT 精选

智能体工作负载正在改写推理成本账本

SemiAnalysis 扒了 43.2 万条真实编码智能体的请求记录,输入 token 的中位数不是大家常说的 3.2 万或 6.4 万,而是 9.6 万。这个量级意味着模型在接到你的问题之前,已经吞下了比《了不起的盖茨比》全书还长的上下文。正文没披露用了哪些模型、成本曲线、采样方式和统计时间窗口,所以这个数字先当个参考,别急着拿它算账。

推荐理由:HKR 三项都过:SemiAnalysis 拿出了一个 43.2 万条编码智能体请求的数据集,中位输入 9.6 万 token,这个数据点本身够硬。但模型、成本曲线、采样方法全都没说,所以只能算强数据点,到不了必写级别。

r/LocalLLaMA

llama.cpp 新分支让 MoE 模型在 12GB 显存上跑得更快,RTX 2060 上速度从 19/22 tk/s 提到 26 tk/s

comanderxv 给 llama.cpp 开了个叫“experts first”的分支,专门优化混合专家模型(MoE)的显存调度。做法是把常用的专家模块提前缓存到显存里,实测用 RTX 2060(12GB 显存)跑 Qwen3.6-35B-A3B 模型,专家缓存命中率约 62%,生成速度从原来的 19 或 22 token/秒提升到了 26 tok...

推荐理由:HKR 三项都踩中了:钩子是一块 12GB 的老卡把 35B MoE 速度拉上来一截,有缓存机制和命中率数据撑着,话题又打在本地推理的成本神经上。不过这事目前还局限在本地推理的小圈子,所以放在 featured 档刚好,不用拔到必读。

5月22日星期五

Hacker News 首页

DeepSeek 把 V4 Pro 的 75 折促销变成永久降价了

DeepSeek 在定价页更新了一条脚注:V4 Pro 模型现在的 75 折优惠在 2026 年 5 月 31 日结束后,会直接变成正式价格,也就是原价的四分之一。具体来说,输入 token(没命中缓存)从每百万 1.74 美元降到 0.435 美元,输出 token 从 3.48 美元降到 0.87 美元。缓存命中的输入价格更便宜,只要 0.0036...

推荐理由:我会先打个折:这条消息的钩子很足,永久四分之一价直接挑动价格战神经,对开发者钱包影响大,所以 H、K、R 都成立。但正文没披露具体单价,信息缺了一块,没法判断实际便宜到什么程度,所以只够 featured 门槛,算不上必写的大新闻。

Dwarkesh Patel 播客

从逻辑门到 AI 芯片:Reiner Pope 的芯片设计黑板课

MatX 的 CEO Reiner Pope 从最底层的与、或、非逻辑门讲起,一步步拆解 AI 芯片到底怎么工作。他先用一个 4 比特乘 4 比特、再用 8 比特累加的例子,演示了乘法累加(MAC)运算在电路里长什么样——这其实就是矩阵乘法的基本动作,AI 芯片绝大部分时间都在干这个。接着聊到数据搬运比计算还贵,所以芯片里要用多路复用器(mux)来省连...

推荐理由:Dwarkesh 这次访谈没讲空话,Reiner Pope 从最底层的门电路开始,一步步解释怎么为 AI 推理专门设计芯片。我会先打个折:这不是产品发布或行业爆料,更像一堂硬核科普,所以分数不会给到新闻级。但内容密度很高,把脉动阵列、数据流和 ASIC 的取舍都讲透了,对做推理优化的人有实际参考价值。正文没披露 MatX 芯片的具体性能指标,这点先别太激动。

Mistral AI

Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP

Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。

推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。

AI HOT 精选

首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布

ModelBest、清华和OpenBMB搞了个BitCPM-CANN,从0.5B到8B都有,全程用华为昇腾910B NPU训练,没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值,内存比BF16省了约6倍,能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%,这点挺实在。我会先打个折:正文没披露具体推理延迟和功耗数据,也...

推荐理由:HKR三项都站得住:昇腾910B全栈训练1.58比特开源模型这个角度够新,数据也扎实。没给P1是因为目前只有发布事实,缺少独立复现或实际落地效果的佐证,所以先放在featured。

Latent Space

AI 基础设施又添独角兽:Exa、Modal、TurboPuffer 三家同时拿到大额融资

这期主要聊了三家 AI 基础设施公司的融资进展。TurboPuffer 先确认年经常性收入达到 1 亿美元并且已经盈利,这个数字说明做向量数据库的生意可以自己造血了。Exa 完成了 2.5 亿美元的 C 轮融资,估值 22 亿美元,他们做的是 AI 搜索引擎。Modal 融了 3.55 亿美元,估值冲到 47 亿美元,业务是帮开发者更方便地跑模型和部署...

推荐理由:Latent Space 这条汇总把三笔 AI 基础设施融资串在一起,信息密度高。TurboPuffer 做到 1 亿美元年经常性收入并且盈利,说明向量搜索这类基础能力已经有客户愿意持续付费,不是纯烧钱。Exa 拿 2.5 亿美元 C 轮、估值 22 亿美元,Modal 拿 3.55 亿美元 C 轮、估值 47 亿美元,两笔都是大额后期融资,反映资本在往模型训练和推理的底层平台集中。对做 AI 应用的人来说,这些数字能帮你判断下游供应商的稳定性和议价空间。正文没展开各家具体技术指标或客户构成,所以估值背后的溢价逻辑只能看个大概,这点先别太激动。

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

纽约时报中文网

特朗普松口卖芯片,北京反而拦着不让买

特朗普半年前批准英伟达向中国卖 H200 芯片,但北京至今没让任何一家公司下单,反而把企业往华为、寒武纪等国产替代上推。文章说这背后是中美技术脱钩的深度不信任:中国想借机逼本土芯片产业提速,企业则抱怨算力不够是最大瓶颈。现在国内芯片性能号称已追上 H200,但良率跟不上,所以很多公司只能租用境外数据中心的英伟达芯片远程训练模型——速度慢、数据泄露风险高...

推荐理由:HKR 三项全中:批准后六个月零采购,加上北京明确引导企业转向华为、寒武纪,这是很强的芯片政策信号。不过它毕竟不是模型发布或重大产品更新,所以分数放在 78–84 区间,82 合理。

Computing Life · Share · 鸭哥调研

DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了,还解决了 agent 对话的“失忆”问题

DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型,性能接近前沿水平,但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎,纯 C、Metal 优先,一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂:模型生成工具调用时,DS4 会记住原话,下次 agent 返...

推荐理由:标题和摘要给的期待是“在 Mac 上本地跑 DeepSeek V4 Flash 的实操方案”,但正文只列了 DS4 引擎的三项机制名称,没给出模型大小、实际性能、Mac 兼容性要求,也没有可复现的测试结果。我会先打个折:对想动手试的开发者来说,知道有这些机制存在已经算有用信息,但离“能照着做”还差关键数据。H、K、R 三项都踩中了,信息缺口也明显,放在 featured 层级刚好——够吸引人点进去看,但读完会发现缺胳膊少腿。

Computing Life · Share · 鸭哥调研

智谱 GLM-5.1 API 跑到每秒 400 个 token,靠的不是优化,是换了一套执行逻辑

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API,输出速度标称 400 tokens/s,是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的,而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离,让数据持续流动,GPU 不再频繁启停。模型本身也做了...

推荐理由:400 tokens/s 是个好钩子,但正文没交代测试条件、并发数、输入长度和计费规则,所以速度先打个折看。TileRT 的说法有信息量,不过没展开具体怎么重构执行模型,技术细节偏薄。整体对从业者有提醒价值,但缺少独立验证,所以分数停在 78 不动。

r/LocalLLaMA

这篇论文主张:输入处理用低精度加速,输出生成用高精度保质量

论文 arXiv 2605.20315 提出一个混合精度策略:在预填充阶段用 W4A4 量化,理论上能把输入处理速度提升 4 倍;但解码阶段仍用原始高精度,因为激活值的量化误差会扰动采样出的 token,并在自回归生成中逐步累积,导致输出质量下降。正文没披露具体实验模型和数据集,也没给出实际延迟或吞吐数据,所以这 4 倍目前只是理论估算,实际能省多少还...

推荐理由:这篇论文的卖点是“前段省、后段稳”:预填充用 W4A4 量化,理论上能换来 4 倍加速,解码时再切回高精度,防止误差递归累积把回答搞崩。思路本身挺直接,但正文只给了理论增益,没披露实测吞吐、困惑度变化和具体硬件环境,所以实际能省多少、质量掉多少还不清楚。我会先打个折,等看到实测数据再判断值不值得跟。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

r/LocalLLaMA

LLM 硬件规划器:按你的用途、模型或预算挑一套跑本地模型的机器,或者给现有机子选模型

totosse17 做了一个叫 LLMRequirements 的硬件规划工具,整理了 60 多套装机方案、50 多个模型,还附了 130 多个有来源标注的每秒 token 生成速度、150 多个评测视频。它会标每套配置的待机功耗和满载功耗,价格覆盖多个地区,数据放在 GitHub 上公开更新。不过 Reddit 原帖正文被屏蔽了,具体界面长什么样、交...

推荐理由:这是一个 Reddit 社区作者做的本地 LLM 硬件规划器,不是大厂产品发布,但信息密度很高。我会先打个折:它更像一个持续更新的公开数据集和参考表,不是一键自动优化的工具。正文没披露数据更新频率的具体机制,但 130 多个 tok/s 来源和 150 多个评测视频让它比一般论坛帖子可信不少。对想自己攒机器跑模型的人来说,功耗和地区价格都列出来,省得自己到处翻,这点挺实在。

The Verge · AI

SpaceX IPO 文件曝光:Anthropic 每月花 12.5 亿美元租用马斯克的数据中心,一年就是 150 亿

SpaceX 在 S-1 上市申请里写明了这笔交易的价码:Anthropic 每月要付 12.5 亿美元,一直付到 2029 年 5 月,用来使用位于孟菲斯的 Colossus I 和 Colossus II 两座 AI 训练中心。一年算下来就是 150 亿美元,这个数字快赶上 SpaceX 2025 年全年 187 亿美元收入的两倍了。合同里还藏了一...

推荐理由:我会先打个折:150 亿美元是年化数字,实际是按月付 12.5 亿,合同到 2029 年 5 月。但即便这样,这笔钱也大到离谱,相当于 Anthropic 把训练算力的命脉交到了马斯克手里。S-1 文件是 SpaceX 上市披露,可信度没问题。正文没披露 Anthropic 具体拿多少 GPU、训练什么模型,但 Colossus I 和 II 是孟菲斯新建的超大规模训练中心,说明 Anthropic 在算力上下了重注。这点先别太激动,合同细节比如是否有退出条款、算力规格都没说,但光这个金额和合作方组合,就值得今天写。

r/LocalLLaMA

腾讯发布 Hy-MT2 翻译模型,覆盖 33 种语言,最小 1.8B 版压缩后仅 440MB

腾讯放出了 Hy-MT2 系列翻译模型,有 1.8B、7B 和 30B-A3B 三个尺寸,支持 33 种语言互译。1.8B 小模型用上 AngelSlim 1.25-bit 量化后,存储占用压到 440MB,推理速度还快了 1.5 倍,适合本地跑。不过 Reddit 原帖被屏蔽了,正文没披露具体翻译质量评测和更多技术细节,这点先别太激动。

推荐理由:我会先打个折:Reddit 信源比较散,所以分数没再往上拉。但 440MB 这个数字太直观了,比单纯列三个模型尺寸更有传播力,从业者一眼就能算出部署成本。正文没披露量化后的翻译质量损失,这点先别太激动,但“小模型干翻译”这个方向本身值得关注。