跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 341–360 条 · 共 455 条

5月3日星期日

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

r/LocalLLaMA

OpenAI 隐私过滤器与 GLiNER 在 600 条 PII 样本上的实测对比

Reddit 上有用户拿 OpenAI 的隐私过滤器(privacy-filter)和 GLiNER large-v2.1 在 600 条含个人身份信息(PII)的样本上跑了一轮。纯 CPU 推理速度,OpenAI 模型每秒处理 2.8 条,GLiNER 是 1.1 条,前者快了一倍多。英文边界识别的宏观 F1 分数,OpenAI 模型 0.498,G...

推荐理由:Reddit 上一个测试用 600 条含姓名、邮箱、电话的样本,把 OpenAI 刚发的 privacy-filter 和 GLiNER large-v2.1 放在 CPU 上跑。宽松边界匹配时,OpenAI 的 macro F1 是 0.498,GLiNER 是 0.416,速度上 OpenAI 每秒 2.8 条,GLiNER 1.1 条,看起来 OpenAI 小胜。但一切到严格匹配,OpenAI 的分数直接掉到 0.155,原因是 tokenizer 切词偏移导致边界对不齐,很多实体只抓到半截。这个坑比速度差距更值得注意,说明实际部署时如果要求...

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

FT · 科技

华为 AI 芯片在中国大卖,英伟达却卡住了

这篇是付费墙后面的文章,正文没披露具体订单金额、芯片型号和交付时间。从标题看,核心信息是华为接到了国内科技公司的大笔 AI 处理器订单,而英伟达因为出口管制在中国市场动弹不得。这背后反映的是中国算力供应链正在被迫转向国产替代,但文章本身没给出更多细节来支撑这个判断,先别太激动。

推荐理由:FT 的信源和华为 vs Nvidia 的中国市场角力,让 H 和 R 都站得住。但 K 这边确实虚:金额、型号、交付节点一概没给,所以分数只能压在 78–84 这个区间,别因为标题冲高。

r/LocalLLaMA

32 块 AMD MI50 老卡跑 Kimi K2.6 模型,生成速度 9.7 token/秒

Reddit 用户 ai-infos 用 32 块 AMD MI50 32GB 显卡(分两台机器,每台 16 卡,走 10G 网线)跑 Kimi K2.6 的 int4 量化版。处理 1.4 万多字的输入时,预处理速度能到 264 token/秒;生成 136 个字的回答时,速度掉到 9.7 token/秒。空载功耗 640W,跑推理时峰值 4,800...

推荐理由:这条帖子本身是个 Reddit 上的野路子基准测试,不是官方发布,所以分数不会给太高。但它的钩子很强——用 32 张二手 MI50 攒出一台能跑 Kimi K2.6 的机器,还给出了吞吐、功耗和网络拓扑的实测数据,对想低成本自建推理集群的人有直接参考价值。我会先打个折,因为正文没披露精度损失的具体对比、延迟抖动和长时间稳定性,这些对生产环境很关键。不过就凭它把 AMD 老卡 + vLLM 分布式栈的可行性摆上台面,加上功耗和 PCIe 带宽这两个真实痛点,74 分放在 featured 里是合理的。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

The Verge · AI

马斯克在法庭上承认 xAI 用 OpenAI 的模型训练了 Grok

马斯克在加州联邦法院作证时,承认 xAI“部分”使用了 OpenAI 的模型来改进自家聊天机器人 Grok。用的方法是模型蒸馏,也就是让一个更聪明的大模型当老师,把知识“教”给一个更小、更省钱的模型。不过报道没说他具体用了 OpenAI 的哪个模型、喂了多少数据、跑了多少次训练。这点先别太激动,正文没披露细节,没法判断这到底是一次常规操作还是越界行为。

推荐理由:HKR 三项全中:马斯克法庭自曝用 OpenAI 模型训 Grok,机制是蒸馏,但模型名、规模、轮次都缺,信息有硬缺口,所以重要性停在 84 而不是更高。

4月30日星期四

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

彭博科技

三星芯片部门利润暴增 48 倍,全靠 AI 数据中心抢内存

三星电子芯片部门在 2026 年第一季度利润同比翻了 48 倍,创下历史新高并超出市场预期。这波增长直接来自 AI 数据中心对内存的疯狂采购,导致供应紧张。不过正文没披露具体的利润金额、是哪种内存(比如 HBM 还是普通 DRAM)以及主要客户是谁。

推荐理由:三星半导体部门一个季度利润翻了48倍,这个涨幅放在任何行业都算炸裂。我会先打个折:正文没写具体赚了多少钱,也没说是哪类内存(HBM还是普通DRAM)在拉动,客户是谁也一概没提。所以这条消息的价值在于信号——AI数据中心在疯狂下单,内存供给可能进一步收紧。如果是真的,对做推理优化和硬件采购的团队来说,成本压力会更大。Bloomberg的报道本身可信度不低,但信息缺口明显,我维持74分,不往上调。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

Dwarkesh Patel 播客

Reiner Pope 黑板讲座:大模型训练和推理背后的数学账本

Dwarkesh 把采访间改成了黑板教室,请来芯片公司 MatX 的 CEO Reiner Pope,用公式和粉笔把大模型从训练到服务的成本结构拆了一遍。讲座从批处理大小讲起:没有批处理,服务成本会直接差出 1000 倍,这也是为什么各家 API 定价和快速模式差价巨大的根源。接着讲了 MoE 模型怎么跨 GPU 机柜摆放、流水线并行如何把模型层切分到...

推荐理由:这是一堂黑板课,不是新闻事件,所以分数没往上拉。但内容确实扎实:Pope 把训练和推理里几个关键的成本开关——尤其是批处理对经济性的影响——用数字讲清楚了。我会先打个折,因为正文没给具体实验数据,更多是经验推演,但“1000 倍”这个量级足够让人重新审视自己的服务设计。

4月29日星期三

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

FT · 科技

OpenAI 那个 5000 亿美元的 Stargate 数据中心计划,已经变了好几次样

这篇 FT 文章正文被付费墙挡住了,只看到标题和摘要片段。从现有信息看,Sam Altman 在基础设施上搞得很灵活,这种灵活让合作伙伴不太踏实,但确实帮 OpenAI 在算力上跑到了前面。至于 Stargate 具体怎么变了、现在是什么结构、有哪些合作方、时间表怎么排,正文没披露,没法细说。

推荐理由:我会先打个折,因为正文没给结构、伙伴和时间表,信息密度撑不起更高分。但 5000 亿这个数字和合作方不安的信号,对关注算力基建的人来说是实打实的信号弹,所以 H 和 R 都站得住。整体放在 76 分、featured 是合理的,更像一条值得盯后续的线索,而不是一篇能直接引用的硬稿。

r/LocalLLaMA

双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B,vLLM 下跑到约 60 tok/s,支持 204K 上下文

一位用户用两张 RTX 5060 Ti 16GB 显卡,通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s,两张卡共占用 32GB 显存。配置上开了张量并行(TP=2)、fp8 KV 缓存、多 token 预测(MTP 一次猜 3 个 token),并把上下文窗口拉到了 204800。显存是瓶...

推荐理由:H、K、R 全中。帖子是一手实测,硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚,对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖,没有更多交叉验证,所以分数停在 76 不进 78–84 那档。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。