跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–120 条 · 共 455 条

6月1日星期一

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

英伟达发布 PC 芯片,正式杀入 Windows 笔记本市场

英伟达推了一款面向 PC 的新芯片,要跟英特尔和 AMD 抢 Windows 笔记本的生意。不过这篇报道正文没披露具体规格、定价、上市时间,也没提 AI 算力指标,所以性能到底怎么样、卖多少钱、什么时候能买到,现在都还不清楚。

推荐理由:Bloomberg 的信源让消息可信,Nvidia 杀进 Windows 笔记本这件事本身就够有话题性,所以 H 和 R 都成立。但文章几乎没给任何硬指标,K 完全站不住。我会先打个折:这条更像一个信号,不是一份能拿来评估的发布,别太激动。

r/LocalLLaMA

有人把英伟达 Parakeet 语音转文字模型移植到了 ggml,不再需要 Python,还能量化压缩

开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍,彻底甩掉了 Python 和 PyTorch。他测试下来,在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致,但速度更快,大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化,提供了 f1...

推荐理由:我会先打个折:这是个人移植项目,不是 NVIDIA 官方出品,长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo,量化后跑得更快,而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说,这是个省事的选择。正文没披露量化后的精度损失有多大,这点先别太激动。整体看,技术验证扎实,痛点打得准,放在 featured 低位合适。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

量子位 · 公众号

英伟达、微软、Arm 同发预告,传老黄自研 CPU 笔记本 N1X 要来了

三家公司在同一天发了同一张“PC 新纪元”的预告图,指向一台传闻中由英伟达主导设计的笔记本 N1X。目前流出的配置是 20 核 Arm 架构 CPU、Blackwell GPU、6144 个 CUDA 核心和 128GB LPDDR5X 统一内存,听起来像一台给 AI 开发者准备的移动工作站。不过正文没披露具体跑分和实测数据,内存带宽和 x86 转译效...

推荐理由:我会先打个折:这目前是三家同一天发暗示拼出来的硬件传闻,发布日期、价格、量产计划正文都没给。但“英伟达自研 CPU 塞进笔记本”这个组合拳,加上 128GB 统一内存这种能跑大模型的规格,确实值得当一条强信号来看。先别太激动,等实锤。

r/LocalLLaMA

我花 6400 美元搭了一台本地大模型服务器,一年下来比用 API 便宜了 700 多

作者晒了一台自组的本地大模型服务器,总花费 6406.45 美元,核心配置是 4 张 AMD MI100 显卡,主要跑 Qwen3.6 27B 模型。这台机器每天处理约 2040 万个输入 token 和 132 万个输出 token。他拿 OpenRouter 的 API 价格算了一笔账:第一年本地总成本(含电费)是 2992.72 美元,而调用同等...

推荐理由:这是一篇个人实测帖,不是厂商通稿。作者把账单摊开算:硬件折旧、电费、OpenRouter 比价,结论是首年能省 700 多美元。我会先打个折——这个结论绑定了他的特定负载(日处理 2000 多万 token)和二手 MI100 价格,换个人未必复现。但文章的价值不在普适性,而在把“自建推理服务器到底划不划算”这笔账算得清楚、可复现,对正在纠结买卡还是调 API 的人有参考意义。信息密度和话题性都够,放在 featured 低位合理。

AI HOT 精选

NVIDIA 用 DynoSim 给推理部署做模拟器,一次能跑几千种配置,速度是实时的 1500 倍

NVIDIA 给自家推理服务框架 Dynamo 配了个仿真工具 DynoSim,用 Rust 写成。它把部署测试变成“先在虚拟时间线上模拟、再挑最好的上真机”的流程,不用一个个试。测试里它能跑到实时速度的 1500 倍,一次筛几千种配置。正文没披露具体硬件环境、支持哪些模型和实测延迟数据,所以这个 1500 倍先打个折看——快是真的快,但省多少时间还得...

推荐理由:HKR 三项都成立:钩子是 1500 倍实时仿真,机制是虚拟时间线批量试配置,共鸣点打在推理成本和延迟上。单信源 NVIDIA 产品更新,信息量有限,放在 featured 低段合理。

5月30日星期六

r/LocalLLaMA

把一块 RTX Pro 6000 塞进 2016 年的戴尔 R730 服务器,跑 65 万 token 上下文

作者想把一块最新的 RTX Pro 6000 Blackwell 显卡装进一台 2016 年的戴尔 PowerEdge R730 服务器里,目标是搭一台能跑 65 万 token 上下文的本地 AI 盒子。过程不顺利:先要切掉风扇导流罩才能把卡塞进去,接着用双 riser 卡解决供电,然后系统卡在 PCIe BAR 分配上,根本认不到全部显存。后面就是...

推荐理由:HKR 三项都站得住:老服务器配新显卡跑 650K 上下文,玩法新鲜、细节扎实、对想省钱自建 AI 机器的人有参考价值。不过它终究是一次个人硬件折腾,不是产品发布或模型更新,所以重要性我给 72 分,放在 featured 里。

AI HOT 精选

xAI 放弃 JAX GPU,改用自研 C 语言训练框架

SemiAnalysis 爆料 xAI 已经不用 JAX 在 NVIDIA GPU 上训练模型了,转而用 Grok Build 写了一套 C 语言训练框架。报道说 xAI 的 JAX 方案模型浮点利用率(MFU)不到 10%,这个数字很低,意味着大部分算力都浪费在调度和通信上,没真正花在训练上。NVIDIA 的 JAX 团队过去两年几乎全员扑在支持 x...

推荐理由:xAI 换训练框架是个强钩子,MFU 不到 10% 这个数字够扎眼,但来源是单条推文,复现条件也没给,所以定在 80 分,不上 P1。我会先打个折看后续:如果真有实锤,这事对训练成本的讨论会很大。

机器之心 · 公众号

苹果搞了个叫 PICO 的图像压缩方案,画质不变,文件能小到三分之一

苹果发了篇论文介绍 PICO,一个用 AI 做图像压缩的编解码器。在主观画质差不多的情况下,它比 AV1、VVC 和 JPEG AI 省 57% 到 70% 的码率,也就是说文件体积能压到原来的三分之一甚至更少。在 iPhone 17 Pro Max 上跑,压一张 1200 万像素的照片要 230 毫秒,解压要 150 毫秒。正文没具体讲模型结构和训练...

推荐理由:HKR 三项都成立:PICO 有明确的 57%–70% 码率节省和 230 毫秒端侧编码数据,不是纯概念。但正文没提产品化时间,目前还是研究发布,所以分数放在 78–84 这个区间。

r/LocalLLaMA

网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速:vLLM 上推理速度提升 3.34 倍

一位老哥在 RTX PRO 6000 显卡上跑了 MTP(多 token 预测,一次猜好几个词来加速生成)的测试。他用 vLLM 跑 Gemma 4 31B 模型,开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个,快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...

推荐理由:这是一篇第一人称的硬核速度测试,有硬件型号、模型、框架和明确的 tok/s 对比,H/K/R 三点都踩中了。我会先打个折:来源是个人博客,权威性一般,而且质量、显存这些关键指标正文没披露,所以分数压在 featured 低位是合理的。

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

TechCrunch · AI

Nvidia 刚花 200 亿美元变相收购人才,AI 芯片公司 Groq 又传出要内部融资 6.5 亿,重心从硬件转向推理

Axios 的消息说,Groq 正在寻求 6.5 亿美元的内部融资,同时公司方向会从造芯片转向主攻 AI 推理,也就是优化模型接到指令后生成回答的那一步。这个动作发生在 Nvidia 被曝用 200 亿美元做了一笔“非收购式挖人”之后。正文没披露 Groq 现在的估值、投资人是谁、交易结构,也没说这轮融资的时间表。

推荐理由:这条消息本身有料:一家做推理芯片的明星公司,一边拿钱一边换赛道。但我会先打个折,因为正文没披露估值、谁在投、钱什么时候到账,这些关键信息都缺着。光靠一个融资意向和战略转向,还撑不起更高的判断。

5月29日星期五

新智元 · 公众号

DeepSeek 三款模型冲进 OpenRouter 月榜前十,总消耗超 17 万亿 Token

OpenRouter 的月度统计显示,DeepSeek 有三款模型进了前十,加起来的 Token 消耗量超过 17 万亿。其中 V4 Flash 一个模型就占了 9.13 万亿 Token,用量很猛。文章还提到华为昇腾的 MegaMoE 算子,在 DeepSeek V3.1 和 Qwen3-235B 的测试里,把预填充(Prefill)吞吐量提升了 2...

推荐理由:HKR三项都成立:17万亿tokens的钩子加上OpenRouter排名和昇腾Prefill提升的具体数字,信息量够。分数定在82,因为算力自主的叙事很强,但正文没披露测试的可复现条件,这点先别太激动。

r/LocalLLaMA

Liquid AI 发布 LFM2.5-8B-A1B,一个 80 亿参数、支持 12.8 万 token 上下文的模型

Liquid AI 放出了新模型 LFM2.5-8B-A1B。它用 380 亿个 token 做预训练,之后又做了大规模强化学习,上下文窗口能塞进 12.8 万个 token。词汇表翻了一倍,对非拉丁语系的 token 切分更友好。模型已经挂在 Hugging Face 上。不过 Reddit 原帖被网络策略挡了,正文没披露具体的基准跑分、推理成本和强...

推荐理由:我会先打个折:正文没给任何跑分、许可证和部署限制,所以别急着下结论。亮点是 8B/A1B 这个尺寸配 128K 上下文,38T token 的预训练量也算扎实,加上大规模 RL 调过,对想在本地跑长文本、又不想烧太多卡的人有吸引力。但没基准测试就没法判断实际水平,这点先别太激动。

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

彭博科技

三星开始向英伟达等客户寄送下一代 AI 内存芯片样品,声称抢到先发优势

三星电子已经开始向客户寄送其最先进的内存芯片样品,这些芯片将用于英伟达等公司的 AI 加速器。不过,正文因为 Bloomberg 的反爬机制没能抓到具体内容,所以芯片型号、客户名单、样品数量、定价和量产时间这些关键信息目前都看不到。

推荐理由:三星放话说自己先跑了一步,把最先进的 AI 内存样品送到客户手里了,Nvidia 这类加速器厂商是直接相关方。我会先打个折:正文没写具体是哪款芯片、给了谁、什么时候能量产,所以目前只能算一个供应链信号,还不是落地实锤。对关注硬件成本和 HBM 供应的人来说,这条值得看一眼,但别急着当定局。

彭博科技

Apollo 正为 Anthropic 拉一笔 360 亿美元贷款,用来买谷歌芯片

Apollo 和 Blackstone 在找其他投资人一起凑约 360 亿美元的债务融资,给 Anthropic 建 AI 基础设施。标题说这笔钱会用来买谷歌的芯片,但正文因为 Bloomberg 的反爬墙没抓到,具体买什么型号、多少量、什么时候交付都没披露。我会先打个折:360 亿这个数字很大,但它是债务融资不是纯股权,结构上可能带杠杆,实际落到芯片...

推荐理由:Bloomberg 这条消息把三件事串起来了:Anthropic 要算力、Apollo 和 Blackstone 出钱、钱指定买 Google 芯片。360 亿这个数字很大,但正文没写具体买什么芯片、分几年执行,所以我会先打个折——这更像是一个融资框架,不是已落地的采购单。对从业者来说,看点在于:一,AI 实验室开始用债务而不是股权来扛算力成本,杠杆风险怎么算;二,Google 芯片在这个单子里替代了 NVIDIA 的位置,如果属实,对供应链是个信号。标题里的“购买 Google 芯片”是钩子,但信息缺口也很明显,别急着当定论。

AI HOT 精选

苹果想把谷歌数万亿参数的 Gemini 模型压缩进 iPhone,给新 Siri 当大脑

苹果正在尝试用模型蒸馏技术,把谷歌那个参数规模大到数万亿的 Gemini 模型缩小,塞进 iPhone 里本地运行,用来驱动新版 Siri。但 Ars Technica 的报道也泼了盆冷水:因为原始模型实在太大,完全在手机本地跑通的可能性很低,大概率还是得搭配云端处理。正文没披露具体的蒸馏方案、参数目标、延迟要求,也没给出发布时间表。

推荐理由:我会先打个折,因为这只是个爆料,不是已发布的产品。文章给了蒸馏方案和“云端大概率必需”的判断,但没披露模型压缩后的具体尺寸、延迟数据或上线时间,所以信息量够上 featured,但别当实锤看。