跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 261–280 条 · 共 455 条

5月13日星期三

r/LocalLLaMA

有人把 Transformer 语言模型塞进了原装 Game Boy Color 里跑

maddiedreese 把 Andrej Karpathy 的 TinyStories-260K 模型成功跑在了一台没改过硬件的 Game Boy Color 上。他用 INT8 量化权重、定点数运算,把模型和 KV 缓存塞进 MBC5 卡带的 bank-switched ROM 和 SRAM 里,全程不靠手机、电脑、Wi-Fi 或云端推理。不过输出...

推荐理由:一个 Reddit 硬件 hack,把 TinyStories-260K 塞进原装 Game Boy Color,用 INT8 和定点数学跑推理,KV cache 放在卡带 SRAM 里。输出慢到没法用,而且基本是乱码,所以别当产品看。但能在这种老设备上把 transformer 跑起来,本身就挺酷,技术细节也给得实在,适合当一条有趣的行业花絮。

彭博科技

CME 打算推出算力期货,把 GPU 租赁变成可交易合约

芝加哥商品交易所(CME)和 Silicon Data 正在筹划一个算力期货市场,让计算资源像原油或玉米一样在交易所买卖。视频里讨论了这么做的逻辑和运作方式,但没公布合约的具体规格、上线时间,也没说价格怎么定。对 AI 公司来说,这相当于提前锁定 GPU 租用成本,不用再担心突然涨价或抢不到卡。不过现在信息还太少,正文没披露流动性由谁提供、用什么基准指...

推荐理由:我会先打个折:正文没披露合约怎么设计、什么时候上线、价格怎么定,所以现在只能当信号看。但信号本身挺有意思——CME 下场做算力期货,等于把 GPU 供应变成可交易的金融资产。对 AI 从业者来说,如果真能对冲算力价格波动,采购和预算会好做很多。这点先别太激动,等具体规格出来再判断。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

TechCrunch · AI

Google 和 SpaceX 在谈把数据中心搬上太空

Google 和 SpaceX 正在讨论建轨道数据中心,专门跑 AI 算力。SpaceX 今年晚些时候要搞 1.75 万亿美元的 IPO,需要这个“太空机房”的故事来撑估值。但先别太激动——TechCrunch 自己算过账,把卫星制造和发射成本算进去,现在太空机房的成本比地面贵得多。Google 也没把宝全押在 SpaceX 身上,同时在跟其他火箭公司...

推荐理由:Google 和 SpaceX 在聊把数据中心送上天,专门给 AI 跑推理用。听着像科幻,但确实在谈。我会先打个折:正文没披露成本差多少、什么时候能上、打算铺多大,所以别太激动。它更像一个信号——大厂在认真找地面以外的算力出路,这点值得留意。

FT · 科技

芝加哥商品交易所(CME)打算推出 AI 算力期货,让 GPU 租金也能像石油一样做对冲

CME 计划推出挂钩 GPU 租赁价格的期货合约,交易员和公司可以用它来赌未来算力成本涨跌,或者锁定成本做套期保值。不过这篇 FT 文章正文被付费墙挡住了,合约的具体规格、参考的租金指数、上线时间这些关键信息都没披露。

推荐理由:FT 报道 CME 计划推出 GPU 租赁价格期货,HKR 三项都踩中了:算力期货这个概念本身就够新鲜,机制上把算力成本变成可对冲的金融风险,而且正好打在 AI 从业者最焦虑的算力账单上。不过正文没给合约规格、上线时间和标的指数,信息缺口明显,所以放在 featured 而不是 P1。

5月12日星期二

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

机器之心 · 公众号

字节开源 DreamLite:0.39B 参数模型在 iPhone 上 3 秒出图,不用联网

DreamLite 是字节跳动开源的一个统一扩散模型,参数量只有 3.9 亿,能在 iPhone 17 Pro 上直接跑,生成或编辑一张 1024×1024 的图大约 3 秒。它靠 DMD2 蒸馏技术把推理压缩到 4 步,全程在手机本地完成,不依赖云端。正文没披露具体的显存占用和功耗数据,也没给出不同机型上的实测对比,所以“秒变画板”这个说法先打个折—...

推荐理由:字节把扩散模型压到 0.39B 参数,在 iPhone 17 Pro 上离线跑 1024×1024 生图和编辑,约 3 秒出结果,靠的是 4 步 DMD2 蒸馏把推理步数砍下来。我会先打个折:正文没披露功耗、内存占用和量化方案,也没给不同机型的对比,所以“手机秒变画板”这个说法先别太激动。但参数和实测平台都给了,比光喊口号实在。作为开源端侧方案,对在意离线、低延迟和隐私的开发者有参考价值,只是目前只有一篇 Reddit 帖子,没有论文或代码仓库链接,可信度要打个问号。

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

r/LocalLLaMA

把 prompt 缓存用到强化学习训练里:长提示短回复场景下,Qwen3.5-4B 训练速度提升 7.5 倍

作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...

推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。

r/LocalLLaMA

Reddit 网友用英特尔傲腾持久内存攒了一台机器,本地跑 1 万亿参数模型,速度超过 4 token/秒

Reddit 用户 APFrisco 分享了一套硬件方案:用 768GB 英特尔傲腾持久内存(Optane PMem)当主存储,搭配 192GB DDR4 ECC 内存和一张 12GB 显存的 RTX 3060 显卡,通过 llama.cpp 的混合推理(CPU+GPU),在本地跑起了 Kimi K2.5 这个 1 万亿参数模型的 Q2_K_XL 量化...

推荐理由:HKR 三项都成立:标题的反差感足够抓人,正文把硬件型号、量化版本和速度都列清楚了,而且对本地推理圈子的成本敏感用户有直接参考价值。不过这只是单个 Reddit 用户的分享,复现细节和稳定性都没展开说,所以分数就压在 featured 门槛上。

5月11日星期一

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。

量子位 · 公众号

OpenAI 签下 750 兆瓦算力大单,芯片公司 Cerebras 趁势把 IPO 估值抬到 350 亿美元

Cerebras 把 IPO 发行价区间上调到每股 150 到 160 美元,按上限算估值约 350 亿美元。直接推手是 OpenAI 刚签了一份 750 兆瓦的 AI 算力采购协议,交付排到 2028 年。不过原文因为微信环境验证拦截,正文内容没抓到,具体合同金额、交付节奏和 Cerebras 的财务数据都没披露,这个估值能撑多久还得看后续招股书细节。

推荐理由:这条不是普通的 IPO 消息。OpenAI 用 200 亿美元、750 兆瓦的采购协议给 Cerebras 站台,直接把估值推到 350 亿美元,等于在英伟达之外硬开了一条新路。我会先打个折:Cerebras 的芯片主打推理优化,跟英伟达的训练生态还不是一个量级,但 OpenAI 愿意砸真金白银,说明大客户已经在认真找备胎了。正文没披露这笔订单的具体年限和单价,所以 200 亿是总承诺额还是框架上限,这点先别太激动。对看算力成本和供应链安全的人来说,这条值得追。

量子位 · 公众号

马斯克申请 SpaceXAI 商标,要把 AI 算力搬上卫星

SpaceX 提交了 SpaceXAI 商标申请,覆盖的业务范围很广:卫星数据中心、轨道计算、AI 软件即服务、云存储、通信硬件,甚至还有社交网络。文章提到 xAI 已经通过全股交易成为 SpaceX 的子公司,并引用了一个 2500 亿美元的 xAI 估值。不过正文因为环境异常被屏蔽了,具体交易条款和商标申请细节都没披露,这个估值数字也先别太当真。

推荐理由:我会先打个折:目前只有商标申请文件,正文说xAI已并入SpaceX,但没披露交易条款或官方公告,这点先别太激动。商标覆盖范围很广,从卫星数据中心到AI SaaS都有,说明马斯克在铺路,但离真正跑起来还差落地细节。重要性给76、放featured是合理的,属于信号而非实锤重组。

AI HOT 精选

Cerebras IPO 被抢爆,超额认购超 20 倍,发行价打算上调近三成

路透社的消息说,做 AI 芯片的 Cerebras 准备上市,结果被投资人抢疯了,超额认购超过 20 倍。公司一看这架势,打算把发行价从原来的 115-125 美元提到 150-160 美元,涨了快三成,发行股票数量也计划从 2800 万股加到 3000 万股,最多能融到 48 亿美元。这可能会是 2026 年到现在全球最大的一笔 IPO。Cerebr...

推荐理由:这条消息的看点在于需求数字很实在,不是那种模糊的“市场反响热烈”。20倍超额认购和主动提价近三成,说明机构在拿真金白银赌Cerebras能分走AI训练/推理芯片的蛋糕。不过正文没披露具体估值和上市日期,所以先别把它当成行业转折点,更像一个强需求信号。我会先打个折,等正式挂牌再看。

AI HOT 精选

本地 35B 模型扛下作者一半日常工作,响应速度是云端 Claude Opus 4.5 的两倍

作者用五周时间测了约 1400 个日常工作请求,发现本地跑的 Qwen 3.6 35B 这类模型能搞定其中一半,平均响应 2.8 秒,比云端 Claude Opus 4.5 的 5.8 秒快了 2.1 倍。像邮件草拟、日程安排、摘要和行政杂活这些任务,本地模型完全够用;市场调研和工程类任务则是对半开,简单查数据、修脚本可以本地跑,复杂的多源分析和架构决...

推荐理由:Tom Tunguz 拿本地35B模型做了五周实验,跑了约1400项日常工作任务,成功处理约一半,平均响应2.8秒,比Claude Opus 4.5快2.1倍。这个结果对从业者来说很实在:不是模型发布,也不是平台级更新,但给出了本地模型在延迟和成本上替代云端模型的一个具体参照点。我会先打个折——正文没披露任务类型分布和失败案例的具体原因,所以50%成功率不能直接当通用结论用。但速度对比和实验规模足够让关注推理成本和隐私的人认真看一眼。

r/LocalLLaMA

MTP 实测:写代码能加速 71%,写小说反而变慢 9%,任务类型决定投机推理是帮忙还是帮倒忙

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试,发现投机推理(让模型先猜后验证)的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%,用 F16 精度跑代码生成速度提升了 171%;但换成创意写作,Q4_K_M 量化下推理速度反而慢了 9%。结论很直接:别只看模型和量化,先看你要让模型...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次实验,不是官方基准,但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显,创意写作接受率低、反而变慢,这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt,但数据量够大,可以先信一半。

5月10日星期日

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。