跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 281–300 条 · 共 455 条

5月10日星期日

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

Redis 作者用几千行 C 代码把 DeepSeek V4 Flash 塞进 MacBook,跑出 27 tok/s

Antirez 开源了一个叫 ds4 的推理引擎,专门给 DeepSeek V4 Flash 用。代码只有几千行 C,能在 128GB 内存的 MacBook Pro 上跑 100 万 token 上下文的模型。他用了三招:对 MoE 专家做不对称 2-bit 量化来压缩模型体积;把 KV Cache 搬到高速 SSD 上,绕开内存不够的问题;再给苹果...

推荐理由:Antirez 开源了一个叫 ds4 的原生推理引擎,几千行 C 代码,在 128GB 内存的 MacBook Pro 上跑 DeepSeek V4 Flash,1M 上下文实测跑到 27 tok/s。我会先打个折,这个速度是在特定硬件和模型上跑出来的,换台机器不一定能复现,但至少证明了不用显卡也能把大模型跑起来。正文没披露量化精度和功耗,这点先别太激动。整体看,这是一个很强的开源推理信号,对关注本地部署和隐私的团队有参考价值。

r/LocalLLaMA

用 12GB 显存跑 Qwen3.6 35B A3B,llama.cpp MTP 实测跑到 80 tok/s、128K 上下文

Reddit 用户 janvitos 在 RTX 4070 Super(12GB 显存)上跑 Qwen3.6-35B-A3B-MTP-GGUF,搭配 llama.cpp 的一个 MTP 拉取请求。他贴出的实测数据是每秒 69.2 到 81.9 个 token,草稿接受率在 0.694 到 0.947 之间,上下文长度拉到 131072。关键设置是 -f...

推荐理由:这条帖子是单用户实测,不是官方数据,验证强度有限,但数字和配置都摆出来了,可复现。对想在家用显卡上跑长上下文模型的人来说,是个很具体的参考点。我会先打个折,毕竟只有一个人晒结果,但 12GB 显存跑 35B 还能 80 tok/s,这点确实让人想试试。

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

新智元 · 公众号

英伟达、AMD、英特尔罕见联手,给 RadixArk 投了 1 亿美元种子轮

RadixArk 在 5 月 5 号宣布拿了 1 亿美元种子轮,投后估值 4 亿美元。领投的是 Accel,Spark Capital 跟投,更少见的是英伟达、AMD、英特尔这三家芯片厂同时出现在投资人名单里,联发科和 Databricks 也参与了。正文因为微信环境验证没抓到具体内容,没法展开说他们到底做什么、钱怎么花,但光看这个阵容,大概率是跟 A...

推荐理由:这条消息的硬核在于钱和站队:1亿美元种子轮、4亿美元投后估值,英伟达、AMD、英特尔三家芯片厂同时出现在投资人名单里,这在AI基础设施赛道不常见。我会先打个折——正文没披露产品性能基准、客户验证或开源项目的实际采用数据,所以目前只能当一笔高关注度的融资来看。对从业者来说,看点不是金额本身,而是三家互相竞争的芯片厂为什么愿意一起押注推理优化,这背后可能指向算力成本、模型部署效率的痛点。信息缺口也很明显:没写团队背景、技术路线和落地案例,后续如果有产品实测或客户名单,价值会更高。

AI HOT 精选

DeepSeek 正以 500 亿美元估值融资 70 亿,创始人自己掏了 30 亿

DeepSeek 这轮最多要融 70 亿美元,估值 500 亿,是中国 AI 公司里单轮金额最高的一次。创始人梁文锋个人出了 30 亿,占这轮融资的 40%,融完后他手里还有公司 90% 的股份。DeepSeek 最早是从他自己的对冲基金里孵化出来的。这笔钱主要用来买算力、推 V4.1 新模型,以及做企业级产品,目标是让公司开始有正向收入,路线跟 Op...

推荐理由:这条消息的钩子是梁文锋个人砸 30 亿美元,不是常规融资通稿。数字够具体,能让人算出估值和出资比例。不过正文没披露领投方、具体条款和官方确认,只有单一信源,所以我会先打个折,不把它当定论。对从业者来说,这轮融资如果属实,说明 DeepSeek 在走一条靠创始人重注维持独立性的路,跟 OpenAI 那种外部巨头主导的模式不一样,这点值得留意。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

The Verge · AI

AI 数据中心扩张引发全美争议:43% 美国人认为电费上涨要怪它们

The Verge 梳理了 AI 数据中心在全球引发的冲突。调查显示 43% 的美国人把电费上涨归咎于数据中心;犹他州一个占地 4 万英亩的项目不顾社区反对获批;Anthropic 宣布将在美国投入 500 亿美元建 AI 数据中心。报道还提到,数据中心附近的电费最高涨了 267%,俄勒冈州的数据中心被怀疑与当地癌症和流产率上升有关,而美国最大的电网系...

推荐理由:这是 The Verge 的一篇动态汇总,不是单一重磅事件,但里面塞了不少硬数字:43% 的民调归因、4 万英亩土地审批、500 亿美元资本开支计划。我会先打个折,因为它更像信息拼盘,不过这些电网和成本数据对从业者判断基础设施风险挺有用,所以放在行业报道的上限位置。

彭博科技

Anthropic 跟 Akamai 签了 18 亿美元的算力合同

Anthropic 和 Akamai 达成了一笔 18 亿美元的计算资源交易,用来应对自家 AI 软件越来越大的算力需求。不过正文被付费墙挡住了,没披露具体买了多少算力、合同签了几年、以及这些服务器会部署在哪些地区。

推荐理由:我会先打个折:正文没写具体买了多少算力、合同签了几年、部署在哪些地区,所以没法判断单价划不划算。但 18 亿美元这个量级,加上 Akamai 这家做 CDN 的公司突然杀进 AI 算力生意,本身就值得留意。对从业者来说,这至少说明 Claude 的推理负载在猛涨,Anthropic 在云厂商之外找第二条算力腿。这点先别太激动,等具体规模出来再算账。

AI HOT 精选

EMO:让专家模型自己长出模块,用八分之一专家就能干活

AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...

推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。

5月8日星期五

r/LocalLLaMA

Gemma 4 26B 在单张 RTX 5090 上跑到每秒 600 token

chain-77 用 vLLM 0.19.2rc1 测了 Gemma 4 26B,开了 DFlash 投机解码后,单张 RTX 5090 的输出吞吐从每秒 228 token 跳到 578 token。测试条件是输入 256 token、输出 1024 token、并发数 1、投机 token 数设为 13。这个速度意味着本地跑 26B 模型已经可以做...

推荐理由:这条帖子本身是单次测试,没对比其他卡或并发场景,所以我会先打个折。但一张消费级显卡把 26B 模型输出速度翻了一倍多,这个提升幅度够实在,而且给了可复现的版本号和参数,对想在家跑大模型的人有参考价值。

机器之心 · 公众号

SGLang 团队拿了 1 亿美元种子轮,成立新公司 RadixArk,要做开放的 AI 基础设施

SGLang 的团队新成立了一家公司叫 RadixArk,5 月 5 号宣布完成 1 亿美元种子轮融资,投后估值 4 亿美元。SGLang 是一个开源的模型推理框架,目前在 GitHub 上有超过 2.7 万颗星,部署的 GPU 超过 40 万张。不过,这篇微信文章因为环境异常被屏蔽了,正文内容没拿到,所以具体的产品方向、团队背景和这笔钱怎么花,暂时都...

推荐理由:这条消息的看点在于钱和团队背景。1 亿美元种子轮在 AI infra 领域不多见,而且 SGLang 本身有 2.7 万星和 40 万张 GPU 的部署量,不是凭空画饼。不过正文对 RadixArk 具体要做什么产品、跟现有 SGLang 项目怎么分工,讲得比较模糊,更像融资公告加路线图预告。我会先打个折,把它放在 featured 里但不到更高档,因为目前还缺产品细节和客户验证。

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

FT · 科技

科技巨头砸了7250亿美元搞AI基建,自由现金流跌到十年最低

FT这篇付费文章正文被锁了,只从标题和摘要片段能看出几个关键信息:硅谷大厂们过去在AI基础设施上累计花掉了7250亿美元,这个数字直接把它们的自由现金流压到了近十年的最低点。以前这些公司是轻资产、现金牛的玩法,现在被迫转型成重资产的基建投资者。但文章没披露具体是哪几家公司、统计的时间跨度、以及自由现金流是按什么会计准则算的,这些缺口让数字的横向可比性打...

推荐理由:标题把 7250 亿 AI 基建投入和十年最低自由现金流绑在一起,冲突感很强,成本与回报的账本焦虑一下就出来了。正文没披露具体公司名单、统计周期和会计口径,所以数字的精确边界还不清楚,我会先打个折。但即便口径模糊,这个量级的支出对比已经足够让从业者关注基建烧钱能不能回血,时效性和话题性都在。

r/LocalLLaMA

单张 4090 跑出 11.67%:TOPAS 递归架构在 ARC-AGI-2 上的本地测试结果

Doug_Bitterbot 用一张 RTX 4090 训练了大约 14 天,让 TOPAS 模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。这个模型只有 1 亿参数,本地跑分最高到过 36%,但它的递归测试时训练(TTT)机制在 Kaggle 的题目上出了问题,将近一半的谜题直接输出空结果。作者觉得调一下阈值、再训 3 到 5...

推荐理由:Doug_Bitterbot 在 Reddit 上发了个帖子,说他的 TOPAS 架构在 ARC-AGI-2 公榜拿了 11.67%,跑在一张 RTX 4090 上,训练大概花了 14 天。模型参数约 100M,本地 checkpoint 能到 36%,但 Kaggle 提交时因为递归 TTT 超时,近一半题目输出空数组,分数被拉低。作者自己预期调一下阈值能到 20%,还说 3-5 周后再训完。这事有意思的地方在于,它只用输入图片来决定怎么压缩视觉 Token,多轮 VQA 里能砍掉 90% 的 Token,正文说精度不掉。不过目前只有一篇帖子,K...

彭博科技

英伟达计划向数据中心公司 IREN 投资最多 21 亿美元,联手建 AI 基础设施

英伟达和 IREN 签了份 AI 基础设施合作协议,英伟达会投进最多 21 亿美元。这笔钱用来一起建 AI 数据中心,但公告没写具体占多少股份、分几期付款,也没提建成后能增加多少算力。

推荐理由:彭博信源加上英伟达最高 21 亿美元的投资,HKR 三项都站得住。信息只到金额和合作方向,没给股权、付款和容量细节,所以停在 featured 档。

The Verge · AI

SpaceX 要在德州砸 550 亿美元建 AI 芯片厂

SpaceX 在奥斯汀的“Terafab”芯片工厂计划投资至少 550 亿美元,一份听证会文件显示后期总投资可能拉到 1190 亿美元。马斯克 3 月说过目标是年产能支撑 200GW 算力的芯片,但正文没披露具体用哪种制程工艺。

推荐理由:这条消息的钩子就是 SpaceX 跨界造芯片,数字大得离谱,所以 HKR 全中。我会先打个折:正文没披露工艺节点、时间表和已签约客户,没法判断是动真格还是画饼。550 亿到 1190 亿的投资区间,以及 200GW 算力目标,如果是真的挺省钱——但前提是得先有厂、有客户、有产能爬坡,这些信息目前全是缺口。

AI HOT 精选

冻结模型里藏着可读的行为信号,Cygnus 靠适配器把 Qwen-32B 的 ARC 得分从 82% 拉到近 95%

Proprioceptive AI 搞了个叫 Cygnus 的技术,给已经冻结的大模型外挂一个自感知适配器,不重新训练就能读出模型内部残留的行为信号。做法是把隐藏状态投影到一个用 gl(4,R) 李代数定义的数学空间里,从中分离出他们称为“暗模式”的精度信号。拿 Qwen-32B 试了一下,只用一张 RTX 3090,ARC-Challenge 准确率...

推荐理由:HKR 三项都成立:12.77 个点的提升数字扎实,李代数投影的做法够新,压缩 90% 视觉 Token 对实际部署很省钱。但来源是 X 上的帖子,正文没给出完整评测集和对照实验,复现性存疑,所以只给低 featured。真正值得盯的是后续有没有第三方复现,如果复现成立,这个“冻结模型+适配器”的省钱路线对多模态推理会是实打实的利好。