跳到正文

#部署/工程

今日 3 条

6月1日星期一

AI HOT 精选

OpenAI 在密歇根州动工开建 1GW 数据中心,属于 Stargate 计划

OpenAI 联合 Oracle 等伙伴,在密歇根州 Saline 市破土动工一个叫“The Barn”的数据中心园区,总供电容量 1GW。官方承诺电费不会转嫁给当地居民,冷却系统用的是闭环设计,耗水量跟一栋普通办公楼差不多。项目预计带来超过 2500 个工会建筑岗位和 450 个长期现场岗位,还会向当地娱乐中心捐 1000 万美元,并在租期内产生约 ...

推荐理由:这条消息的钩子够硬:OpenAI 直接亮出 Stargate 在密歇根的 1GW 数据中心。1GW 这个数字说明供电规模很大,对推理和训练都有想象空间。但正文没给投资额、没给工期、也没说里面塞什么 GPU,信息缺口很明显。我会先打个折,因为缺的这些关键参数让实际落地时间表和成本结构都悬着,不能直接当投产新闻看。对从业者来说,这更像一个信号——OpenAI 在自建算力底座上继续加码,但离真正跑起来还有多远,正文没交代。

r/LocalLLaMA

网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s

一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...

推荐理由:这不是行业大新闻,但胜在是第一手实测,配置细节都给了:TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文,还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说,这些数字比官方宣传实在。HKR 三项都踩中,放在低 featured 位置刚好。

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

英伟达发布 PC 芯片,正式杀入 Windows 笔记本市场

英伟达推了一款面向 PC 的新芯片,要跟英特尔和 AMD 抢 Windows 笔记本的生意。不过这篇报道正文没披露具体规格、定价、上市时间,也没提 AI 算力指标,所以性能到底怎么样、卖多少钱、什么时候能买到,现在都还不清楚。

推荐理由:Bloomberg 的信源让消息可信,Nvidia 杀进 Windows 笔记本这件事本身就够有话题性,所以 H 和 R 都成立。但文章几乎没给任何硬指标,K 完全站不住。我会先打个折:这条更像一个信号,不是一份能拿来评估的发布,别太激动。

r/LocalLLaMA

有人把英伟达 Parakeet 语音转文字模型移植到了 ggml,不再需要 Python,还能量化压缩

开发者 mudler_it 把英伟达的 Parakeet 语音转文字模型用 C++ 和 ggml 重写了一遍,彻底甩掉了 Python 和 PyTorch。他测试下来,在 f32 和 f16 精度下输出结果和原版 NeMo 逐字节一致,但速度更快,大一点的 TDT 和混合模型在 GPU 上能跑到大约 5 倍加速。模型还支持 GGUF 量化,提供了 f1...

推荐理由:我会先打个折:这是个人移植项目,不是 NVIDIA 官方出品,长期维护和后续模型支持还得看社区。但亮点很明确——输出字节级对齐 NeMo,量化后跑得更快,而且不用碰 Python 环境。对想在树莓派、本地服务器或离线场景跑语音转文字的人来说,这是个省事的选择。正文没披露量化后的精度损失有多大,这点先别太激动。整体看,技术验证扎实,痛点打得准,放在 featured 低位合适。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

量子位 · 公众号

英伟达、微软、Arm 同发预告,传老黄自研 CPU 笔记本 N1X 要来了

三家公司在同一天发了同一张“PC 新纪元”的预告图,指向一台传闻中由英伟达主导设计的笔记本 N1X。目前流出的配置是 20 核 Arm 架构 CPU、Blackwell GPU、6144 个 CUDA 核心和 128GB LPDDR5X 统一内存,听起来像一台给 AI 开发者准备的移动工作站。不过正文没披露具体跑分和实测数据,内存带宽和 x86 转译效...

推荐理由:我会先打个折:这目前是三家同一天发暗示拼出来的硬件传闻,发布日期、价格、量产计划正文都没给。但“英伟达自研 CPU 塞进笔记本”这个组合拳,加上 128GB 统一内存这种能跑大模型的规格,确实值得当一条强信号来看。先别太激动,等实锤。

r/LocalLLaMA

我花 6400 美元搭了一台本地大模型服务器,一年下来比用 API 便宜了 700 多

作者晒了一台自组的本地大模型服务器,总花费 6406.45 美元,核心配置是 4 张 AMD MI100 显卡,主要跑 Qwen3.6 27B 模型。这台机器每天处理约 2040 万个输入 token 和 132 万个输出 token。他拿 OpenRouter 的 API 价格算了一笔账:第一年本地总成本(含电费)是 2992.72 美元,而调用同等...

推荐理由:这是一篇个人实测帖,不是厂商通稿。作者把账单摊开算:硬件折旧、电费、OpenRouter 比价,结论是首年能省 700 多美元。我会先打个折——这个结论绑定了他的特定负载(日处理 2000 多万 token)和二手 MI100 价格,换个人未必复现。但文章的价值不在普适性,而在把“自建推理服务器到底划不划算”这笔账算得清楚、可复现,对正在纠结买卡还是调 API 的人有参考意义。信息密度和话题性都够,放在 featured 低位合理。

AI HOT 精选

NVIDIA 用 DynoSim 给推理部署做模拟器,一次能跑几千种配置,速度是实时的 1500 倍

NVIDIA 给自家推理服务框架 Dynamo 配了个仿真工具 DynoSim,用 Rust 写成。它把部署测试变成“先在虚拟时间线上模拟、再挑最好的上真机”的流程,不用一个个试。测试里它能跑到实时速度的 1500 倍,一次筛几千种配置。正文没披露具体硬件环境、支持哪些模型和实测延迟数据,所以这个 1500 倍先打个折看——快是真的快,但省多少时间还得...

推荐理由:HKR 三项都成立:钩子是 1500 倍实时仿真,机制是虚拟时间线批量试配置,共鸣点打在推理成本和延迟上。单信源 NVIDIA 产品更新,信息量有限,放在 featured 低段合理。

5月30日星期六

r/LocalLLaMA

把一块 RTX Pro 6000 塞进 2016 年的戴尔 R730 服务器,跑 65 万 token 上下文

作者想把一块最新的 RTX Pro 6000 Blackwell 显卡装进一台 2016 年的戴尔 PowerEdge R730 服务器里,目标是搭一台能跑 65 万 token 上下文的本地 AI 盒子。过程不顺利:先要切掉风扇导流罩才能把卡塞进去,接着用双 riser 卡解决供电,然后系统卡在 PCIe BAR 分配上,根本认不到全部显存。后面就是...

推荐理由:HKR 三项都站得住:老服务器配新显卡跑 650K 上下文,玩法新鲜、细节扎实、对想省钱自建 AI 机器的人有参考价值。不过它终究是一次个人硬件折腾,不是产品发布或模型更新,所以重要性我给 72 分,放在 featured 里。

AI HOT 精选

xAI 放弃 JAX GPU,改用自研 C 语言训练框架

SemiAnalysis 爆料 xAI 已经不用 JAX 在 NVIDIA GPU 上训练模型了,转而用 Grok Build 写了一套 C 语言训练框架。报道说 xAI 的 JAX 方案模型浮点利用率(MFU)不到 10%,这个数字很低,意味着大部分算力都浪费在调度和通信上,没真正花在训练上。NVIDIA 的 JAX 团队过去两年几乎全员扑在支持 x...

推荐理由:xAI 换训练框架是个强钩子,MFU 不到 10% 这个数字够扎眼,但来源是单条推文,复现条件也没给,所以定在 80 分,不上 P1。我会先打个折看后续:如果真有实锤,这事对训练成本的讨论会很大。

机器之心 · 公众号

苹果搞了个叫 PICO 的图像压缩方案,画质不变,文件能小到三分之一

苹果发了篇论文介绍 PICO,一个用 AI 做图像压缩的编解码器。在主观画质差不多的情况下,它比 AV1、VVC 和 JPEG AI 省 57% 到 70% 的码率,也就是说文件体积能压到原来的三分之一甚至更少。在 iPhone 17 Pro Max 上跑,压一张 1200 万像素的照片要 230 毫秒,解压要 150 毫秒。正文没具体讲模型结构和训练...

推荐理由:HKR 三项都成立:PICO 有明确的 57%–70% 码率节省和 230 毫秒端侧编码数据,不是纯概念。但正文没提产品化时间,目前还是研究发布,所以分数放在 78–84 这个区间。

r/LocalLLaMA

网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速:vLLM 上推理速度提升 3.34 倍

一位老哥在 RTX PRO 6000 显卡上跑了 MTP(多 token 预测,一次猜好几个词来加速生成)的测试。他用 vLLM 跑 Gemma 4 31B 模型,开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个,快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...

推荐理由:这是一篇第一人称的硬核速度测试,有硬件型号、模型、框架和明确的 tok/s 对比,H/K/R 三点都踩中了。我会先打个折:来源是个人博客,权威性一般,而且质量、显存这些关键指标正文没披露,所以分数压在 featured 低位是合理的。

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

TechCrunch · AI

Nvidia 刚花 200 亿美元变相收购人才,AI 芯片公司 Groq 又传出要内部融资 6.5 亿,重心从硬件转向推理

Axios 的消息说,Groq 正在寻求 6.5 亿美元的内部融资,同时公司方向会从造芯片转向主攻 AI 推理,也就是优化模型接到指令后生成回答的那一步。这个动作发生在 Nvidia 被曝用 200 亿美元做了一笔“非收购式挖人”之后。正文没披露 Groq 现在的估值、投资人是谁、交易结构,也没说这轮融资的时间表。

推荐理由:这条消息本身有料:一家做推理芯片的明星公司,一边拿钱一边换赛道。但我会先打个折,因为正文没披露估值、谁在投、钱什么时候到账,这些关键信息都缺着。光靠一个融资意向和战略转向,还撑不起更高的判断。

5月29日星期五

新智元 · 公众号

DeepSeek 三款模型冲进 OpenRouter 月榜前十,总消耗超 17 万亿 Token

OpenRouter 的月度统计显示,DeepSeek 有三款模型进了前十,加起来的 Token 消耗量超过 17 万亿。其中 V4 Flash 一个模型就占了 9.13 万亿 Token,用量很猛。文章还提到华为昇腾的 MegaMoE 算子,在 DeepSeek V3.1 和 Qwen3-235B 的测试里,把预填充(Prefill)吞吐量提升了 2...

推荐理由:HKR三项都成立:17万亿tokens的钩子加上OpenRouter排名和昇腾Prefill提升的具体数字,信息量够。分数定在82,因为算力自主的叙事很强,但正文没披露测试的可复现条件,这点先别太激动。

r/LocalLLaMA

Liquid AI 发布 LFM2.5-8B-A1B,一个 80 亿参数、支持 12.8 万 token 上下文的模型

Liquid AI 放出了新模型 LFM2.5-8B-A1B。它用 380 亿个 token 做预训练,之后又做了大规模强化学习,上下文窗口能塞进 12.8 万个 token。词汇表翻了一倍,对非拉丁语系的 token 切分更友好。模型已经挂在 Hugging Face 上。不过 Reddit 原帖被网络策略挡了,正文没披露具体的基准跑分、推理成本和强...

推荐理由:我会先打个折:正文没给任何跑分、许可证和部署限制,所以别急着下结论。亮点是 8B/A1B 这个尺寸配 128K 上下文,38T token 的预训练量也算扎实,加上大规模 RL 调过,对想在本地跑长文本、又不想烧太多卡的人有吸引力。但没基准测试就没法判断实际水平,这点先别太激动。

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

彭博科技

三星开始向英伟达等客户寄送下一代 AI 内存芯片样品,声称抢到先发优势

三星电子已经开始向客户寄送其最先进的内存芯片样品,这些芯片将用于英伟达等公司的 AI 加速器。不过,正文因为 Bloomberg 的反爬机制没能抓到具体内容,所以芯片型号、客户名单、样品数量、定价和量产时间这些关键信息目前都看不到。

推荐理由:三星放话说自己先跑了一步,把最先进的 AI 内存样品送到客户手里了,Nvidia 这类加速器厂商是直接相关方。我会先打个折:正文没写具体是哪款芯片、给了谁、什么时候能量产,所以目前只能算一个供应链信号,还不是落地实锤。对关注硬件成本和 HBM 供应的人来说,这条值得看一眼,但别急着当定局。

彭博科技

Apollo 正为 Anthropic 拉一笔 360 亿美元贷款,用来买谷歌芯片

Apollo 和 Blackstone 在找其他投资人一起凑约 360 亿美元的债务融资,给 Anthropic 建 AI 基础设施。标题说这笔钱会用来买谷歌的芯片,但正文因为 Bloomberg 的反爬墙没抓到,具体买什么型号、多少量、什么时候交付都没披露。我会先打个折:360 亿这个数字很大,但它是债务融资不是纯股权,结构上可能带杠杆,实际落到芯片...

推荐理由:Bloomberg 这条消息把三件事串起来了:Anthropic 要算力、Apollo 和 Blackstone 出钱、钱指定买 Google 芯片。360 亿这个数字很大,但正文没写具体买什么芯片、分几年执行,所以我会先打个折——这更像是一个融资框架,不是已落地的采购单。对从业者来说,看点在于:一,AI 实验室开始用债务而不是股权来扛算力成本,杠杆风险怎么算;二,Google 芯片在这个单子里替代了 NVIDIA 的位置,如果属实,对供应链是个信号。标题里的“购买 Google 芯片”是钩子,但信息缺口也很明显,别急着当定论。

AI HOT 精选

苹果想把谷歌数万亿参数的 Gemini 模型压缩进 iPhone,给新 Siri 当大脑

苹果正在尝试用模型蒸馏技术,把谷歌那个参数规模大到数万亿的 Gemini 模型缩小,塞进 iPhone 里本地运行,用来驱动新版 Siri。但 Ars Technica 的报道也泼了盆冷水:因为原始模型实在太大,完全在手机本地跑通的可能性很低,大概率还是得搭配云端处理。正文没披露具体的蒸馏方案、参数目标、延迟要求,也没给出发布时间表。

推荐理由:我会先打个折,因为这只是个爆料,不是已发布的产品。文章给了蒸馏方案和“云端大概率必需”的判断,但没披露模型压缩后的具体尺寸、延迟数据或上线时间,所以信息量够上 featured,但别当实锤看。

5月28日星期四

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

r/LocalLLaMA

Zai 把 GLM-5.1 推理集群的网络架构换了,吞吐量提了 15%

Zai 在一个千卡规模的 GLM-5.1 代码推理集群上,把原来的 ROFT 网络拓扑换成了自研的 ZCube。硬件、软件栈和模型都没变,但交换机与光模块成本降了 33%,GPU 推理吞吐量提升了 15%。在把输入理解(prefill)和内容生成(decode)拆开跑的部署模式下,首个 token 的 P99 尾部延迟也砍掉了 40.6%。不过帖子正文...

推荐理由:HKR 三项都踩中了:GLM-5.1 推理集群的成本、吞吐和延迟数字都很具体,40.6% 的延迟降幅是个强钩子。不过来源只有 Reddit 单帖,且话题偏 infra 细分,所以定在 78 分。

r/LocalLLaMA

一张 RTX 3060 12GB 跑通 Qwen3.6-35B-A3B,128K 上下文生成速度 37 token/秒

用户 old-mike 在一张 RTX 3060 12GB 显卡上,用 spiritbuun 的 llama.cpp 优化分支和 mudler 的 APEX 量化模型,成功跑起了 17.3GB 的 Qwen3.6-35B-A3B。在已填充 72K 上下文时,生成速度达到 37.17 token/秒;上下文塞到 129K 时,速度仍有 28.08 tok...

推荐理由:HKR 三项都踩中了。一个 Reddit 用户用消费级显卡跑通 35B 大上下文,还给出了速度和困惑度,对本地推理圈子是实打实的参考。信息来自单篇帖子,影响范围也就在本地推理场景,所以放在 featured 而不是 P1。

AI HOT 精选

Mistral 在 AI Now 峰会上公布工业 AI 路线图,Vibe 升级,并在巴黎郊区建推理数据中心

Mistral 在自家峰会上主要说了三件事。第一,他们和空客、宝马、ASML 合作搞工业 AI,让模型进到设计、制造这类业务流程里干活,但具体怎么落地、效果如何正文没细讲。第二,Vibe 这个能处理长周期任务的 AI 助手迎来升级,具体能力变化也没展开。第三,他们要在巴黎南边的 Les Ulis 建一个 10 兆瓦的推理数据中心,计划 2026 年第三...

推荐理由:我会先打个折:这次没发新模型能力,也没给定价细节,所以重要性卡在 featured 门槛上。但 Mistral 把数据中心规格(10 MW)和时间表(2026 Q3)都摊出来了,还绑定了空客、宝马、ASML 这些实打实的工业客户,比纯概念发布实在。正文没披露推理成本的具体数字,这点先别太激动。整体看,对做工业 AI 和关注欧洲算力布局的人值得扫一眼。

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。

新智元 · 公众号

清华团队开源 PilotDeck:让多个 AI 分工干活,Token 成本砍掉七成

清华 NLP 实验室、面壁智能、OpenBMB 和 AI9stars 一起放出了 PilotDeck 的开源代码。这套系统让多个 AI 子代理分工协作,各自有独立的工作区和可编辑的记忆库,每次任务还会留下调度日志。文章里举了个例子:在小红书内容生成测试里,用 PilotDeck 把成本从 12.58 美元压到了 2.83 美元,相当于省了 77% 的 ...

推荐理由:我会先打个折,标题里“彻底凉了”是流量话术,但正文确实给了硬数据:子 Agent 路由在小红书内容生成场景把成本从 12.58 美元压到 2.83 美元,降幅接近 77%。如果是真的,对跑 Agent 工作流的人来说挺省钱。不过正文没披露这个数字是在什么规模、什么模型上测的,也没说延迟有没有变差,这点先别太激动。整体是个有具体成本锚点的工具发布,不是大模型或平台级动作,所以分数放在 78–84 区间是合理的。

机器之心 · 公众号

Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL,想把参数量、数据量、训练步数这些变量塞进同一个框架里

正文因为微信环境异常被屏蔽了,具体技术细节看不到。从标题和已有英文摘要看,这篇论文提出了一种叫 UNSL(统一神经缩放定律)的多变量公式,不再只看模型参数或数据量单一维度,而是同时建模参数量、token 数、训练步数,还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里,UNSL 在 60.87% 的视觉任务和 88.89% 的语...

推荐理由:这篇不是又一个刷榜的 scaling law,而是把之前各自为政的变量(参数量、token 数、步数、瓶颈、过拟合、超参数反作用)捏到了一起。我会先打个折:视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到,但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大,这点先别太激动。如果是真的,训练前就能更准地估出该堆参数还是堆数据,省钱。

TechCrunch · AI

Snowflake 跟 AWS 签了 60 亿美元的五年长约,专门锁定 AI 芯片算力

Snowflake 和 AWS 敲定了一笔 60 亿美元、为期五年的合同,用来确保 AI 芯片的供应。原文没披露具体芯片型号、交付时间,也没说这批算力是拿来做模型训练、跑推理还是两者都有。对 AWS 来说这是个大单,对 Nvidia 则是个信号——大客户在找替代方案。不过正文信息有限,具体怎么用、能省多少成本都还没谱。

推荐理由:这条消息我会先打个折:60 亿数字很唬人,但正文没说是哪款芯片、怎么交付、用来训练还是推理,所以只能当个信号看。如果是真的,Snowflake 在算力上省一笔钱,但也把自己跟 AWS 绑得更紧。对同行来说,这单子说明大客户在认真找英伟达以外的选项,但实际效果还得等更多细节。

r/LocalLLaMA

一台 300 美元笔记本跑 Qwen 3.5 35B 模型,推理速度跑到每秒 10.33 个 token

一位 Reddit 用户在一台 300 美元买的联想 Ideapad Slim 3i 上,用纯 CPU 跑 Qwen 3.5 35B 模型(Q4_K_S 量化版),推理速度达到了每秒 10.33 个 token。这台机器是 i3-1215U 处理器,板载 8GB 内存加一条 32GB DDR4 扩展内存。能跑出这个速度,主要靠几个操作:用 ik_lla...

推荐理由:我会先打个折:这是 Reddit 单帖,不是系统评测,复现性存疑。但信息本身很实在——一台 300 美元的联想轻薄本,用双核 CPU 跑 35B 参数的模型,推理速度能到每秒 10 个 token 出头。这个数字说明,如果场景对延迟要求不高,极低成本硬件也能把大模型跑起来。正文没披露上下文长度和内存占用,这点先别太激动。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

5月27日星期三

AI HOT 精选

Perplexity 开源 Unigram 分词器,CPU 占用降了五六倍

Perplexity 把自家重写的 Unigram 分词器开源了,放在 pplx-garden 仓库里。这个分词器主要解决一个实际问题:现在小型的重排序模型和嵌入模型在 GPU 上跑一次只要几毫秒,但 CPU 分词那一步反而成了拖后腿的环节。他们这次重构后,CPU 占用直接降了 5 到 6 倍,等于把分词这步的延迟砍掉一大截,让整体响应更快。正文没提具...

推荐理由:我会先打个折:正文没给独立基准测试、代码仓库细节和实际部署规模,所以 5-6 倍这个数字先别太激动。但分词器确实是重排序和嵌入模型里容易被忽略的 CPU 消耗大户,Perplexity 把这块开源出来,对跑生产 RAG 和搜索管线的团队来说,省下来的算力就是省下来的钱。

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

新智元 · 公众号

OpenRouter 月吞 100 万亿 Token,刚拿了 1.13 亿美元 B 轮融资

OpenRouter 做的是 AI 模型的“中转站”,用一个 API 就能调用 400 多个模型。现在每周处理 25 万亿 Token,一个月差不多 100 万亿。这轮融资由 CapitalG 领投,估值到了 13 亿美元。正文没披露具体盈利和成本结构,所以“赚爆了”这个说法先打个折,但流量规模确实大。

推荐理由:这条融资消息我会先打个折,毕竟不是技术突破,但100万亿月token这个量级确实把“模型路由”这门生意做实了。正文没披露利润率或抽成比例,所以别急着说它暴利,但400多个模型接入、每周25万亿token的吞吐量,说明开发者已经在用脚投票。对从业者来说,这比某个新模型跑分更有参考价值——它告诉你钱和流量正往基础设施层聚。

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

Latent Space

AI 推理基础设施又出百亿美金独角兽:Fireworks 估值 150 亿,Baseten 估值 110 亿,OpenRouter 融了 1.13 亿

这周 AI 圈的钱主要涌向了推理层。Fireworks 正在谈一轮估值 150 亿美元的融资,7 个月内估值涨了 3.75 倍;Baseten 也在以 110 亿美元估值募资,3 个月翻 2.2 倍。这两家都还没正式官宣,数字先别太当真。已经落定的是 OpenRouter 的 1.13 亿美元 C 轮融资,他们 6 个月内周调用量从 5 万亿 toke...

推荐理由:这条消息把三家推理服务商的估值摆在一起看,Fireworks 和 Baseten 还在谈,OpenRouter 已经拿钱且用量涨得很快。我会先打个折,估值数字本身是谈判口径,不代表最终成交价,但能看出资本在往推理层集中砸钱。对从业者来说,这直接关系到未来用谁的 API、成本怎么走,以及这些平台会不会变成新的流量入口。正文没披露具体营收或利润率,所以别急着喊泡沫,但估值确实不低。

AI HOT 精选

高通要给字节跳动做定制 AI 芯片,订单量在百万颗级别

彭博社的消息人士说,高通和字节跳动签了一份 AI ASIC 合作协议。ASIC 就是按特定需求定制的芯片,不像 GPU 那样通用,但干专一的活更省电、效率更高。字节跳动会向高通采购数百万颗这种定制芯片,用来跑自己的 AI 服务。另一个消息源提到,这笔交易能帮字节跳动把内部已经设计好的芯片方案,变成真正可以量产的半导体。不过正文没披露具体芯片规格、单价、...

推荐理由:这条消息的钩子很硬——高通和字节跳动、AI ASIC、百万颗级别采购,三个关键词一摆,从业者很难不点。我会先打个折:正文除了“数百万颗”这个量级,什么都没披露,芯片规格、单价、交付节奏、是否量产全是空白,所以别急着当定论。但即便只是传闻,它同时戳中了推理降本、中国算力替代和中美供应链博弈三条线,话题性够强,放在 featured 里合理。

彭博科技

Fireworks AI 正谈新一轮融资,估值冲到 150 亿美元

彭博社援引知情人士消息,Fireworks AI 正在谈一笔新融资,投后估值可能达到 150 亿美元。这家公司主要做模型推理和微调服务,帮企业跑开源模型时更快、更省钱。不过正文没披露这轮具体要融多少钱、哪些投资方在谈,也没给时间表。150 亿这个数字放在当前 AI 基础设施赛道里算很高了,但先别太激动——谈判还在进行,条款可能变,最后能不能落定还不一定。

推荐理由:Bloomberg 先爆出来的消息,还在谈,没签。150 亿美元估值听着挺高,但正文没写这轮要融多少钱、谁在跟投、什么时候 close,所以先别太激动。我会打个折放进 featured 低位,等具体条款出来再调。