# Thinking Machines 发布 Inkling：一个万亿参数、原生多模态的开源模型

> 原标题：Welcome Inkling by Thinking Machines

- 来源：Hugging Face 博客
- 发布时间：2026-07-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45366
- 原文：https://huggingface.co/blog/thinkingmachines-inkling

## 摘要

Inkling 是一个总参数量约 1 万亿（975B）、每次推理激活 41B 参数的混合专家（MoE）模型，能直接吃进文字、图片和音频，支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练，还内置了多 token 预测（MTP）投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本，Hugging...

## 推荐理由

Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型，规格写得挺满：975B 总参、41B 激活、100 万上下文、45T token 训练量，还自带投机解码加速。硬指标和实用性都有料，所以 H 和 K 都站得住。但团队没品牌积累，没故事可讲，R 这块确实弱，大家会先打个折观望。

## 锐评

Thinking Machines 发布的 Inkling 是个大块头：总参数约 9750 亿，但每次推理只激活 410 亿，属于混合专家模型。它最大的卖点是原生多模态，不用外挂插件就能直接理解文字、图片和音频，上下文窗口能塞进 100 万个 token，相当于一次能处理整部《三体》三部曲。

为了跑得快，它内置了多 token 预测投机解码层，还提供了压缩后的 NVFP4 版本，对显存会友好一些。Hugging Face 这边支持很到位，transformers、vLLM、llama.cpp 等主流框架上线第一天就能跑，覆盖了编程、视觉和音频任务。

不过，45 万亿多模态 token 的训练数据具体是什么、质量如何，正文没披露。这种规模的原生多模态模型，实际表现很依赖数据配比和清洗，所以基准跑分和真实场景的体验可能会有差距。另外，虽然激活参数只有 41B，但全量部署的门槛依然不低，个人开发者想本地跑还是得掂量一下硬件。
