# Thinking Machines 发布原生交互模型：2760 亿参数，120 亿激活，实时语音不再靠外挂

> 原标题：[AINews] Thinking Machines' Native Interaction Models - TML-Interaction-Small 276B-A12B - advances SOTA Realtime Voice and kills standard VAD

- 来源：Latent Space
- 发布时间：2026-05-12T04:33:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22439
- 原文：https://www.latent.space/p/ainews-thinking-machines-native-interaction

## 摘要

Thinking Machines 终于又冒泡了，这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿，是个 MoE 架构，实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里，不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想，用 200 毫秒一个的“微对话轮次”连续...

## 推荐理由

我会先打个折——基准分是 Thinking Machines 自己跑的，还没第三方复现，所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推，因为它给出了具体架构（276B MoE、12B 激活）、200ms 微轮次这个硬指标，还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说，哪怕只是思路参考也有价值。

## 锐评

这条新闻最值得看的是架构思路：TML-Interaction-Small 总参数 2760 亿，但实际干活只激活 120 亿，用 MoE 把成本压下来。它把音频和图像直接喂给模型，不经过单独的编码器，端到端延迟控制在 200 毫秒以内，这比传统“语音转文字→大模型→文字转语音”的流水线快得多，也更像人和人聊天。

团队自己做了几个新基准来测“时机感”，比如能不能在用户指定的时间点开口、能不能在视频里动作发生的瞬间给出反馈。这些指标比跑分更有参考价值，因为实时交互的难点不是回答对不对，而是开口的时机对不对。

不过正文没披露这个模型实际跑在什么硬件上、单次推理成本多少、有没有开源计划。演示视频很流畅，但真实网络环境和嘈杂场景下的表现还是未知数。另外，2760 亿参数即使只激活 120 亿，部署门槛也不低，小团队想用上可能还得等。
