# Mira 的新公司 Thinking Machines 发了个原生多模态交互模型，前台 200 毫秒一响应，后台跑长线推理

> 原标题：Thinking Machines发布原生多模态"交互模型"，实现实时人机协作

- 来源：AI HOT 精选
- 发布时间：2026-05-12T02:19:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17699
- 原文：https://x.com/op7418/status/2054023602874491326

## 摘要

这个模型把音频、视频、文字直接吃进去，不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入，保持对话的实时感，用户可以随时打断；后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本，也没给评测对比，所以实际效果和泛化能力还得看后续公开信息。

## 推荐理由

我会先打个折：正文没披露定价、开放范围和具体 benchmark，所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重，而是给了一套前台 200 毫秒交互节点加后台推理的分层设计，原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说，至少提供了一个可参考的架构思路，但没看到代码或论文之前，不宜再往上拉。

## 锐评

Mira Murati 离开 OpenAI 后搞的 Thinking Machines 终于亮出了第一个产品。这个模型最大的卖点是原生多模态，音频、视频、文字一口吃进去，不用像现在很多方案那样靠 agent 把语音识别、视觉、语言模型串成流水线。架构上分了两层：前台交互模型每 200 毫秒处理一次输入，保证对话不卡顿，用户可以随时插话打断；后台推理模型负责长程规划和调工具。这种设计思路挺务实，把实时交互和重度推理拆开，各干各的。

但正文没披露任何硬指标。参数量多大、训练数据从哪来、推理成本多少、跟 GPT-4o 或 Gemini 的对比评测，一概没有。200 毫秒的响应间隔听起来不错，可如果后台推理要等好几秒，前台再快也只是在拖时间。另外，原生多模态听着高级，实际能不能稳定处理嘈杂环境下的语音、模糊视频画面，还得看后续公开的测试结果。

现在还缺的是第三方实测和开放试用。光靠一篇公告没法判断这个模型到底比现有方案强在哪，建议等有公开 benchmark 或 demo 再下结论。
