# Google 开源 Tunix：一个让 TPU 在训智能体时不再干等的 JAX 库

> 原标题：Google 推出 Tunix：基于 JAX 的高吞吐智能体后训练库

- 来源：AI HOT 精选
- 发布时间：2026-07-21T16:00:05.337Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45678
- 原文：https://developers.googleblog.com/scaling-agentic-rl-high-throughput-agentic-training-with-tunix

## 摘要

Google 放出了 Tunix，一个基于 JAX 的智能体后训练库，专门解决用强化学习训智能体时 TPU 摸鱼的问题。核心思路是把“让模型干活”和“让模型学习”这两件事拆开：模型在等工具返回结果（比如等一次网页搜索）的时候，推理引擎立刻切去给另一个活跃的智能体生成回答，不让芯片闲着。生成好的回答会通过一个动态的生产者-消费者管道，边攒边往训练器里送，...

## 推荐理由

Google 发了个 JAX 库，用生产者-消费者管道把智能体等待工具返回时的 TPU 空闲时间利用起来，直接解决 RL 训练里芯片摸鱼的问题。对做训练基建的团队是个实用的参考，但本质是开发者博客的技术发布，不是产品或模型，所以重要性刚好卡在 featured 门槛上。

## 锐评

Tunix 解决的是一个很实际的工程痛点：用强化学习训智能体时，模型经常要等外部工具（比如搜索、代码执行）返回结果，这段时间 TPU 就闲着。Tunix 的做法是把“干活”和“学习”拆开，当一个智能体在等工具时，推理引擎立刻切去给另一个活跃的智能体生成回答，不让芯片摸鱼。生成好的回答会边攒边往训练器里送，训练器不会断粮。

这个思路不新，但 Google 把它做成了基于 JAX 的库，还集成了 vLLM-TPU 和 SGLang-Jax，对用 TPU 的团队可能省不少事。另外它自带轻量级监控，能把训练循环的宏观指标和 TPU 时间线对上，方便找瓶颈。

不过正文没给开源仓库链接，也没放吞吐量提升的具体数字或基准测试结果。到底能省多少算力、在什么规模的智能体任务上有效，都得等实际跑起来才知道。
