# NVIDIA 发布 Star Elastic：一个模型文件能直接切出 30B、23B、12B 三种推理模型

> 原标题：NVIDIA AI Releases Star Elastic: One Checkpoint that Contains 30B, 23B, and 12B Reasoning Models with Zero-Shot Slicing

- 来源：r/LocalLLaMA
- 发布时间：2026-05-10T00:48:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16673
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t8s83r/nvidia_ai_releases_star_elastic_one_checkpoint/

## 摘要

NVIDIA 放出了一个叫 Star Elastic 的模型，一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型，不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程，30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上，这种...

## 推荐理由

我会先打个折：这还是个研究发布，不是大规模验证过的产品，影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型，而且 23B 负责思考、30B 负责回答这种分工方式，在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说，这种“一份权重、多种用法、精度可选”的思路，直接打中了成本和延迟的痛点，所以放在 featured 里是合适的。

## 锐评

NVIDIA 放出的 Star Elastic 模型，一个检查点文件里塞了 30B、23B 和 12B 三个尺寸的推理模型，不用再训练就能直接“切片”取用。玩法是把思考过程交给 23B 子模型，最终答案让 30B 模型出，在 AIME-2025、GPQA 等几个测试集上准确率涨了 16%，延迟降到原来的约 1/1.9。这对本地部署挺友好，一个文件覆盖多种精度和算力场景，省了来回下载切换的麻烦。

不过原文是 Reddit 帖子，点进去被网络策略挡了，看不到技术细节和完整评测。16% 的涨幅和 1.9 倍延迟降低具体在什么硬件、什么量化配置下跑的，功耗和吞吐量怎么样，这些都没披露。另外“零样本切片”听起来像直接从大模型里抽子结构，但子模型之间参数怎么共享、会不会互相干扰，正文也没解释。如果这些缺口补不上，实际效果得自己跑一遍才知道。
