# 商汤绝影把32B总参、3B激活的模型塞进车机，跑分压过GPT-5.4和Opus 4.6

> 原标题：3B激活参数，干翻GPT-5.4和Opus4.6，商汤绝影把龙虾塞进了车里

- 来源：量子位 · 公众号
- 发布时间：2026-04-22T06:51:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8801
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247885436&idx=4&sn=adbc0d1af7ada4cbd1c729dbf4ed563f

## 摘要

商汤绝影发布了一个叫Sage的车载端侧多模态模型，总参数32B，但每次推理只激活3B参数。它在PinchBench上拿了94%，比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上，首字延迟约0.5秒，单token生成约0.03秒，吞吐80 tok/s。训练用了两个方法：SCOUT省了约60%...

## 推荐理由

我会先打个折：所有数据都是商汤自报，没有第三方复现，PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX，还给出了推理延迟和吞吐，这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数，缺训练规模和消融细节，先别太激动。整体看，信息量够、落地指向明确，但验证链不完整，所以重要性给 79，放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

## 锐评

这条新闻最值得看的是“3B激活参数跑车载端侧”这个思路，不是它宣称的跑分。商汤绝影的Sage模型总参数32B，推理时只激活3B，相当于把一个大模型塞进车里，跑在Nvidia OrinX上，首字延迟约0.5秒，单token生成约0.03秒，吞吐80 tok/s——这些数字说明它在车载硬件上确实能实时响应。训练上用了两个方法：SCOUT省了约60%的GPU小时，ERL让复杂任务完成率提高20%，但正文没解释这两个方法具体怎么工作，也没给出消融实验。

PinchBench上94%的分数比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高，但这里有个大坑：正文完全没披露PinchBench是什么基准、测了多少样本、有没有多轮工具调用场景。如果只是单轮问答或简单指令，这个分数对车载Agent的实际意义有限。车载场景真正难的是多步工具调用——比如“帮我找最近的充电桩，顺路买杯咖啡，避开拥堵路段”——这种任务对3B激活参数能不能稳住，正文没给任何证据。

另外，模型是端侧部署，但训练数据、安全对齐、极端场景表现这些关键信息全部缺失。商汤说这是“龙虾塞进车里”，我会先打个折：技术路线有看点，但验证太弱，等第三方评测或实际路测数据出来再说。
