# 腾讯混元把295B大模型压到单GPU能跑，发了1-bit和4-bit量化版

> 原标题：腾讯混元发布 Hy3 模型 1-bit/4-bit 量化版，单 GPU 可运行

- 来源：AI HOT 精选
- 发布时间：2026-07-14T08:53:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44250
- 原文：https://x.com/TencentHunyuan/status/2076953120765280284

## 摘要

混元Hy3是个2950亿参数的MoE模型，现在出了1-bit和4-bit两个压缩版，用llama.cpp就能在单张显卡上跑，还支持MTP加速推理。官方说这个尺寸下它表现最好，能跟万亿参数的大模型掰手腕，适合让模型进业务流程干活。模型走Apache 2.0协议，可以商用，OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少，也没说...

## 推荐理由

腾讯混元把2950亿参数的Hy3模型压到单GPU能跑，对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API，试错成本低。没给85分以上，是因为正文没披露量化后精度掉了多少，这点先别太激动。

## 锐评

腾讯把自家旗舰模型Hy3做了1-bit和4-bit压缩，用llama.cpp就能在单张显卡上跑，硬件门槛直接从数据中心降到个人工作站。官方说这个尺寸下它表现最好，能跟万亿参数的大模型掰手腕，还支持MTP加速推理，走Apache 2.0协议可以商用，OpenRouter上给了两周免费API。但正文没披露量化后精度损失的具体数字，也没说单卡到底需要多大显存——是24GB的消费级卡还是48GB的专业卡，差别很大。2950亿参数的MoE模型，激活参数大概在几十亿到上百亿，压缩到1-bit后推理质量掉多少，能不能真在业务场景里顶用，得自己跑一遍才知道。另外，适合让模型进业务流程干活这个说法，也需要看具体任务和延迟要求，别被单卡部署这个卖点带跑了。
