# 腾讯混元 Hy3 的 1-bit 量化：单卡能装下，离好用还有多远

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-16T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44921
- 原文：https://yage.ai/share/hy3-one-bit-single-gpu-20260716.html

## 摘要

腾讯给 295B 参数的混元 Hy3 模型做了 IQ1_M 量化，文件大小约 85.5 GiB，能塞进一张 96GB 显卡。但“1-bit”只是量化规格的名字，实际每个权重平均占 2.4 bit 左右，因为注意力、嵌入等关键层保留了更高精度。单卡跑起来，显存依然很紧：权重加上 64K 上下文的 KV cache 就吃掉近 94 GiB，只剩 2 GiB...

## 推荐理由

这是一篇动手实测，不是官方通稿。用真实数字回答了'装进一张卡之后还剩多少显存、速度怎么样、精度掉在哪'，三个维度都踩中了。但作为单篇技术评测而非官方发布，重要性给 74、tier 给 featured 是合理的。

## 锐评

腾讯给混元Hy3做的这个IQ1_M量化，名字叫1-bit，实际每个权重平均占2.4 bit左右，因为注意力、嵌入这些关键层没压那么狠。文件大小约85.5 GiB，确实能装进一张96GB显卡，但跑起来显存很紧：权重加上64K上下文的KV缓存就吃掉近94 GiB，只剩2 GiB给计算缓冲和显存碎片，官方配置也标了tight，说明只是能跑，不是跑得从容。

量化带来的能力损失，官方只说agent和代码有小幅回落，但没给BF16和IQ1_M在同一套评测下的完整对照。多步任务里任何一步偏差都可能被放大，普通问答看不出差异，不代表长程coding agent同样可靠。这点目前没有公开数据验证。

速度方面，社区测试在M3 Max上生成约23-25 tok/s，日常交互够用，但8K prompt的prefill要等近200秒，长上下文场景下首字等待才是瓶颈。已有96GB卡可以试着玩玩，没有的话别为这个单独买硬件，API可能更省心。
