跳到正文
AI HOT 精选

腾讯混元放出 Hy3 的 1-bit 和 4-bit 压缩版,295B 模型能在单张显卡上跑

腾讯混元发布 Hy3 1-bit 与 4-bit 版本

混元把 295B 参数的 Hy3 模型压成了 1-bit 和 4-bit 版本,通过 llama.cpp 加 MTP(多 token 预测)就能在单张 GPU 上运行。GGUF 格式的文件已经挂在 HuggingFace 上,可以直接下载。不过正文没给出具体的硬件要求、推理速度或精度损失数据,实际效果得自己跑一下才知道。

推荐理由:腾讯混元把 295B 的 Hy3 模型压成了 1-bit 和 4-bit 版本,靠 llama.cpp 加 MTP 推理就能在单张 GPU 上跑,GGUF 文件已经放出来了。这个压缩幅度很抓眼球,技术路径也够具体,从业者看完就能下载试。但我会先打个折——正文没披露精度掉了多少、跑起来多快、要多大显存,这些才是决定能不能真用在生产环境里的东西。所以这条消息值得关注,但别急着激动,等自己跑完 benchmark 再说。

读原文 ↗导出 Markdown