跳到正文
AI HOT 精选

腾讯混元把295B大模型压到单GPU能跑,发了1-bit和4-bit量化版

腾讯混元发布 Hy3 模型 1-bit/4-bit 量化版,单 GPU 可运行

混元Hy3是个2950亿参数的MoE模型,现在出了1-bit和4-bit两个压缩版,用llama.cpp就能在单张显卡上跑,还支持MTP加速推理。官方说这个尺寸下它表现最好,能跟万亿参数的大模型掰手腕,适合让模型进业务流程干活。模型走Apache 2.0协议,可以商用,OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少,也没说...

推荐理由:腾讯混元把2950亿参数的Hy3模型压到单GPU能跑,对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API,试错成本低。没给85分以上,是因为正文没披露量化后精度掉了多少,这点先别太激动。

读原文 ↗导出 Markdown