General Instinct 开源 InstinctRazor:把 245GB 的大模型压到 48GB,能在本地设备上跑
Launch HN: General Instinct (YC P26) – Frontier models on edge devices
General Instinct 开源了 InstinctRazor,一个专门给边缘设备用的模型压缩方案。他们拿 Qwen3.5-122B-A10B 开刀,这个模型原本是 BF16 格式的混合专家模型(MoE),体积大约 245GB。压缩后变成一个 48GiB 的 GGUF 文件,比 Gemma-4-26B-A4B 还小,但在 MMLU-Pro 和 G...
推荐理由:我会先打个折:这是 YC 的 Launch HN,不是独立评测,性能数据得等第三方复现。但亮点很实在——把一个 245GB 的 MoE 模型压到 48GiB,还能在消费级显存上跑 8k 上下文。正文没披露压缩后推理速度有多快,也没说 MMLU-Pro 具体掉了多少分,这点先别太激动。不过思路本身对想在本地跑大模型的团队挺省钱,所以放在 featured 合适。