# Fermion 发布 Neutrino-1 8B：一个 3.88 GB 的模型文件，能在 H100、L4 和 MacBook 上直接跑

> 原标题：Neutrino-1 8B

- 来源：Hacker News 首页
- 发布时间：2026-07-28T04:49:54.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47118
- 原文：https://www.fermionresearch.com/models/neutrino-8b/

## 摘要

Fermion Research 放出了一个叫 Neutrino-1 8B 的模型，参数量 81.9 亿，但整个模型文件只有 3.88 GB，是常规 fp16 格式的八分之一大小。它把模型里 252 个线性层的权重用一种他们自研的“三值家族”格式压缩存储，用的时候在计算核心里直接解码，全程不产生 fp16 或 fp32 的权重数据。这么小的体积直接改变...

## 推荐理由

Neutrino-1 8B 把 81.9 亿参数模型压到 3.88 GB，是 fp16 的八分之一，靠的是自研三值家族格式直接压缩 252 个线性层权重，推理时在核心里解码，不产生浮点权重。技术细节够具体，不是公关稿。但这是新实验室的首发模型，正文没给出第三方复现或跨模型对比，所以我会先打个折，保持 78 分。

## 锐评

Fermion Research 放出的 Neutrino-1 8B 最直接的价值是让大模型跑在了更便宜的硬件上。它把81.9亿参数模型里252个线性层的权重，用一种自研的“三值家族”格式压缩存储，整个模型文件只有3.88GB，是常规fp16格式的八分之一。这意味着它可以直接塞进8GB显存的GPU或16GB内存的笔记本里，不用再为跑一个8B模型专门上大显存卡。

速度数据挺亮眼：H100上普通解码396 tok/s，投机解码能冲到763 tok/s；M5 MacBook用MLX跑33.7 tok/s，纯CPU也有24.9 tok/s。单流解码的瓶颈本来就是每生成一个token要搬运多少数据，3.88GB的工作集天然比16GB的fp16模型快。模型基于阿里的Qwen3-8B，用了Apache-2.0协议，MMLU 5-shot得分72.1。

但要注意，官方博文没提训练数据来源和具体的压缩训练方法，只说了“三值家族格式”和“在计算核心里直接解码”。压缩后62.63%的权重为零，正负权重几乎完美对称，这个结果是怎么训出来的、有没有精度损失、在其他基准上的表现如何，正文都没披露。想在生产环境用的话，这些信息缺口得先补上。
