Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token
The GB10 Solution Atlas is now open source, the inference engine made for the community with breakneck inference speeds (Qwen3.6-35B-FP8 100+ tok/s)
Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...
推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。