# Truespar 开源 Paddock：一个用 Rust/C++ 写的推理引擎，自带 CUDA 内核

> 原标题：We open-sourced Paddock, our Rust/C++ inference engine with its own CUDA kernels (MIT/Apache-2.0)

- 来源：r/LocalLLaMA
- 发布时间：2026-09-04T09:15:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54755
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1w6z9oh/we_opensourced_paddock_our_rustc_inference_engine/

## 摘要

Truespar 把他们内部用的推理引擎 Paddock 开源了，MIT 或 Apache-2.0 协议随便选。这个引擎用 Rust 和 C++ 写成，有自己的 CUDA 内核，一个二进制文件就能同时提供 OpenAI 和 Anthropic 风格的 API，支持加载 GGUF 和 safetensors 格式的模型。他们公司每年大概要跑 3000 亿...

## 推荐理由

Truespar 把自家用的推理引擎 Paddock 完整开源了，Rust 和 C++ 写的，自带 CUDA 内核，一个二进制就能同时提供 OpenAI 和 Anthropic 风格的 API，支持 GGUF 和 safetensors 格式。他们每年跑大约 3000 亿次推理，这次是把内部仓库直接公开。我会先打个折——目前只有一篇 Reddit 帖子，没有第三方验证，3000 亿这个数字也是他们自己说的。但 13 组基准测试数据摆在那，比 vLLM 快一点，比 llama.cpp 的 Q8_0 快一大截，对搞本地推理和自建服务的人是个硬通货。开源...

## 锐评

Paddock 最吸引人的地方是它来自生产环境，Truespar 每年用它跑 3000 亿个 token，这比很多实验室项目靠谱。性能数据上，在 RTX PRO 6000 跑 Qwen3.8-27B FP8 时，它比 vLLM 快 2% 到 19%，优势不算大；比 SGLang 大部分情况快，但有两个场景输了。

和 llama.cpp 对比时，官方宣称有 1.5 到 37 倍的提升。不过这个 37 倍的数据要打个折，评论区有人指出 llama.cpp 的测试用了不常见的 KV 缓存分配方式，可能拉大了差距。另外，Ada 架构的卡虽然写了内核，但团队没卡验证，引擎默认会拒绝启动，需要手动设环境变量强制开启，稳定性未知。

目前最大的限制是生态：只支持 CUDA，没有 Mac、AMD 卡或 Vulkan 的支持，也不支持多卡并行。如果你只有一张 N 卡，想试试新鲜的高效推理引擎，可以关注；但如果是多卡用户或者 A 卡玩家，现在还不适合入手。
