# Hetzner 开始试水大模型推理 API，目前只挂了一个模型

> 原标题：Hetzner is working on LLM Inference

- 来源：Hacker News 首页
- 发布时间：2026-07-24T09:24:44.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46353
- 原文：https://sliplane.io/blog/hetzner-inference

## 摘要

Hetzner 上线了一个实验性的推理 API，接口兼容 OpenAI 格式，目前只提供 Qwen 3.6 35B FP8 这一个模型。作者实测首 token 延迟中位数 153 毫秒，输出速度每秒 224 个 token，速度不错，但模型连简单的算术题都会做错。现在没有计费、没有 SLA，Hetzner 明说就是想看看需求、测测扩容和负载。更有意思的...

## 推荐理由

Hetzner 下场做推理是个信号：一家欧洲云厂商开始从卖裸金属往模型托管上探。作者给的实测数据挺实在，延迟和吞吐看着不差，但选的模型（Qwen 3.6 35B FP8）和算术翻车都说明这事还非常早期。我会先打个折，当成一次公开的压测和需求摸底来看，别当成品。

## 锐评

Hetzner 上线了一个实验性的推理 API，接口兼容 OpenAI 格式，目前只提供 Qwen 3.6 35B FP8 这一个模型。作者实测首 token 延迟中位数 153 毫秒，输出速度每秒 224 个 token，速度不错，但模型连简单的算术题都会做错。现在没有计费、没有 SLA，Hetzner 明说就是想看看需求、测测扩容和负载。

更有意思的是 Hetzner 的动机。他们擅长低成本运营硬件，如果能把闲置 GPU 算力打包成低毛利的推理服务，可能会把市场价格往下拉。但正文没披露到底用了什么 GPU，只提到他们公开的 GPU 产品线里有 RTX 4000 SFF（20GB 显存）和 RTX PRO 6000（96GB 显存），硬件配置还是个谜。

现在这个服务还太早期，延迟和吞吐数据都来自单人单次测试，并发一上来会怎样完全不知道。模型本身能力也偏弱，只适合做做原型验证。如果 Hetzner 后续能上更强模型、公布硬件方案和定价，这件事才值得认真看。
