跳到正文
Hacker News 首页

Hetzner 开始试水大模型推理 API,目前只挂了一个模型

Hetzner is working on LLM Inference

Hetzner 上线了一个实验性的推理 API,接口兼容 OpenAI 格式,目前只提供 Qwen 3.6 35B FP8 这一个模型。作者实测首 token 延迟中位数 153 毫秒,输出速度每秒 224 个 token,速度不错,但模型连简单的算术题都会做错。现在没有计费、没有 SLA,Hetzner 明说就是想看看需求、测测扩容和负载。更有意思的...

推荐理由:Hetzner 下场做推理是个信号:一家欧洲云厂商开始从卖裸金属往模型托管上探。作者给的实测数据挺实在,延迟和吞吐看着不差,但选的模型(Qwen 3.6 35B FP8)和算术翻车都说明这事还非常早期。我会先打个折,当成一次公开的压测和需求摸底来看,别当成品。

读原文 ↗导出 Markdown