Hetzner 试水 LLM 推理:低价云厂商想把开放模型也做成基础设施商品
作者:陈墨|OC 产业与资本编辑
作者:陈墨|OC 产业与资本编辑
欧洲云厂商 Hetzner 正在实验一项 LLM 推理服务,通过兼容 OpenAI 的 API 提供开放权重模型。根据 Sliplane 创始人的第三方试用,服务目前免费、没有 SLA、没有生产可用性保证,也只有一个模型。
一句话结论:这还不是 Hetzner 正式进入模型云市场,但它验证了一条可能的路线:当模型权重和 API 格式都趋于标准化,推理服务可以像廉价服务器一样靠运营效率竞争。
实验提供的是 Qwen/Qwen3.6-35B-A3B-FP8,一个总参数约 350 亿、每次激活约 30 亿参数的混合专家模型,支持文本和图像、约 26.2 万 token 上下文,并使用 FP8 权重量化。开发者可以从实验控制台获取令牌,再把现有 OpenAI 客户端指向 Hetzner 的接口。
试用者在 7 月 23 日进行的小规模测试中,七次短请求的首 token 中位延迟为 153 毫秒,五次较长生成的输出速度约为每秒 224 token。但这只是单一客户端、单一时点的少量请求,不是并发基准或服务承诺。模型在测试中还答错了两道简单算术题。

真正值得观察的不是当前模型,而是 Hetzner 的成本结构。开放权重模型允许不同厂商运行相同软件,OpenAI 兼容接口又降低了迁移成本,供应商很难长期依靠模型独占获得高毛利。优势将来自更低的硬件采购成本、更高的 GPU 利用率和更有效的数据中心运营。
Hetzner 具备低价裸金属服务器和欧洲数据中心经验,但公开 GPU 产品主要是 20GB 的 RTX 4000 SFF Ada 和 96GB 的 RTX PRO 6000 Blackwell Max-Q,并非训练和运行超大模型常见的 B200/B300 高密度集群。实验接口背后使用何种硬件,Hetzner 也没有公开。
陈墨认为,Hetzner 的潜在机会不是挑战前沿闭源模型,而是把中小型开放模型做成低利润、高利用率的基础设施。如果后续出现计费、SLA、更多模型和企业数据条款,这项实验才会从有趣入口变成真实云业务。
关键事实
- 来源:Sliplane 第三方试用
- 涉及公司:Hetzner
- 当前模型:Qwen3.6-35B-A3B-FP8
- 服务状态:实验阶段,无计费、无 SLA、无生产保证
OC 判断
现在不能用一次速度测试判断 Hetzner 已具备推理竞争力。更关键的信号是它是否建设更大 GPU 集群、公布稳定计费,并把欧洲数据驻留和低价运营转化为可持续产品。
为什么重要
- 对开发者:兼容 OpenAI 的接口降低了测试和切换开放模型供应商的成本。
- 对企业:实验服务不适合生产负载,仍需等待 SLA、安全和数据处理条款。
- 对市场:低价云厂商进入后,标准开放模型的推理利润可能继续被压缩。
评论
围绕这篇文章补充信息、提出问题或分享观察。