# Ollaya 让你在本地跑决策模型，一次前向传播出结果，延迟不到 10 毫秒

> 原标题：Ollaya – Ollama for open-source, Jev-style decision models

- 来源：Hacker News 首页
- 发布时间：2026-09-25T18:33:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58902
- 原文：https://ollaya.dev/

## 摘要

Ollaya 是一个本地运行开源决策模型的工具，可以理解成分类和打分版的 Ollama。它不走逐 token 生成，而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型，处理一个包含五个问题的请求，端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取，锁定到具体 commit 并用 sha256 校验，运...

## 推荐理由

Ollaya 把决策模型做成 Ollama 风格本地工具，概念干净，延迟数据也硬——8 到 10 毫秒对比云端动辄 200 毫秒以上，省下来的时间对实时打分场景很关键。但项目还在早期 beta，模型就一个 Laya，没生态也没生产环境故事，所以先给 72 分放进 featured，等有更多模型或实际部署反馈再往上调。

## 锐评

Ollaya 可以理解成决策模型版的 Ollama，专门在本地跑分类、打分、是非判断这类任务。它不走 token 逐个生成的路线，而是一次前向传播直接给答案，所以在 RTX 4090 上处理一个包含五个问题的请求，端到端只要 8 到 10 毫秒，比调用 TypeSafe 的云端 API 快了一个数量级。模型权重直接从 Hugging Face 拉取，锁定 commit 并校验 sha256，运行时用 ONNX Runtime，默认只监听 127.0.0.1，数据不出本机，这对处理工单、邮件等敏感文本是个实在的安全卖点。

目前提供四组模型：Laya 系列覆盖英语和 100 多种语言，参数量 3 亿到 4 亿出头；decider 系列基于 Qwen3.5，用选项字母的 logits 直接读出答案，自称是工具里最准的开放决策模型，参数量 7.5 亿到 19 亿；nli 和 gliclass 走零样本分类路线，其中 gliclass 把所有选项一次过完，选项多了成本也不怎么涨。不过正文没披露这些模型的训练数据来源和微调细节，校准误差也只给了 Laya 的数字，其他模型的可靠性暂时没法判断。

兼容性上，它直接复用了 TypeSafe 的 /v1/systemone API，官方 Python SDK 不用改就能指向本地服务，迁移成本很低。桌面端覆盖 macOS、Windows 和 Linux，也提供 Docker 镜像，GPU 加速需要 NVIDIA 驱动 R580 以上。整体看，这是一个把决策模型从云端拉回本地的务实工具，延迟和隐私是明显长板，但模型生态还薄，准不准得自己拿业务数据测。
