跳到正文
Hacker News 首页

Ollaya 让你在本地跑决策模型,一次前向传播出结果,延迟不到 10 毫秒

Ollaya – Ollama for open-source, Jev-style decision models

Ollaya 是一个本地运行开源决策模型的工具,可以理解成分类和打分版的 Ollama。它不走逐 token 生成,而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型,处理一个包含五个问题的请求,端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取,锁定到具体 commit 并用 sha256 校验,运...

推荐理由:Ollaya 把决策模型做成 Ollama 风格本地工具,概念干净,延迟数据也硬——8 到 10 毫秒对比云端动辄 200 毫秒以上,省下来的时间对实时打分场景很关键。但项目还在早期 beta,模型就一个 Laya,没生态也没生产环境故事,所以先给 72 分放进 featured,等有更多模型或实际部署反馈再往上调。

读原文 ↗导出 Markdown