跳到正文
热点事件历史事件

Ollaya 让你在本地跑决策模型,一次前向传播出结果,延迟不到 10 毫秒

1 篇报道1 个报道来源4 天前更新

先了解这件事

事实说明

Ollaya 是一个本地运行开源决策模型的工具,可以理解成分类和打分版的 Ollama。它不走逐 token 生成,而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型,处理一个包含五个问题的请求,端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取,锁定到具体 commit 并用 sha256 校验,运...

报道时间线

沿着报道,了解事件的不同侧面。

9月26日
  1. Hacker News 首页精选
    Ollaya 让你在本地跑决策模型,一次前向传播出结果,延迟不到 10 毫秒

    Ollaya 是一个本地运行开源决策模型的工具,可以理解成分类和打分版的 Ollama。它不走逐 token 生成,而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型,处理一个包含五个问题的请求,端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取,锁定到具体 commit 并用 sha256 校验,运...