热点事件历史事件
Ollaya 让你在本地跑决策模型,一次前向传播出结果,延迟不到 10 毫秒
1 篇报道1 个报道来源4 天前更新
先了解这件事
事实说明
Ollaya 是一个本地运行开源决策模型的工具,可以理解成分类和打分版的 Ollama。它不走逐 token 生成,而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型,处理一个包含五个问题的请求,端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取,锁定到具体 commit 并用 sha256 校验,运...
报道时间线
沿着报道,了解事件的不同侧面。
9月26日
- Hacker News 首页精选Ollaya 让你在本地跑决策模型,一次前向传播出结果,延迟不到 10 毫秒
Ollaya 是一个本地运行开源决策模型的工具,可以理解成分类和打分版的 Ollama。它不走逐 token 生成,而是一次前向传播直接给出答案。在 RTX 4090 上跑 Laya 模型,处理一个包含五个问题的请求,端到端耗时约 8 到 10 毫秒。模型权重直接从 Hugging Face 拉取,锁定到具体 commit 并用 sha256 校验,运...