跳到正文
r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MOOSE-Star (ICML 2026): 7B model + 108K-paper dataset for scientific hypothesis discovery

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

读原文 ↗导出 Markdown