# 阿里开源 LOGOS 科学模型，用 1/56 参数量在多项任务上超过微软 NatureLM

> 原标题：阿里开源首个统一科学大模型 LOGOS，仅用 1/56 参数超越微软 NatureLM

- 来源：AI HOT 精选
- 发布时间：2026-06-18T04:33:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39117
- 原文：https://www.ithome.com/0/965/928.htm

## 摘要

阿里和人大高瓴学院开源了一个叫 LOGOS 的科学模型，把蛋白质、小分子、材料等七种科学数据统一编成一套“科学语法”的 token 序列，让模型用预测下一个词的方式直接处理。它把蛋白质口袋和配体的 3D 接触模式也转成了离散 token，不依赖显式 3D 坐标就能预测空间相互作用。LOGOS-1B 只有 10 亿参数，微软 NatureLM 是 8×7...

## 推荐理由

阿里开源了一个 10 亿参数的科学模型 LOGOS，把七种科学数据统一成 token 序列，用预测下一个词的方式处理，还在多个任务上赢了参数多 56 倍的微软 NatureLM。有具体数字、有开源代码，知识增量扎实。但领域太专，我会先打个折——对科学 AI 圈内人是硬货，对圈外人共鸣不强，所以放在 featured 里比较合适。

## 锐评

这条新闻最值得看的是思路：把蛋白质、小分子、材料这些原本“鸡同鸭讲”的数据，全部编码成统一的离散 token 序列，然后用同一个“预测下一个词”的目标来训练和推理。这相当于给科学领域建了一套通用语言，模型不再需要为每个任务换一套架构和假设。LOGOS-1B 只有 10 亿参数，微软 NatureLM 是 8×7B 的混合专家模型，参数量差了 56 倍，却在六个任务上匹配或超越了对方，参数效率确实亮眼。

不过有几个地方要先打个折。第一，正文只说了“匹配或超越”，没有给出具体任务上的绝对分数对比，不知道领先是小数点后几位还是实质性差距。第二，44.87B tokens 的预训练语料里蛋白质占了 28.9B，小分子只有 2.1B，数据分布很不均衡，模型在小分子相关任务上的表现是否同样稳定，正文没展开。第三，把 3D 空间接触模式转成离散 token 这个想法很巧妙，但完全抛弃显式 3D 坐标后，在需要精确几何约束的场景下会不会丢精度，目前没有消融实验支撑。

整体看，这套“统一语法 + 序列建模”的范式如果能跑通更多科学领域，确实能省掉大量适配工作。但现阶段还缺更多独立复现结果和实际应用案例，先当一篇有意思的技术报告看比较合适。
