2026-06-22 09:46
阿里开源统一科学大模型 LOGOS,仅用五十六分之一参数超越微软
文章提及的 AI 工具Microsoft Designer
文本核心速览
- 开源科学基础模型—阿里与人大联合开源LOGO,采用统一科学语法和纯序列建模范式,在六大科学任务上匹配或超越传统专用方法。
- 参数效率极高—仅1B参数的LOGOS-1B性能超越参数量高达8×7B的微软NatureLM模型,展现极高参数效率。
- 统一异构对象科学语法—构建涵盖7类模态、44.87B tokens的预训练语料库,通过共享词表将蛋白质、小分子等异构对象编码为统一离散序列。
- 消除预训练与应用断层—预训练数据序列形式与下游任务输入输出完全一致,无需适配层即可直接激活生成能力,并已完整开源模型权重、代码及报告。
1B参数干翻微软8×7B——阿里和人大开源科学语法统一模型LOGOS
阿里ATH-Token Foundry和中国人民大学高瓴人工智能学院今天直接把首个基于统一科学语法的多领域科学生成基础模型LOGOS给开源了,模型权重、推理代码和技术报告全放了上来。
参数效率高得离谱
有开发者试了说,这个模型在六大代表性科学任务里,纯靠序列建模范式,结果和传统领域专用方法打平甚至更好。更离谱的是,只有1B参数的LOGOS-1B,在多个核心任务上直接碾压了微软的8×7B参数的NatureLM语言模型——也就是8个70亿参数的混合专家模型,价格和算力成本差了一个数量级。
科学语法把异构对象全统一了
群里在传,LOGOS搞了一套独创的科学语法,把生物大分子、化学实体、界面互作等7类模态、总共44.87B tokens的预训练语料库,通过共享词表全部编码成统一的离散Token序列。这相当于蛋白质和小分子这些以前互不兼容的东西,现在被塞进同一个生成空间里,模型自回归地往前推。它甚至发明了一种“文字描述法”——不用输入复杂的3D坐标,只靠序列预测,就能在脑子里重建复杂的空间互作规律。
预训练和应用不再割裂
传统科研里换个环节就得换个模型,落地还要大量微调。但群里有人实测发现,LOGOS的预训练数据序列形式,和下游任务的输入输出格式完全一样。这个高度对齐一搞,预训练和下游应用之间的鸿沟直接消失了,不需要什么适配层,模型拿到手就能直接吐结果。
接下来盯着看什么
阿里已经把LOGOS的模型权重、推理代码和技术报告全扔到了开源社区。这会让那些靠领域专用模型吃饭的厂商很难受——比如专门做蛋白质结构预测或分子生成的小公司,以后可能被一个通用模型按在地上摩擦。接下来就看这个模型在真实工业场景(比如药物筛选或新材料设计)里能不能跑通,速度和成本能不能压到实用级别。
来源: aibase阅读原文