详情

首页手游攻略 110 亿参数塞进六类科学大脑:上智院开放神珍多模态模型 从蛋白质到气象场一个模型全读懂

110 亿参数塞进六类科学大脑:上智院开放神珍多模态模型 从蛋白质到气象场一个模型全读懂

佚名 2026-07-21 17:47:02

一个模型既要读懂DNA的序列密码,又要看穿气象场的时空演化,还要在医学影像上圈出病灶——过去这得拆成好几个各管一摊的专用模型。7月20日,上海科学智能研究院把这道难题的系统性答案摊开了:开放科学多模态基础模型神珍(Monkey King Bang, MKB),用约110亿参数,在一个统一模型里同时接住DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,既做理解,也直接产出结果。

在科学智能这条赛道上,蛋白质、分子、气象和医学影像方向早就各自跑出了性能出色的专用模型。但它们背后的规律并不相通:序列讲究前后依赖,分子强调原子之间的连接结构,气象场盯着时空演化,医学影像则看重局部细节。怎么既保住这些差异、又让一个模型学出它们之间可共享的规律,一直是科学基础模型绕不开的命题。神珍正是冲着这个问题去的。

image.png

它的骨架选了Qwen3-VL-8B作为共享主干,再为六类科学数据各开一条专门的数据处理通路。关键点在于,它没有图省事把所有数据都压成同一种格式,而是在进入共享模型之前,分别把序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节都原样保留下来。蛋白质与核酸仍按序列走,小分子仍按结构走,气象数据保留空间分布,医学影像保留图像细节,这些能力集成在同一个模型里,用的时候按任务调用对应功能。除文本回答外,神珍还能直接生成RNA序列、机器可读的SMILES分子表示、全球气象场以及医学影像分割结果。

在约110亿参数的体量下,神珍在生物序列、小分子、气象和医学影像等任务里都拿出了有竞争力的成绩。在覆盖DNA、RNA、蛋白质及不同生物序列关系判断的20项任务中,神珍有9项拿下三款参评模型里的最优结果,17项排进前二;逐项比下来,它在16项任务上的得分高于同量级的Biology-Instructions,而面对总参数约1万亿的Intern-S1-Pro,两款模型各在10项任务上更胜一筹。这组对照说明了一件事:参数规模并不是衡量科学模型能力的唯一标尺,面向不同科学对象设计有效的建模方式,才是更值得持续打磨的方向。

跳出生物序列,神珍在小分子、气象和医学影像上同样做了验证。小分子方面,在公开基准SMolInstruct的6项属性理解任务中,神珍有4项取得或并列取得最优。气象方面,离线评测里给定一帧初始大气场,模型每6小时滚动预报一步、持续推演到第10天,在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到或优于业务级数值预报的水平。医学影像分割方面,在覆盖CT、MRI、病理等九种影像模态、逾十万个图文样本的评测中,神珍预测区域与人工标注重合程度的平均Dice得分达到91.20,在7种参评方法里排第一,分9类影像看,5类排名第一、其余4类排名第二。

神珍把四类代表性能力汇进了同一个统一模型:理解生物序列、预测小分子性质或生成SMILES、滚动生成最长10天的全球气象场、依据文字提示完成医学影像分割。不同任务会调用各自的处理组件,但共享同一模型主干和联合训练的权重,研究者不必再在多个彼此独立的领域模型之间来回切换。

对科学模型而言,开放权重只是第一步。能不能同时给到可运行的代码、示例和清晰的输入输出说明,直接决定了模型能否被验证和复用。这次发布同步放出了模型权重、推理代码、示例脚本、输入说明和使用文档,并补齐了气象预报与医学影像分割所需的配置,支持研究者本地部署或接入已有科研流程。研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台汇聚的1500余个科学模型和工具组合再创造,也能在Hugging Face下载权重、在GitHub获取推理代码与示例。

作为今年3月初面世的系统级科研智能体大圣的超级大脑,神珍这个名字取自《西游记》里的天河定底神珍铁。团队希望这套开放模型以相对精炼的形态承载多样的科学任务,也让更多研究者参与进来检验、使用与共建。

点击查看更多
推荐专题
热门阅读