MENU

新闻中心

当前位置: 首页» 新闻中心» 科研进展

Analytical Chemistry|基因组所纪宏超团队利用大语言模型解析质谱中的分子结构信息

2026-08-03 11:31:00

【字体:

  

2026年7月15日,中国农科院基因组所(大鹏湾实验室)纪宏超团队在《分析化学(Analytical Chemistry)》上在线发表题为 “Can Large Language Models Translate MS/MS into Molecular Caption?” 的研究论文。该研究提出质谱大语言模型框架 MS2LLM,将串联质谱(MS/MS)图、分子式及相似分子等信息统一表示为自然语言序列,通过指令微调学习质谱碎裂模式与分子结构语义之间的对应关系,实现了从MS/MS谱图到分子骨架、官能团及化学类别等层次化描述的智能解析,为未知化合物的可解释性注释提供了新思路。


串联质谱是代谢组学、天然产物研究和复杂样品分析中解析分子结构的重要技术,但未知化合物的鉴定长期受到谱图库和结构数据库覆盖范围的限制。现有方法通常通过谱图匹配、数据库检索或候选结构排序寻找最可能的分子,当目标化合物未被数据库收录时,往往只能获得相似候选,难以直接判断其分子骨架、官能团和化学类别。与此同时,直接从MS/MS谱图生成完整结构仍面临结构信息不充分、同分异构体难以区分以及预测结果可解释性不足等问题。因此,如何在无法确定唯一结构的情况下,充分提取谱图中蕴含的化学信息,是未知化合物解析中的关键难题。


研究团队整合了大规模串联质谱数据及其对应的分子信息,对化学领域大语言模型进行针对性训练,使其学习分子碎裂信号与结构特征之间的联系。与传统方法主要依赖数据库匹配不同,该方法尝试直接从质谱图中提取可解释的分子信息,包括整体骨架、主要官能团和化学类别,从而将复杂的质谱解析转化为由大语言模型生成分子描述的过程。


图1|MS2LLM框架图


研究结果表明,该模型能够从质谱数据中生成较为准确、具体的分子描述,在化学类别判断和分子特征识别方面,整体表现优于通用大语言模型和传统分析方法,并在不同来源的测试数据中保持了较好的稳定性。进一步分析发现,质谱信号、分子组成信息和相似分子线索能够相互补充,共同提高模型对未知化合物的解析能力。


图2|模型在化学类别判断和分子描述任务中与其他方法的性能比较


这项研究为未知化合物解析提供了新的技术思路。即使目标分子尚未被现有数据库收录,模型仍可以先给出具有参考价值的结构线索,帮助研究人员判断其可能的化学特征、缩小候选范围,并为后续实验验证和完整结构鉴定提供依据。该方法有望应用于代谢组学、天然产物发现和复杂样品分析,也为大语言模型进一步参与科学实验数据解读提供了新的方向。


该研究得到中国农业科学院科技创新工程、国家自然科学基金以及中央高校基本科研业务费专项资金项目的资助。


原文链接:https://pubs.acs.org/doi/10.1021/acs.analchem.6c02505


TOP TOP