近邻检索基线:不同假设下 MS/MS 谱图分子指纹预测的公平基准
近邻检索为何成为质谱指纹预测的“硬基线”
在代谢组学与化学信息学中,从串联质谱(MS/MS)谱图预测分子指纹是一项核心任务。近年来,多项研究(Khoo and Barzilay, 2026;Liu et al., 2026;Gupta et al., 2026)相继指出,近邻检索(nearest-neighbour retrieval) 作为一种看似简单的非深度学习方法,其多个变体在性能上已经能够匹敌甚至超越当前主流的深度学习模型。这一发现对领域内“深度学习必然更优”的惯性认知构成了挑战。
然而,“近邻”并非单一方法,而是一类检索策略的统称。不同变体在推理阶段所假设可用的信息上存在关键差异——例如是否允许使用候选分子的结构信息、是否依赖数据库覆盖范围、是否引入额外的化学先验等。这些假设的不同,会直接导致性能对比的失真。
系统性对比:不同假设如何影响性能
针对上述问题,Ling Min Serena Khoo 在最新预印本(arXiv:2610.02249)中,对多种近邻检索变体进行了系统性比较,并量化了不同信息假设对预测性能的影响。该报告篇幅仅 6 页、含 2 幅图,属于方法学短评,但目标明确:建立更严格的基线,以支持更严谨的基准测试,并更真实地衡量该领域的进展。
核心结论可以概括为:
- 假设越宽松,基线越强:当推理时允许使用更多辅助信息(如候选库的额外标注),近邻方法的表观性能会显著提升,但这可能高估了模型在实际场景中的可用性。
- 公平比较需要对齐假设:若深度学习模型与近邻基线在推理信息上不对等,则“超越”或“匹敌”的结论均不可靠。
- 严格基线缺失导致进展误判:作者强调,领域内需要更严格的基线,否则难以分辨真正的算法进步与评测设定带来的虚高。
对 AI 与化学信息学的启示
这项工作虽聚焦于质谱指纹预测,但其方法论意义具有普适性。在 AI 驱动的科学发现中,检索式方法与生成式/判别式深度模型的边界正变得模糊。当数据覆盖充分时,简单的近邻检索往往能凭借“记忆”取得惊人效果;而深度模型的优势更多体现在泛化与数据稀缺场景。
因此,该报告提醒研究社区:
- 基准测试必须明确推理假设,否则跨论文比较将失去意义;
- 近邻检索应作为默认强基线,而非被忽视的对照;
- 衡量进展需区分“方法创新”与“信息红利”。
对于从事 AI for Science 的研究者与工程师而言,这篇短报告提供了一个重要的方法论视角:在追求更复杂模型之前,先确保基线的严格性与可比性。
注:该预印本为 6 页短报告,未提供完整实验细节与代码链接,具体数值结论需以原文及后续正式发表版本为准。
