[2026年7月24日提交(v1),最后修订于2026年7月29日(当前版本,v2)]

查看PDF

摘要:蛋白质语言模型学习可迁移的序列表示。然而,由于它们主要建模氨基酸序列上的上下文依赖,其训练目标并未显式约束模型去学习折叠后形成的三维残基接触。在此,我们引入LC-SEPLM(Long-range Contact-supervised ESM Protein Language Model,长程接触监督ESM蛋白质语言模型),该模型使用LoRA和长程残基对接触监督对ESM2进行适应,同时保留仅序列的下游推理。特定对查询通过对完整序列的交叉注意力提取与长程空间接触相关的全局序列上下文。为了让模型接触多样的结构信息,我们在500,000个AlphaFold Swiss-Prot蛋白上训练了LC-SEPLM。在下游评估中,LC-SEPLM在所有八项蛋白质级任务上均优于ESM2。最大增益出现在远程同源性识别中,宏F1从0.6122提升至0.6769(+0.0647,或6.47个百分点)。在官方ESM-S EC基准测试中,LC-SEPLM也优于ESM-S,最大绝对增益为0.1771。这些结果支持残基对接触监督作为一种有界途径,用于将结构信息引入蛋白质序列表示,同时保持仅序列推理。

提交历史

来自:Boming Kang [查看邮箱]
[v1] 2026年7月24日,周五,08:35:06 UTC (2,311 KB)
[v2] 2026年7月29日,周三,01:10:20 UTC (2,638 KB)