[2026年7月24日投稿 (v1)、2026年7月29日最終改訂 (本バージョン, v2)]
要約:タンパク質言語モデルは転移可能な配列表現を学習します。しかし、主にアミノ酸配列に沿った文脈依存をモデル化するため、学習目標は折り畳み後に形成される三次元残基コンタクトを明示的に制約しません。ここでは、LC-SEPLM(Long-range Contact-supervised ESM Protein Language Model)を紹介します。これはLoRAと長距離残基対コンタクト教師あり学習によりESM2を適応させ、配列のみの下流推論を維持します。対特異的クエリは完全な配列に対するクロスアテンションを使用して、長距離空間コンタクトに関連する大域的な配列文脈を抽出します。モデルに多様な構造情報を提示するため、500,000のAlphaFold Swiss-Protタンパク質でLC-SEPLMを学習しました。下流評価では、LC-SEPLMはESM2に対して8つのタンパク質レベルタスクすべてを改善しました。最大の向上はリモートホモロジー認識で、マクロF1が0.6122から0.6769に向上しました(+0.0647、6.47パーセントポイント)。公式ESM-S ECベンチマークでは、LC-SEPLMはESM-Sを上回り、最大絶対利得は0.1771でした。これらの結果は、配列のみの推論を保ちながら、タンパク質配列表現に構造情報を導入するための境界付き経路として、残基対コンタクト教師あり学習を支持します。
投稿履歴
投稿者: Boming Kang [メールを表示]
[v1]
2026年7月24日 金曜日 08:35:06 UTC (2,311 KB)
[v2]
2026年7月29日 水曜日 01:10:20 UTC (2,638 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.