[2026年7月6日提出 (v1)、最終改訂 2026年7月23日 (本バージョン、v2)]

PDFを表示 HTML (experimental)

Abstract:異種の表形式情報を格納したリレーショナルデータベース(RDB)が与えられたとき、対象となるカラムの欠損値(または将来値)をどのように予測できるでしょうか?企業環境では潜在的なターゲットの範囲が非常に広いため、新しい予測タスクごとにゼロから新しいモデルを学習することは避けることが望まれます。RDB固有のエンコーダに基づく凍結基盤モデルは実行可能な解決策を提供しますが、理想的な設計は依然として未解決の問題です。一方、特定のparameter-freeサブグラフエンコーダと単一テーブル基盤モデルを組み合わせることで、RDB固有の事前学習を必要とせずに近SOTA性能を達成できることが最近主張されています。一方、他の現代的な研究では、観測可能なラベルを活用してタスク固有の表現を学習するように事前学習されたパラメータ化されたエンコーダを提唱しています。この曖昧さに対処するため、ラベルが入力として存在する場合に特化してRDBエンコーダの特性を分析し、学習可能なエンコーダパラメータの潜在的な有効性に対する限界を証明します。実証的検証として、多くの関連ベンチマークタスクにおいて、かなりシンプルなparameter-freeエンコーダが依然として強力な性能を発揮できることを示します。

Submission history

From: Linjie Xu [view email]
[v1] Mon, 6 Jul 2026 10:25:54 UTC (303 KB)
[v2] Thu, 23 Jul 2026 10:34:48 UTC (303 KB)