[2026年7月28日投稿]

PDFを表示 HTML(実験的)

要約:高次元データの二次元埋め込みは、支持できる範囲を大幅に超えて解釈されることが一般的です。クラスタ内およびクラスタ間の距離、空きスペースの意味、および各点に隠された構造の量は、t-SNEやUMAPなどの手法の出力では一般的に不可視です。これは、これらの特性の意味を支えうる情報が最適化プロセスで破棄されるためです。ここでは、データを通可逆な正規化流を用いて埋め込む次元削減手法であるFloDRを提示します。FloDRは最初の2つの出力座標のみを使用して二次元埋め込みを作成しますが、残りの座標は破棄せずに保持します。埋め込みに加えて、正確な逆変換と正確な密度は訓練された写像の特性であり、これにより、レイアウトを描画したモデルの近似ではなく正確な逆変換から計算される診断可視化が可能になります。具体的には、条件付き散布度(各埋め込み位置で入力単位で未決定のまま残っている元のデータの量を測定する)と隠れコントラスト(2つのプロットされた座標がラベル付きコントラストに関する情報をどれだけ破棄しているかを測定する)の2つのフィールドを描画します。両方のフィールドは、入力データの保留部分に対する事前指定の検定とブートストラップ信頼度でレンダリングされます。検定に失敗したフィールドは拒否されたものとして報告されます。

投稿履歴

投稿者: Daniel Probst [メールを表示]
[v1] 2026年7月28日火曜日 21:20:52 UTC (9,956 KB)