[Submitted on 29 Jul 2026]

View PDF HTML (experimental)

Abstract:長上下文語言模型的一個已知限制是,隨著上下文長度增加,其在非加法、基於集合的聚合任務上的表現會越來越不可靠。例如基數估計、集合關係以及分組統計等,這些任務廣泛存在於日誌、程式輸出、表格以及多輪對話中。為了提供這些任務所需的聚合狀態,我們引入了一種模型端聚合介面,該介面在凍結的語言模型旁維護緊湊的基於雜湊的 HyperLogLog(HLL)草圖狀態。在模型處理上下文的同時,一個提取器將每筆相關記錄映射到一個標準識別碼。該識別碼隨後被雜湊並更新 HLL 狀態。這些狀態可以跨上下文片段合併及/或直接讀出以供下游推理使用,從而避免額外的生成-執行-返回循環。我們透過將 HLL 狀態大小設定為 2 KiB(2,048 個暫存器)來驗證所提出的方法,該大小不會隨上下文長度或集合基數增加。在包含一百萬筆記錄的相異計數實驗中,平均相對誤差為 1.6%。在另一個合併測試中,由最多 256 個片段建立的狀態,與對同一資料流單次掃描所產生的讀取結果完全相同。在來自 174 個來源視窗的 3,969 個「先聚合再推理」任務中,固定預算介面在 Gemma 4(31B,BF16)上達到 99.2% 的準確率,而在精確聚合下為 100.0%;配對差距為 0.8 個百分點(95% 視窗群集 CI:0.5–1.3 個百分點)。在 174 個配對項目上,我們的方法相較於直接使用完整上下文推理,在 Qwen 上提升了 63.2 分,在 Gemma 上提升了 56.3 分。相較於思維鏈(CoT)推理,相應的提升分別為 60.9 分與 63.2 分。在固定的 1,200 任務 Oolong-Synth 子集中,我們的方法在 Qwen 上達到 91.1%,在 Gemma 上達到 99.3%。程式碼可在 this https URL 取得。

Submission history

From: Dachuan Song [view email]
[v1] Wed, 29 Jul 2026 03:56:12 UTC (187 KB)