[2026 年 7 月 29 日提交]
摘要:长上下文语言模型的一个已知局限是,随着上下文长度增加,其在非加法、基于集合的聚合任务中的性能日益不可靠。示例包括基数估计、集合关系和分组统计,这些任务广泛存在于日志、程序输出、表格和多轮对话中。为提供这些任务所需的聚合状态,我们引入了一个模型端聚合接口,该接口在冻结语言模型的同时维护紧凑的基于哈希的 HyperLogLog(HLL)草图状态。当模型处理上下文时,提取器将每条相关记录映射到规范身份。身份随后被哈希并更新 HLL 状态。这些状态可在上下文段之间合并和/或直接读出以供下游推理,避免额外的生成-执行-返回周期。我们通过将 HLL 状态大小设置为 2 KiB(2,048 个寄存器)来验证所提出的方法,该大小不随上下文长度或集合基数增加而增大。在涉及一百万条记录的去重计数实验中,平均相对误差为 1.6%。在单独的合并测试中,由多达 256 个段构建的状态与对同一流的一次性处理产生了完全相同的读出结果。在来自 174 个源窗口的 3,969 个聚合后推理任务中,固定预算接口在 Gemma 4(31B,BF16)上达到了 99.2% 的准确率,而精确聚合下为 100.0%;配对差距为 0.8 个百分点(95% 窗口聚类置信区间:0.5-1.3 个点)。在 174 个项目的匹配集合上,我们的方法在 Qwen 上比直接全上下文推理提高了 63.2 个点,在 Gemma 上提高了 56.3 个点。相对于思维链(CoT)推理的相应增益分别为 60.9 和 63.2 个点。在固定的 1,200 任务 Oolong-Synth 子集上,我们的方法在 Qwen 上达到 91.1%,在 Gemma 上达到 99.3%。代码可在 此 https URL 获取。
提交历史
来自:Dachuan Song [查看邮件]
[v1]
2026 年 7 月 29 日星期三 03:56:12 UTC (187 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.