[2025年11月18日提交 (v1),最后修订于2026年7月30日(本版本,v2)]
摘要:监督分类器会输出一个类别分布,但通常是针对通过将多个标注者折叠成多数票而获得的单个标签进行训练的。在标注者分歧反映真正歧义的任务中——如自然语言推理、礼貌判断、视觉模糊分类——这种折叠会丢弃信息,并迫使模型在人类系统性地存在分歧的输入上表达统一的置信度。我们在跨越视觉和自然语言处理领域的三个数据集(ChaosNLI、POPQUORN、CIFAR-10H)上,比较了使用完整标注分布作为目标的软标签训练与硬标签训练。软标签训练在每个数据集上的准确率均达到或超过硬标签训练,平均将与标注者分布的KL散度降低了32%(p < 10^-4),并使预测的每样本熵与标注者熵的相关性提高了61%——在分布上训练的模型,其不确定性恰好出现在人类不确定的时候。我们认为这些益处源于一个基本观察:当标注者存在合理分歧时,标注分布才是正确的学习目标,而非它的噪声估计。
提交历史
来自:Agamdeep Singh [查看邮箱]
[v1]
2025年11月18日 星期二 04:02:29 UTC (998 KB)
[v2]
2026年7月30日 星期四 07:08:07 UTC (1,021 KB)
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.