我们认为能够可靠地识别 AI 生成的写作非常重要,因此我们构建了一个可以完成这项工作的检测器。由于这个问题如此重要,透明地说明它的工作原理才是谨慎之举。
当任何作者写下一个句子时,他们都在对如何组织这个句子做出成千上万个有意识和无意识的决定。从根本上说,AI 检测是一个作者识别问题——将哪些决定归类为哪种作者的典型特征。我们能够做到这一点,是因为虽然像 ChatGPT 这样的 LLM 不是人类,但它们仍然是一个单一的作者在做出决定。它们容易做出的决定类型也受到约束:辅助模型需要产生有帮助、清晰的写作才能有效地回答问题。这些偏好在训练过程中被植入模型,一旦存在,就很难阻止它们浮现。
Pangram 是一种称为 分类器模型 的神经网络。从最广泛的意义上讲,Pangram 读取一段写作,并使用一组庞大的学习模式来估计它是否是 AI 生成的。
Pangram 通过构建一种地图来学习区分人类和 LLM 写作,在这张地图上,写作风格相似的作者被放置在一起,而风格不同的作者则被放置得更远。在这张地图上,人类写作和 AI 生成的文本形成了不同的集群,我们的研究表明 Pangram 甚至可以将主要的商业语言模型(如 ChatGPT 和 Claude)定位在 不同区域。

当 Pangram 遇到一段从未见过的写作时,它会通过与已知文本进行比较来确定它在地图上的位置。写作的任何单一方面都不会决定它落在哪里,因此人类作者不会仅仅因为 ChatGPT 采用了他们最喜欢的一种表达方式(如破折号)而被错误分类。可见的 LLM 特征只是 Pangram 考虑的数十万个信号之一。
如果最终坐标落在人类写作区域,Pangram 会预测该文本是人类撰写的;如果落在更模糊的区域,或者同一文本的不同段落指向不同方向,Pangram 就会开始怀疑其中可能包含 AI 写作。这就是为什么 Pangram 有最低字数要求:更多单词意味着更精确的坐标。同样的方法也帮助 Pangram 泛化到新的 AI 模型发布,这些模型往往继承了前代的大部分风格和语调,因此占据地图上非常相似的区域。
之前检测 AI 写作的尝试都遭遇了惨痛且公开的失败。这是因为它们试图逆向工程大型语言模型生成文本的方式。在句子的每个词之后,这些检测器都会问: 如果我是一个 LLM,下一个词会是什么?
例如,给定一个句子片段如“我要带我的狗去……”,AI 模型可能会认为“散步”或“跑步”是非常可能的下一个词,而像“预兆”或“冰凌”这样的不连贯词则不会是可能的候选词。早期的检测器试图重建 LLM 对可能词的排序,并与实际出现的词进行比较,因此文本越频繁地遵循可预测的选择,检测器就越有可能将其分类为 AI 生成的。本质上,这反映了 LLM 遇到句子中下一个词时的困惑程度,因此这种 AI 检测模式被称为 困惑度分析。

困惑度分析存在很多问题。它不是一个衡量它试图区分的事物的好指标,因为人类句子经常和 LLM 散文一样受限。因此,可预测或结构化的人类写作经常被困惑度检测器错误标记,同时,这些检测器也可以通过用不常见同义词替换单词等明显策略被轻易绕过。
著名的是,困惑度模型在许多计算机出现之前的文本上也会失败。基于困惑度的检测喜欢告诉你《圣经》、《独立宣言》或玛丽·雪莱的 《弗兰肯斯坦》 是 100% AI 生成的。它这样做是因为 LLM 在训练过程中阅读了《独立宣言》数千次,因此其中每个下一个词从 LLM 的角度来看都非常不出人意料。检测器将这种可能性误解为写作是 AI 生成的证据。
Pangram 避免了这个问题,因为它不是试图逆向工程 LLM 如何生成文本。而不是查看每个词并问“LLM 会在这里写什么?”,Pangram 查看整个文本并问“这听起来像谁写的?”。这样,ChatGPT 的熟悉程度永远不会导致 Pangram 将历史文档错误分类为 AI 生成的——但并非所有情况都这么容易。
训练一个分类器达到 98% 的准确率并不难。大多数 AI 写作都很容易识别,神经网络可以快速学习最明显的特征。正如几乎任何人都可以将 E. E. 卡明斯的诗与《卡拉马佐夫兄弟》中的引文进行比较并得出结论它们是由不同作者所写一样,基本分类器可以轻易区分 AI 生成的意大利面食谱和人类的日记条目。但在 AI 检测中,98% 的准确率非常糟糕:2% 的错误率意味着每 50 份文档中就会错误分类一份,这会使任何给定的预测受到质疑。因此,考虑一下,如果你是一个前 2% 的陀思妥耶夫斯基区分者,你会用什么策略来成为 前 0.01%?
在那个水平上,直接重读陀思妥耶夫斯基会产生递减的回报——缩小差距需要找到除了陀思妥耶夫斯基之外没有人能产生的特征。一个好的策略可能是聘请几位专业模仿者来撰写最令人信服的陀思妥耶夫斯基克隆作品,并研究差异。这就是我们训练 Pangram 的方式:对于我们商业许可的人类写作文本数据集的每个元素,我们生成一个尽可能接近其来源的 AI 双胞胎。这些双胞胎长度相同、语调相同、主题相同,但由 AI 生成。然后我们 在那些人类-AI 文本对上训练 Pangram 模型。

在学习区分这些对时,Pangram 有效地提高了其内部地图上边界区域的分辨率。为了确保 Pangram 的地图尽可能准确,我们对数据污染非常谨慎:我们已知人类文本的数据集来自 2021 年及之前,那时 AI 还没有在互联网上泛滥。这目前效果很好,但我们意识到我们将不得不随着语言的变化进行调整。在数据漂移成为问题之前预防性地解决它是我们最重要的研究优先事项之一。
Pangram 是一个仅基于文本进行预测的统计模型,因此其准确性也必须通过统计方式进行测试。这就是我们所做的。我们为发布的每个 Pangram 模型以及每次 AI 实验室更新其 LLM 时发布内部基准。我们还接受了独立第三方的测试和验证,如芝加哥大学和马里兰大学的团队。
如果你是研究人员——或者如果你有一个很好的想法并承诺发表你的结果——你可以申请我们的 API 信用额度赠予,并亲自测试我们的模型。我们一直在寻找改进的方法。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.