AI生成の文章を確実に識別できることは重要だと考え、私たちはそれを実現する検出器を構築しました。この問題が非常に重要であるため、その仕組みについて透明性を保つことは当然のことです。

著者が文を書く際には、どのように構成すべきかについて、何千もの意識的・無意識的な判断が行われます。根本的に、AI検出は著者識別の問題であり、どの判断がどのような著者に典型的なものかを分類することです。私たちがこれを行えるのは、ChatGPTのようなLLMは人間ではないものの、それでも単一の著者として判断を下しているからです。LLMが下しがちな判断の種類も制約されています。アシスタントモデルは質問に効果的に答えるために、役立ち、明確な文章を生成する必要があります。これらの好みはトレーニング中にモデルに組み込まれ、一度組み込まれると、それらが表面化するのを防ぐことは非常に困難です。

Pangramは分類器モデルと呼ばれるニューラルネットワークの一種です。最も広い意味で、Pangramは文章のセグメントを読み込み、学習した膨大なパターンセットを用いて、それがAI生成かどうかを推定します。

Pangramは、人間とLLMの文章を区別することを、似た文体を持つ著者を近くに、異なる文体の著者を遠くに配置する一種の地図を作成することで学びます。この地図上では、人間が書いたテキストとAI生成のテキストはそれぞれ異なるクラスターを形成し、私たちの研究では、PangramがChatGPTやClaudeなどの主要な商用言語モデルを異なる領域に位置づけられることが示されています。

Pangramがこれまで見たことのない文章に出会うと、すでに知っているテキストと比較することで、その文章が地図上のどこに位置すべきかを決定します。文章のどの単一の側面も、その着地点を決定づけるものではありません。そのため、人間の著者が、ChatGPTが彼らのお気に入りの表現(例:em dash)を採用したという理由だけで誤分類されるリスクはありません。目に見えるLLM特有の特徴は、Pangramが考慮する数十万ものシグナルのうちの1つに過ぎません。

結果として得られた座標が人間が書いた領域に位置する場合、Pangramはそのテキストが人間によるものと予測します。より曖昧な領域に位置する場合、または同じテキスト内の異なる部分が異なる方向を指す場合、Pangramはその中にAI生成の文章が含まれている可能性があると疑い始めます。これがPangramに最低単語数要件がある理由です。単語数が多いほど、より正確な座標が得られます。このアプローチは、Pangramが新しいAIモデルのリリースにも対応できるようにも役立ちます。新モデルは前世代のスタイルや声の多くを継承するため、地図上の非常に似た領域を占める傾向があるからです。

これまでのAI文章検出の試みは、悲惨で公然たる失敗に終わっています。これは、大規模言語モデルがテキストを生成する方法を逆エンジニアリングしようとしたためです。文の各単語の後に、これらの検出器は次のように問いかけました:もし自分がLLMだったら、次に来る単語として何を期待するだろうか?

たとえば、「I’m going to take my dog for a …」という文の断片が与えられた場合、AIモデルは「walk」や「run」を非常に可能性の高い次の単語とみなす一方で、「harbinger」や「verglas」のような唐突な単語は候補として適切ではないと判断するでしょう。初期の検出器は、LLMの可能性の高い単語のランキングを再構築し、実際に現れた単語と比較しようとしました。つまり、テキストが予測可能な選択肢に従う頻度が高いほど、その検出器がAI生成と分類する可能性が高くなるのです。本質的に、これはLLMが文中の次の単語に出会ったときにどれだけ困惑するかを反映しており、このAI検出の手法はperplexity analysisと呼ばれました。

Perplexity analysisには多くの問題があります。これは区別しようとしているものを適切に測定するものではなく、人間の文もLLMの散文と同じくらい定型化されていることが多いためです。そのため、予測可能または構造化された人間の文章は、perplexity検出器によって誤ってフラグが立てられることが多く、一方で、それらの検出器は、一般的でない同義語に入れ替えるような明白な戦略によって簡単に回避されてしまいます。

有名なように、perplexityモデルはコンピュータの登場以前に書かれた多くのテキストでも失敗します。Perplexityベースの検出は、聖書、独立宣言、またはメアリー・シェリーのフランケンシュタインが100% AI生成であると判定したがります。これは、LLMがトレーニングの過程で独立宣言を何千回も読み込んでいるため、その中のすべての次の単語がLLMの視点から見て非常に意外性のないものだからです。検出器はその尤度を、文章がAI生成である証拠として誤解釈するのです。

Pangramはこれを回避します。なぜなら、LLMがテキストを生成する方法を逆エンジニアリングしようとしないからです。各単語を見て「LLMならここで何を書くだろうか?」と問うのではなく、Pangramはテキスト全体を見て「これは誰の文章のように聞こえるか?」と問います。この方法により、ChatGPTの親しみ度が原因でPangramが歴史的文書をAI生成と誤分類することは決してありません。ただし、すべてのケースがそれほど簡単というわけではありません。

分類器を98%の精度でトレーニングすることは難しくありません。ほとんどのAI文章は容易に認識可能であり、ニューラルネットワークは最も明白な特徴を素早く学習できます。E. E. Cummingsの詩と『カラマーゾフの兄弟』の引用を比較して、異なる著者によるものだと結論づけることがほぼ誰にでもできるように、基本的な分類器はAI生成のパスタレシピと人間の日記エントリを自明に区別できます。しかし、AI検出において98%の精度は著しく悪いものです。2%のエラー率は、50件に1件の文書を誤分類することを意味し、どのような予測も疑わしいものにします。そこで、もしあなたが上位2%のドストエフスキー識別者だった場合、どのようにして上位0.01%になる戦略を考えるでしょうか?

そのレベルでは、ドストエフスキーを直接再読しても収穫は逓減します。ギャップを埋めるには、ドストエフスキー以外には生み出せない特徴を見つける必要があります。良い戦略は、プロの物真似師を何人か雇って、可能な限り説得力のあるドストエフスキーのクローンを書かせ、その違いを研究することです。私たちがPangramをトレーニングする方法もそれと同じです。商業的にライセンスされた人間が書いたテキストのデータセットの各要素に対して、元のソースにできる限り近いAIの複製を生成します。複製は同じ長さ、同じトーン、同じトピックですが、AI生成です。そして、Pangramモデルをそれらの人間-AIテキストペアでトレーニングします

これらのペアを区別することを学ぶことで、Pangramは内部地図の境界領域の解像度を実質的に高めます。Pangramの地図をできる限り正確にするため、私たちはデータポイズニングに極めて注意を払っています。既知の人間のテキストのデータセットは、AIがインターネットに解放される前の2021年以前のものから抽出されています。これは現時点ではうまく機能しますが、言語が変化するにつれて調整が必要になることを認識しています。データドリフトが問題になる前に先制的に対処することは、私たちの最優先研究課題の1つです。

Pangramはテキストのみに基づいて予測を行う統計モデルであるため、その精度も統計的に検証する必要があります。それが私たちが行っていることです。私たちはリリースするすべてのPangramモデルについて内部ベンチマークを公開しており、AIラボがLLMを更新するたびにも公開しています。また、シカゴ大学やメリーランド大学のチームなど、独立した第三者機関によるテストと検証も受けています。

あなたが研究者である場合、または本当に良いアイデアがあり、結果を公開することを約束する場合には、APIクレジット助成金のいずれかに申請して、私たちのモデルを自分でテストすることができます。私たちは常に改善の方法を探しています。

Discussion about this post

Ready for more?