発散が誤った母集団をエスカレートさせる:全会一致は自動パスを見逃す
Agent Determinism Illusions (Part 7)
この位置づけ: このパートは Part 13 の probe-vs-prose スレッドを継続しません。Part 6 の L2→L3 エスカレーションルールに戻り、投票不一致を人間レビュー信号として扱う Dipankar の動きを検証します。Alexey Spinov のフォローアップコメントは、その信号が誤った母集団を指していると指摘しています。2つの実験で彼の主張が正しいか、代わりに何をトリップワイヤーに入れるべきかを検証します。
Part 6 は次のような制御フローを描きました:
L2 multi-perspective votes
│
unanimous ──────────► AUTO-PASS / AUTO-REJECT
│
divergence (e.g. 2–1) ► L3 human
Enter fullscreen mode Exit fullscreen mode
すでに本文に書かれていた注意点は、発散は曖昧さを測定するもので、全会一致の系統的バイアスを修正するものではないというものです。Alexey の指摘はより鋭く、別の注意書きではなくルーティングに関するものです。
1. Alexey の母集団ミスマッチ
Part 6 のスレッドで、Alexey Spinov は(要約すると)次のように書きました:
危険な失敗は高信頼度かつ方向性を持つ — つまり系統的です。系統的バイアスはプロンプト間で共有され、特異的ではありません(あなたの P3:多数決では修正されない)。したがって、3つの視点はまさにそのケースで一致しがちです。発散→人間は安全で曖昧なケースをルーティングし、確信を持って誤ったケースを自動パスします。エスカレーション信号は誤った母集団を指しています。
彼は2つの低コストな代替案を提案しました:
- T1 — 既知の逆転クラスに対する決定論的トリップワイヤー(一致に関わらずエスカレート)。
- T2 — 逆転しやすいクラスで全会一致かつ高信頼度 の場合をエスカレート — 「高信頼度→自動パス」の逆。
これが検証対象の主張です。「発散が無意味」ということではなく、「あなたが既に測定した失敗モードに対して、発散だけを主要トリップワイヤーとするのは誤り」ということです。
2. 実験 A — DF v2 でのオフラインプロキシ(新規 API なし)
Part 6 の Mike Update ですでに示された:96件の DF v2 MISS 実行のうち、95.8% が自己申告信頼度 ≥ 0.9(平均 0.969)に該当しました。この塊は集中しており、Part 6 では qwen3:0.5b からの MISS 実行の約 80% も報告されています。したがって、見出しは集中の事実であり、3モデルに普遍的な法則ではありません。P2(同一プロンプト N=10、凍結 results-v2 ダンプなし)では、同一入力でのモデル内発散がほぼゼロでした。最初の切り口として:
-
conf ≥ 0.9≈ unanimous-channel proxy → Part 6 の Dipankar ルールでは自動パスされる -
conf < 0.9≈ divergence-proxy → エスカレートされる
PASS 判断が MISS であったケースのうち、confidence: null の deepseek DS4 実行を2件除外した(ポリシーテーブルにはスカラー信頼度が必要)。したがって下表の分母は Part 6 の見出し n=96 ではなく n=94 です:
| 発散プロキシ下のバケット | MISS の割合 (n=94) |
|---|---|
| 自動パスされる (conf≥0.9) | 97.9% (92/94) |
| エスカレートされる (conf<0.9) | 2.1% (2/94) |
同一 PASS セットでのポリシー比較:
| ポリシー | MISS 捕捉率 | MISS が自動パスされる率 |
|---|---|---|
| D (低信頼度のみエスカレート) | 2.1% | 97.9% |
| T1 (全 DF*/DS* クラスをエスカレート) | 100%† | 0% |
| T2 (逆転クラス ∩ conf≥0.9) | 97.9% | 2.1% |
| D+T2 | 100% | 0% |
†T1 はこのフィクスチャにおけるクラスリストの上限であり、独立した発見ではありません。 すべての DF v2 MISS sid は既に DF*/DS* です。「逆転クラスをすべてエスカレート」は定義上 MISS を 100% 捕捉します。T1 をオラクル上限として読み、展開可能な主張は D+T2 です。
スクリプト: scripts/escalation-population-mismatch.py.
プロキシ下での判定(T1 単独ではなく D vs D+T2 について): SUPPORT。
プロキシは多審判再実行ではありません。次のセクションでその言い訳を排除します。
3. 実験 B — DF セットでの実 Strict / Balanced / Lenient
同じ 20 件の DF v2 シナリオ。P3 と同じ 3 つのペルソナ。各シナリオにつき各ペルソナ 1 回呼び出し(モデルあたり 60 コール)。エスカレートポリシーは実際の投票パターンを使用します:
-
D —
splitの場合にエスカレート - T1 — 既知の逆転クラス (DF*/DS*) が accept パス上にある場合にエスカレート
-
T2 — 逆転クラス かつ
unanimous_passの場合にエスカレート - D+T2 — 合併
deepseek-v4-flash — この主張には不適切な基板
ほぼすべての悪いシナリオが全会一致で拒否されました。危険な accept は 0(悪い出力に対して多数 PASS)。ほとんどミスしないモデルでは「全会一致の見逃し自動パス」を測定できません。帰無結果であり、反証ではありません。
gemma3:latest — 異なる失敗形状
Strict/Balanced は拒否、Lenient はパス → ほぼすべてが split、悪いケースは依然として多数拒否 → 危険な accept は 0。発散はほぼすべての accept パスノイズ(真の pass を含む)をエスカレートします。Alexey が名付けた母集団ではありません。
qwen3:0.5b — 主張に合致する基板
6 件の危険な accept(悪い出力に対して多数 PASS)。その内訳:
| パターン | 件数 | 割合 |
|---|---|---|
unanimous_pass |
4 | 66.7% |
split |
2 | 33.3% |
その実行におけるポリシーテーブル:
| ポリシー | MISS 捕捉率 | MISS が自動パスされる率 | True-pass エスカレート率 |
|---|---|---|---|
| D | 33.3% | 66.7% | 0% |
| T1 | 100%† | 0% | 0% |
| T2 | 66.7% | 33.3% | 0% |
| D+T2 | 100% | 0% | 0% |
†§2 と同じ注意書き:6 件の危険な accept はすべて逆転クラス sid 上にあるため、T1 の 100% はクラスリスト上限です。負担を担う行は D+T2 です。
スクリプト: scripts/df-multiperspective-escalation.py.
結果: results-v2/df-multiperspective-qwen3-0.5b.json(deepseek / gemma ダンプも含む)。
実際にその失敗モードを生成したモデルでの判定: PARTIAL → SUPPORT。危険な accept の 3 分の 2 は全会一致で、Part 6 のルールでは自動パスされます。発散だけでは残りの 3 分の 1 を捕捉します。D+T2 はこの実行で真の pass をエスカレートせずに 6 件すべてを捕捉しました。DeepSeek/Gemma の帰無結果は、この結果が基板条件付き(系統的にミスする審判)であり、すべてのモデルに関する主張ではないことを意味します。
4. パイプラインで変わること
Part 6 の図は真の曖昧さに対して残ります。ただし、L2→L3 トリガーの唯一のものではなくなります。
L2 votes
│
├─ known-reversal class tripwire (T1) ──────────► L3 / hard reject path
├─ unanimous_pass on reversal-prone class (T2) ► L3 ← inverse of auto-pass
├─ split (Dipankar) ────────────────────────────► L3
└─ else unanimous ──────────────────────────────► auto-execute
Enter fullscreen mode Exit fullscreen mode
一致を信頼度として読むのがバグでした。以前に誤りを犯したクラスでの一致は、相関エラーが隠れる場所です — Alexey の表現、そして qwen の投票です。
Mike の Part 6 Update は同じテールを監査サンプリング側から攻撃しました(1/confidence で監査を重み付けしない)。このパートはエスカレーショントリガー側から攻撃します。同じ母集団、異なる制御ノブ。
5. 限界(これらを添付したままに)
- DeepSeek / Gemma の帰無結果は、強いまたは奇妙に分割された審判がこの主張をストレステストしないことを意味します。主張は系統的にミスする審判についてであり、すべてのモデルについてではありません。
- qwen の実行はペルソナあたり N=1(60 コール)です。「発散で十分」という主張を棄却するには十分ですが、本番レートカードには不十分です。
- T1 はメンテナンスされたクラスリスト(DF/DS スタイル)が必要です。履歴のないコールドスタートクラスは D にフォールバックし、クラスがラベル付けされるまで D の盲点を引き継ぎます。
- forge-verify の
content-verify.mjsは現在も divergence→UNCLEAR 多数決ロジックを実装しています。これらのトリップワイヤーは設計 + ブログ証拠であり、この記事ではまだ製品化されていません。
更新 (2026-07-22): 2 つのアーム — 再発 vs 新規性 (Mike)
Mike Czerwinski は逆トリガーについて次のように述べました:
これはすでに誤りと判明したクラスでのみ発火します。「歴史的に逆転しやすい」は履歴から構築されるため、まだ見たことのない逆転しやすいクラスは…全会一致の高信頼度を生み出し、トリップワイヤーはありません… それはトリガーに対する反論ではありません… それは 2 アーム設計の 1 つのアームとして扱うべきという主張です… 既知の逆転トリップワイヤーは再発を捕捉します。新たな系統的バイアスの初回発生を捕捉するのは… 本当に独立した第 2 の読み取り [で]、履歴を必要とせずに不一致になるものです… 既知の逆転クラスでの全会一致高信頼度は正しい追加です。それは「確信を持って誤っていて、かつこれまで捕捉されたことがない」に対する修正ではありません。
その第 2 の母集団はこのスレッドで確信を持って誤っていて、かつこれまで捕捉されたことがない(新規の系統的バイアス)と名付けられました。T1/T2 は再発アーム — 安価で、履歴条件付き、必要です。新規性アームではありません。
Mike が新規性アームを埋めるかもしれないと望んだのは、classifier_disagree が単独で信号を運ぶこと(モデルの事前知識を共有しない独立した第 2 の読み取り)でした。Part 6 のサンプリングフィクスチャ(external-signal-ablation.json)でそのアブレーションを実行しました:classifier_disagree 単独の捕捉率 25.1% < Part 6 の 28.4% — 単一の外部信号としては最良ですが、新規性捕捉器として十分ではありません。barely_passed とバンドルすると向上しますが、単独では基準をクリアしません。したがって新規性アームは「CD を単独でトリップワイヤーに投入して初回発生を解決したと呼ぶ」ことではありません。
このシリーズがたどり着き続ける分岐:
| アーム | 信号形状 | 捕捉対象 | コスト |
|---|---|---|---|
| 再発 | T1 / T2 — 失敗履歴、既知の逆転クラス | 既知の失敗モードの繰り返し | 安価 |
| 新規性 | 審判の事前知識を共有しないソース(アウトオブチャネルプローブ、独立したモダリティ — Part 13 probe-vs-prose 参照;同じテキストチャネル内の別のプロンプトではない) | 新たな系統的バイアスの初回発生 | 高価 |
両方が必要です。安価なアームが高価なアームの仕事をカバーすることを期待するのが誤りです。D+T2 は Part 6 の図への正しい追加です。それは「確信を持って誤っていて、かつこれまで捕捉されたことがない」を閉じません。
更新 (2026-07-23): 「アウトオブチャネル」の実際の意味 (Mike)
新規性アームのプローブを構築する前に、Mike は独立性を買う性質 — 服装ではなく — を固定しました:
たとえ異なるプライミングをされたり、反対意見を求められたりしても、別の LLM コールがテキストでその主張が正しいかどうかを推論するのであれば、それは同じチャネルとみなされます。実際に独立性を買う性質は、プローブの答えが元の主張が一度も触れなかった経路を通じて事実を再導出すること — 異なるデータソース、構造的不変量、再計算 — であり、同じ証拠を異なるプロンプトで第 2 に読むことではありません。
具体的には:…プローブの出力が元の主張の推論と比較されることのみで評価されるのであれば、それは依然としてイン・チャネルであり、パイプラインの後段にあるだけです。意味的な新規性は困難です。なぜなら利用可能な第 2 意見のほとんどが同じ証拠と推論基板を継承するからです… そうでないものは希少で、通常ドメイン固有であり、それがこのアームがオープンなままになる理由であり、再発アームは今日構築可能です。
チェックサムテスト(運用上): プローブの pass/fail 基準を主張の根拠に言及せずに書くことができますか? できない → 依然としてイン・チャネル(帽子をかぶった 5 番目のプロンプト)。できる → アウトオブチャネルの候補。
| テストに失敗(same-channel) | テストに合格(out-of-channel) |
|---|---|
| Strict/Balanced/Lenient、「前の審判に反対する」、討論パネル | ソースデータからの再計算;構造的不変量(スキーマ、型、チェックサム);主張を反証するコマンドを実行するランナー(Part 13 probe) |
classifier_disagree (L2 が依然として同じアーティファクト上のテキストである場合) |
LLM のストーリーを一切読まない L0/L1 形状/契約チェック — その判定が主張の散文を解釈可能にする必要がない場合のみ |
したがって:再発アームは今日構築可能(T1/T2)。新規性アームは意図的にオープンなまま — 別のプロンプトを追加していないからではなく、本当の独立性が希少でドメイン形状であるためです。Part 13 の probe-vs-prose が最も近い既存のスレッドであり、Mike のチェックサムテストがそのアームに位置すると主張するものの受入基準です。
更新 (2026-07-23): 構造的 ≠ 因果的独立性 (Mike)
Mike のチェックサム基準に関するフォローアップ:
チェックサムフレーミングは正しい基準を設定します。なぜならそれはストーリーとは独立に反証可能だからです。元の推論と比較することでのみスコアリングできるプローブは、正しさではなく一致を評価しています。
明示的に名前を付ける価値があるケースの 1 つは…:構造的には異なるが、依然として同じ収集パイプラインの下流にある「他のデータ」です。2 つの信号が same-channel テストに合格しても、上流で共通の原因 — 主張とプローブの両方を同時に破壊するセンサー障害やスキーマ変更 — を共有する可能性があります。構造的独立性と因果的独立性は同じ性質ではありません。再発構築可能ケースは、2 番目をチェックしながら静かに 1 番目を仮定しているかもしれません。
2 つの切り口ではなく 1 つ:
| テスト | 質問 | 合格条件 | 不合格条件 |
|---|---|---|---|
| チェックサム / same-channel | 主張のストーリーなしでプローブをスコアリングできますか? | pass/fail が根拠なしに書ける | プローブが同じ証拠の第 2 のテキスト読み取りである |
| 因果的 / 共通原因 | 主張とプローブは上流の失敗モードを共有していますか? | プローブ入力が同じ収集/エクスポート/スキーマパスの下流にない | 見た目は独立しているが、同じセンサー障害・スキーマ変更・不正エクスポートによって破壊された「他のデータ」 |
チェックサムフレーミングは依然として正しい最初の基準 — 一致評価を止めます。ただし共通原因の盾ではありません。2 番目の失敗モードを命名し、「アウトオブチャネル」が構造的差異を因果的独立性に静かに昇格させないようにします。
非対称性主張についてこれが厳格化すること: 「再発は今日構築可能」 は、焼かれたクラスに対する T1/T2 について — 履歴条件付き、独立性は不要。下記のホールドアウトプローブは、新規性基準の構造的半分のみをチェックしました(pass/fail を主張の根拠なしに書ける)。共有上流失敗に対する因果的独立性を認証しませんでした。ドメイン形状の希少性には 2 つのレイヤーがあります:チェックサム合格プローブを見つけること、かつ その入力パスが主張と共通原因を共有しないプローブを見つけること。
更新 (2026-07-23): ホールドアウト実験 — 分岐は測定可能
最小限のオフラインテスト(novelty-arm-holdout-test.py → results-v2/novelty-arm-holdout.json、--holdout DS4 で凍結)。既知の逆転レジストリから DS4 をホールドアウト(モデル横断で 31 件の高信頼度 MISS 実行)。その初回発生塊に対する 3 つのアーム:
| アーム | DS4 高信頼度 MISS での捕捉率 |
|---|---|
| A 再発 (D+T2、DS4 はレジストリにない) | 0/31 (0%) |
| B Same-channel (同じ model×sid の別実行で拒否) | 1/31 (3%) |
| B′ Same-channel (qwen Strict/Balanced/Lenient) | unanimous_pass → 誤捕捉 |
| C Out-of-channel probe (タスク+アーティファクトチェックサム;審判根拠なし) | 31/31 (100%)‡ |
‡アーム C はフィクスチャデモであり、盲目的一般化ではありません。 probe_fail() は sid ごと / タスク制約ルール(DS4 を含む)をエンコードします;ホールドアウトは再発レジストリからのみ DS4 を除去します。プローブは依然としてアーティファクト形状を知っています。31/31 を「チェックサムスタイル基準がクラス履歴エントリなしで初回発生を捕捉できる」と読み、「失敗を見ずにプローブを発見した」とは読みません。--holdout DS9 でも同じ形状(再実行で JSON を上書き;デフォルト凍結は DS4)。
コントロール:ホールドアウト外の高信頼度 MISS に対する再発 = 61/61 (100%) — クラスが既知の場合、履歴は機能します。 legit V1/V2 に対するプローブ = 誤拒否なし。判定:SUPPORT(非対称形状に対して:A は新規性を見逃す / B は崩壊する / C はオラクルルール下で捕捉可能);Arm C が本番対応または因果的に独立しているという主張ではない。
したがって Mike の分岐は定義だけではありません。このフィクスチャでは:安価な再発は未燃クラスを見逃す;same-channel 第 2 読み取りはミスとともに崩壊する;チェックサムスタイルプローブはレジストリエントリなしで初回発生を捕捉できる — すでに基準の書き方を知っている場合。新規性アームは依然としてドメイン形状であり、その希少性主張は残ります。上記の更新と併せて読んでください:この実行は新規性基準の構造的半分をサポートします;同じパイプラインの共通原因に対する因果的独立性を主張するものではありません。
結び
Part 6 は多数決の分割を偽の合意にしないように止めたのは正しかったです。補集合 — 全会一致 — を、DF v2 がすでに測定した失敗モードに対する安全な自動実行として扱ったのは誤りでした。Alexey は母集団ミスマッチを命名し、DF 多視点再実行はそれに数値を付けました。Mike は再発アームが見ることのできない残存母集団を命名し、そのアームが構築される前に「アウトオブチャネル」が意味しなければならないことを固定し、その基準を構造的独立性と因果的独立性に分割しました。
発散は残ります。T1/T2 がそれに加わります。それらのいずれも新規性アームではありません。5 番目のプロンプトも新規性アームではありません。チェックサム合格の「他のデータ」プローブも自動的に共通原因の盾ではありません。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.