分歧將錯誤族群升級:全體一致卻漏掉自動通過

Agent Determinism Illusions (Part 7)

定位:本篇 延續 Part 13 的 probe-vs-prose 討論,而是回到 Part 6 的 L2→L3 升級規則——Dipankar 將投票分歧視為人工審核訊號。Alexey Spinov 的後續評論指出,該訊號指向錯誤的族群。兩項實驗驗證他是否正確,以及 tripwire 應該改放什麼。

Part 6 繪出此控制流程:

L2 multi-perspective votes
        │
   unanimous ──────────► AUTO-PASS / AUTO-REJECT
        │
   divergence (e.g. 2–1) ► L3 human

進入全螢幕模式 退出全螢幕模式

原文已有提醒:分歧測量的是模糊度,並未修正全體一致的系統性偏差。Alexey 的論點更尖銳——它關乎 路由,而非另一段提醒。


1. Alexey 的人口錯配

在 Part 6 討論串中,Alexey Spinov 寫道(精簡改寫):

危險的失敗是高信心且有方向性——系統性。系統性偏差跨提示共享,而非個別(你的 P3:多數決無法修正)。因此三種視角往往會在這些案例上 一致。分歧→人工於是把安全模糊的案例送給人類,卻自動通過有信心卻錯誤的案例。升級訊號指向錯誤的族群。

他提出兩種低成本替代:

  1. T1 — 對已知反轉類別設定確定性 tripwire(無論是否一致皆升級)。
  2. T2 — 將 全體一致且對歷史易反轉類別有高信心 視為升級——「高信心→自動通過」的反向

這就是待驗證的主張。不是「分歧無用」,而是「對你已測量的失敗模式而言,單一分歧不是主要的 tripwire」。


2. 實驗 A——DF v2 離線代理(無新 API)

Part 6 的 Mike Update 已顯示:在 96 次 DF v2 MISS 執行中,95.8% 的自我報告信心 ≥ 0.9(平均 0.969)。這群體相當集中——Part 6 亦指出 qwen3:0.5b 貢獻約 80% 的 MISS,因此標題是集中事實,而非三模型普適法則。P2(同提示 N=10;未凍結 results-v2 轉儲)顯示相同輸入的模型內分歧接近 0。因此初步:

  • conf ≥ 0.9全體一致通道代理 → 在 Part 6 的 Dipankar 規則下會 自動通過
  • conf < 0.9分歧代理 → 會 升級

在 PASS 決策卻是 MISS 的案例中,移除 2 次 deepseek DS4 信心為 null 的執行(政策表需要標量信心)。下表分母因此為 n=94,而非 Part 6 標題的 n=96:

分歧代理下的分桶 MISS 佔比 (n=94)
會 AUTO-PASS(conf≥0.9) 97.9% (92/94)
會 ESCALATE(conf<0.9) 2.1% (2/94)

同一 PASS 集的政策比較:

政策 MISS 捕捉率 MISS 仍自動通過率
D(僅低信心升級) 2.1% 97.9%
T1(升級所有 DF*/DS* 類別) 100%† 0%
T2(反轉類別 ∩ conf≥0.9) 97.9% 2.1%
D+T2 100% 0%

T1 在此測試上是類別清單上限,而非獨立發現。 每一次 DF v2 MISS sid 皆為 DF*/DS*;「升級所有反轉類別」因此依定義捕捉 100% MISS。T1 應視為神諭上限;可部署的主張是 D+T2

腳本:scripts/escalation-population-mismatch.py

代理下的判決(針對 D 與 D+T2,而非單獨 T1):SUPPORT

代理並非多法官重跑。下一節移除此藉口。


3. 實驗 B——DF 集上的真實 Strict / Balanced / Lenient

同 20 個 DF v2 情境。同 P3 的三人角色。每情境每角色一次呼叫(每模型 60 次)。升級政策現使用 實際投票模式

  • D —— split 即升級
  • T1 —— 已知反轉類別(DF*/DS*)位於接受路徑即升級
  • T2 —— 反轉類別 unanimous_pass 即升級
  • D+T2 —— 聯集

deepseek-v4-flash——此主張的錯誤基質

幾乎所有壞情境都被全體否決。0 次危險接受(壞案例多數 PASS)。無法在幾乎不失誤的模型上測量「全體一致失誤自動通過」。空結果,並非否證。

gemma3:latest——不同的失敗形狀

Strict/Balanced 拒絕,Lenient 通過 → 幾乎皆為 split,多數仍拒絕壞案例 → 0 次危險接受。分歧會升級幾乎所有接受路徑雜訊(含真實通過)。亦非 Alexey 所指族群。

qwen3:0.5b——符合主張的基質

6 次危險接受(壞輸出多數 PASS)。其中:

模式 次數 比例
unanimous_pass 4 66.7%
split 2 33.3%

該次執行的政策表:

政策 MISS 捕捉率 MISS 仍自動通過率 真實通過升級率
D 33.3% 66.7% 0%
T1 100%† 0% 0%
T2 66.7% 33.3% 0%
D+T2 100% 0% 0%

†與 §2 相同提醒:六次危險接受皆位於反轉類別 sid,因此 T1 的 100% 是類別清單上限。承重列為 D+T2

腳本:scripts/df-multiperspective-escalation.py

結果:results-v2/df-multiperspective-qwen3-0.5b.json(另有 deepseek / gemma 轉儲)。

在實際產生此失敗模式的模型上判決:PARTIAL → SUPPORT。三分之二的危險接受為全體一致,在 Part 6 規則下會自動通過。單獨分歧捕捉另外三分之一。D+T2 捕捉全部六次,且未升級本次執行的真實通過。DeepSeek/Gemma 空值表示這是基質條件結果(系統性失誤的法官),而非對所有模型的主張。


4. 管線的變更

Part 6 的圖示保留給真正模糊。它不再是唯一的 L2→L3 觸發器。

L2 votes
   │
   ├─ known-reversal class tripwire (T1) ──────────► L3 / hard reject path
   ├─ unanimous_pass on reversal-prone class (T2) ► L3   ← inverse of auto-pass
   ├─ split (Dipankar) ────────────────────────────► L3
   └─ else unanimous ──────────────────────────────► auto-execute

進入全螢幕模式 退出全螢幕模式

將一致視為信心是錯誤。一致卻發生在你曾經判錯的類別,正是相關錯誤藏匿之處——Alexey 的用語,以及 qwen 的投票。

Mike 的 Part 6 Update 從稽核抽樣端攻擊同一尾巴(不要用 1/confidence 加權稽核)。本篇從升級觸發器端攻擊。同一族群,不同控制旋鈕。


5. 限制(請一併附上)

  • DeepSeek / Gemma 空值表示:強或奇特分割的法官無法壓力測試此主張。主張針對系統性失誤的法官,而非所有模型。
  • qwen 執行是每角色 N=1(60 次呼叫)。足以拒絕「分歧就夠了」,但不足以產出生產級速率卡。
  • T1 需要維護類別清單(DF/DS 風格)。無歷史的冷啟動類別退回 D——直到類別被標記前,仍繼承 D 的盲點。
  • forge-verify 的 content-verify.mjs 目前仍實作 divergence→UNCLEAR 多數邏輯。這些 tripwire 是設計 + 部落格證據,尚未在此篇文章中產品化。

更新(2026-07-22):兩條臂——重現 vs 新穎(Mike)

Mike Czerwinski 針對反向觸發器:

它只在你已捕捉到錯誤的類別上觸發。「歷史易反轉」由歷史建構,因此尚未見過的反轉類別……會產生全體一致高信心且無 tripwire……這不是反對觸發器的論點……而是主張將其視為雙臂設計的一臂……已知反轉 tripwire 捕捉重現。新系統性偏差首次出現時,需要更接近……真正獨立的第二次讀取 [它] 不需要歷史就能不同意……已知反轉類別上的全體一致高信心是正確的補充。它不是捕捉「有信心卻錯誤且從未被抓到過」的解方。

該第二族群在此討論串中有了名稱:有信心卻錯誤且從未被抓到過(新穎系統性偏差)。T1/T2 是重現臂——便宜、依賴歷史、必要。它們不是新穎臂。

Mike 希望填補新穎臂的是 classifier_disagree 單獨攜帶訊號(獨立的第二次讀取,不共享模型的先驗)。我們在 Part 6 抽樣測試上執行該消融(external-signal-ablation.json):classifier_disagree 單獨捕捉 25.1% < Part 6 的 28.4%——最佳單一外部訊號,仍然不足以單獨作為新穎捕捉器。與 barely_passed 綁定可提升;單獨則無法達標。因此新穎臂 不是「把 CD 單獨放入 tripwire 就解決首次發生」。

本系列持續落腳的岔路:

訊號形狀 捕捉 成本
重現 T1 / T2——失敗歷史、已知反轉類別 已燒毀模式的重複 便宜
新穎 不共享法官先驗的來源(跨通道探測、獨立模態——見 Part 13 probe-vs-prose;非同一文字通道的另一提示) 新系統性偏差的首次發生 昂貴

兩者都要。錯誤在於期待便宜臂能完成昂貴臂的工作。D+T2 仍是 Part 6 圖示的正確補充。它並未關閉「有信心卻錯誤且從未被抓到過」。

更新(2026-07-23):什麼是「跨通道」(Mike)

在建構新穎臂探測前,Mike 釘下獨立性的屬性——而非外表:

若探測仍是另一個 LLM 呼叫,以文字推理判斷主張是否正確,即使提示不同或要求不同意,仍屬同通道。真正買到獨立性的屬性是:探測的答案來自透過原主張從未觸及的路徑重新推導事實——不同的資料來源、結構不變量、重新計算,而非對同一證據的第二次讀取(不同提示)。

具體而言:……事先陳述探測錯誤意味什麼且不依賴原主張的內容,就像校驗和可以獨立於檔案內容是否正確而判斷錯誤。若評估探測輸出的唯一方式是與原主張的推理比較,則仍屬同通道,只是管線稍後。語義新穎性之所以困難,正是因為大多數可取得的第二意見繼承了相同的證據與相同的推理基質……那些不繼承的較為稀有且通常領域特定,這大概也是為什麼此臂至今仍開啟,而重現臂今天就能建構。

校驗和測試(可操作):你是否能在不參照主張理由的情況下寫出探測的通過/失敗準則?若否 → 仍屬同通道(戴帽子的第五提示)。若可 → 跨通道候選。

未通過測試(同通道) 通過測試(跨通道)
Strict/Balanced/Lenient、「不同意前一位法官」、辯論小組 從來源資料重新計算;結構不變量(schema、type、checksum);執行可反駁主張的命令的 runner(Part 13 probe)
classifier_disagree(當 L2 仍是對同一構件的文字讀取) L0/L1 形狀/合約檢查,從不讀取 LLM 的故事——僅當其裁決不需要主張散文即可解讀時

因此:重現臂今天就能建構(T1/T2)。新穎臂刻意保持開啟——不是因為我們還沒加另一個提示,而是因為真正的獨立性稀有且領域形塑。Part 13 的 probe-vs-prose 是現有最接近的討論串;Mike 的校驗和測試是任何宣稱位於該臂的接受準則。

更新(2026-07-23):結構 ≠ 因果獨立(Mike)

Mike 針對校驗和門檻的後續:

校驗和框架設定了正確的門檻,因為它可獨立於故事而被否證。一個只能透過與原推理比較來評分的探測,評的是同意度,而不是正確性。

值得明確命名的案例……:「其他資料」在結構上不同,但仍處於同一收集管線的下游。兩個訊號可通過同通道測試,卻仍共享上游共同原因——感測器停機或 schema 變更同時損壞主張與探測輸入。結構獨立與因果獨立不是同一屬性,而重現-今天可建構的案例可能悄悄假設了後者,卻只檢查了前者。

兩道切割,而非一道:

測試 詢問 通過條件 仍失敗條件
校驗和 / 同通道 你是否能在不看主張故事的情況下評分探測? 通過/失敗可不參照理由撰寫 探測是對同一證據的第二次文字讀取
因果 / 共同原因 主張與探測是否共享上游失敗模式? 探測輸入不處於同一收集/匯出/schema 路徑的下游 「其他資料」看起來獨立,卻被同一感測器停機、schema 變更或錯誤匯出損壞

校驗和框架仍是第一道正確門檻——它阻止同意度評分。它不是共同原因的護盾。命名第二種失敗模式,讓「跨通道」不會默默將結構差異提升為因果獨立。

這對不對稱主張的收緊:「重現今天可建構」指的是 T1/T2 作用於已燒毀類別——依賴歷史,不需要獨立性。下方的保留探測僅檢查了新穎門檻的結構一半(通過/失敗可不參照主張理由撰寫)。它並未驗證針對共享上游失敗的因果獨立。領域形塑的稀有性現在有兩層:找到通過校驗和的探測,以及找到其輸入路徑不與主張共享共同原因的探測。

更新(2026-07-23):保留實驗——岔路可測量

最小離線測試(novelty-arm-holdout-test.pyresults-v2/novelty-arm-holdout.json,以 --holdout DS4 凍結)。將 DS4 從已知反轉登錄檔中保留(跨模型 31 次高信心 MISS)。針對首次發生群體的三臂:

DS4 高信心 MISS 捕捉率
A 重現(D+T2,DS4 不在登錄檔) 0/31(0%)
B 同通道(同一 model×sid 的其他執行被拒) 1/31(3%)
B′ 同通道(qwen Strict/Balanced/Lenient) unanimous_pass → 捕捉失敗
C 跨通道探測(任務+構件校驗和;無法官理由) 31/31(100%)‡

臂 C 是測試示範,而非盲泛化。 probe_fail() 編碼每 sid / 任務約束規則(含 DS4);保留僅移除 DS4 在重現登錄檔中的條目。探測仍知道構件形狀。將 31/31 讀作「校驗和式準則可以在沒有類別歷史條目的情況下捕捉首次發生」,而非「我們在不看失敗的情況下發現了探測」。同形狀以 --holdout DS9(重跑會覆寫 JSON;預設凍結為 DS4)。

對照:重現臂在保留高信心 MISS 上的捕捉率 = 61/61(100%)——類別已知時歷史有效。探測在合法 V1/V2 上的誤拒 = 0。判決:SUPPORT 不對稱形狀(A 漏掉新穎 / B 崩壞 / C 可在神諭規則下捕捉);不是 主張臂 C 已可生產或具因果獨立。

因此 Mike 的岔路不僅是定義。在此測試上:便宜的重現臂漏掉從未燒毀的類別;同通道第二次讀取與失誤一起崩壞;校驗和式探測可以在沒有登錄檔條目的情況下捕捉首次發生——前提是你已經知道如何撰寫準則。新穎臂仍是領域形塑;稀有性主張維持不變。配合上方更新閱讀:本次執行支持新穎門檻的結構一半;它並未主張針對同一管線共同原因的因果獨立。


結語

Part 6 停止將多數決分割視為虛假共識是正確的。它錯在將補集——全體一致——視為已測量失敗模式(DF v2)的安全自動執行。Alexey 指出了人口錯配;DF 多視角重跑為其提供了數字。Mike 指出了重現臂無法看見的殘餘族群,釘下了該臂建構前「跨通道」必須意味什麼,並將門檻拆分為結構與因果獨立。

分歧保留。T1/T2 加入。沒有任何一者是新穎臂。第五個提示也不是新穎臂。通過校驗和的「其他資料」探測也不自動成為共同原因護盾。