James Whitfield

我開始為 CAPA 分流打造 AI 助理原型,因為我們的待辦事項讓 QA 團隊應接不暇。想法顯而易見:讓模型讀取新進的不符合或申訴,建議可能的根本原因類別、從技術檔案中找出相關文件,並提出供人類編輯的糾正措施草案。它在沙盒中加速了篩選流程,直到那個令人不舒服的問題出現:我們要如何驗證,才能讓法規機構(或我的內部稽核員)接受?

如果你在 21 CFR 820 和 ISO 13485 規範下工作,你已經知道 CAPA 不是一個可以未經證實就冒險的地方:21 CFR 820.100 要求文件化的程序與有效性驗證;ISO 13485 要求受控的糾正/預防流程。但這些標準是為人類流程和傳統軟體驗證而撰寫的。AI 改變了「驗證」與「證據」的形態。

以下是我在原型開發過程中學到的經驗,以及我們用來從實驗走向受控輔助部署的實用驗證模式。

核心問題:當模型具機率性時,「驗證」的是什麼?

傳統軟體驗證是:輸入 X → 預期的確定性輸出 Y。對於 LLM,輸出是機率的、受脈絡影響的,且會隨模型更新而改變。這意味著你無法把模型當成永遠產生相同糾正計畫的黑箱 SOP。然而,你可以把模型視為「受控輔助」——一種建議來源,須經人類審查與追溯。但即使如此,仍需要驗證文件。

我原型開發的內容(務實而非理論)

  • 從我們的 QMS 擷取去識別化的歷史 CAPA 與不符合報告樣本(我們已清除 PHI 與供應商敏感文字)。
  • 建立我們受控文件的嵌入索引(設計歷史、風險評估、過往 CAPA),讓助理能找出脈絡。
  • 建立「影子模式」管線:AI 撰寫建議,但我們不採取行動——我們記錄建議並與原始人類結果比較。
  • 衡量一致性:AI 的根本原因類別是否與人類類別相符?其前 3 個建議參考文件是否包含人類實際使用的文件?

結果揭示了常見現象:有幫助的命中、看似合理卻錯誤的論述,以及偶爾出現的幻覺——附帶聽起來自信卻不存在的引用。

對我們有意義的驗證模式

我不想「驗證模型」(太脆弱);我想驗證受控輔助流程,並產出法規機構所期望的證據。我們定義以下項目、進行迭代,並將一切納入變更管制:

  1. 定義範圍與邊界

    • 助理可以觸及哪些 CAPA 類型?(例如:僅限行政分流;不得影響製造停工決定)
    • 允許的資料:不得將 PHI 或受管制的供應商 IP 傳送至公開 LLM。
  2. 建立黃金測試語料庫

    • 去識別化的歷史案例,包含人類已接受的根本原因、使用的參考文件,以及最終糾正措施。
    • 包含邊緣案例與模糊輸入。
  3. 驗收標準(可衡量)

    • 範例指標:與人類相比的前 1 名根本原因一致性、前 5 名參考文件中至少包含一個正確文件的比例、每 100 個建議中出現幻覺引用的比率。
    • 依風險定義通過/失敗閾值(對任何影響產品處置的事項提高審查嚴格度)。
  4. 持續監控與漂移偵測

    • 記錄模型版本、提示範本與嵌入索引版本。
    • 定期對黃金語料庫與新的即時決策稽核執行重新測試。
    • 若效能下降,啟動變更管制並重新驗證。
  5. 人類在迴路中的控制

    • 助理的輸出以草稿形式儲存在 CAPA 記錄中,並清楚標註來源(模型版本、時間戳、提示)。
    • 在採取任何行動前,必須由指定的人類審查者接受、編輯並簽核。
  6. 文件與追溯性

    • 助理使用的 SOP、驗證計畫、測試報告,以及定期審查日誌。
    • 維護可稽核的軌跡,將建議連結至最終 CAPA 內容。

對工程師有用的實作說明

  • 將提示、測試套件與評估程式碼視為受版本控制的文件。我們使用小型 CI 作業,在變更提示或升級模型時執行黃金語料庫測試。
  • 快照你的嵌入索引,並將助理所使用的版本儲存在每個 CAPA 記錄中。這可保留助理為何顯示某文件的「原因」。
  • 在呼叫外部 LLM 前,先將 PHI 與供應商機密資料編輯或代碼化。若必須傳送敏感資料,請優先使用符合 DPA 與 SOC2 控制的企業/私有託管模型。
  • 將所有記錄寫入僅附加的稽核儲存區(我們透過 webhook 將記錄寫入 QMS,使每個草稿建議成為 CAPA 歷史的一部分)。
  • 定義角色:誰可以接受 AI 建議、誰只能檢視、誰可以編輯模型提示/政策。

稽核員與通知機構會提出異議的地方

根據我的經驗,審查者關心的是:

  • 證明助理不會在沒有監督的情況下改變 CAPA 結果。
  • 顯示模型版本控制與決策路徑的可重現記錄。
  • 資料保護控制(特別是臨床申訴)。
  • 清楚的 SOP,說明何時可以使用助理、何時必須繞過。

如果你無法展示這些文件,預期會被提問——並準備好出示你的黃金語料庫測試結果與重新驗證計畫。

結語

AI 可以大幅減少分流時間,並從大型技術檔案中找出相關證據。但驗證對話不是一次性的勾選項目;它是一個持續性的計畫:測試語料庫、監控、變更管制與人類監督。最終,我們接受 AI 在減少行政工作的地方使用,而絕不在它可能直接改變產品處置且未經人類簽核的地方使用。

我想從這個社群學到的是:你們是否有用來說服內部稽核員或通知機構,AI 輔助 CAPA 工作流程已「驗證足夠」的具體測試案例或指標清單?若有,能否分享在你們的稽核中有效的測試案例或驗收標準類型?