由于我们的积压工作让 QA 团队不堪重负,我开始为 CAPA 分流原型设计一款 AI 助手。这个想法显而易见:让模型读取传入的不符合或投诉,建议可能的根本原因类别,从技术文件中提取相关文档,并提出供人工编辑的纠正措施草案。在沙箱环境中,它确实加快了筛查速度——直到那个令人不安的问题出现:我们如何验证它,以让监管机构(或我的内部审计师)能够接受?
如果您在 21 CFR 820 和 ISO 13485 框架下工作,您已经知道 CAPA 不是一个可以进行未经证实的赌博的地方:21 CFR 820.100 要求有记录的程序和有效性验证;ISO 13485 要求受控的纠正/预防过程。但这些标准是为人工流程和经典软件验证编写的。AI 改变了“验证”和“证据”的形式。
以下是我通过原型设计学到的内容,以及我们用来从实验转向受控辅助部署的实用验证模式。
核心问题:当模型具有概率性时,什么是“已验证”的?
传统的软件验证是:输入 X → 期望的确定性输出 Y。使用 LLM 时,输出是概率性的、上下文敏感的,并且会随着模型更新而变化。这意味着您不能将模型视为始终产生相同纠正计划的黑匣子 SOP。然而,您可以将模型视为“受控辅助”——一种受人工审查和可追溯性约束的建议来源。但以这种方式处理它仍然需要验证工件。
我原型设计的内容(实用的,而非理论的)
- 从我们的 QMS 中摄取了已去标识的历史 CAPA 和不符合报告样本(我们清理了 PHI 和供应商敏感文本)。
- 构建了我们受控文档(设计历史、风险评估、过去的 CAPA)的嵌入索引,以便助手可以提取上下文。
- 创建了一个“影子模式”管道:AI 编写建议,但我们没有对其采取行动——我们记录了建议,并将其与原始人工结果进行比较。
- 测量对齐度:AI 的根本原因类别是否与人工类别匹配?其前 3 个建议的参考文献是否包含人工实际使用的文档?
这揭示了通常的情况:有帮助的命中、看似合理但错误的理由,以及偶尔出现的带有听起来自信的引用但实际上不存在的幻觉。
对我们有意义的验证模式
我不想“验证模型”(太脆弱);我想验证受控辅助过程,并生成监管机构期望的证据。我们定义了以下内容,进行了迭代,并将所有内容置于变更控制之下:
-
定义范围和边界
- 助手可以触及哪些 CAPA 类型?(例如,仅行政分流;不能做出制造暂停决定)
- 允许的数据:不得将 PHI 或受监管的供应商 IP 发送到公共 LLM。
-
创建黄金测试语料库
- 带有已获人工接受的根本原因、所用参考文献和最终纠正措施的已去标识历史案例。
- 包括边缘案例和模棱两可的输入。
-
验收标准(可衡量的)
- 示例指标:与人工相比的 top-1 根本原因一致性、top-5 参考文献中至少包含一个正确文档的出现率、每 100 个建议的幻觉引用率。
- 根据风险定义通过/失败阈值(对影响产品处置的任何内容进行更高程度的审查)。
-
持续监控和漂移检测
- 编录模型版本、提示模板和嵌入索引版本。
- 根据黄金语料库和新实时决策审计定期运行重新测试。
- 如果性能下降,则启动变更控制和重新验证。
-
人在回路控制
- 助手的输出将作为草案保存到 CAPA 记录中,并带有明确的来源(模型版本、时间戳、提示)。
- 在采取任何行动之前,必须由指定的人工审查员接受、编辑并签字确认。
-
文档和可追溯性
- 助手使用 SOP、验证计划、测试报告和定期审查日志。
- 维护将建议链接到最终 CAPA 内容的审计跟踪。
对工程师有用的实施说明
- 将提示、测试套件和评估代码视为源代码控制工件。当我们更改提示或升级模型时,我们使用一个小的 CI 作业来运行黄金语料库测试。
- 对您的嵌入索引进行快照,并将助手在每个 CAPA 记录中使用的版本存储起来。这可以保留助手提取文档的“原因”。
- 在调用外部 LLM 之前,编辑或标记化 PHI 和供应商机密。如果您必须发送敏感数据,请优先选择受 DPA 和 SOC2 控制的企业/私有托管模型。
- 将所有内容记录到仅追加审计存储中(我们通过 webhook 将日志写入我们的 QMS,以便每个草案建议都成为 CAPA 历史记录的一部分)。
- 定义角色:谁可以接受 AI 建议,谁只能查看,以及谁可以编辑模型提示/策略。
审计师和公告机构将提出异议的地方
根据我的经验,审查员关心的是:
- 证明助手不会在没有监督的情况下改变 CAPA 结果的证据。
- 显示模型版本控制和决策路径的可重现记录。
- 数据保护控制(尤其是针对临床投诉)。
- 关于何时可以使用助手以及何时必须绕过助手的明确 SOP。
如果您无法证明这些工件,请做好接受提问的准备——并准备好出示您的黄金语料库测试结果和重新验证计划。
最后的想法
AI 可以显著减少分流时间,并从大型技术文件中提取相关证据。但验证对话不是一次性复选框;它是一个持续的程序:测试语料库、监控、变更控制和人工监督。最终,我们接受了 AI 在减少行政工作方面发挥作用的地方,而从未在它可以直接改变产品处置而无需人工签字确认的地方接受它。
我想从这个社区了解:您是否有说服内部审计师或公告机构相信 AI 辅助的 CAPA 工作流“已充分验证”的具体测试用例或指标列表?如果有,您能否分享在您的审计中有效的测试用例或验收标准的类型?
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.