可证明为正确,而非大概率正确
可证明为正确,意味着一项临床 AI 决策可以按需重建:所引的确切规则、所核的确切取值、返回通过或不通过的确定性操作,以及一位对其加以确认的署名的人。大概率正确,意味着系统很有把握。在核查之下,二者只有其一能存活。
这是一个类别层面的区分,不是一句营销话术。它把临床 AI 分成两种架构:它们在演示中看起来一模一样,却在某一刻表现得截然不同,那一刻,一位监管者、一个伦理委员会或一个法庭,问出唯一重要的问题:给我看这项决策究竟是如何做出的。
一种架构以概率作答。另一种以证明作答。
没有任何概率能回答的问题
一位核查员走进一个临床中心。她随机挑出一名已入组的受试者,说:请一步步向我说明,你是如何判定这名受试者符合入选资格的。
如果这项决策无法当着她的面被重建,即源数据、入选与排除的核查、把二者连起来的逻辑,那就是一项方案合规发现。多年来,方案合规一直位列 FDA 与 EMA 的 GCP 核查中最常被提及的缺陷类别之一。它是这一领域最古老、也最被充分理解的失败。
一个置信度分数无法向任何人说明任何事。
每一个治理临床 AI 的监管框架都建立在同一个要求之上:一项受监管的决策必须可重建,即从源数据,经决策逻辑,直到产出它的那条规则,在核查员发问的那一刻可以重建。这一要求出现在 21 CFR Part 11、ALCOA+、ICH E6(R3)、欧盟人工智能法案第 11、12、13、14 条、巴西 CFM 决议 2.454/2026,以及印度 New Drugs and Clinical Trials Rules, 2019 之中。措辞因管辖区而异,架构上的要求不变。
一个置信度分数,就其构造而言,是一个概率分布的输出。它不是一条规则应用于源数据的输出。你可以在事后为它贴上一个监管标签,却无法从一条规则把它推导出来。
这就是全部的区分,落在证据的层面上:
🔹 大概率正确优化的是系统有多经常正确。
🔹 可证明为正确优化的是我们能否证明系统在这一具体决策上遵守了每一项约束。
两个问题都重要。既有的验证范式回答的是第一个。第二个被留给监管事务去自行"翻译",而它无法被翻译。一个置信度分数不是合规 artefact,它是披着监管外衣的营销信号。
模拟与证明
"大概率正确"有一个更微妙的版本值得点名,因为最精巧的系统正是在那里失败。
有些临床 AI 在模拟监管者。它预测一位核查员、一个伦理委员会或一位机构评审员会如何评价某一给定输出。一个训练良好的模型能把这件事做得惊人地好。但对监管者判断的预测,按定义就是大概率正确。它是对一个从未真正作出的人类裁决的、一个很好的猜测。
可证明为正确不模拟监管者。
它以确定性方式证明一组有界的结构性属性,没有概率性的中间地带,并把这一边界之外的每一处判断,都交给一位署名的人类确认者。机器证明可被证明者,人决定需要判断者。没有任何东西被先猜测,再打扮成裁决。
这就是把两类分开的那句话:
一个预测监管者会怎么说的系统,是大概率正确。
一个证明有界属性、并把其余交给一位负责之人的系统,是可证明为正确。
证明证书究竟是什么
证明证书不是一个隐喻,也不是一个仪表盘。它是一份具体的、结构化的 artefact,由系统在决策时刻产出,包含一组既定的属性。其核心为:
🔹 所引规则。 所应用的具体规则,按来源、引用与版本。不是"FDA 指南"。方案第 4.2.1 节,入选标准 7,依据 ICH E6(R3) 的源数据要求核查。
🔹 所核取值。 所核对的确切患者、方案、中心与运营取值。逐项列出,而非概括。可归因至来源。
🔹 验证操作。 针对这一具体决策返回通过或不通过的确定性程序。可检视。可复现。可在核查员面前重新运行。
🔹 边界声明。 该操作未核查的内容,以及刻意保留给负责之人的人类判断要素。
完整规范把这扩展到八项属性,另加决策被冻结的风险类别、作出确认之人的身份、覆盖与升级记录,以及一项明确声明:该操作是*呈交给审阅者的证据,而非对审阅者判断的替代。*完整 schema 见监管验证框架。
没有概率。没有模型置信度。没有事后附加的可解释性分数。
这正是 21 CFR Part 11 自 1997 年起所要求的。是 ALCOA+ 在每一个受核查的中心每天所要求的。是欧盟人工智能法案如今明确要求的。也接近 CFM 决议 2.454/2026 对巴西医疗实践中 AI 的期待:可解释性、决策可追溯性,以及一项由人作出的最终决定,其重心在于决策的可追溯性,而非模型的可解释性。该决议治理医疗实践,将于 2026 年 8 月生效;它所明确的原则,即决策层面的可追溯性,正是证明证书所产出的。
监管标准已经在此。而供应商这一侧的许多部分尚未跟上。
三秒测试
有一个测试,任何监管事务专业人士今天都能对任何临床 AI 系统施行。
请说:把这项决策的证明 artefact 给我看,所引规则、源取值、验证操作、边界声明,在一份文件里。然后为回答计时。
🔹 如果回答跳转到一个仪表盘,那是包在界面里的一个置信度分数。
🔹 如果回答提出导出一份审计日志,那是一个时间戳数据库。
🔹 如果系统在数秒内产出一份携带上述属性的结构化 artefact,那才是一份证明证书。
如今部署的多数临床 AI 都通不过这个测试。不是因为供应商不诚实,而是因为其架构把合规当作末端加上的一层。到那时,监管原语,即"规则到决策到源数据"的可核验轨迹,已被一个概率取代。你无法把一份证明证书事后加装到一个置信度分数之上。系统必须从第一行��码起就围绕证书来构建。
为什么证据必须是非相关的
还有一项属性,把证明与表现区分开来,而它最常被忽略。
置信度分数是模型在给自己的作业打分。它由其所评分之输出的同一系统生成,因而继承了那一输出的盲区。当它出错时,它往往恰恰以那一输出出错的方式出错。这是披着核查外衣的相关性证据。临床 AI 中许多被当作质量控制来呈现的东西,即一个 agent 核查另一个在相同数据上训练的 agent,具有同样的缺陷。
可证明为正确,要求以不同方式失效的证据。
一次��定性规则核查、一份形式化结构证明、一项人类确认,是三种不同的底层。它们不太可能共享一个共同的失败原因。一次规则核查可能以结构证明会捕捉到的方式出错。一份结构证明可能在一个人会否决的判定上放行。一个人可能捕捉到两项机器操作都未被界定去看的东西。取自以不同方式失效之底层的证据,其可辩护性是单一自报数字所永远不具备的。
相关性证据是置信度。非相关性证据是证明。
这所定义的类别
"可证明为正确,而非大概率正确"是某一特定基础设施类别之下的设计原则:面向受监管临床决策的、验证优先的 AI。这一区分首先是架构上的。
🔹 一个概率模型可以参与决策流程,但仅仅因为它被一道它无法绕过的确定性核查所把关。模型提议。证明裁定。
🔹 核查员、伦理委员会或法庭所见的一切,都由确定性验证层产出,而非由喂给它的概率性底层产出。
🔹 是验证层,而非模型,产出受监管的 artefact。
正因如此,这一类别由它能重建什么来定义,而非由它自称有多准确来定义。准确是模型的属性。可采性是架构的属性。
监管框架正从各个方向向此收敛:美国的持续、实时核查走向,欧盟的高风险合规评估,巴西的决策层面可解释性。当核查变为持续时,验证就必须是确定性的、即时的。事后记录符合性的程序性验证,无法在这一节奏下运作。架构性验证可以。
这个领域将不得不选择,哪一份 artefact 算数。一个概率,还是一份证明。
可证明为正确,而非大概率正确。这就是标准。证书,就是那份证明。
常见问题
在临床 AI 中,"可证明为正确,而非大概率正确"意味着什么?
它意味着一项临床 AI 决策可以被确定性地重建并加以辩护,即确切的规则、取值、验证操作与人类确认,而不仅仅附带一个表明模型有多确定的置信度分数。概率描述的是模型的内部状态。证明描述的是究竟核查了什么。
为什么置信度分数不是合规 artefact?
置信度分数是一个概率分布的输出,而非一条规则应用于源数据的输出。诸如 21 CFR Part 11、ICH E6(R3) 与欧盟人工智能法案第 11、12、13、14 条等法规,要求一项受监管的决策可按需重建。置信度分数无法被重建为产出该决策的规则与取值,因此无法满足这一要求。
证明证书是什么?
证明证书是一份在 AI 辅助决策做出的时刻产出的结构化 artefact。它记录所引规则、所核取值、确定性验证操作、一份关于未核查内容的明确边界声明、被冻结的风险类别、作出确认之人的身份、覆盖与升级记录,以及一项声明:该操作是证据,而非对人类判断的替代。
证明证书与审计日志有何不同?
审计日志通常是一个记录"某事发生过"的时间戳数据库。证明证书则如实记录究竟核查了什么、对照哪条规则与版本、用哪些源取值,以及什么被刻意留给了人类判断,全都在一份可复现、可在核查员面前重新运行的单一 artefact 之中。
验证优先的架构是否取代人类审阅者?
否。该架构明确是证据,不是替代。验证操作是一份上游证据,由一位署名的人在确认该决策之前加以消费。问责始终在人。
NexTrial.ai 为 AI 辅助的临床试验激活构建验证优先的基础设施。此处所述能力反映该框架的设计意图。完整架构参见监管验证框架。