法规立场
本分析体现基于风险的质量源于设计立场。它描述的是以法规互信为导向的实践,并不意味着获得任何监管机构的认可。
面向临床试验中 AI 的验证框架,是让一项 AI 辅助决策在核查下可重建、可辩护的一整套规则、artefact 与验证步骤。下文提出的框架建立在单一原语之上:在决策时刻产出的一份证明证书,经确定性验证把关,并由一位署名的人加以确认。模型提议。证明裁定。
人工智能正以越来越快的速度进入临床试验运营。AI 辅助的监管撰写、患者入选资格的预测性分析、多管辖区的合规协调,都已不再是设想,而是在生产环境中运行。然而,治理这些系统的验证范式,仍锚定在为诊断设备与作为医疗器械的软件所设计的框架之上,而非为在多管辖区之间撰写、核查并编排一项试验的文件与决策的编排系统而设计,其覆盖从方案与激活文书,到知情同意事件,直至结题。这一类别正是 NexTrial 所称的 Trial Activation Intelligence。
本文为这一空白提出一个验证框架。它是一份供批评、精化、并与监管事务群体共同开发的架构提案,不是产品规格,也不是对监管背书的宣称。
关于立场的说明。 此处任何内容都不主张或暗示任何监管机构、政府机关、标准组织或个人对 NexTrial 的背书,也不主张与任何具名标准的符合。引用监管文书是为了展示设计上的对齐,而非认证。所述益处均为设计意图。所述方法与 GxP 对齐,而非经 GxP 验证。文书按发布之日生效者引用;任何运行中的系统以当前文本为准,而非此处印出的引用。
空白:设备时代的验证遇上编排时代的 AI
美国在受监管记录的数据完整性上的基线是 21 CFR Part 11,它早于如今所讨论的系统。FDA 在这一领域最直接的表态,是 2025 年 1 月发布并仍为草案的指南《Considerations for the Use of Artificial Intelligence To Support Regulatory Decision-Making for Drug and Biological Products》。它建立在一个基于风险的、七步的可信度评估框架之上,以模型的使用情境为锚:即在何处、为何相信一个模型输出的描述。
这一使用情境的主线很重要,本框架直接采纳。但该草案从其范围中保留了那些用于内部运营效率、且其使用不涉及受试者安全、药品质量或结果可靠性的 AI,并且没有规定一个为受监管输出把关的确定性验证层本身如何被验证。一个产出监管提交、为入选资格预测患者轨迹、或跨管辖区强制合规的系统,直接关乎结果的可靠性。它落在该指南的关注之内,却尚未被该指南的机制所处理。
欧盟在一个方向上走得更远。欧盟人工智能法案(EU AI Act)将相关医疗 AI 归类为高风险,并在第 9 至 14 条下课以合规评估、技术文档、风险管理与上市后监测的义务。但它对形式化验证,即数学证明而非统计估计,如何映射到合规评估,提供的指引有限。
其结果是一个领域正从各个管辖区同时收敛于同一个问题:
当核查员问一项 AI 辅助决策是如何做出的时,哪一份 artefact 来回答?
论点:验证层就是可采性层
每一个治理临床 AI 的监管框架都建立在同一个共同要求之上。一项受监管的决策必须可重建,即从源数据,经决策逻辑,直到产出它的那条规则,在核查员发问的那一刻可以重建。这一要求出现在 21 CFR Part 11、ALCOA+、ICH E6(R3)、欧盟人工智能法案第 11、12、13、14 条、巴西 CFM 决议 2.454/2026,以及印度 New Drugs and Clinical Trials Rules, 2019 之中。措辞各异,架构上的要求不变。
当前临床研究中的 AI 部署有两种主导模式。
🔹 第一种把模型输出当作受监管的 artefact,并在事后为其叠加一层合规。
🔹 第二种把模型输出当作一个提议,在它成为受监管的 artefact 之前,必须经确定性验证把关。
只有第二种模式在上述框架下是可采的,无论模型的准确率、置信度或训练方法如何。事后叠加的合规层,记录的是一项已经以概率方式做出的决策。确定性闸门则从一开始就把决策作为一项可核验的操作产出。
治理本框架其余部分的规则,正源于这一区分:模型提议;证明裁定。 是验证层,而非模型,产出受监管的 artefact。一个概率模型之所以能作为决策流程中的参与者被采纳,仅仅因为它被一道它无法绕过的确定性核查所把关。核查员或伦理委员会所见的一切,都由确定性验证层产出,而非由喂给它的概率性底层产出。
原语:八项属性的证明证书
框架的核心架构原语是证明证书:一份在 AI 辅助决策做出的时刻产出的结构化 artefact。它被规定包含八项属性。
🔹 1. 所引规则。 具体的规则,按来源、引用与版本:一项监管条款、一条方案标准、一个 SOP 步骤,或一项管辖区要求。
🔹 2. 所核值。 所核对的确切患者、方案、中心或运营取值,逐项列出而非概括,可归因至来源。
🔹 3. 验证操作。 针对这一具体决策返回通过或不通过的确定性程序,可检视、可复现。
🔹 4. 边界声明。 该操作未核查的内容,以及保留给负责之人的人类判断要素。
🔹 5. 风险分级。 决策在做出时刻冻结的风险类别,它索引所施加的严格程度与重新验证的节奏。
🔹 6. 人类审阅者身份。 作出确认之人的身份与角色,与确认相绑定。
🔹 7. 覆盖与升级记录。 人是否接受、拒绝或要求修订,连同任何覆盖理由与任何升级。
🔹 8. 是证据,不是替代。 一项明确声明,说明该操作是呈交给审阅者的证据,而非对审阅者独立判断的替代。
该 artefact 可复现、可检视,并被设计为在核查下可采。一个置信度分数三者皆非。它无法满足 21 CFR Part 11 的可追溯性、ALCOA+ 的数据完整性、ICH E6(R3) 的源数据核查、欧盟人工智能法案第 11、12、13、14 条,也无法满足巴西 CFM 决议 2.454/2026 与印度 NDCTR 2019 的类似要求。
关于证明证书主张���么,需要说得精确,因为精确正是要点。它证明的是结构性属性:必填字段齐备、引用可解析、不存在结构性矛盾、既定的安全边界对某一具体输出成立。它不证明某一输出在语义意义上于临床或监管上正确。那一判断,留给监管验证,最终留给人。证书的价值不在于认证正确,而在于产出一份确定性的、可独立核验的、防篡改的记录,如实记下究竟核查了什么、未核查什么。
这些建议规定的是一份 artefact 与一套 schema,而非某一家厂商。任何产出符合规范之证书的系统都满足该标准,无论它是否与 NexTrial 的相像。
三道闸
证书由三道验证闸依次产出。每一道闸是不同的底层,而这种不同是刻意为之。
🔹 第一闸 — 管辖区特定的监管合规。 一个确定性的监管引擎,将所提议的决策对照治理管辖区的编码要求加以核查。验证由某一输出所治理之中心的管辖区触发,而非作为一份通用清单套用。规则正是在这里成为一项可计算的核查。
🔹 第二闸 — 形式化结��证明。 一个形式化验证步骤,就输出的结构性属性产出一份要么成功、要么失败、没有概率性中间地带的证明证书。这是对结构的数学证明,而非对质量的统计估计。
第二闸,即形式化证明层,现已上线并处于首次验证。框架的其余部分被描述为设计意图。
🔹 第三闸 — 强制性人类确认。 一位署名的人审阅证据并加以确认。该确认被绑定进记录。人是问责之点,而证书的设计意在使人的判断更充分知情,而非削减或取代它。
在开发过程中,两条原则反复浮现,如今组织起整个框架。
风险分级是架构原语。 每一道闸所施加的严格程度、重新验证的节奏,以及所需的人类确认层级,全都索引到一个在决策时刻分配并冻结的风险类别。高风险决策与低风险决策不会得到相同处理,而记录会显示施加了哪一种。
AI 验证是证据,不是替代。 证明证书是核查员或审计员所消费的上游证据。它并不减轻人类审阅者的负担。这是对"人在环中"这一套话最具承重意义的纠正:监督所针对的是一项决策,而非一个概率。审阅者无法有意义地验证一个 0.918。审阅者可以验证一份逐条的核查。
为什么证据必须是非相关的
有两项属性,使验证层可信,而非仅仅存在。
非相关性证据。 三道闸是以不同方式失效的独立底层。一次确定性规则核查可能以形式化结构证明会捕捉到的方式出错。一次结构证明可能在一个人会否决的判定上放行。一个人可能捕捉到两项机器操作都未被界定去看的东西。取自以不同方式失效之底层的证据,其可辩护性是单一自报分数所不具备的。
置信度分数提供的恰是相反。它由其所评分之输出的同一模型生成,因而继承了那一输出的盲区。它是披着核查外衣的相关性证据。临床 AI 中许多被当作质量控制来呈现的东西,即一个 agent 核查另一个在相同数据上训练的 agent,具有同样的缺陷。
结构性边界,而非外挂式过滤器。 提议层中的模型被约束在非创造性、可核验的操作之内,因而操纵落在运行封套之外,而非在事后被过滤掉。一个通用模型在一个创造性内核上外挂一个拒绝过滤器;能力仍在,而过滤器是一个关于该抑制什么的概率性猜测。约束运行封套,是比过滤其输出更强的保证。该架构被设计为不存储文件、且不采集超出一次验证操作所需的患者数据,从而刻意保持攻击面很小。
证明与正当性:持续学习下的验证
验证自适应 AI 最难的问题是:当系统不断学习时,"已验证"究竟意味着什么。框架的回答,是把证明绑定到一个系统状态,而非一个模型。
一项决策及其证明在某一时点被固定。证明确认的是决策做出时生效的确切监管、方案与系统状态。系统继续学习,但证明对它所证明的东西成立。为使这一点保持为真,每一份证明在其下方三者之一发生变化之后,都必须仍然可重建、可辩护:监管、方案,或系统本身。
其机制有三部分:
🔹 一枚签名的状态指纹,固定决策时刻的确切监管、方案与系统状态。
🔹 一条双时序溯源,区分一个事实何时在世界中为真,与系统何时记录它,从而一项决策总能对照产出它的那个状态被重放。
🔹 一个预定变更封套,在保持可审计的同时,限定该自适应系统可以如何演化,与 FDA 的 Predetermined Change Control Plan 的方向一致。
由此得出一个框架视为根本的区分:证明是某一状态在决策时刻为真的东西;正当性是随着规则、方案与情境向前推移仍然为真的东西。 一份时点证明不会随世界变化而衰减。它对它所证明的那个状态成立。一个"两只时钟"的模型,命名何时需要重新认证,才能使一项决策在今天仍然可辩护,把决策的时钟与世界的时钟分开。
每一份证明都被限定在一个声明的使用情境之内,即在何处、为何相信某一给定能力的描述。这一限定并非需要致歉的局限,而是该主张诚实的范围。
管辖区作为一等维度
该架构在构造上即为全球性的。一个新管辖区不是一个新平台,而是一个新适配器,编码该法域的文书。每个适配器所依托的要求面是刻意具体的。
🔹 美国(FDA)。 21 CFR Parts 11、50、54、56、312、314 与 601;ICH E6(R3) 与 E8(R1);以及 FDA 的 AI/ML 指南轨迹,包括 Predetermined Change Control Plan 与关于 AI 支持监管决策的指南草案。已定稿的 FDA Computer Software Assurance 指南锚定其保证方法。适用时,HIPAA 治理受保护的健康信息。
🔹 欧盟(EMA / 各国主管机关)。 法规 (EU) No 536/2014,即 Clinical Trials Regulation,经 CTIS 提交;GDPR,尤重第 6 与第 9 条;ICH E6(R3);以及欧盟人工智能法案,在第 9 至 14 条下对高风险医疗 AI 课以合规评估与技术文档义务。
🔹 巴西(ANVISA / CFM)。 Lei nº 14.874/2024,治理试验实施;ANVISA 的监管资料路径;CFM 决议 2.454/2026,治理医疗实践中的 AI,要求可解释性、决策可追溯性、有记录的人类监督,以及一项由人作出的最终决定,于 2026 年 2 月发布、2026 年 8 月生效;以及 LGPD。它在此处的相关性是原则性的:它把决策层面的可追溯性变成一项明确的监管期待,而这正是证明证书所产出的。巴西的重要性不在于监管复杂度,而在于巴西以立法确立了法律确定性,并把这一期待明确化。
🔹 印度(CDSCO)。 New Drugs and Clinical Trials Rules, 2019,依据 Drugs and Cosmetics Act, 1940 颁布;印度 GCP 指南;以及 Digital Personal Data Protection Act, 2023。
🔹 英国(MHRA)。 更新后的英国临床试验框架,自 2026 年 4 月 28 日起生效,经 IRAS 提交;UK GDPR 与 Data Protection Act 2018;以及作为 GCP 标准的 ICH E6(R3)。
一份符合规范的证明证书被设计为从一个规范表示出发,对上述每一套证据标准加以渲染,而非为每个管辖区产出一份单独的 artefact。而且,因为规则就是规则,无论其来源为何,同一确定性操作都适用,无论该规则是一项监管、一条方案条款、一个程序步骤,还是一项管辖区特定要求。一份可信度 artefact 覆盖全部四者,而无需为每一者设立单独的证据体系。
为什么此刻紧迫:实时化的走向
发展的方向使架构问题更加尖锐,而非缓和。
2026 年 4 月,FDA 宣布一项推进实时临床试验的倡议,把持续报告终点与安全信号的肿瘤学概念验证试验,与一项关于 AI 赋能早期临床试验优化之拟议试点计划的信息征询相结合。该征询,Docket 号 FDA-2026-N-4390(91 FR 23100,2026 年 4 月 29 日),正是本框架为之而写、意在配合的文件。
它对验证架构的意义是结构性的。当核查员能够在一项决策做出之际即看到它时,决策与其核查之间的距离便压缩趋近于零。事后记录符合性的程序性验证,无法在这一节奏下运作。在决策时刻产出可检视 artefact 的确定性验证,则可以。实时试验并不让架构性验证成为可选项,而是让它成为唯一跟得上节奏的那一种。
框架是邀请,而非结论
本框架在其自身架构无法独力解决的问题上,是刻意开放的。居于首位的核心问题引领其���一切:
谁来认证一项监管被编码为一项可计算核查是正确的?
这是框架首要的未解问题。一份证明证书能证明一条被编码的规则被忠实地应用于具体取值。它本身无法证明,把监管编码为一种可��机器核验的形式,一开始就是对该监管的忠实解读。那样的认证,需要一个尚不存在的论坛,一个把监管者、伦理委员会、主要研究者、方法学家与多管辖区监管负责人聚在一起的论坛。
其他问题仍然真正开放:当各地区规则以独立周期更新时,如何验证管辖区特定的适配器;一个系统如何在模型更新、监管变化与数据漂移中保持已验证;AI 入选资格工具如何避免放大既有的入组不平等;在缺乏针对 AI 辅助临床决策的相互承认协议时,证明 artefact 如何跨境互操作;以及当一项 AI 辅助决策出错时,责任如何分摊。就最后一点,架构的回答正是边界声明本身:如果证书记录了机器核查了什么、未核查什么,并把其余保留给一位署名的人,那么责任便沿边界而定,而非消失于五方的含混之中。
目标是通过协作确立一项验证标准,赶在监管格局回溯性地强制某一标准、而业界仓促合规之前。分歧本身就是工作。
可证明为正确,而非大概率正确。 一组既定的结构性属性,在没有概率性中间地带的情况下被证明,其余每一处判断都由基于风险的控制与负责任的人类确认来管理。这就是框架所提出的标准。证书,是它得以维系的方式。
常见问题
面向临床试验中 AI 的监管验证框架是什么?
它是让一项 AI 辅助的临床决策在监管核查下可重建、可辩护的一整套规则、artefact 与验证步骤。本框架提出一个建立在证明证书之上的框架,该证书在决策时刻产出、经确定性验证把关、并由一位署名的人加以确认,从而任何受监管的决策都可按需重建。
三道验证闸是什么?
第一闸是由确定性监管引擎进行的、管辖区特定的监管合规验证。第二闸是形式化结构证明,产出一份没有概率性中间地带的通过或不通过的证明证书。第三闸是由一位署名之人作出的强制性确认,该人仍是问责之点。
框架如何验证持续学习的 AI?
证明被绑定到一个系统状态而非一个模型,借助一枚签名的状态指纹、一条双时序溯源,以及一个预定变更封套。一份时点证明对它所证明的确切监管、方案与系统状态成立,而一个两只时钟的模型决定一项决策何时需要重新认证以保持可辩护。
本框架是否宣称获得 FDA 或 EMA 的背书?
否。它是一份在参与、而非背书的立场下提出的架构提案。引用监管文书是为展示设计上的对齐。方法被描述为与 GxP 对齐、而非经 GxP 验证,且不宣称任何监管认证。
框架如何处理多个管辖区?
管辖区被视为一等维度。每个管辖区是一个各自独立的适配器,编码该法域的文书,从 FDA 与欧盟人工智能法案,到 ANVISA、CFM 2.454/2026、CDSCO 与 MHRA。一份符合规范的证明证书被设计为从一个规范表示出发,对每个管辖区的证据标准加以渲染。
证明证书与置信度分数有何不同?
置信度分数报告的是模型内部的确定性,且由其所评分之输出的同一模型生成,因而继承那一输出的盲区。证明证书就一项具体决策记录规则、取值、确定性操作、边界、风险类别与人类确认,并在核查下可复现。参见可证明为正确,而非大概率正确。
本框架反映了 NexTrial 技术与监管团队,以及在 2026 年通过公开共同开发对其加以压力测试的监管事务、伦理与临床运营从业者的工作。贡献均为个人贡献,不意味着机构背书。能力均以设计意图描述。通信:Steven Thompson,NexTrial.ai 创始人兼 CEO。