Artículo pilar

El marco de validación regulatoria

Un marco de arquitectura de verificación para validar la IA que redacta, verifica y coordina decisiones de ensayos clínicos entre FDA, UE, ANVISA y CDSCO.

Regulatorio18 min de lecturaActualizado 1 de febrero de 2026

Postura regulatoria

Este análisis refleja una postura de calidad por diseño basada en riesgo. Describe una práctica orientada a la confianza regulatoria y no implica respaldo de ninguna autoridad.

Un marco de validación para IA en ensayos clínicos es el conjunto de reglas, artefactos y pasos de verificación que hacen que una decisión asistida por IA sea reconstruible y defendible bajo inspección. El marco a continuación propone uno construido sobre una única primitiva: un certificado de prueba producido en el momento de la decisión, condicionado por verificación determinista y atestiguado por un humano nombrado. El modelo propone. La prueba dispone.

La inteligencia artificial está entrando en las operaciones de ensayos clínicos a un ritmo acelerado. La redacción regulatoria asistida por IA, el análisis predictivo de elegibilidad de pacientes y la coordinación de cumplimiento multijurisdiccional ya no son especulativos. Están en producción. Los paradigmas de validación que gobiernan estos sistemas, sin embargo, siguen anclados en marcos diseñados para dispositivos de diagnóstico y software como dispositivo médico, no para sistemas de orquestación que redactan, verifican y coordinan los documentos y las decisiones de un ensayo entre jurisdicciones, desde el protocolo y el papeleo de activación hasta los eventos de consentimiento y el cierre. Esa categoría es lo que NexTrial llama Trial Activation Intelligence.

Este documento propone un marco de validación para esa brecha. Es una propuesta de arquitectura destinada a la crítica, el refinamiento y el codesarrollo con la comunidad de asuntos regulatorios, no una especificación de producto ni una afirmación de respaldo regulatorio.

Una nota sobre la postura. Nada aquí afirma ni implica respaldo de NexTrial por ningún regulador, agencia, organismo de normalización o individuo, ni conformidad con ninguna norma nombrada. Los instrumentos regulatorios se citan para mostrar alineación de diseño, no certificación. Los beneficios se declaran como intención de diseño. La metodología descrita está alineada con GxP, no validada en GxP. Los instrumentos se citan como vigentes en la fecha de publicación; cualquier sistema operativo sigue el texto vigente, no la cita aquí impresa.

La brecha: la validación de la era de los dispositivos frente a la IA de la era de la orquestación

La línea base de los Estados Unidos para la integridad de datos en registros regulados es la 21 CFR Parte 11, y precede a los sistemas ahora en cuestión. El pronunciamiento más directo de la FDA sobre IA en este dominio, la guía preliminar Considerations for the Use of Artificial Intelligence To Support Regulatory Decision-Making for Drug and Biological Products, se emitió en enero de 2025 y sigue siendo preliminar. Se apoya en un marco de evaluación de credibilidad basado en riesgo, de siete pasos, anclado en el contexto de uso de un modelo: la descripción de dónde, y para qué, se confía en la salida de un modelo.

Esa columna de contexto de uso es importante, y este marco la adopta directamente. Pero la guía preliminar excluye de su alcance la IA usada para eficiencia operativa interna cuando el uso no afecta la seguridad del participante, la calidad del medicamento o la fiabilidad de los resultados, y no especifica cómo se valida en sí misma una capa de verificación determinista que condiciona salidas reguladas. Un sistema que produce presentaciones regulatorias, predice trayectorias de pacientes para elegibilidad o impone cumplimiento entre jurisdicciones afecta directamente la fiabilidad de los resultados. Está dentro de la preocupación de la guía. Aún no lo aborda la mecánica de la guía.

La UE ha avanzado más en una dirección. El Reglamento de IA de la UE clasifica la IA sanitaria pertinente como de alto riesgo e impone obligaciones de evaluación de conformidad, documentación técnica, gestión de riesgos y vigilancia poscomercialización bajo los Artículos 9 a 14. Pero ofrece una orientación limitada sobre cómo la verificación formal, prueba matemática en lugar de estimación estadística, se traduce en la evaluación de conformidad.

El resultado es un campo que converge hacia una sola pregunta, desde todas las jurisdicciones a la vez:

Cuando un inspector pregunta cómo se tomó una decisión asistida por IA, ¿qué artefacto responde?

La tesis: la capa de verificación es la capa de admisibilidad

Todo marco regulatorio que gobierna la IA clínica descansa sobre un requisito común. Una decisión regulada debe ser reconstruible, desde los datos fuente a través de la lógica de la decisión hasta la regla que la produjo, en el momento en que un inspector lo pide. El requisito aparece en la 21 CFR Parte 11, en ALCOA+, en ICH E6(R3), en los Artículos 11, 12, 13 y 14 del Reglamento de IA de la UE, en la Resolución CFM 2.454/2026 de Brasil y en las New Drugs and Clinical Trials Rules, 2019, de la India. La formulación varía. El requisito arquitectónico no.

Dos patrones dominan actualmente el despliegue de IA en la investigación clínica.

🔹 El primero trata la salida del modelo como el artefacto regulado y le aplica una sobrecapa de cumplimiento después del hecho.
🔹 El segundo trata la salida del modelo como una propuesta que debe ser condicionada por verificación determinista antes de convertirse en el artefacto regulado.

Solo el segundo patrón es admisible bajo los marcos nombrados arriba, con independencia de la exactitud, la confianza o la metodología de entrenamiento del modelo. Una sobrecapa de cumplimiento aplicada después del hecho documenta una decisión ya tomada de manera probabilística. Un control determinista produce la decisión como una operación verificable desde el inicio.

La regla que gobierna el resto de este marco se desprende de esa distinción: el modelo propone; la prueba dispone. La capa de verificación, no el modelo, produce el artefacto regulado. Un modelo probabilístico es admisible como participante en la tubería de decisión solo porque está condicionado por un control determinista que no puede eludir. Todo lo que un inspector o un comité de ética ve es producido por la capa de verificación determinista, no por el sustrato probabilístico que la alimentó.

La primitiva: el certificado de prueba de ocho propiedades

La primitiva arquitectónica central del marco es el certificado de prueba: un artefacto estructurado producido en el momento en que se toma una decisión asistida por IA. Se especifica para contener ocho propiedades.

🔹 1. Regla invocada. La regla específica, por fuente, cita y versión: una disposición regulatoria, un criterio de protocolo, un paso de POE o un requisito jurisdiccional.
🔹 2. Valores verificados. Los valores exactos de paciente, protocolo, centro u operativos comprobados, enumerados en lugar de resumidos, atribuibles a la fuente.
🔹 3. Operación de verificación. El procedimiento determinista que devolvió aprobación o rechazo sobre esta decisión específica, inspeccionable y reproducible.
🔹 4. Declaración de límite. Lo que la operación no comprobó, y los factores de juicio humano reservados al humano responsable.
🔹 5. Clasificación de riesgo. La clase de riesgo de la decisión, congelada en el momento de la decisión, que indexa el rigor aplicado y la cadencia de reverificación.
🔹 6. Identidad del revisor humano. La identidad y el rol del humano que atestiguó, vinculados a la atestación.
🔹 7. Registro de anulación y escalamiento. Si el humano aceptó, rechazó o pidió revisión, con cualquier justificación de anulación y cualquier escalamiento.
🔹 8. Evidencia, no sustitución. Una declaración explícita de que la operación es evidencia presentada al revisor, no una sustitución del juicio independiente del revisor.

El artefacto es reproducible, inspeccionable y está diseñado para ser admisible bajo inspección. Un puntaje de confianza no es ninguna de estas cosas. No puede satisfacer la trazabilidad de la 21 CFR Parte 11, la integridad de datos de ALCOA+, la verificación de fuente de ICH E6(R3), los Artículos 11, 12, 13 y 14 del Reglamento de IA de la UE, ni los requisitos análogos de la Resolución CFM 2.454/2026 de Brasil y las NDCTR 2019 de la India.

Una palabra precisa sobre lo que afirma un certificado de prueba, porque la precisión es el punto. Prueba propiedades estructurales: que los campos requeridos están presentes, que las referencias resuelven, que no existen contradicciones estructurales, que límites de seguridad definidos se sostienen para una salida específica. No prueba que una salida sea clínica o regulatoriamente correcta en sentido semántico. Ese juicio permanece con la verificación regulatoria y, por último, el humano. El valor del certificado no es certificar corrección. Es producir un registro determinista, verificable de forma independiente y a prueba de manipulaciones, de exactamente lo que se verificó y lo que no.

Las recomendaciones especifican un artefacto y un esquema, no un proveedor. Cualquier sistema que produzca un certificado conforme satisface el estándar, se parezca o no al de NexTrial.

Las tres compuertas

El certificado es producido por una secuencia de tres compuertas de verificación. Cada compuerta es un sustrato diferente, y esa diferencia es deliberada.

🔹 Compuerta 1 — Cumplimiento regulatorio específico de la jurisdicción. Un motor regulatorio determinista comprueba la decisión propuesta contra los requisitos codificados de la jurisdicción rectora. La verificación se dispara por la jurisdicción del centro que una salida gobierna, no se aplica como una lista de verificación universal. Aquí es donde una regulación se convierte en una comprobación computable.
🔹 Compuerta 2 — Prueba estructural formal. Un paso de verificación formal produce un certificado de prueba que tiene éxito o falla, sin término medio probabilístico, sobre las propiedades estructurales de la salida. Esto es prueba matemática de estructura, no estimación estadística de calidad.

La Compuerta 2, la capa de prueba formal, está en producción y en primera validación ahora. El resto del marco se describe como intención de diseño.

🔹 Compuerta 3 — Atestación humana obligatoria. Un humano nombrado revisa la evidencia y atestigua. La atestación queda vinculada al registro. El humano es el punto de responsabilidad, y el certificado está diseñado para hacer que el juicio del humano esté mejor informado, no para reducirlo o reemplazarlo.

A lo largo del desarrollo, dos principios surgieron repetidamente y ahora organizan todo el marco.

La clasificación de riesgo es la primitiva arquitectónica. El rigor aplicado en cada compuerta, la cadencia de reverificación y el nivel de atestación humana exigido están todos indexados a una clase de riesgo asignada y congelada en el momento de la decisión. Una decisión de alto riesgo y una de bajo riesgo no reciben el mismo tratamiento, y el registro muestra cuál se aplicó.

La verificación por IA es evidencia, no sustitución. El certificado de prueba es evidencia aguas arriba que un inspector o auditor consume. No reduce la carga del revisor humano. Esta es la corrección más estructural del lugar común del "humano en el bucle": la supervisión se ejerce sobre una decisión, no sobre una probabilidad. Un revisor no puede validar de forma significativa un 0,918. Un revisor puede validar una verificación cláusula por cláusula.

Por qué la evidencia tiene que ser no correlacionada

Dos propiedades hacen que la capa de verificación sea confiable en lugar de meramente presente.

Evidencia no correlacionada. Las tres compuertas son sustratos independientes que fallan de maneras diferentes. Una comprobación determinista de reglas puede equivocarse de formas que una prueba estructural formal detectaría. Una prueba estructural puede aprobar una determinación que un humano rechazaría. Un humano puede captar lo que ninguna operación de máquina fue alcanzada a ver. La evidencia extraída de sustratos que fallan de forma diferente es defendible de un modo que un único puntaje autorreportado no lo es.

Un puntaje de confianza ofrece lo contrario. Lo genera el mismo modelo cuya salida puntúa, así que hereda los puntos ciegos de esa salida. Es evidencia correlacionada vistiendo la etiqueta de una comprobación. Buena parte de lo que se presenta en la IA clínica como control de calidad, un agente comprobando a otro agente entrenado con los mismos datos, tiene el mismo defecto.

Límites estructurales, no filtros atornillados. El modelo en la capa proponente está restringido a operaciones no creativas y verificables, de modo que la manipulación queda fuera del envolvente de operación en lugar de filtrarse después del hecho. Un modelo de propósito general atornilla un filtro de rechazo sobre un núcleo creativo; la capacidad permanece y el filtro es una conjetura probabilística sobre qué suprimir. Restringir el envolvente de operación es una garantía más fuerte que filtrar su salida. La arquitectura está diseñada para no almacenar documentos y no capturar datos de pacientes más allá de lo que una operación de verificación requiere, lo que mantiene la superficie de ataque deliberadamente pequeña.

Prueba frente a legitimidad: validación bajo aprendizaje continuo

La pregunta más difícil al validar IA adaptativa es qué significa siquiera "validado" cuando el sistema sigue aprendiendo. El marco la responde vinculando la prueba a un estado del sistema, no a un modelo.

Una decisión y su prueba se fijan en un punto en el tiempo. La prueba atestigua la regulación, el protocolo y el estado del sistema exactos vigentes cuando se tomó la decisión. El sistema sigue aprendiendo, pero la prueba se sostiene para lo que certificó. Para mantener eso verdadero, cada prueba debe permanecer reconstruible y defendible después de que cualquiera de tres cosas cambie por debajo de ella: la regulación, el protocolo o el propio sistema.

El mecanismo tiene tres partes:

🔹 Una huella de estado firmada que fija la regulación, el protocolo y el estado del sistema exactos en el momento de la decisión.
🔹 Un linaje bitemporal que distingue cuándo un hecho fue verdadero en el mundo de cuándo el sistema lo registró, para que una decisión siempre pueda reproducirse contra el estado que la produjo.
🔹 Un envolvente de cambio predeterminado que acota cómo puede evolucionar el sistema adaptativo manteniéndose auditable, consistente con la dirección del Predetermined Change Control Plan de la FDA.

De esto surge una distinción que el marco trata como fundamental: la prueba es lo que era verdadero de un estado en el momento de la decisión; la legitimidad es lo que sigue siendo verdadero a medida que reglas, protocolos y contexto avanzan. Una prueba puntual no se degrada a medida que el mundo cambia. Se sostiene para el estado que certificó. Un modelo de "dos relojes" nombra cuándo se requiere recertificación para que una decisión siga siendo defendible hoy, separando el reloj de la decisión del reloj del mundo.

Toda prueba está acotada dentro de un contexto de uso declarado, la descripción de dónde y para qué se confía en una capacidad dada. Esa delimitación no es una limitación que disculpar. Es el alcance honesto de la afirmación.

La jurisdicción como dimensión de primera clase

La arquitectura es global por construcción. Una nueva jurisdicción no es una nueva plataforma. Es un nuevo adaptador que codifica los instrumentos de ese régimen. La superficie de requisitos de la que cada adaptador se vale es deliberadamente específica.

🔹 Estados Unidos (FDA). 21 CFR Partes 11, 50, 54, 56, 312, 314 y 601; ICH E6(R3) y E8(R1); y la trayectoria de guías de IA/ML de la FDA, incluido el Predetermined Change Control Plan y la guía preliminar sobre IA para apoyar la decisión regulatoria. La guía finalizada Computer Software Assurance ancla la metodología de aseguramiento. La HIPAA rige la información de salud protegida cuando aplica.
🔹 Unión Europea (EMA / autoridades nacionales competentes). Reglamento (UE) nº 536/2014, el Clinical Trials Regulation, presentado a través del CTIS; RGPD, con peso particular en los Artículos 6 y 9; ICH E6(R3); y el Reglamento de IA de la UE, que impone obligaciones de evaluación de conformidad y documentación técnica a la IA sanitaria de alto riesgo bajo los Artículos 9 a 14.
🔹 Brasil (ANVISA / CFM). La Lei nº 14.874/2024 que gobierna la conducción de ensayos; la vía del dosier regulatorio de ANVISA; la Resolución CFM 2.454/2026, que gobierna la IA en la práctica médica y exige explicabilidad, trazabilidad de la decisión, supervisión humana registrada y una decisión final humana, publicada en febrero de 2026 y con vigencia a partir de agosto de 2026; y la LGPD. Su relevancia aquí es de principio: hace de la trazabilidad a nivel de decisión una expectativa regulatoria explícita, que es precisamente lo que produce un certificado de prueba. La importancia de Brasil no es la complejidad regulatoria. Es que Brasil legisló seguridad jurídica e hizo explícita esa expectativa.
🔹 India (CDSCO). Las New Drugs and Clinical Trials Rules, 2019, promulgadas bajo el Drugs and Cosmetics Act, 1940; las guías indias de BPC; y el Digital Personal Data Protection Act, 2023.
🔹 Reino Unido (MHRA). El marco actualizado de ensayos clínicos del Reino Unido, en vigor desde el 28 de abril de 2026, con presentaciones a través de IRAS; el UK GDPR y el Data Protection Act 2018; y el ICH E6(R3) como estándar de BPC.

Un único certificado de prueba conforme está diseñado para renderizar contra cada uno de estos estándares probatorios a partir de una representación canónica, en lugar de producir un artefacto separado por jurisdicción. Y porque una regla es una regla independientemente de su fuente, la misma operación determinista se aplica ya sea que la regla sea una regulación, una disposición de protocolo, un paso de procedimiento o un requisito específico de la jurisdicción. Un artefacto de confiabilidad abarca las cuatro sin un régimen probatorio separado para cada una.

Por qué esto es urgente ahora: la trayectoria en tiempo real

El sentido de la marcha agudiza la pregunta arquitectónica en lugar de suavizarla.

En abril de 2026 la FDA anunció una iniciativa para avanzar los ensayos clínicos en tiempo real, combinando ensayos oncológicos de prueba de concepto que reportan desenlaces y señales de seguridad de forma continua con una solicitud de información sobre un programa piloto propuesto de optimización, habilitada por IA, de ensayos clínicos de fase temprana. Esa solicitud, Docket nº FDA-2026-N-4390 (91 FR 23100, 29 de abril de 2026), es el documento que este marco fue escrito para acompañar.

Su relevancia para la arquitectura de verificación es estructural. Cuando un inspector puede ver una decisión a medida que se toma, la distancia entre una decisión y su inspección se comprime hacia cero. La verificación procedimental, que documenta la conformidad después del hecho, no puede operar a esa cadencia. La verificación determinista, que produce un artefacto inspeccionable en el momento de la decisión, sí puede. Los ensayos en tiempo real no hacen opcional la verificación arquitectónica. La convierten en el único tipo que mantiene el ritmo.

El marco es una invitación, no una conclusión

Este marco está deliberadamente abierto en las preguntas que su propia arquitectura no puede resolver sola. La central encabeza todas las demás:

¿Quién certifica que la codificación de una regulación en una comprobación computable es correcta?

Ese es el principal problema no resuelto del marco. Un certificado de prueba puede probar que una regla codificada se aplicó fielmente a valores específicos. No puede, por sí solo, probar que la codificación de la regulación en una forma verificable por máquina fue una lectura fiel de la regulación en primer lugar. Esa certificación requiere un foro que aún no existe, uno que incluya reguladores, comités de ética, investigadores principales, metodólogos y líderes regulatorios multijurisdiccionales juntos.

Otras preguntas siguen genuinamente abiertas: cómo validar adaptadores específicos de jurisdicción cuando las reglas de cada región se actualizan en ciclos independientes; cómo un sistema permanece validado a lo largo de actualizaciones de modelo, cambios regulatorios y deriva de datos; cómo las herramientas de elegibilidad por IA evitan amplificar inequidades de reclutamiento existentes; cómo los artefactos de prueba interoperan a través de fronteras en ausencia de un acuerdo de reconocimiento mutuo para decisiones clínicas asistidas por IA; y cómo se reparte la responsabilidad cuando una decisión asistida por IA es errónea. Sobre este último punto, la respuesta de la arquitectura es la propia declaración de límite: si el certificado registra lo que la máquina verificó y no verificó, y reserva el resto a un humano nombrado, entonces la responsabilidad sigue al límite en lugar de desaparecer en una ambigüedad de cinco partes.

El objetivo es establecer un estándar de validación mediante la colaboración, antes de que el panorama regulatorio imponga uno de forma retroactiva y la industria se apresure a cumplir. El desacuerdo es el trabajo.

Comprobadamente correcto, no probablemente correcto. Un conjunto definido de propiedades estructurales probado sin término medio probabilístico, y todo juicio restante gestionado por controles basados en riesgo y atestación humana responsable. Ese es el estándar que propone el marco. El certificado es cómo se mantiene.


Preguntas frecuentes

¿Qué es un marco de validación regulatoria para IA en ensayos clínicos?
Es el conjunto de reglas, artefactos y pasos de verificación que hacen que una decisión clínica asistida por IA sea reconstruible y defendible bajo inspección regulatoria. Este marco propone uno construido sobre un certificado de prueba producido en el momento de la decisión, condicionado por verificación determinista y atestiguado por un humano nombrado, de modo que cualquier decisión regulada pueda reconstruirse bajo demanda.

¿Cuáles son las tres compuertas de verificación?
La Compuerta 1 es la verificación de cumplimiento regulatorio específico de la jurisdicción por un motor regulatorio determinista. La Compuerta 2 es la prueba estructural formal que produce un certificado de prueba de aprobación o rechazo sin término medio probabilístico. La Compuerta 3 es la atestación obligatoria por un humano nombrado, que sigue siendo el punto de responsabilidad.

¿Cómo valida el marco la IA que sigue aprendiendo?
La prueba se vincula a un estado del sistema en lugar de a un modelo, usando una huella de estado firmada, un linaje bitemporal y un envolvente de cambio predeterminado. Una prueba puntual se sostiene para la regulación, el protocolo y el estado del sistema exactos que certificó, y un modelo de dos relojes determina cuándo una decisión requiere recertificación para seguir siendo defendible.

¿Este marco reclama respaldo de la FDA o la EMA?
No. Es una propuesta de arquitectura ofrecida bajo una postura de involucramiento, no respaldo. Los instrumentos regulatorios se citan para mostrar alineación de diseño. La metodología se describe como alineada con GxP, no validada en GxP, y no se reclama ninguna certificación regulatoria.

¿Cómo maneja el marco múltiples jurisdicciones?
La jurisdicción se trata como dimensión de primera clase. Cada jurisdicción es un adaptador distinto que codifica los instrumentos de ese régimen, desde la FDA y el Reglamento de IA de la UE hasta ANVISA, CFM 2.454/2026, CDSCO y MHRA. Un único certificado de prueba conforme está diseñado para renderizar contra el estándar probatorio de cada jurisdicción a partir de una representación canónica.

¿En qué se diferencia un certificado de prueba de un puntaje de confianza?
Un puntaje de confianza reporta la certeza interna del modelo y lo genera el mismo modelo cuya salida puntúa, así que hereda los puntos ciegos de esa salida. Un certificado de prueba registra la regla, los valores, la operación determinista, el límite, la clase de riesgo y la atestación humana para una decisión específica, y es reproducible bajo inspección. Ver Comprobadamente Correcto, No Probablemente Correcto.

Este marco refleja el trabajo del equipo técnico y regulatorio de NexTrial y de los profesionales de asuntos regulatorios, ética y operaciones clínicas que lo pusieron a prueba mediante codesarrollo público en 2026. Las contribuciones son individuales y no implican respaldo institucional. Las capacidades se describen como intención de diseño. Correspondencia: Steven Thompson, Fundador y CEO, NexTrial.ai.