Human Reproduction · 2026 · 41(9) 1466–1469
«Explainability of artificial intelligence (AI) tools in assisted reproductive technologies (ARTs): promise, clinical reality, and conceptual limits»
Es un artículo de opinión, no un estudio. No tiene diseño, ni muestra, ni desenlaces, ni tablas de resultados. En las cuatro páginas hay una sola cifra clínica, la que aparece abajo. Por eso esta ficha no lleva tarjetas de resultados, ni gráfico de comparación entre grupos, ni método en cuatro pasos: el artículo no los tiene y no se inventan. Lo que se recoge es la arquitectura del argumento.
La pregunta
La fecundación in vitro consigue entre un 20 y un 40 % de recién nacido vivo por ciclo de media. Los autores llaman a esa cifra «aún perfectible». Los pacientes afrontan mientras tanto una carga emocional y económica.
La reproducción humana reúne complejidad biológica, conocimiento mecanístico incompleto y una variabilidad considerable entre individuos. Las decisiones en reproducción asistida son probabilísticas y se toman con incertidumbre parcial.
Con ese telón de fondo, la IA se presenta con frecuencia como la vía para estandarizar procedimientos y mejorar la capacidad del clínico de predecir el resultado de las opciones disponibles. La dificultad está en el tipo de modelo que mejor rinde: arquitecturas complejas, como las redes neuronales profundas, difíciles o imposibles de interpretar para un profesional por su cuenta. Entregan puntuaciones, rankings, probabilidades, segmentaciones de embriones y predicciones de tiempos sin mostrar cómo han combinado los datos de entrada.
Los autores formulan tres preguntas abiertas: cuánto debe apoyarse el clínico en estas herramientas, qué papel le queda al juicio experto si la IA lo hace todo, y quién responde cuando el resultado no es el esperado. De ahí sale la pregunta del artículo: ¿la explicabilidad es un requisito previo para usar IA en reproducción asistida, o su valor depende del contexto?
La única cifra del artículo
Definiciones
El artículo separa tres ideas que en el debate suelen ir mezcladas.
Hasta qué punto un humano entiende la lógica interna del modelo.
Métodos posteriores que aproximan cómo el modelo llegó a una predicción concreta.
Declarar limitaciones y métricas de rendimiento siguiendo guías estándar como TRIPOD+AI y PROBAST+AI.
El artículo considera la frontera entre caja negra y caja blanca en buena medida heurística y pide interpretarla con cautela. Ningún modelo es intrínsecamente explicable ni intrínsecamente inexplicable del todo. El comportamiento de caja negra aparece cuando el modelo supera la capacidad cognitiva de una persona para abarcar la relación entre lo que entra y lo que sale. Una regresión logística con muchas variables e interacciones se vuelve opaca en la práctica. Una red neuronal se puede interrogar en parte con técnicas dedicadas.
La consecuencia es que la explicabilidad depende de tres cosas: la complejidad del espacio de predicción, la experiencia de quien usa el modelo y el tiempo disponible para interrogarlo. El mismo sistema puede resultar transparente para un experto que le dedica un análisis detallado y funcionar como caja negra para un clínico que decide en consulta.
El inventario
La aplicación más madura. La valoración tradicional se apoya en criterios morfológicos evaluados a ojo en estadios predefinidos, con variabilidad entre observadores y dentro del mismo observador. Los incubadores time-lapse han multiplicado el volumen y el detalle de los datos. Hay modelos entrenados con imágenes estáticas y con vídeo que predicen implantación, euploidía o recién nacido vivo, además de segmentar el embrión, aplicar la clasificación de Gardner de forma automática y predecir tiempos de desarrollo. La mayoría entrega una puntuación sin explicar qué rasgos la sostienen. Cuando esa puntuación discrepa de la valoración visual del embriólogo, al profesional le cuesta reconciliar las dos.
En ICSI de rutina la selección se hace a mano, por motilidad y morfología al microscopio óptico, criterios que son indicadores limitados de la competencia funcional y están sujetos a variabilidad del observador. Los sistemas CASA con IA automatizan y cuantifican esa evaluación, y mejoran reproducibilidad y volumen de trabajo. La lógica por la que el algoritmo prioriza un espermatozoide concreto sigue siendo opaca. Los autores señalan que eso plantea preguntas sobre el papel de la IA al definir el valor biológico, y sobre la aparición de nuevas normas que rigen la ordenación de entidades vivas.
Los modelos integran edad, perfiles hormonales e historia de tratamiento para predecir el resultado de la FIV. Se han propuesto para planificar tratamiento individualizado, incluida la personalización de los protocolos de estimulación ovárica. Aquí la recomendación algorítmica puede guiar la dosis de medicación o la cancelación de un ciclo, y con eso la transparencia y la responsabilidad pesan más.
Los modelos que actualizan sus pesos a medida que procesan datos nuevos plantean un problema propio: la explicación de una salida concreta puede cambiar con el tiempo. Eso complica la rendición de cuentas clínica a largo plazo.
Lo que está en juego
Cuando la salida del algoritmo choca con la valoración del experto, al clínico le faltan herramientas para entender de dónde viene el desacuerdo y en qué condiciones toca replantear. El resultado es deferencia acrítica al algoritmo o descarte sistemático de sus recomendaciones. Ninguna de las dos conduce a una buena decisión.
La reproducción asistida se apoya en estándares visuales e interpretativos compartidos, construidos con formación y experiencia. Dominar la valoración embrionaria pasa por un marco colectivo y un repertorio común de guías. Automatizar la anotación puede reconfigurar la pericia de los profesionales y debilitar su dominio de la evaluación embrionaria. Las puntuaciones sin explicación erosionan esas normas compartidas y dificultan construir un entendimiento común de buena práctica.
Sobre todo en personal con menos experiencia. En entornos clínicos de presión, las salidas del algoritmo pueden adquirir un estatus «oracular» que desincentiva el escrutinio crítico. En otros campos de la medicina ya se ha descrito cómo los sistemas opacos desplazan la responsabilidad lejos de quien decide.
El clínico invierte esfuerzo en explicar decisiones y resultados, a menudo con narrativas visuales del desarrollo embrionario. Una puntuación generada por IA, sin contexto interpretable, encaja mal en ese trabajo relacional. Menos todavía en el momento emocionalmente delicado del fracaso del tratamiento.
El debate
El artículo enfrenta las dos posiciones y se coloca en una de ellas con matices.
Sus defensores la consideran un prerrequisito para intervenciones clínicamente relevantes y éticamente guiadas. Las decisiones en reproducción asistida tienen implicaciones personales y morales profundas, así que apoyarse en sistemas opacos resulta inaceptable. La explicabilidad sostiene el consentimiento informado, permite detectar sesgos, facilita la aprobación regulatoria y alinea las salidas del modelo con el razonamiento clínico. En esta posición es una exigencia ética, por encima de una característica técnica.
Van Royen y colaboradores sostienen que la explicabilidad puede no entregar explicaciones clínicamente relevantes, y que incluso puede deteriorar la toma de decisiones. Su objeción central es la «ilusión de comprensión»: los gráficos de atribución de rasgos y los mapas de calor se ven claros e intuitivos mientras son inestables, dependientes del modelo y sensibles a perturbaciones menores de los datos. Eso alimenta confianza mal puesta o escepticismo injustificado. Los autores del artículo matizan la etiqueta: esta posición defiende el reporte transparente según guías estándar como TRIPOD y PROBAST.
Los modelos de predicción son correlacionales por construcción. Las personas interpretan las explicaciones en clave causal. En reproducción asistida eso puede llevar al clínico a inferir mecanismos biológicos o intervenciones accionables sin validez causal demostrada.
Muchas herramientas médicas establecidas se usan con eficacia sin comprensión mecanística completa, y el artículo pone como ejemplo los propios medios de cultivo de FIV. Exigir explicabilidad a la IA impone entonces un estándar inconsistente con el que se aplica a esas otras herramientas.
Los matices que ponen los autores
Un artículo de opinión no tiene limitaciones de muestra. Lo que tiene son los límites que sus propios autores le ponen a la explicabilidad, incluida la que ellos defienden.
En reproducción asistida, donde el análisis de imagen y vídeo suele requerir aprendizaje profundo, las explicaciones se centran en un embrión o un paciente concretos. No ofrecen una comprensión del modelo completo.
Las técnicas de atribución de rasgos, perturbación de entradas y mapas de atención ayudan a evaluar robustez, coherencia con el conocimiento del dominio y modos de fallo. También descansan en simplificaciones que pueden no reflejar el proceso real de decisión de un modelo complejo.
Los autores lo dejan abierto en sus términos: hasta qué punto estas explicaciones mejoran de verdad el razonamiento clínico, en lugar de ofrecer tranquilidad o racionalizaciones posteriores que se pueden sobreinterpretar, sigue siendo incierto
.
El artículo admite que en algunos contextos la explicabilidad puede oscurecer las limitaciones de los modelos predictivos antes que aclararlas.
«El objetivo último de la IA en reproducción asistida no debería ser simplemente abrir la caja negra, sino garantizar que la IA, explicable o no, se reporte de forma transparente y sirva a una atención reproductiva centrada en el paciente.»
«The ultimate goal of AI in ART should not simply be to open the black box, but to ensure that AI, either explainable or not, is transparently reported and serves patient-centered reproductive care.»
Freour T, Anichini G, Gaillard M, Mouchère H. Human Reproduction, 2026. Conclusión del artículo. La traducción al castellano es nuestra.Para citarlo