Código AdrIA Papers legibles

Clinical Obstetrics and Gynecology · Vol. 69 · Nº 1 · Marzo 2026

Ningún ensayo demuestra más recién nacidos vivos

«AI in Reproductive Medicine: Hope or Hype?»

Shruti Agarwal, Alexander M. Quaas y Mark P. Trolice.
University of Central Florida-HCA Consortium of Greater Orlando · Shady Grove Fertility, San Diego (California).

Tipo Revisión narrativa Base 46 referencias Páginas 6–12 DOI 10.1097/GRF.0000000000000983 Acceso Suscripción · © Wolters Kluwer
i

Esto no es un estudio con muestra propia. Es una revisión narrativa: los autores repasan lo publicado en cada fase del tratamiento y no aportan datos nuevos. Todas las cifras de esta ficha vienen de los trabajos que el artículo cita, y se indica de cuál. El artículo no incluye apartado de métodos ni estrategia de búsqueda, de modo que no es una revisión sistemática.

La pregunta

Casi todas las fases del tratamiento tienen ya un modelo

Dos cosas han empujado la entrada de la IA en la medicina reproductiva: los grandes conjuntos de datos clínicos, ahora accesibles, y la mejora de la imagen embrionaria.

El artículo enumera dónde está ya. Algoritmos que puntúan y seleccionan embriones por morfología y tiempos de desarrollo. Modelos que valoran movilidad y morfología espermática. Imagen no invasiva del ovocito para predecir competencia. En estimulación ovárica, modelos para individualizar la dosis de gonadotropinas, predecir la respuesta y optimizar el momento del trigger. En endometrio, ecografía tridimensional con segmentación automática para estimar receptividad. Y, además de lo que toca al paciente, sistemas para normalizar el control de calidad del laboratorio, manejar grandes bases de datos, reducir la variabilidad entre observadores y dar apoyo al consejo médico.

El problema aparece al preguntar qué valor clínico tiene todo eso. Las revisiones sistemáticas que cita el artículo señalan que la mayoría de los estudios son retrospectivos, monocéntricos y con recogida de datos heterogénea, lo que hace difícil determinar su valor real.

Los autores recogen dos avisos previos. Letterie subraya que la IA se debe introducir «with a much-needed word of caution» y que no puede verse como una solución «plug-and-play» en el laboratorio de reproducción asistida. Riegler y colaboradores apuntan que, aunque la valoración de embrión y esperma da resultados prometedores, los problemas de reproducibilidad y el beneficio dudoso para el paciente impiden implantarla de rutina.

De ahí el criterio que proponen los autores: una tecnología nueva se evalúa por si añade valor al cuidado del paciente. La revisión recorre embrión, esperma, ovocito, estimulación, endometrio, predicción de resultados y consideraciones éticas para determinar qué correlación tienen con los resultados del paciente.

Las cifras que circulan

Precisión alta en imagen, meseta en la predicción

Ninguno
Ensayo aleatorizado que demuestre mayor tasa de recién nacido vivo con IA
Se afirma en esperma, en estimulación y en las conclusiones
69–77 %
Precisión de STORK-A al predecir euploidía
Más de 10.000 embriones con PGT-A · mantiene rendimiento en validación externa (ref. 12)
96,7 %
Precisión de un ResNet-50 clasificando espermatozoide normal o anormal
Sobre imágenes de esperma fijado o teñido, no utilizable para ICSI (ref. 18)
0,7–0,8 AUC
Meseta de rendimiento de los modelos de predicción de resultados
«Perhaps too low to be clinically useful», dicen los autores

Hasta dónde llega la evidencia en cada área

Diseño de estudio más exigente que el artículo describe para cada aplicación. La última columna está vacía en las cinco.

Área Retrospectivo o monocéntrico Prospectivo (concordancia o seguridad) ECA de no inferioridad ECA de superioridad con recién nacido vivo
Embrión
Retrospectivo o monocéntrico
Prospectivo
ECA de no inferioridad (iDAScore)
ECA de superioridad con recién nacido vivo
Espermatozoide
Retrospectivo o monocéntrico
Prospectivo
ECA de no inferioridad
ECA de superioridad con recién nacido vivo
Ovocito y estimulación
Retrospectivo o monocéntrico
Prospectivo (concordancia de dosis)
ECA de no inferioridad
ECA de superioridad con recién nacido vivo
Endometrio
Retrospectivo o monocéntrico
Prospectivo
ECA de no inferioridad
ECA de superioridad con recién nacido vivo
Predicción y decisión
Retrospectivo o monocéntrico
Prospectivo
ECA de no inferioridad
ECA de superioridad con recién nacido vivo

Cada punto encendido corresponde a un diseño que el artículo describe en esa sección: el ensayo aleatorizado multicéntrico de iDAScore en embrión; el estudio prospectivo multicéntrico de dosis y trigger, y el software de dosificación con muy buena concordancia con clínicos experimentados, en estimulación. En esperma, endometrio y predicción, los propios autores describen la evidencia como retrospectiva y de un solo centro.

El mapa por fases

Qué se ha probado en cada punto del tratamiento

Las cinco áreas que recorre el artículo, con lo que hay publicado y lo que los autores señalan que falta.

Fase 01

Embrión: valoración y selección

Qué se ha probado

Las redes neuronales convolucionales clasifican blastocistos con una precisión similar a la del embriólogo y estratifican de forma consistente entre conjuntos de datos, lo que resuelve la variabilidad entre observadores (Khosravi). Bormann añadió los tiempos de desarrollo a la morfología. STORK-A se entrenó con más de 10.000 embriones con su resultado de PGT-A y predijo euploidía con una precisión del 69 % al 77 %, manteniendo el rendimiento en cohortes de validación externa. BELA hace lo mismo desde vídeo time-lapse con igual precisión. BlastAssist mejora la predicción de implantación frente a la puntuación del embriólogo en análisis retrospectivo. La evidencia clínica más sólida es el ensayo aleatorizado multicéntrico de iDAScore: las transferencias guiadas por el algoritmo no fueron inferiores a la selección del embriólogo en gestación evolutiva y redujeron la variabilidad entre laboratorios.

Qué falta

STORK-A, BELA y BlastAssist se apoyan en datos retrospectivos, de un solo centro o de definición estrecha. La predicción de ploidía por imagen sigue por debajo de la fiabilidad del PGT-A, que continúa siendo el estándar clínico. El ensayo de iDAScore mostró rendimiento a la par, no superior. La puntuación no siempre es explicable: el embriólogo puede enumerar los rasgos morfológicos de su decisión y el algoritmo no, lo que complica el consejo y deja sin resolver de quién es la responsabilidad. Muchos conjuntos de entrenamiento infrarrepresentan a poblaciones minoritarias.

«La aplicación más avanzada de la IA en medicina reproductiva», según los autores, que piden verla con optimismo cauto.

Fase 02

Espermatozoide: elección para ICSI

Qué se ha probado

Elegir un único espermatozoide es una de las tareas más subjetivas de la reproducción asistida, y con los criterios de la OMS sigue dependiendo del operador. Javadi entrenó un modelo de aprendizaje profundo con más de 1.500 imágenes de esperma sin teñir y alcanzó hasta un 94 % de precisión identificando anomalías de cabeza, acrosoma y vacuolas. Mashaal aplicó un ResNet-50 para separar normal de anormal con un 96,7 %. En movilidad, motilitAI predice con un rendimiento comparable al de embriólogos experimentados, y un método basado en redes convolucionales sobre vídeo distingue con fiabilidad los patrones de movilidad progresiva. Se empieza a incorporar la fragmentación del ADN y la integridad de la cromatina a los modelos de selección. Un caso clínico describe el primer nacido vivo con un sistema totalmente automatizado, con IA en la selección del espermatozoide y en la micromanipulación.

Qué falta

Hay una distancia grande entre el rendimiento técnico y la utilidad clínica. La mayoría de los trabajos son retrospectivos y se apoyan en colecciones de esperma fijado o teñido que no sirve para ICSI; incluso los modelos entrenados con imágenes de esperma viable necesitan validación prospectiva antes de usarse. Ninguno ha demostrado mejor fecundación, desarrollo a blastocisto ni recién nacido vivo. Y los sistemas evalúan morfología, movilidad o integridad del ADN por separado, mientras que el embriólogo integra las tres cosas a la vez.

Todavía «en fase de investigación»: ayudas de apoyo, no sustitutos del embriólogo experimentado.

Fase 03

Ovocito y estimulación ovárica

Qué se ha probado

Hanassab aplicó IA explicable a la ecografía tridimensional para identificar los rasgos foliculares que predicen madurez sin perder interpretabilidad para el clínico. Liang usó análisis volumétrico automatizado para ligar tamaño y morfología del folículo con el rendimiento en ovocitos maduros. En estimulación hay modelos de dosificación individualizada de gonadotropinas que, según el artículo, superan el juicio del médico, algoritmos de dosis interpretables y sistemas que predicen mejor el día óptimo de trigger que la respuesta ovárica. Un software prospectivo mostró muy buena concordancia con clínicos experimentados en la dosis, y otros modelos predicen ovocitos maduros y día de trigger en poblaciones diversas. En una cohorte retrospectiva apareada, una herramienta de apoyo a la decisión bajó la dosis inicial y total de FSH manteniendo el mismo número de ovocitos en metafase II.

Qué falta

Los modelos de valoración del ovocito son pequeños y retrospectivos. Los de dosificación se han evaluado solo de forma retrospectiva o en simulación, sin validación por resultados; incluso en los prospectivos, los desenlaces han priorizado la concordancia o el recién nacido vivo por delante de la seguridad. La generalización es dudosa porque la respuesta ovárica depende de edad, índice de masa corporal, reserva y protocolo. Siguen siendo cajas negras, y el consejo se complica cuando la predicción contradice el criterio clínico. No hay ensayos aleatorizados que muestren que la IA maneje la estimulación mejor que el clínico experto, ni en recién nacido vivo ni en evitar complicaciones.

Promesa real de reproducibilidad e individualización, con la evidencia todavía temprana.

Fase 04

Endometrio e implantación

Qué se ha probado

La receptividad se sigue valorando con grosor, morfología, hormonas y características del ciclo, marcadores solo moderadamente predictivos. Un trabajo con ecografía tridimensional demostró que la segmentación automática cuantifica el grosor endometrial con alta precisión, de forma reproducible e independiente del operador, aunque sus autores no afirman que sea superior a la ecografía estándar. EndoClassify integró características ecográficas en un sistema de clasificación y describió una tasa de gestación evolutiva del 74 % cuando más de la mitad del endometrio trilaminar correspondía a las capas externas. Un modelo con variables clínicas, de laboratorio y endometriales alcanzó un AUC de 0,79 para gestación clínica y se propuso para decidir la transferencia de embrión único. El análisis de más de 24.000 ciclos situó el protocolo de estimulación, el número de embriones y las características endometriales entre los predictores más fuertes, con el aprendizaje automático por encima de la regresión. En más de 400 ciclos de transferencia de embrión congelado con terapia hormonal sustitutiva, grosor, morfología, hormonas séricas y calidad embrionaria fueron los rasgos más predictivos, y los random forest los más precisos.

Qué falta

Casi todo es monocéntrico, retrospectivo y desarrollado sobre poblaciones heterogéneas. EndoClassify depende de análisis de imagen comercial y de esquemas de clasificación no estandarizados, lo que dificulta comparar entre clínicas. Y varios autores señalan que los modelos rinden mucho en su conjunto de entrenamiento y no mejoran los resultados al validarse de forma prospectiva en poblaciones diversas.

Campo en fase temprana: hará falta prospectivo y multicéntrico, con el recién nacido vivo como desenlace.

Fase 05

Predicción de resultados y apoyo a la decisión

Qué se ha probado

Es la aplicación más centrada en el paciente. Wen construyó una herramienta que predice gestación y estima el riesgo de gestación múltiple, para decidir entre transferir uno o dos embriones. Wang, con más de 24.000 ciclos, mostró que combinar detalles de la estimulación, características del embrión y parámetros endometriales personaliza más que la edad sola. Liu predijo con precisión razonable el resultado de la transferencia en ciclos de embrión congelado. Amitai llevó el trabajo al primer trimestre y anticipó el riesgo de aborto a partir de rasgos del desarrollo embrionario, con un AUC en torno a 0,7. Y un árbol de decisión en mujeres de 43 a 45 años estima la tasa acumulada de recién nacido vivo con ciclos propios adicionales, para encuadrar una de las conversaciones más difíciles: seguir con ovocitos propios o pasar a donación.

Qué falta

La mayoría son retrospectivos y específicos de un centro. La precisión es modesta incluso con conjuntos grandes, y se informa más de gestación clínica que de recién nacido vivo. Lo que funciona en un sitio puede rendir mal en otro. El rendimiento se estanca en un AUC de 0,7 a 0,8, «quizá demasiado bajo para ser clínicamente útil». Estos modelos no sustituyen a los predictores de implantación y aneuploidía basados en el embrión: su papel es probablemente adyuvante. El árbol de decisión ofrece un consejo formal, pero no reemplaza una conversación sobre las implicaciones económicas y emocionales. Y anticipar el aborto puede aumentar la ansiedad sin una intervención que cambie el resultado.

Dan probabilidades, no garantías, y aún no han demostrado que cambien decisiones ni que mejoren la tasa de recién nacido vivo.

Ética, ley y sociedad

Responsabilidad, equidad, consentimiento y datos

Los autores dedican un apartado entero a los aspectos éticos, legales y sociales, y avisan de que no son accesorios: determinan si estas tecnologías pueden aplicarse de forma responsable.

Koplin y colaboradores sostienen que, si estos sistemas acortan el tiempo hasta el embarazo y reducen la carga económica, puede existir un imperativo moral de considerarlos, por el coste emocional y económico de la infertilidad. Los mismos autores advierten del riesgo contrario: la deshumanización de tratar a embriones y pacientes como puntos de datos.

Responsabilidad y caja negra

Si un sistema desvía la selección, ¿la responsabilidad es del clínico que se apoyó en la herramienta, de la clínica que la adoptó o de quien la desarrolló? El sesgo de automatización agrava el problema: el clínico puede sentirse presionado a ceder ante la confianza del algoritmo aunque su intuición discrepe.

Equidad e hiper-estratificación

Homanen advierte de que la IA «amenaza con meter en una caja negra las desigualdades en salud» y de generar «hiper-estratificaciones» de la reproducción, donde quien tiene más medios gana más ventaja. Farhud lleva la preocupación al plano global: las clínicas con pocos recursos difícilmente adoptarán sistemas caros, y la brecha internacional se ensancha.

Consentimiento informado

Rolfes señala la «mayor dificultad para asegurar el consentimiento informado» cuando se pide aceptar tecnologías cuyo funcionamiento puede ser opaco hasta para el clínico. Park lo midió: los pacientes dan tanta importancia a que se les informe del uso de IA como a los riesgos del procedimiento. Iserson pide explicar las limitaciones del sistema y cómo se resolverán los desacuerdos entre criterio clínico y recomendación algorítmica.

Datos y adopción comercial

Las clínicas que despliegan sistemas grandes deben proteger información reproductiva sensible con cifrado, cortafuegos y protocolos de ciberseguridad como los de la banca. Zammit avisa de una adopción comercial incontrolada, con algoritmos propietarios implantados sin transparencia ni rendición de cuentas, y de que las implicaciones a largo plazo de la selección embrionaria guiada por algoritmo sobre la salud de la descendencia siguen siendo inciertas.

«Hasta que la IA no demuestre una tasa más alta de recién nacido vivo, la tecnología actual puede servir como adyuvante para reducir la variabilidad, agilizar el flujo de trabajo y ayudar en el consejo, pero no para sustituir la decisión humana.»

Conclusiones del artículo

La letra pequeña

Las limitaciones que reconocen los propios autores

Son las que el artículo repite en todas sus secciones.

Diseño retrospectivo

La mayoría de los estudios son retrospectivos, a menudo de un solo centro y con recogida de datos heterogénea. Es lo que impide determinar el valor clínico real de estas herramientas.

Desenlaces intermedios

Se mide viabilidad embrionaria o gestación clínica, no recién nacido vivo. En predicción de resultados, la precisión es modesta incluso con conjuntos grandes y suele informarse sobre gestación clínica.

No inferioridad, no mejora

Incluso los ensayos prospectivos, como el aleatorizado de iDAScore, han mostrado no inferioridad en lugar de una mejora real de los resultados.

Techo de rendimiento

La capacidad predictiva se estanca en un AUC de 0,7 a 0,8, «quizá demasiado bajo para ser clínicamente útil». Estos modelos tampoco pueden sustituir a los predictores de implantación y aneuploidía basados en el embrión.

«Solo entonces sabremos si estas aplicaciones representan una esperanza genuina, un camino hacia una atención de fertilidad más segura, más eficaz y más accesible; o simplemente ruido, que añade complejidad sin beneficio real.»

«Only then will we know whether these applications represent genuine hope, a pathway to safer, more effective, and more accessible fertility care; or simply hype, adding complexity without meaningful benefit.»

Última frase de las conclusiones del artículo

Para citarlo

La referencia

Agarwal S, Quaas AM, Trolice MP. AI in Reproductive Medicine: Hope or Hype? Clin Obstet Gynecol. 2026;69(1):6–12.

doi: 10.1097/GRF.0000000000000983
Los autores declaran no tener nada que declarar. Copyright © 2025 Wolters Kluwer Health, Inc. Artículo de suscripción: no es de acceso abierto.

Ver el número en Clinical Obstetrics and Gynecology
Ficha visual de Código AdrIA, elaborada sobre el artículo original sin añadir datos ni interpretaciones ajenas al texto. Cada cifra se ha verificado contra su sección antes de maquetarla, y la tabla de evidencia por áreas se ha construido con lo que el propio artículo dice de cada una. Esta página no sustituye al artículo original.