Código AdrIA Papers legibles

Frontiers in Endocrinology · Volumen 17 · 2026

Baja reserva: el pronóstico lo marca el embrión

«Stage-specific machine learning prediction of cumulative live birth in women with diminished ovarian reserve»

Lidan Liu, Bo Liu, Qianyi Huang, Lang Qin, Li Jiang y Huimei Wu.
Guangxi Reproductive Medical Center, Primer Hospital Afiliado de la Universidad Médica de Guangxi, Nanning (China).

Cohorte retrospectiva unicéntrica · modelo predictivo 1.234 ciclos de punción · AMH ≤ 1,1 ng/mL DOI 10.3389/fendo.2026.1832301
Qué tipo de evidencia es Un modelo entrenado y probado dentro del mismo centro, sin validación externa. Los autores lo califican de «generador de hipótesis»; no lo presentan como una herramienta lista para la clínica. Lo que describe es qué información predice y cuál no, en esta población.
!

Tres momentos, tres modelos. El estudio construye un modelo con lo que se sabe antes de empezar (edad, AMH, IMC, años de infertilidad, edad del varón), otro añadiendo lo que se sabe el día del desencadenante (estradiol, LH) y un tercero con lo que se sabe antes de transferir (calidad embrionaria). Y mide cuánto mejora la predicción en cada paso.

La pregunta

Cuánto se puede afinar el pronóstico en baja reserva, y cuándo

Las mujeres con reserva ovárica disminuida tienen tasas de recién nacido vivo acumulado por debajo del 30 % tras la transferencia, y las herramientas de pronóstico actuales se apoyan en datos basales estáticos, sin interpretabilidad.

El artículo señala dos problemas de fondo en los modelos publicados. Uno, que casi ninguno maneja bien el desbalance de clases: el nacido vivo es el resultado minoritario, y un algoritmo que no lo tenga en cuenta puede acertar mucho en apariencia y fallar justo en lo que importa. Dos, que la caja negra impide que el clínico entienda por qué el modelo dice lo que dice.

La consecuencia, según los autores, es que en la consulta se recurre a la experiencia subjetiva en lugar de a una estratificación de riesgo basada en evidencia.

Las preguntas del trabajo: ¿cuánto mejora la predicción del recién nacido vivo acumulado al incorporar la respuesta a la estimulación y después los datos embriológicos? ¿Qué variables la sostienen, y con qué umbrales?

Los resultados

La estimulación no añade capacidad predictiva; la calidad embrionaria, sí

El mejor algoritmo en las tres etapas fue CatBoost. Con las cinco variables basales, el área bajo la curva en el conjunto de prueba fue 0,759. Añadir los datos del día del desencadenante no la movió. Añadir la calidad embrionaria la subió a 0,793.

AUC 0,793
Modelo pre-transferencia, con calidad embrionaria
IC95% 0,739–0,840 · sensibilidad 70,6 % · especificidad 72,4 % · conjunto de prueba, n = 371
−0,004
Lo que aportó la respuesta a la estimulación al AUC basal
AUC 0,759 con datos basales frente a 0,755 añadiendo estradiol y LH del día del desencadenante
< 30 %
Sensibilidad de los algoritmos sin corrección del desbalance
Gradient Boosting y AdaBoost, con AUC de 0,71–0,77 · se dejaban más del 70 % de los nacidos vivos
62,5 %
Peso conjunto de la edad de la mujer y la calidad embrionaria
SHAP: edad 32,8 % · calidad embrionaria 29,7 % · edad del varón 16,1 % · umbrales a los 37 y los 40 años

Modelo basal frente a modelo pre-transferencia, en el conjunto de prueba

Mismo algoritmo (CatBoost) y mismos 371 ciclos de prueba. Verde: etapa 1, cinco variables basales. Morado: etapa 3, ocho variables con la calidad embrionaria. Umbral de decisión 0,5.

Área bajo la curva ROC · discriminación
Basal
0,759IC 0,704–0,810
Pre-transfer.
0,793IC 0,739–0,840
mejora de 0,034 · IC95% 0,704–0,810 frente a 0,739–0,840 · los intervalos se solapan
Sensibilidad · nacidos vivos que el modelo detecta
Basal
76,5 %
Pre-transfer.
70,6 %60 / 85
el modelo basal detecta más nacidos vivos, a costa de más falsos positivos
Especificidad · ciclos sin nacido vivo bien clasificados
Basal
63,6 %
Pre-transfer.
72,4 %207 / 286
la calidad embrionaria mejora sobre todo la especificidad
Valor predictivo positivo
Basal
38,5 %
Pre-transfer.
43,2 %
bajo en ambos: solo el 22,8 % de los ciclos acaban en nacido vivo
Valor predictivo negativo
Basal
90,1 %
Pre-transfer.
89,2 %
sin cambio · cuando el modelo dice que no, acierta nueve de cada diez veces

La etapa intermedia no aparece en el gráfico porque no cambió nada: AUC 0,755 (IC95% 0,699–0,808), sensibilidad 72,9 %, especificidad 63,6 %. Calibración: las probabilidades brutas salían sobreconfiadas (Brier 0,186 y ECE 0,180 en la etapa 3); tras reescalar con Platt bajaron a 0,153 y 0,082 sin tocar el AUC. Los autores concluyen que el orden de riesgo es fiable, pero la probabilidad individual hay que recalibrarla en cada centro antes de dársela a una paciente.

Ver qué variables entraron en cada etapa y cuánto pesan
EtapaVariables seleccionadas (de las candidatas)AUC prueba
1 · BasalEdad de la mujer, edad del varón, AMH, IMC, duración de la infertilidad (5 de 22)0,759
2 · Tras estimulaciónLas cinco anteriores + estradiol y LH el día del desencadenante (7 de 31)0,755
3 · Pre-transferenciaLas siete anteriores + calidad embrionaria (8 de 37)0,793

Cómo se reparten las decisiones del modelo final (SHAP): edad de la mujer 32,8 % del peso total, calidad embrionaria 29,7 %, edad del varón 16,1 %, y el 21,4 % restante entre las otras cinco variables. Los embriones de grado 5 empujan la predicción hacia arriba (SHAP de +0,3 a +0,7); los de grado 1 y 2, con fuerza hacia abajo (de −1,0 a −1,5). El efecto de la edad se acelera a partir de los 37 años en la mujer y de los 40 en el varón. La Discusión del artículo cita porcentajes distintos para estas mismas importancias (38,9 %, 35,2 % y 19,0 %); la ficha usa los de la sección de Resultados y del resumen.

El método

Cómo se hizo

1

A quién se incluyó

De 7.773 pacientes con transferencia en el centro entre enero de 2019 y julio de 2024, 1.359 cumplían AMH ≤ 1,1 ng/mL (criterios de Bolonia). Tras excluir 125 con historia incompleta quedaron 1.234 ciclos.

Mediana de edad 38 años, AMH 0,67 ng/mL. Desenlace: recién nacido vivo acumulado por ciclo de punción, incluyendo todas las transferencias en fresco y congelado de esa punción.

2

Cómo se repartió la muestra

División aleatoria estratificada en entrenamiento (n = 863, 70 %) y prueba (n = 371, 30 %). El conjunto de prueba se apartó al principio y solo se tocó para la evaluación final.

La tasa de nacido vivo acumulado fue 22,8 % en ambos conjuntos. Selección de variables con Random Forest solo sobre el entrenamiento, quedándose con las cinco más importantes en cada etapa.

3

Qué algoritmos se compararon

Seis modelos de árboles: Decision Tree, LightGBM, Gradient Boosting, XGBoost, CatBoost y AdaBoost, con hiperparámetros fijados de antemano (100 estimadores, profundidad 3–5, tasa de aprendizaje 0,1).

Corrección del desbalance según el algoritmo (peso 1 : 3,4, calculado sobre 197 eventos frente a 666 no eventos). Gradient Boosting y AdaBoost se entrenaron sin corrección, a propósito, para ver qué pasaba.

4

Cómo se evaluó y se explicó

Validación cruzada de 10 pliegues en entrenamiento; AUC en prueba con intervalos por 1.000 remuestreos bootstrap. Sensibilidad, especificidad, valores predictivos y F1 a umbral 0,5. Calibración con Brier, ECE y Hosmer-Lemeshow.

Interpretación con SHAP sobre el modelo final en unidades clínicas reales. Análisis de sensibilidad con cinco estrategias para los datos faltantes: el AUC se movió entre 0,801 y 0,806.

La letra pequeña

Lo que los autores reconocen de su propio trabajo

Los límites que listan los autores condicionan cualquier uso del modelo fuera de su centro.

Solo validación interna

Todo descansa en la partición 70/30, la validación cruzada y el bootstrap dentro del mismo centro. No se realizó ninguna validación externa independiente. Las diferencias entre centros en protocolos de estimulación, cultivo y criterios de gradación embrionaria pueden reducir el rendimiento en poblaciones no vistas.

Por eso los resultados deben considerarse evidencia generadora de hipótesis y no una herramienta clínicamente desplegable.

El umbral de AMH es una convención

El corte de 1,1 ng/mL sigue los criterios de Bolonia, pero los autores lo reconocen algo arbitrario: otros umbrales, o modelar la AMH como variable continua, podrían cambiar el patrón de importancias.

Sin datos genéticos del embrión

No se dispuso de resultados de PGT-A, que cada vez pesan más en la selección embrionaria y que podrían mejorar la predicción de la etapa pre-transferencia. Tampoco entraron datos de time-lapse ni parámetros morfocinéticos.

Las predicciones individuales llevan incertidumbre

Aunque SHAP da una interpretación con base teórica, las predicciones individuales deben comunicarse con cautela: llevan incertidumbre y deben complementar, no sustituir, el juicio clínico. Y las probabilidades brutas del modelo salían sobreconfiadas hasta recalibrarlas.

«Desarrollamos y validamos un marco de aprendizaje automático para predecir el recién nacido vivo acumulado en mujeres con reserva ovárica disminuida sometidas a transferencia embrionaria, demostrando que los parámetros embriológicos mejoran sustancialmente la precisión de la predicción más allá de las características basales, mientras que los marcadores posteriores a la estimulación aportan un valor incremental insignificante.»

«We developed and validated a machine learning framework for predicting cumulative live birth in women with diminished ovarian reserve undergoing embryo transfer, demonstrating that embryological parameters substantially enhance prediction accuracy beyond baseline characteristics, while post-stimulation markers contribute negligible incremental value.»

Liu L et al. Frontiers in Endocrinology, 2026.

Para citarlo

La referencia

Liu L, Liu B, Huang Q, Qin L, Jiang L, Wu H. Stage-specific machine learning prediction of cumulative live birth in women with diminished ovarian reserve. Front Endocrinol (Lausanne). 2026;17:1832301. doi:10.3389/fendo.2026.1832301

Leer el artículo original · Acceso abierto bajo licencia CC BY
Esta ficha se ha elaborado sobre el artículo original, sin añadir datos ni interpretaciones ajenas al texto. Cada cifra se ha verificado contra las tablas y la sección de resultados del artículo antes de maquetarla. Enlaza al artículo para quien quiera leerlo completo.
Código AdrIA · serie «papers legibles»