Frontiers in Endocrinology · Volumen 17 · 2026
«Stage-specific machine learning prediction of cumulative live birth in women with diminished ovarian reserve»
Tres momentos, tres modelos. El estudio construye un modelo con lo que se sabe antes de empezar (edad, AMH, IMC, años de infertilidad, edad del varón), otro añadiendo lo que se sabe el día del desencadenante (estradiol, LH) y un tercero con lo que se sabe antes de transferir (calidad embrionaria). Y mide cuánto mejora la predicción en cada paso.
La pregunta
Las mujeres con reserva ovárica disminuida tienen tasas de recién nacido vivo acumulado por debajo del 30 % tras la transferencia, y las herramientas de pronóstico actuales se apoyan en datos basales estáticos, sin interpretabilidad.
El artículo señala dos problemas de fondo en los modelos publicados. Uno, que casi ninguno maneja bien el desbalance de clases: el nacido vivo es el resultado minoritario, y un algoritmo que no lo tenga en cuenta puede acertar mucho en apariencia y fallar justo en lo que importa. Dos, que la caja negra impide que el clínico entienda por qué el modelo dice lo que dice.
La consecuencia, según los autores, es que en la consulta se recurre a la experiencia subjetiva en lugar de a una estratificación de riesgo basada en evidencia.
Las preguntas del trabajo: ¿cuánto mejora la predicción del recién nacido vivo acumulado al incorporar la respuesta a la estimulación y después los datos embriológicos? ¿Qué variables la sostienen, y con qué umbrales?
Los resultados
El mejor algoritmo en las tres etapas fue CatBoost. Con las cinco variables basales, el área bajo la curva en el conjunto de prueba fue 0,759. Añadir los datos del día del desencadenante no la movió. Añadir la calidad embrionaria la subió a 0,793.
Modelo basal frente a modelo pre-transferencia, en el conjunto de prueba
Mismo algoritmo (CatBoost) y mismos 371 ciclos de prueba. Verde: etapa 1, cinco variables basales. Morado: etapa 3, ocho variables con la calidad embrionaria. Umbral de decisión 0,5.
La etapa intermedia no aparece en el gráfico porque no cambió nada: AUC 0,755 (IC95% 0,699–0,808), sensibilidad 72,9 %, especificidad 63,6 %. Calibración: las probabilidades brutas salían sobreconfiadas (Brier 0,186 y ECE 0,180 en la etapa 3); tras reescalar con Platt bajaron a 0,153 y 0,082 sin tocar el AUC. Los autores concluyen que el orden de riesgo es fiable, pero la probabilidad individual hay que recalibrarla en cada centro antes de dársela a una paciente.
| Etapa | Variables seleccionadas (de las candidatas) | AUC prueba |
|---|---|---|
| 1 · Basal | Edad de la mujer, edad del varón, AMH, IMC, duración de la infertilidad (5 de 22) | 0,759 |
| 2 · Tras estimulación | Las cinco anteriores + estradiol y LH el día del desencadenante (7 de 31) | 0,755 |
| 3 · Pre-transferencia | Las siete anteriores + calidad embrionaria (8 de 37) | 0,793 |
Cómo se reparten las decisiones del modelo final (SHAP): edad de la mujer 32,8 % del peso total, calidad embrionaria 29,7 %, edad del varón 16,1 %, y el 21,4 % restante entre las otras cinco variables. Los embriones de grado 5 empujan la predicción hacia arriba (SHAP de +0,3 a +0,7); los de grado 1 y 2, con fuerza hacia abajo (de −1,0 a −1,5). El efecto de la edad se acelera a partir de los 37 años en la mujer y de los 40 en el varón. La Discusión del artículo cita porcentajes distintos para estas mismas importancias (38,9 %, 35,2 % y 19,0 %); la ficha usa los de la sección de Resultados y del resumen.
El método
De 7.773 pacientes con transferencia en el centro entre enero de 2019 y julio de 2024, 1.359 cumplían AMH ≤ 1,1 ng/mL (criterios de Bolonia). Tras excluir 125 con historia incompleta quedaron 1.234 ciclos.
Mediana de edad 38 años, AMH 0,67 ng/mL. Desenlace: recién nacido vivo acumulado por ciclo de punción, incluyendo todas las transferencias en fresco y congelado de esa punción.
División aleatoria estratificada en entrenamiento (n = 863, 70 %) y prueba (n = 371, 30 %). El conjunto de prueba se apartó al principio y solo se tocó para la evaluación final.
La tasa de nacido vivo acumulado fue 22,8 % en ambos conjuntos. Selección de variables con Random Forest solo sobre el entrenamiento, quedándose con las cinco más importantes en cada etapa.
Seis modelos de árboles: Decision Tree, LightGBM, Gradient Boosting, XGBoost, CatBoost y AdaBoost, con hiperparámetros fijados de antemano (100 estimadores, profundidad 3–5, tasa de aprendizaje 0,1).
Corrección del desbalance según el algoritmo (peso 1 : 3,4, calculado sobre 197 eventos frente a 666 no eventos). Gradient Boosting y AdaBoost se entrenaron sin corrección, a propósito, para ver qué pasaba.
Validación cruzada de 10 pliegues en entrenamiento; AUC en prueba con intervalos por 1.000 remuestreos bootstrap. Sensibilidad, especificidad, valores predictivos y F1 a umbral 0,5. Calibración con Brier, ECE y Hosmer-Lemeshow.
Interpretación con SHAP sobre el modelo final en unidades clínicas reales. Análisis de sensibilidad con cinco estrategias para los datos faltantes: el AUC se movió entre 0,801 y 0,806.
La letra pequeña
Los límites que listan los autores condicionan cualquier uso del modelo fuera de su centro.
Todo descansa en la partición 70/30, la validación cruzada y el bootstrap dentro del mismo centro. No se realizó ninguna validación externa independiente.
Las diferencias entre centros en protocolos de estimulación, cultivo y criterios de gradación embrionaria pueden reducir el rendimiento en poblaciones no vistas.
Por eso los resultados deben considerarse evidencia generadora de hipótesis
y no una herramienta clínicamente desplegable
.
El corte de 1,1 ng/mL sigue los criterios de Bolonia, pero los autores lo reconocen algo arbitrario
: otros umbrales, o modelar la AMH como variable continua, podrían cambiar el patrón de importancias.
No se dispuso de resultados de PGT-A, que cada vez pesan más en la selección embrionaria y que podrían mejorar la predicción de la etapa pre-transferencia. Tampoco entraron datos de time-lapse ni parámetros morfocinéticos.
Aunque SHAP da una interpretación con base teórica, las predicciones individuales deben comunicarse con cautela
: llevan incertidumbre y deben complementar, no sustituir, el juicio clínico
. Y las probabilidades brutas del modelo salían sobreconfiadas hasta recalibrarlas.
«Desarrollamos y validamos un marco de aprendizaje automático para predecir el recién nacido vivo acumulado en mujeres con reserva ovárica disminuida sometidas a transferencia embrionaria, demostrando que los parámetros embriológicos mejoran sustancialmente la precisión de la predicción más allá de las características basales, mientras que los marcadores posteriores a la estimulación aportan un valor incremental insignificante.»
«We developed and validated a machine learning framework for predicting cumulative live birth in women with diminished ovarian reserve undergoing embryo transfer, demonstrating that embryological parameters substantially enhance prediction accuracy beyond baseline characteristics, while post-stimulation markers contribute negligible incremental value.»
Liu L et al. Frontiers in Endocrinology, 2026.Para citarlo