Predecir no es prevenir: lo que muestra la evidencia 2023–2026, sus promesas y sus nuevos riesgos
RESUMEN EJECUTIVO:
En enero de 2026, ECRI publicó su lista anual de peligros de la tecnología sanitaria. El primer lugar fue para el mal uso de los chatbots de inteligencia artificial (IA) (ECRI, 2026a). Dos meses después, la misma organización eligió como la principal preocupación de seguridad del paciente del año el "dilema diagnóstico de la IA" (ECRI, 2026b). La tecnología que más promete reducir el daño evitable encabeza al mismo tiempo las dos listas de riesgos. Esa paradoja es el punto de partida de este trabajo.
Revisamos la literatura más relevante de los últimos tres años en ocho líneas clásicas de la seguridad del paciente: error diagnóstico, sepsis y deterioro clínico, errores de medicación, eventos adversos quirúrgicos, infecciones asociadas al cuidado, caídas, lesiones por presión, y notificación y análisis de incidentes. Hicimos a cada línea la misma pregunta: ¿hay evidencia de que la IA reduzca el daño a los pacientes, o solo de que predice bien? Además, ¿qué riesgos nuevos introduce?
Diez mensajes clave
1. Predecir no es prevenir.
En casi todas las líneas abundan los estudios que muestran que un algoritmo predice bien, y escasean los que muestran que los pacientes sufren menos daño. Cuando se miden desenlaces duros, a menudo el resultado es neutro:
• Un modelo de mortalidad quirúrgica con muy buena capacidad de discriminación se implementó en UCLA sobre más de 40.000 cirugías, y la mortalidad no cambió (Wingert et al., 2026).
• El índice que anticipa la hipotensión intraoperatoria reduce los minutos de hipotensión. Pero en 14 ensayos aleatorizados no mejoró de manera robusta la lesión renal, la lesión miocárdica ni la mortalidad (S. S. Wang et al., 2026).
2. El diagnóstico es hoy la línea con mejor evidencia de beneficio real.
En un ensayo en el que participaron más de 105.000 mujeres, y la IA como apoyo a la lectura de mamografías aumentó la sensibilidad. Los cánceres de intervalo, que son los que se "escapan" entre dos controles, bajaron un 12%. Esa reducción cumplió el criterio de no inferioridad, aunque no demostró superioridad (Gommers et al., 2026). Además, la carga de lectura de los radiólogos bajó un 44%. En un ensayo pragmático con casi 16.000 pacientes, las alertas de un electrocardiograma analizado con IA redujeron la mortalidad a 90 días de 4,3% a 3,6% (C.-S. Lin et al., 2024).
3. En sepsis y deterioro clínico las señales son alentadoras, pero no concluyentes.
Estudios observacionales muestran reducciones de mortalidad cercanas al 17% (Adams et al., 2022; Boussina et al., 2024). Sin embargo, el metaanálisis que reunió solo ensayos aleatorizados no encontró una diferencia significativa (Ein Alshaeba et al., 2025). En sala general, los sistemas de alerta de deterioro reducen los paros cardíacos intrahospitalarios, pero su efecto sobre la mortalidad no es concluyente (Chua et al., 2026). La advertencia más citada es el modelo de sepsis de Epic, uno de los más difundidos del mundo. Cuando se analizaron solo las predicciones previas a que el médico sospechara la sepsis, rindió peor que el azar (Kamran et al., 2024).
4. El algoritmo no salva vidas: lo hace el circuito que responde a la alerta.
Las experiencias exitosas tienen algo en común: detrás de la alerta hay un equipo, un protocolo y un tiempo de respuesta. En Kaiser Permanente, la reducción de mortalidad asociada a su índice de deterioro dependió de un equipo de enfermería que monitoreaba a distancia y activaba la respuesta (Escobar et al., 2020). Comprar un algoritmo sin rediseñar el proceso es comprar una alarma más.
5. La combinación de profesional e IA supera a cada uno por separado, pero no alcanza con tener la herramienta.
En una farmacia en línea, un modelo de lenguaje con revisión humana redujo un 33% los casi-errores en la transcripción de indicaciones (Pais et al., 2024).
• En casos simulados, los farmacéuticos asistidos por IA detectaron más errores de medicación que trabajando solos (Ong, Jin, et al., 2025).
•En cambio, darle GPT-4 a un grupo de médicos no mejoró su razonamiento diagnóstico, aunque el modelo solo rendía mejor que ellos (Goh et al., 2024).
• Con pacientes pasa algo parecido. Los modelos identificaron la condición correcta en el 95% de los casos, pero las personas que los consultaban acertaron en menos del 35% (Bean et al., 2026).
El algoritmo acierta; el desafío es que acierte el equipo.
6. En caídas y lesiones por presión la evidencia es la más débil.
Los modelos predicen el riesgo mejor que las escalas tradicionales, pero no hay ensayos aleatorizados que muestren menos caídas. El mejor estudio disponible redujo las caídas con lesión, pero no las caídas totales (Cho et al., 2023). Para las lesiones por presión, una revisión paraguas de 70 herramientas concluyó que ni la escala de Braden ni los modelos de aprendizaje automático demostraron reducir su incidencia (Hillier et al., 2025a).
7. Lo que funciona en un hospital puede fallar en otro.
Los sistemas de visión por computadora que miden la higiene de manos alcanzan un 95% de exactitud en la unidad donde se entrenaron, y caen a un 56% al trasladarse a otro servicio (X. Lin et al., 2026). En el caso de Epic, lo que falló fue un producto propietario, desplegado a gran escala sin validación independiente. Validar el modelo en la propia población no es un lujo: es una condición de seguridad.
8. Con los incidentes, la IA ya sabe clasificar, pero todavía no sabe analizar.
Un modelo de lenguaje clasificó reportes de errores de medicación con un 96% de concordancia con farmacéuticos expertos (Krifors et al., 2026). Pero al buscar los factores contribuyentes de un evento adverso, los modelos confunden los factores organizacionales con los individuales (Y. Wang et al., 2026). Es decir, tienden a señalar a la persona donde había una falla del sistema. En un análisis causa raíz eso no es un detalle técnico: es un retroceso hacia la cultura de la culpa.
9. La IA genera riesgos propios.
• Sesgo de automatización. Cuando la IA sugería una categoría equivocada, la exactitud de los lectores inexpertos de mamografía cayó de casi 80% a 20% (Dratsch et al., 2023).
•Pérdida de habilidades. Después de acostumbrarse a la IA, los endoscopistas detectaron menos adenomas en las colonoscopías que hacían sin ella (Budzyń et al., 2025).
• Escribas ambientales. Los asistentes que redactan la historia clínica a partir de la conversación omiten o alteran información de manera sutil (Lukac et al., 2025).
• Chatbots de salud. En una prueba estructurada, un chatbot orientado a pacientes subestimó la urgencia en la mitad de las emergencias (Ramaswamy et al., 2026).
A esto se suma que los incidentes en los que la IA contribuye casi no se notifican (Taylor, 2025).
10.Qué hacer.
Para las instituciones, el consenso internacional converge en cinco medidas (IHI Lucian Leape Institute, 2024; Joint Commission & Coalition for Health AI, 2025):
• validar localmente antes de implementar;
• xigir evidencia de desenlaces, no solo de rendimiento;
• diseñar qué ocurre después de cada alerta;
• establecer una gobernanza que monitoree el desempeño en el tiempo;
• incorporar los eventos vinculados a la IA al sistema de notificación.
Para los profesionales, la IA debe funcionar como una segunda opinión y no como un piloto automático. Esto vale también en el plano médico-legal: la firma al pie de la historia clínica sigue siendo del médico, aunque el texto lo haya escrito una máquina.
Seguir leyendo AQUÍ
Dr. Fabián Vítolo NOBLE Cía de Seguros
