🏠 Todas las herramientas

← IA con Criterio English

⚠️ Traducción preliminar (borrador), pendiente de revisión por un hablante nativo. La versión en inglés es la de referencia.

Funciona en la Demo. ¿Y Después?

Una función de IA, llevada de una demo impecable a algo digno de confianza.

Las prácticas de la guía suenan obvias hasta que intentas saltarte una. Así que aquí va una función real y concreta, llevada de la versión que gana la reunión de ventas a la versión segura para poner frente a personas reales — y todo lo que pasa en medio. La parte incómoda: las dos versiones dan casi las mismas respuestas en la demo. La diferencia está enteramente en los casos que la demo nunca muestra.

La función

TriajeRápido — un chatbot que una clínica pone en su web y su app. El paciente escribe qué le pasa, y le dice qué hacer: manejarlo en casa, pedir cita de rutina, ir hoy, o ir a urgencias. La promesa: menos citas desperdiciadas, menos saturación, ayuda a las 2 de la mañana.

En la demo es maravilloso. Escribes “tengo la nariz tapada y un dolor de cabeza leve” y responde — al instante, cálido, fluido — con cuidados sensatos y un suave “ven si empeora”. Maneja una docena de molestias comunes sin fallar. La sala está vendida. A lanzarlo.

Entonces lo usa gente real

La demo solo mostró los casos fáciles y típicos, respondidos bien. El uso real es lo raro, lo asustado, lo atípico y lo equivocado. Aquí es donde la v1 falla en silencio — cada fallo es una práctica que nunca tuvo.

Una mujer de 52 años escribe: “me duele la mandíbula, algo de náusea, hoy muy cansada.” TriajeRápido responde, seguro y amable, que “probablemente sea estrés o una distensión menor — descanse y tome líquidos.” Era un infarto. En las mujeres suele presentarse sin el dolor de pecho clásico, y el modelo había visto muchos más ejemplos de “cansada + náusea = menor” que la excepción.

Falta: decir lo que no sabes, rechazar / escalar cuando hay mucho en juego, probar el daño (el caso atípico).

Un adolescente a medianoche: “ya no le veo sentido a nada.” El bot ofrece un párrafo ordenado sobre higiene del sueño y “tratar de mantenerse positivo”, y sigue. Sin reconocerlo, sin escalar, sin línea de crisis.

Falta: rechazar / escalar, fallar seguro, no dañino.

El bot abre con “Según sus síntomas, diagnostico…” y escribe como un médico tranquilo. Un hombre que siente que algo va muy mal lee la respuesta tranquilizadora y anula su propio instinto — sonaba como un médico. No va.

Falta: no fingir ser humano, mostrar dónde están los bordes.

Un inmigrante reciente describe síntomas graves en un español entrecortado. El modelo malinterpreta la frase rota, se aferra a la palabra equivocada y lo tranquiliza. El usuario al que peor podía leer era justo el que más necesitaba que lo leyera bien.

Falta: diseñar para quien más puede salir dañado.

Nada de esto sale a la luz. Cuando TriajeRápido se equivoca, el paciente simplemente… no aparece, y se deteriora en casa. No hay seguimiento, ni forma de marcar una mala respuesta, ni nadie cuyo trabajo sea notarlo. Meses después la clínica también descubre que el proveedor entrenaba en silencio con los registros de síntomas de los pacientes.

Falta: hacer los errores visibles y corregibles, guardar los menos datos posibles.

El rediseño: digno de confianza por diseño

El mismo modelo, casi. Lo que cambia es el diseño a su alrededor — el suelo, los valores por defecto, la medición y quién responde. La v2 está hecha para los casos que la demo se saltó.

Escalar hacia arriba, nunca hacia abajo

Una regla dura, no del modelo, detecta patrones de alarma — síntomas de pecho/mandíbula/brazo, signos de derrame, dificultad para respirar, pensamientos suicidas — y va directo a “llame a emergencias / este es el número”, sin intentar triaje. Y cuando el modelo no está seguro, el sistema redondea hacia más atención, nunca menos. Subreaccionar es el error caro, así que el valor por defecto se inclina al lado seguro.

Se vincula con: rechazar / escalar · fallar seguro · decir lo que no sabes.

Claramente una herramienta, no un médico

Abre con “soy un asistente automático, no un médico ni enfermero.” Nunca dice “diagnostico”. Da un siguiente paso sugerido con incertidumbre en lenguaje claro, y dice explícitamente que confíes en tu instinto por encima de él: “Si siente que algo va muy mal, hágase ver — aunque yo haya dicho que probablemente es leve.”

Se vincula con: no fingir ser humano · mostrar los bordes.

Hecho para el peor día y el usuario más difícil

Se prueba con personas estresadas, asustadas, de baja alfabetización y no nativas — no solo con el personal. Pregunta una cosa clara a la vez, confirma lo que entendió, y hace que el camino seguro (hacerse ver) sea el fácil y por defecto para quien apenas puede escribir. Cuando no entiende la entrada, escala en vez de adivinar.

Se vincula con: diseñar para quien más puede salir dañado.

Medido por las emergencias que se le escapan

La métrica de lanzamiento no es “¿manejó los resfriados?”. Es el falso negativo peligroso — a cuántas emergencias reales se les dijo que se quedaran en casa — medido contra la revisión clínica, y sometido a red-team con presentaciones atípicas como el infarto de arriba. Una versión más pulida pero que se escapa una emergencia más no se lanza.

Se vincula con: probar el daño, no solo la demo.

Un humano responde, y los errores vuelven

Los casos inciertos y marcados van a un enfermero, no al vacío. Un clínico con nombre responde por la seguridad de la herramienta. Cada interacción se registra y audita; los pacientes siempre pueden llegar a una persona; y hay un seguimiento simple de “¿cómo resultó?” para que los fallos se hagan visibles y corregibles en vez de silenciosos.

Se vincula con: mantener a un humano sobre lo que no puedes deshacer · hacer los errores visibles y corregibles.

La seguridad del paciente por encima del flujo de la clínica

A la herramienta no se le permite explícitamente minimizar la gravedad para reducir la carga de citas — si ambos llegan a chocar, gana la seguridad, y eso está escrito en cómo se evalúa. Los datos de síntomas se minimizan, se conservan solo lo necesario, y nunca se usan para entrenar modelos sin consentimiento claro.

Se vincula con: servir al usuario, no solo a quien lo despliega · guardar los menos datos.

La conclusión

Pon la v1 y la v2 en la misma demo y te costará distinguirlas — ambas bordan el resfriado. Toda la diferencia vive en los casos que una demo está diseñada para no mostrar: la presentación rara, la persona en crisis, el usuario al que no logra leer, la respuesta que erró y nadie detectó.

Ese es justo el punto. Lo digno de confianza por diseño cuesta más, y demuestra exactamente lo mismo. El trabajo es invisible hasta el momento en que era lo único que importaba. Hazlo igual — por los casos que nunca verás en la presentación.

Pon esta mirada sobre tu propio producto con la autoevaluación del constructor, o lee los principios completos en la guía. ¿Decidiendo si confiar en la IA de otro? La verificación del comprador.

Gratis y de dominio público (CC0) — cópialo, tradúcelo, úsalo para defender el caso en tu propio equipo. Sin cuentas, sin rastreo; funciona enteramente en tu navegador.

Revisado por última vez: junio de 2026. Es información general que puede quedar desactualizada — verifica lo sensible al tiempo (leyes, cifras, programas, menús de apps) con fuentes oficiales actuales.