Un juez cívico abre un expediente a las tres de la mañana. El sistema ya sugirió una clasificación de la falta, redactó un borrador de los hechos y marcó una coincidencia con un registro anterior. El juez revisa, acepta casi todo, cambia una palabra y resuelve.
Seis meses después llega una queja. Alguien pregunta por qué la falta se clasificó así. La institución tiene la resolución firmada, pero no puede contestar lo esencial: ¿la clasificación la propuso el sistema o la decidió el juez? ¿El juez la revisó contra el certificado médico o la aceptó tal como venía? ¿Qué decía la sugerencia original antes del cambio?
Cuando un gobierno incorpora IA, la conversación se concentra en el modelo: qué tan preciso es, con qué datos se entrenó, si tiene sesgos. Son preguntas necesarias. Pero en la mayoría de los usos públicos la IA no decide sola. Sugiere, y una persona decide. La calidad de esa decisión depende de algo que el modelo no controla: si queda registro de lo que la persona hizo con la sugerencia.
Una sugerencia no es una decisión. Y una supervisión humana que no deja rastro no se puede demostrar.
En seguridad pública, justicia cívica y atención ciudadana, los usos más comunes de IA no reemplazan a nadie. Redactan la narrativa de un evento, proponen la clasificación de una falta o de un reporte, detectan duplicados, comparan una huella contra registros existentes o revisan inconsistencias de un expediente.
En todos esos casos hay una persona al final: el oficial que firma, el juez que resuelve, el operador que acepta la clasificación. Por eso se dice que estos sistemas tienen "un humano en el ciclo", y se asume que esa presencia basta como salvaguarda.
La investigación sobre decisiones públicas apoyadas por algoritmos muestra que esa suposición es incompleta.
Saar Alon-Barkat (Universidad de Haifa) y Madalina Busuioc (Vrije Universiteit Amsterdam) publicaron en el Journal of Public Administration Research and Theory tres experimentos sobre cómo se procesa la recomendación de un algoritmo en decisiones públicas. El escenario: elegir a cuál de tres docentes en periodo de prueba no se le renovaría el contrato, con una calificación numérica y una evaluación cualitativa de cada uno. A la mitad de los participantes se les dijo que la calificación venía de un algoritmo; a la otra mitad, de un experto humano.
Buscaban dos sesgos: el de automatización, seguir al sistema aunque otras fuentes lo contradigan, y la adherencia selectiva, seguir la recomendación cuando confirma un estereotipo.
En los tres estudios, con 605, 904 y 1,345 participantes, no encontraron que la gente siguiera más al algoritmo que al experto. Pero en el segundo sí encontraron adherencia selectiva: la recomendación se seguía más cuando coincidía con un estereotipo sobre el grupo de la persona evaluada, viniera de un algoritmo o de un experto.
El tercer estudio se hizo con servidores públicos neerlandeses poco después del escándalo de las prestaciones por cuidado infantil. Ahí, la autoridad fiscal usó un algoritmo que, entre otros criterios, tomaba la nacionalidad como variable para marcar solicitudes de alto riesgo, y personal de la autoridad revisaba manualmente las solicitudes marcadas. Había una persona en el ciclo. Aun así, el resultado afectó de forma desproporcionada a familias de origen extranjero. Los autores lo describen como el punto de encuentro entre el sesgo del sistema y el de quien revisa.
La lección es directa: la presencia de una persona no garantiza que la decisión se haya revisado. Se puede aceptar una sugerencia por prisa, por carga de trabajo o porque confirma lo que ya se pensaba. Si la institución no registra qué se sugirió, qué se aceptó y qué se cambió, no tiene forma de distinguir una revisión real de una firma automática.
Los marcos más avanzados ya no se conforman con que haya una persona. Piden que la intervención humana sea efectiva y quede documentada.
La Directiva sobre Toma de Decisiones Automatizada del Gobierno de Canadá, vigente desde 2019 y actualizada en 2025, aplica a cualquier sistema que asista o reemplace el juicio de quien decide en una resolución administrativa. Exige documentar las decisiones hechas o asistidas por el sistema, monitorear sus resultados para detectar efectos injustos, y registrar la retroalimentación de las personas afectadas, los impactos inesperados y las ocasiones en que una persona contradijo al sistema, para usar esos registros en corregir problemas.
El Reglamento de Inteligencia Artificial de la Unión Europea va en la misma dirección. Su artículo 14, sobre supervisión humana de sistemas de alto riesgo, exige que quienes supervisan puedan entender los límites del sistema, interpretar sus resultados y descartar, corregir o revertir lo que produce. Nombra el sesgo de automatización de forma explícita: quienes supervisan deben mantenerse conscientes de la tendencia a confiar de más en el sistema, sobre todo cuando recomienda decisiones. Y para ciertos sistemas de identificación biométrica pide que al menos dos personas competentes verifiquen por separado la identificación antes de actuar, con excepciones que el propio reglamento acota.
Los municipios mexicanos no están sujetos a estas normas, pero su lógica sirve como estándar de diseño: no basta con que alguien decida; hay que poder demostrar qué decidió frente a qué sugerencia.
El sistema escribe su propuesta directamente en el campo definitivo. Después no hay forma de saber si ese valor fue elegido o heredado.
La IA redacta la narrativa de hechos y el oficial la firma con dos ajustes. Meses después nadie puede separar lo que escribió el sistema de lo que corrigió la persona, y esa diferencia puede importar ante una queja o un procedimiento.
Una búsqueda por huella sugiere que la persona detenida ya tiene registros con otro nombre. El operador confirma, pero solo se guarda el resultado final: no qué candidatos se mostraron, quién confirmó ni cuándo.
Alguien fusiona dos registros que el sistema marcó como la misma persona. Si fue un error, deshacerlo exige reconstruir a mano qué venía de cada uno, y si no se sabe quién la aprobó, no se puede revisar el criterio.
Si se acepta el 99 % de las clasificaciones sugeridas, puede ser que el modelo sea excelente o que nadie las revise. Sin el dato de aceptación y rechazo, la institución no puede distinguir entre ambos escenarios.
Registrar la decisión humana no significa llenar al operador de pantallas de confirmación. Significa que el sistema guarde, por diseño, cinco elementos cada vez que una sugerencia toca un expediente.
El valor, el texto o la coincidencia que propuso el sistema, tal como lo propuso, separado del valor final.
La persona, su rol y el momento en que aceptó, modificó o rechazó la sugerencia, ligados a esa sugerencia concreta.
Aceptarla, modificarla o descartarla. En puntos sensibles, con una razón breve que deje escrito el criterio.
Si la persona tenía enfrente el certificado médico, la evidencia o el historial al decidir. Revisar sin la información relevante a la vista no es revisar.
Tasas de aceptación, modificación y rechazo por tipo de sugerencia, área y periodo. Es el dato que convierte el registro individual en supervisión institucional: muestra si la revisión humana funciona o se volvió trámite.
Con esos cinco elementos, la pregunta de la queja tiene respuesta. El sistema propuso la clasificación A; el juez la revisó con el certificado médico a la vista, la cambió a B y dejó escrito por qué. O bien: el sistema propuso A y el juez la aceptó sin cambios en once segundos. Las dos respuestas son útiles. La ausencia de respuesta no.
Es la otra cara de lo que planteamos en La IA institucional falla cuando la operación no es trazable: si la operación no deja rastro, la IA aprende de un expediente débil. Si la decisión sobre lo que la IA propone no deja rastro, la institución no puede supervisar ni a la IA ni a quien la usa.
Tribuna, la plataforma de Intello para seguridad pública y justicia cívica, incluye INTELLO AI, un asistente que ayuda a redactar los hechos a partir del evento, sugiere la clasificación de faltas, revisa la consistencia del expediente antes de enviarlo y apoya la estructura del dictamen médico. El principio de diseño es explícito: el asistente sugiere y la decisión es de la persona.
Ese asistente opera sobre una base pensada para dejar rastro. La auditoría de Tribuna registra lecturas, escrituras y eventos de riesgo, pide un motivo de acceso para abrir expedientes sensibles y conserva la cronología completa de cada expediente. Cada comparación biométrica por huella o rostro queda en bitácora. La red de personas detecta duplicados por CURP, nacimiento, domicilio y teléfono, y la fusión de registros se hace con alta confianza. Y el juez resuelve con faltas, certificado médico, pertenencias y evidencia en el mismo expediente.
Ágora, la plataforma de atención ciudadana, aplica la misma lógica a otro tipo de sugerencias: deduplicación inteligente y clasificación automática de reportes que llegan por web, app, chat, teléfono y ventanilla. Su trazabilidad conserva el historial completo de cada caso: quién hizo qué, cuándo y con qué resultado.
En ambas, la IA no es una caja aparte: trabaja dentro del mismo expediente que se audita, y eso permite que la supervisión humana sea demostrable.
Antes de comprar una herramienta que sugiere, clasifica o compara, conviene preguntar:
- ¿El sistema guarda la sugerencia original por separado del valor final?
- ¿Queda registrado quién aceptó, modificó o rechazó cada sugerencia, y cuándo?
- ¿La persona que decide tiene a la vista la evidencia relevante, o solo la sugerencia?
- ¿Las fusiones de registros y las confirmaciones biométricas dejan constancia de quién las aprobó?
- ¿La institución puede ver tasas de aceptación y rechazo por tipo de sugerencia, área y periodo?
- ¿Se puede reconstruir, para un expediente concreto, qué propuso el sistema y qué decidió la persona?
Si el proveedor no puede contestar con claridad, el problema no es el modelo. Es que la institución no podrá demostrar que supervisó lo que el modelo hizo.
La mayor parte del valor de la IA en la operación pública estará en ayudar a las personas a trabajar mejor, no en sustituirlas. Pero un asistente solo fortalece a la institución si cada sugerencia termina en una decisión que se puede rastrear: quién la tomó, con qué información y qué hizo con lo que el sistema propuso.
La pregunta para los equipos directivos no es si su sistema tiene un humano en el ciclo. Es si pueden demostrar, expediente por expediente, lo que ese humano hizo.
Si tu institución está evaluando cómo incorporar IA sin perder trazabilidad, conoce cómo Tribuna integra un asistente que sugiere dentro de un expediente auditado, cómo Ágora mantiene el historial completo de cada caso ciudadano, o solicita una demo.