Alucinaciones de la IA: el informe cuadró al peso y estaba mal
Un modelo analizó 2.377 movimientos de cartera y entregó un Excel impecable. Se le escapó el 97% de la mora. Las seis pruebas para auditarlo.
En resumen: un modelo de frontera analizó 2.377 movimientos de la cartera de una copropiedad y entregó un libro de Excel impecable: inventario, antigüedad por tramos, concentración, facturación por coeficiente, intereses y conciliación bancaria. Todos los subtotales cuadraban al peso. Cuando un segundo modelo lo auditó, apareció lo que no estaba: 18 unidades que no pagaban desde febrero y que concentraban el 97 % del saldo. El informe no tenía una sola resta mal. Tenía un agujero. Esta guía explica por qué pasa, cómo se detecta con seis pruebas y qué debe quedar documentado.
Qué es una alucinación de la IA (y por qué la definición común se queda corta)
Una alucinación de la inteligencia artificial es una afirmación que el modelo presenta con seguridad y que no está respaldada por la fuente. La imagen que todo el mundo tiene en la cabeza es la de una cifra inventada o una norma que no existe. Pasa, y más adelante veremos el caso más famoso.
Pero en el trabajo contable la alucinación peligrosa casi nunca es esa. Es más discreta y tiene tres formas:
- El supuesto silencioso. El modelo no tenía un dato, lo dedujo y siguió trabajando sobre esa deducción como si fuera un hecho.
- La omisión. No inventó nada: simplemente no dijo lo más importante. Y como no hay error visible, nadie lo busca.
- La afirmación sin rastro. La cifra es correcta, pero no se puede señalar el registro del que salió. Para un papel de trabajo, eso no es evidencia.
Las tres aparecieron en el caso que sigue. Ninguna de las tres se detecta leyendo el informe: solo se detectan volviendo a la fuente.
Por qué ocurren
Ayuda entender la mecánica, porque explica cuándo hay más riesgo. Un modelo de lenguaje no consulta una base de datos: predice cuál es la continuación más probable de un texto, a partir de patrones aprendidos en un entrenamiento enorme. Eso lo hace extraordinariamente bueno produciendo respuestas que suenan correctas, incluso cuando no tiene con qué sostenerlas. Las causas habituales son cuatro:
- Falta de contexto. El dato no estaba en lo que usted entregó. El modelo rellena el hueco con lo más plausible.
- Datos de entrenamiento con errores o desactualizados. De ahí salen las normas mal citadas y las cifras de sectores que cambiaron.
- Una instrucción ambigua o permisiva. Si el prompt autoriza a suponer, el modelo supone. Volveremos sobre esto.
- Información que no se puede derivar del archivo y que el modelo intenta igual, en vez de detenerse a preguntar.
Por eso el riesgo no está repartido por igual. Es bajo cuando se le pide calcular sobre datos completos que usted entregó, y alto cuando se le pide concluir, interpretar una norma o rellenar un parámetro que nadie declaró. En la práctica contable, el terreno peligroso es siempre el mismo: lo que el archivo no dice.
El caso: una cartera de copropiedad, 2.377 movimientos
El ejercicio se hizo en vivo, con datos sintéticos —ninguna copropiedad real, ninguna persona real— sobre un centro residencial y comercial de uso mixto: 80 apartamentos, 12 locales, 92 unidades privadas, corte al 31 de agosto de 2026.
El archivo tenía cuatro hojas: los parámetros del encargo, los 92 coeficientes con su cuota, los 2.377 movimientos de cartera de un año y el extracto bancario con 982 consignaciones individuales, cada una con la referencia de la unidad que pagó.
La instrucción pedía seis fases: inventario de la población, cartera al corte por antigüedad, concentración y mora, contraste de la facturación contra el coeficiente, análisis de los intereses y cruce del recaudo movimiento a movimiento, sin muestreo.
Lo que el modelo sí vio, y hay que reconocerlo
El resultado no fue un mal trabajo. En una sola corrida entregó un libro con una hoja por fase y una lista de asuntos formulados como preguntas a la administración. Entre lo que detectó, sin que nadie se lo señalara:
- 12 abonos guardados como texto y no como número, por $7.895.908, más 31 fechas en el mismo estado. Es la clase de detalle que un ojo humano no ve en 2.377 filas y que, si el sistema los ignora, descuadra todo.
- 15 cargos que no correspondían al coeficiente de la unidad. Locales registrados por $884.000 en marzo frente a los $816.000 que les tocaba.
- Una diferencia de $4.180.000 entre el extracto bancario y el auxiliar, ubicada en el mes exacto, con las partidas del banco sin contrapartida listadas una a una.
Cualquiera que reciba ese archivo un lunes por la mañana siente que ganó tres días de trabajo. Y en buena medida es cierto.
Lo que no vio
El segundo modelo, trabajando sobre el archivo original y sobre la respuesta del primero, encontró esto:
18 unidades no habían pagado nada desde febrero de 2026 y concentraban $82.449.866: el 97 % del saldo de cartera.
El informe hablaba de antigüedad por tramos, de los diez mayores deudores, de la distribución entre residencial y comercial. Todo correcto. Pero no dijo la única frase que un revisor fiscal necesita para dormir: que casi toda la cartera está en manos de dieciocho unidades que llevan seis meses sin abonar un peso.
Esa no es una cifra equivocada. Es una omisión. Y fue el veredicto de la única prueba que el informe reprobó por completo.
La prueba que engaña: cuadró al peso
Aquí está la lección que cuesta más trabajo aceptar. Cuando el validador verificó la aritmética, el resultado fue este: todos los subtotales, todos los tramos y todos los conteos cuadraban al peso.
La verificación aritmética —que es la que casi todos hacemos, porque es la que sabemos hacer— habría dado luz verde. El informe era internamente coherente. Un documento puede ser perfectamente consistente consigo mismo y estar describiendo mal la realidad, porque la consistencia interna no dice nada sobre lo que quedó fuera.
Es el mismo principio de los procedimientos analíticos de la NIA 520: una relación que se comporta como se espera no prueba que el saldo esté bien; solo indica dónde no hay que mirar primero.
Las seis pruebas, con el veredicto real
El protocolo se aplica sobre la respuesta, no sobre la copropiedad. El validador no recibe la respuesta correcta: tiene que derivarla él mismo desde la fuente, y parte del sesgo de que el resultado no es confiable mientras no se demuestre lo contrario.
Este es el ejercicio completo, sin cortes ni edición. Vale más verlo que leerlo: el veredicto va apareciendo prueba por prueba, en vivo, sobre un informe que hasta ese momento parecía impecable.
Empieza en el minuto 71, cuando el validador arranca a leer sus veredictos. Tres minutos después aparece la omisión de las 18 unidades.
| Prueba | Qué pregunta | Veredicto |
|---|---|---|
| 1 · ¿Procesó todo? | ¿Leyó la población completa o una parte que no declaró? | Superada con excepciones. Leyó el 100 % de los registros, pero silenció 14 abonos sin comprobante y describió mal una columna |
| 2 · ¿Cuadra consigo misma? | ¿Los subtotales suman los totales que él mismo reportó? | Superada con excepciones. Cuadra al peso, pero cuenta una misma partida como saldo a favor y deudor, y rotula como mora un saldo sin fecha de vencimiento |
| 3 · ¿Se reproduce? | ¿La cifra resiste un recálculo por otra vía? | Superada |
| 4 · ¿Tiene respaldo? | ¿Cada afirmación apunta a un registro concreto? | Superada con excepciones. De 25 afirmaciones: 16 rastreables, 3 condicionadas a un supuesto, 1 incompleta, 3 sin rastro, 1 falsa y 1 con el registro mal citado |
| 5 · ¿Inventó algo? | ¿Hay cifras o normas que no están en la fuente? | Superada con excepciones. No citó ninguna norma inexistente, pero introdujo tres premisas que el archivo no contiene |
| 6 · ¿Qué no dijo? | ¿Qué se le escapó de lo que sí estaba en los datos? | No superada |
Fíjese en el orden de dificultad. Las cinco primeras se pueden contestar leyendo el informe con cuidado. La sexta no se puede contestar leyendo el informe, porque pregunta por lo que no está. Solo se contesta volviendo al archivo. Por eso es la que casi nadie hace, y la que aquí reprobó.
El veredicto que importa no es aprobado o reprobado
El cierre del validador no fue «sirve» ni «no sirve». Fue esto: la respuesta es utilizable para 68 de las 92 unidades y no lo es para las 24 restantes, que concentran $82 millones. Sirve como insumo para el inventario, los totales y la aritmética de los tramos. No sirve para concluir sobre riesgo, concentración ni recuperabilidad, que es justamente para lo que uno pide un análisis de cartera.
Once excepciones, cada una con su efecto en pesos. Ese es el nivel de detalle que convierte una sospecha en un papel de trabajo.
Con qué se audita: la regla de los cinco puntos
Aquí hay un error de método que arruina todo el ejercicio: pedirle al mismo modelo que revise lo que acaba de escribir.
- Mismo modelo, misma conversación. Recuerda su respuesta y la defiende. Coincide consigo mismo, y esa coincidencia se parece mucho a una confirmación sin serlo.
- Mismo modelo, conversación nueva. Mejora, porque no recuerda haberlo escrito. Pero conserva los mismos sesgos de lectura: si ignoró un dato al analizar, lo va a ignorar otra vez al revisar.
- Otro modelo, de otra casa. Distinto entrenamiento, distintos puntos ciegos. Es lo más parecido a una segunda opinión.
Y una condición que se pasa por alto: los dos modelos deben estar al mismo nivel. No se le puede pedir a un modelo básico que audite el trabajo de uno de frontera; no tiene con qué. La referencia práctica es no separarlos más de unos cinco puntos en los índices públicos de comparación de modelos, y que no sean del mismo fabricante.
En el ejercicio, el análisis lo hizo un modelo de frontera de OpenAI y la auditoría, uno de Anthropic de nivel equivalente, en septiembre de 2026. Los nombres de versión cambian cada pocos meses; lo que no cambia es el criterio: mismo nivel, distinta casa, y el validador nunca debe saber de dónde salió lo que está revisando.
Por qué inventó: la instrucción lo autorizó
Las tres premisas que el modelo dio por ciertas —un vencimiento de cuota, un presupuesto anual y una regla de imputación de pagos— no salieron de la nada. El prompt incluía esta frase: «no me hagas preguntas; si algo falta, dedúcelo y deja constancia del supuesto».
El modelo obedeció. Dedujo, dejó constancia y siguió. La alucinación no fue un defecto de la herramienta: fue una licencia que le dio quien escribió la instrucción. Un parámetro que no se declara se convierte en un supuesto inventado, y un supuesto inventado que nadie relee se convierte en una cifra del informe.
De ahí salen las cuatro medidas que más reducen las alucinaciones antes de que ocurran, y que no tienen nada de técnico:
- Declare los parámetros. Entidad, fecha de corte, tamaño de la población, tasas aplicables. Lo que no se declara, se supone.
- Prohíba deducir. Que se detenga y pregunte, en lugar de rellenar. Una ejecución interrumpida cuesta un minuto; un supuesto silencioso cuesta el encargo.
- Pida totales de control por fase, y que no avance sin cuadrarlos.
- Exija trazabilidad. Cada cifra con la hoja y la fila de la que salió. Una afirmación sin rastro no sirve como evidencia.
Cómo se arma ese prompt, paso a paso, lo explicamos en ingeniería de prompts para contadores, porque es la mitad preventiva de este problema. Aquí basta con la conclusión: antes de desconfiar del modelo, lea otra vez lo que le pidió.
El precedente que conviene conocer
En junio de 2023, un juez federal de Manhattan sancionó a dos abogados de Nueva York y a su firma con una multa de 5.000 dólares por presentar un escrito con seis citas de casos inexistentes, generadas por un chatbot. El proceso era una demanda por lesiones personales contra la aerolínea colombiana Avianca, y fueron los abogados de la aerolínea quienes advirtieron al tribunal que no lograban encontrar los fallos citados.
El juez escribió algo que debería estar pegado en la pared de toda firma contable: no hay nada inherentemente impropio en que un profesional use inteligencia artificial para apoyarse, pero las reglas de ética le imponen un papel de guardián sobre la exactitud de lo que presenta.
Es exactamente lo que dice el Consejo Técnico de la Contaduría Pública sobre nuestra profesión, y lo tratamos a fondo en el artículo sobre la inteligencia artificial en la contabilidad y la norma colombiana: la norma no prohíbe ni autoriza, y por eso mismo no traslada la responsabilidad. Ausencia de prohibición no es ausencia de responsabilidad.
Lo que debe quedar documentado
Si usted usó inteligencia artificial en un procedimiento, eso va al papel de trabajo. No es burocracia: es la diferencia entre un procedimiento defendible y una improvisación que no se puede reconstruir seis meses después. Seis elementos, dos párrafos en la memoria de planeación y una fila más:
- Herramienta y versión, y para qué procedimiento se usó.
- La instrucción exacta. La salida no se entiende sin la entrada.
- Población y suma de control. Qué se entregó y de dónde salió.
- Prueba de validación aplicada, cuál y con qué resultado.
- Conclusión propia, firmada, en primera persona.
- Constancia de confidencialidad o del tratamiento de anonimización aplicado.
Sobre el último punto: en este ejercicio los datos eran sintéticos, pero en un encargo real la información de la copropiedad o del cliente no se sube sin más. Se genera el reporte, se anonimiza y se procesa. Lo vemos con más detalle en los riesgos de la inteligencia artificial para el contador.
Una excepción no es un hallazgo
Conviene cerrar separando dos oficios que se confunden cuando el entregable sale bonito.
| Lo que hace la herramienta | Lo que hace el profesional |
|---|---|
| Aplica reglas sobre todo el universo | Agrupa las excepciones por causa raíz |
| Devuelve cada incidencia por separado | Define qué es material y qué no |
| Trata igual lo grande y lo irrelevante | Decide el efecto sobre el alcance |
| No opina, no prioriza, no concluye | Formula la pregunta a la administración |
Y hay una asimetría que no se puede perder de vista: si el trabajo sale mal, la herramienta no pierde nada. La tarjeta profesional es suya. Revisar unos archivos no es auditar, y un memorando no es un dictamen; nombrar bien lo que se hizo también es parte del trabajo. Si su encargo es de revisoría fiscal o toca la contabilidad de una propiedad horizontal, esa distinción tiene consecuencias legales.
Preguntas frecuentes
¿Las alucinaciones se van a acabar con modelos mejores?
Han disminuido mucho y los modelos actuales revisan su propio trabajo bastante más que hace dos años. Pero el caso de arriba se hizo con modelos de frontera, de pago, en septiembre de 2026, y la omisión estaba ahí. Mientras el resultado dependa de lo que usted pidió y de lo que había en el archivo, el riesgo no desaparece: cambia de forma.
¿Puedo usar la versión gratuita para este tipo de trabajo?
Para explorar, sí. Para un análisis que va a sostener una conclusión profesional, no es lo aconsejable: los modelos gratuitos suelen tener ventanas de contexto menores y capacidades de cálculo más limitadas, y con 2.377 registros eso se nota. Y para auditar el resultado, el validador debe estar al nivel del que hizo el trabajo.
¿Cuántas pruebas hay que aplicar?
Aquí mostramos seis porque es lo que cabe en una sesión. En un encargo real se trabaja con doce a dieciocho puntos de comprobación, según el riesgo del procedimiento y el tamaño de la población. Seis bien aplicadas valen más que dieciocho mal hechas.
¿Qué hago si el validador encuentra excepciones?
No son hallazgos todavía. Se agrupan por causa raíz, se decide cuáles son materiales, se define si afectan el alcance y se convierten en preguntas dirigidas a la administración. Los procedimientos adicionales los define usted, no el modelo.
¿Esto reemplaza la revisión humana?
No. La reordena. El modelo procesa el volumen que usted no alcanza a revisar registro por registro; el segundo modelo le señala dónde mirar; y usted decide qué significa. Lo que no se puede delegar es la conclusión, porque es la única parte que lleva firma.
En una frase
La pregunta correcta frente a un informe hecho con inteligencia artificial no es «¿está bien calculado?», porque probablemente lo esté. Es «¿qué no me está diciendo?». El error que le cuesta la tarjeta profesional casi nunca es una suma mal hecha: es un renglón que nunca apareció, en un documento que cuadraba al peso.
Los profesionales que dominan estas herramientas ahorran más de 10 horas semanales
No se trata de reemplazar tu criterio profesional, sino de potenciarlo. En el Programa Ejecutivo en IA para Auditoría te enseño paso a paso cómo integrar la IA en tu flujo de trabajo diario con resultados medibles.
📲 Escríbeme por WhatsApp y te cuento cómo funciona.
Autor: Francisco Moreno Díaz — CP · MBA · MBAN · CAIO
Publicado en: IA Contable
ver abajo