Cómo auditar sistemas de inteligencia artificial: la nueva frontera del auditor
Cómo auditar sistemas de inteligencia artificial: fases, pruebas de datos y sesgo, ISO 42001, NIST AI RMF, prompts y un caso real para el auditor.
TL;DR: Saber cómo auditar sistemas de inteligencia artificial ya no es un tema de ingenieros: es evaluar la gobernanza, los datos, el desempeño y la supervisión humana de los modelos que deciden a quién se le presta, qué factura se paga o qué transacción se marca como sospechosa. No necesita ser científico de datos. Necesita llevar las preguntas de siempre —quién autoriza, quién controla, cómo se verifica, qué pasa si falla— a un objeto nuevo, apoyado en marcos como ISO/IEC 42001 y el NIST AI RMF. Aquí tiene las fases, las pruebas, cuatro prompts y un caso real.
Durante años he usado estas herramientas en mi trabajo y he enseñado a colegas a hacerlo. Este artículo invierte el lente: explica cómo auditar sistemas de inteligencia artificial cuando la tecnología deja de ser el instrumento y se convierte en el objeto de la auditoría.
Piénselo un momento. En su organización o en la de sus clientes ya hay modelos tomando decisiones: aprobar un crédito, priorizar un cobro, liberar un pago sin revisión, fijar un precio. Cada una de esas decisiones automatizadas es un proceso con riesgos que probablemente ninguna auditoría ha cubierto, porque «eso es de sistemas». Es un error. Un proceso crítico que decide sin intervención humana es territorio natural de la auditoría interna, y quien aprenda a recorrerlo primero tendrá años de ventaja profesional.
¿Qué es una auditoría de inteligencia artificial y para qué sirve?
Definición de trabajo: una auditoría de IA es la evaluación independiente de si los sistemas que una organización desarrolla, compra o usa cuentan con gobernanza adecuada (inventario, propósito aprobado, responsables), controles sobre sus datos y su funcionamiento (calidad de insumos, monitoreo, intervención humana) y resultados confiables (exactitud, trato equitativo, trazabilidad y explicabilidad de las decisiones), frente a un criterio definido: la política interna, un estándar como ISO/IEC 42001, el NIST AI RMF o la regulación aplicable.
Sirve para tres cosas concretas: darle al comité y a la junta una opinión sobre riesgos que hoy nadie mide, detectar incumplimientos de privacidad y protección de datos antes de que los detecte un regulador, y verificar que la información financiera producida con apoyo de un algoritmo es confiable, algo que toca de lleno el control interno sobre el reporte. No exige entender la matemática interna del modelo. Igual que se evalúa tesorería sin ser tesorero, un modelo de IA se evalúa preguntando por objetivos, riesgos, controles y evidencia.
¿Por qué es importante revisar los sistemas de IA?
Porque la IA toma decisiones a una escala y una velocidad que ningún control manual alcanza, y porque sus errores no se ven como errores: se ven como respuestas razonables. Un modelo degradado sigue aprobando créditos con total seguridad; un chat corporativo sigue redactando con aplomo aunque invente la cifra.
En mi práctica veo cuatro razones que convencen a cualquier comité:
- Responsabilidad que no se terceriza. La decisión de un modelo comprado a un proveedor sigue siendo una decisión de la administración.
- Datos personales. En Colombia, la Superintendencia de Industria y Comercio expidió la Circular Externa 002 de 2024 con lineamientos sobre el tratamiento de datos personales en sistemas de IA, bajo las Leyes 1266 de 2008 y 1581 de 2012.
- Información financiera. Si una provisión o una clasificación sale de un modelo, la confiabilidad de esa cifra depende de controles que alguien debe probar.
- Reputación. Un trato discriminatorio hecho por un algoritmo se paga igual que uno hecho por una persona, con el agravante de que se repitió miles de veces.
Profundizo en los riesgos para el profesional en el artículo sobre riesgos de la IA para contadores: confidencialidad, alucinaciones y responsabilidad. Aquí el foco es otro: los riesgos de la organización auditada.
¿Qué normas sirven de criterio para auditar sistemas de inteligencia artificial?
Todo hallazgo necesita un criterio. Estos son los que hoy uso, con su naturaleza bien distinguida, porque confundir un estándar voluntario con una ley es un error frecuente en los informes:
| Marco o norma | Naturaleza | Para qué le sirve al auditor |
|---|---|---|
| ISO/IEC 42001:2023 | Estándar certificable de sistema de gestión de IA, publicado en diciembre de 2023 | Criterio para evaluar política, evaluación de impacto, ciclo de vida y control de proveedores |
| NIST AI RMF 1.0 (enero de 2023) | Marco voluntario de gestión de riesgos | Estructura de pruebas en cuatro funciones: gobernar, mapear, medir y gestionar |
| AI Auditing Framework del IIA | Guía profesional para auditoría interna, actualizada en 2024 | Programa por componentes y lista de verificación inicial alineada con las tres líneas |
| Reglamento (UE) 2024/1689, la ley de IA de la Unión Europea | Ley obligatoria en la UE, con calendario modificado por el Reglamento (UE) 2026/1744 | Clasificación por niveles de riesgo; referencia para grupos con operación europea |
| Circular Externa 002 de 2024 de la SIC | Instrucción del regulador colombiano de datos personales | Criterio para probar idoneidad, necesidad, razonabilidad y proporcionalidad del tratamiento |
| CONPES 4144 de 2025 | Política nacional de IA de Colombia | Contexto; no impone obligaciones directas a las empresas privadas |
¿Cuándo es obligatoria una auditoría de IA? En Colombia, hoy, ninguna ley exige una auditoría independiente de estos sistemas. En la Unión Europea, la ley de IA impone a los sistemas de alto riesgo —entre ellos, la evaluación de solvencia de personas naturales— obligaciones de gestión de riesgos, documentación, registro y control humano, y en algunos casos evaluación de conformidad; el Ómnibus Digital de 2026 aplazó parte de esas obligaciones, así que verifique el calendario vigente en EUR-Lex antes de citarlo. Para la profesión contable colombiana, el CTCP aclaró en su concepto 2026-0209 que «el uso de inteligencia artificial no sustituye el juicio profesional ni traslada a la herramienta la responsabilidad». Lo desarrollé en qué dice la norma colombiana sobre la IA en la contabilidad.
¿Cuáles son los tipos de auditorías de IA?
No todas las auditorías persiguen lo mismo, y definir el tipo desde la carta de encargo evita malentendidos con el comité:
- De gobierno y cumplimiento normativo: política, inventario, roles, aprobaciones y cumplimiento de la regulación de datos. Es la puerta de entrada natural para la auditoría interna.
- De datos: origen, calidad, licencias y representatividad de los datos de entrenamiento y de operación.
- De desempeño y sesgo (algorítmica): exactitud, degradación en el tiempo y diferencias de resultado entre grupos.
- De seguridad de la información: accesos, manipulación de entradas, fuga de datos por herramientas de IA generativa.
- De sistema de gestión: evaluación de primera o segunda parte contra ISO/IEC 42001, o de certificación cuando la hace un organismo acreditado.
En la práctica, la primera auditoría combina gobernanza, datos y un modelo crítico. Las demás se programan después, según el riesgo.
¿Cuáles son las fases de una auditoría de sistemas de IA paso a paso?
Uso las mismas cuatro etapas de cualquier proceso de auditoría —planear, ejecutar, informar y hacer seguimiento—, con contenido nuevo en cada una:
- Planeación e inventario. Levantar qué sistemas existen, clasificarlos por riesgo, definir el alcance y el criterio. Aquí aparece casi siempre el primer hallazgo.
- Entendimiento y evaluación de controles. Recorrer el ciclo de vida de cada sistema en alcance: aprobación, datos, cambios de versión, monitoreo e intervención humana.
- Pruebas sustantivas. Reejecutar decisiones sobre una muestra, comparar resultados entre grupos y contrastar predicciones con desenlaces reales.
- Informe y seguimiento. Hallazgos con condición, criterio, causa y efecto, y planes de acción con dueño y fecha.
Si su área trabaja con plan anual, los modelos deben entrar al universo auditable con su propia frecuencia; lo explico en cómo construir el plan anual de auditoría interna basado en riesgos.
Fase 1: el inventario que casi nadie tiene
La primera pregunta —«¿qué sistemas de IA usa la organización?»— suele destapar el primer hallazgo: nadie tiene la lista completa.
Prompt 1 — Relevamiento del inventario de IA:
Actúe como auditor interno de una empresa colombiana que inicia la revisión de sus sistemas de IA. Diseñe un cuestionario de relevamiento dirigido a líderes de área y de tecnología para construir el inventario. Por cada herramienta debe capturar: nombre y propósito, decisión que toma o apoya, grado de autonomía (decide solo, recomienda o asiste), procesos y áreas usuarias, datos que consume y su origen, si trata datos personales (Ley 1581 de 2012), proveedor o desarrollo interno, responsable de negocio y técnico, y si existe aprobación formal de uso. Incluya preguntas para detectar IA en la sombra: herramientas de IA generativa que los empleados usan sin autorización, con datos de la empresa. Entregue el cuestionario en tabla y una escala de clasificación de riesgo alto, medio y bajo.
La IA en la sombra es el equivalente moderno de la hoja de cálculo crítica sin control: empleados pegando información confidencial en chats públicos. Este solo punto justifica la auditoría ante cualquier comité.
¿Qué elementos se revisan en una auditoría de IA: datos, algoritmos y gobierno?
Organizo el programa de auditoría en cuatro capas, de la más gerencial a la más técnica. Coincide en lo esencial con las funciones del NIST AI RMF y con los componentes del marco del IIA:
| Capa | Pregunta central | Evidencia a solicitar |
|---|---|---|
| 1. Gobierno | ¿Quién responde por esta IA? | Política de uso, inventario, actas de aprobación, matriz de roles, cláusulas con proveedores |
| 2. Datos | ¿Con qué se alimenta? | Origen y licencias, reglas de calidad, autorizaciones de titulares, análisis de representatividad |
| 3. Desempeño | ¿Funciona y alguien lo vigila? | Métricas de exactitud por periodo, umbrales de alerta, bitácora de cambios de versión |
| 4. Uso y supervisión | ¿Hay una persona donde debe haberla? | Tasas de reversión, tiempos de revisión, registros de trazabilidad, canal de reclamos |
La capa de datos merece atención especial: un modelo es tan bueno como los datos con que se entrenó. Si la organización no tiene reglas de calidad y propiedad de la información, ese es el hallazgo raíz. Lo trato en detalle en gobierno de datos financieros para IA.
Prompt 2 — Programa de trabajo sobre gobierno de la IA:
Desarrolle el programa de trabajo para evaluar el gobierno de la IA en una organización del sector [sector] en Colombia, con ISO/IEC 42001 y el NIST AI RMF como criterio. Para cada objetivo de control entregue: riesgo que mitiga, procedimiento concreto, evidencia a solicitar y criterio para reportar hallazgo. Cubra como mínimo: política de uso de IA, inventario y clasificación por riesgo, aprobación previa al despliegue, gestión de proveedores (derecho a información sobre variables, aviso de cambios de versión, uso de datos del cliente para entrenamiento), cumplimiento de la Circular Externa 002 de 2024 de la SIC, roles definidos y respuesta a incidentes causados por IA. Presente el resultado en una tabla.
¿Cómo se identifican y gestionan los riesgos y sesgos en una auditoría de IA?
La gestión de riesgos de IA sigue la lógica que el auditor ya conoce: identificar el evento, evaluar probabilidad e impacto, verificar la respuesta. Lo que cambia es el catálogo: sesgo, degradación del modelo, falta de explicabilidad, alucinación, fuga de datos y dependencia de un proveedor.
La prueba de sesgo asusta más de lo que debería. La versión del auditor es conceptualmente simple: comparar resultados entre grupos comparables y exigir que la diferencia tenga una explicación de negocio legítima.
Prompt 3 — Análisis de resultados por grupos:
Adjunto la base anonimizada de decisiones del sistema de IA de [proceso] del último [periodo]: solicitud, variables principales, decisión del modelo y desenlace real cuando existe. 1) Calcule tasas de aprobación y rechazo por segmento: [región, rango de edad, tamaño de empresa u otras variables disponibles]. 2) Identifique diferencias notorias entre grupos comparables. 3) Para cada diferencia, formule la pregunta que debo hacerle al dueño del modelo: qué variable de negocio legítima la explica. 4) Compare la tasa de error (decisiones contradichas por el desenlace real) entre grupos. Presente todo en tablas y no concluya que hay discriminación: solo señale lo que requiere explicación.
Fíjese en el estándar del hallazgo. No es «el modelo es sesgado», afirmación que exige un análisis técnico profundo. Es «existen diferencias de trato entre grupos que la organización no puede explicar ni ha analizado». Ese hallazgo es sólido, defendible y accionable. Si el sistema evalúa clientes, le servirá contrastarlo con lo que expliqué sobre riesgo crediticio de clientes con IA.
¿Qué técnicas y herramientas existen para auditar la transparencia, la equidad y la seguridad?
Las técnicas clásicas siguen vigentes; cambian los objetos sobre los que se aplican:
- Indagación y observación: entrevistas con el dueño del modelo y recorrido del proceso en operación real.
- Inspección documental: fichas del modelo, bitácoras de cambios, contratos y evaluaciones de impacto.
- Reejecución: pasar una muestra de casos por el sistema y comparar con la decisión registrada.
- Pruebas de caso límite: entradas diseñadas para ver si el sistema escala a revisión humana o decide solo.
- Pruebas sobre la población completa: tasas por grupo, deriva de las variables en el tiempo y registros de acceso.
- Pruebas adversariales en asistentes generativos: instrucciones que intentan extraer información confidencial o saltarse las restricciones del asistente.
Existen además bibliotecas abiertas de equidad y explicabilidad que usan los equipos técnicos. El equipo de auditoría no necesita operarlas: necesita exigir que se usen, que sus resultados queden documentados y que alguien actúe sobre ellos.
Cuando la entidad produce información financiera con IA
Escenario cada vez más común: la provisión de cartera la calcula un modelo, la conciliación la hace un agente, las notas las redactó un chat. Su evidencia tiene un eslabón automatizado en la cadena de producción. Bajo la NIA 315, eso es uso de TI por la entidad, y exige entender el sistema y sus controles generales y de aplicación. Si quiere ver cómo operan esos agentes por dentro, empiece por agentes de IA para contabilidad: qué son y cómo funcionan.
Prompt 4 — Información producida con IA en una auditoría de estados financieros:
En mi auditoría de estados financieros de una sociedad colombiana, la entidad usa IA para [proceso: por ejemplo, clasificar facturas y calcular el deterioro de cartera]. Con la lógica de la NIA 315 sobre el uso de TI por la entidad y de la NIA 500 sobre información producida por la entidad, ayúdeme a diseñar la respuesta: 1) qué debo entender del sistema (insumos, lógica general, salidas, cambios recientes); 2) qué controles generales y de aplicación esperaría (accesos, cambios al modelo, validación periódica, revisión de excepciones); 3) qué prueba independiente valida sus salidas (recálculo paralelo de una muestra, comparación con el desenlace real); 4) qué señales indicarían que no puedo confiar en esa información. Entregue un papel de trabajo en tabla.
La regla que aplica aquí y en todo el artículo: la automatización del auditado nunca reduce su responsabilidad sobre la evidencia; solo cambia dónde debe mirar.
Caso aplicado: el modelo de crédito que nadie había mirado
Así se ve una primera auditoría real, con datos generalizados para proteger al cliente: una financiera de consumo que aprueba automáticamente créditos de bajo monto con un modelo de puntuación comprado a un proveedor hace tres años.
Inventario. El relevamiento encontró siete sistemas donde la gerencia creía tener dos: además del modelo de crédito, un chatbot de cobranza, un priorizador comercial, dos automatizaciones construidas por un analista y, el hallazgo más grave, el área de crédito usando un chat público para redactar respuestas a reclamaciones, con datos personales completos. Hallazgo de severidad alta antes de probar un solo modelo.
Gobierno. No había política ni proceso de aprobación, y el contrato con el proveedor no daba derecho a conocer las variables ni obligaba a notificar cambios de versión. En lenguaje de auditor: la organización delegó decisiones de crédito en una caja que contractualmente no puede abrir.
Desempeño y sesgo. El modelo no se recalibraba desde la compra. El análisis del último año mostró una tasa de impago a 90 días del doble en un segmento regional frente al resto, sin que nadie lo hubiera medido. Y los casos que «van a revisión humana» se aprobaban casi en su totalidad, con menos de un minuto por caso: control humano de utilería.
Informe. Cinco hallazgos accionables sin una sola línea de matemática avanzada: inventario y política inexistentes, datos personales en herramientas públicas, contrato sin derechos de información, modelo sin monitoreo y revisión humana nominal. El comité entendió cada uno, porque cada uno era una pregunta clásica sobre un objeto nuevo. Para que los planes de acción no se queden en el papel, aplique lo que expliqué sobre seguimiento de hallazgos.
Conviene no confundir dos trabajos que suenan parecido. Auditar un sistema de inteligencia artificial es lo que describe este artículo: revisar el modelo, sus datos, sus sesgos y su gobernanza. Auditar una respuesta de inteligencia artificial es otra cosa: verificar si el informe que un modelo le entregó esta mañana se sostiene contra la fuente. El segundo trabajo lo hace cualquier contador, todas las semanas, y casi nadie lo documenta; lo desarrollamos en el artículo sobre las alucinaciones de la IA y las seis pruebas para auditar un resultado, con un caso en el que el informe cuadraba al peso y aun así omitía el 97 % de la cartera.
¿Qué habilidades necesita un auditor de IA y qué errores debe evitar?
Las competencias que más pesan son las que ya da la auditoría —escepticismo, método, redacción de hallazgos—, sumadas a tres nuevas: lectura de marcos de IA, nociones de aprendizaje automático suficientes para hacer buenas preguntas y análisis de datos sobre poblaciones completas. Los errores que más veo en quien empieza:
- Intentar revisar la matemática. El hallazgo no vive dentro del algoritmo; vive en el gobierno, los datos, el monitoreo y el control humano. La validación matemática es de especialistas: exija que exista.
- Aceptar «es del proveedor» como respuesta. La responsabilidad por las decisiones no se terceriza. Sin derechos contractuales de información, ese es el hallazgo.
- Confundir tener un humano con tener control. Mida tasas de reversión y tiempos de revisión humana. Quien aprueba todo en segundos es un sello de caucho con salario.
- Revisar la IA una vez y archivarla. Los modelos se degradan y los datos cambian. Lo ideal es un monitoreo en tiempo real a cargo de la administración y revisiones periódicas de la tercera línea.
Preguntas frecuentes
¿Necesito una certificación para una auditoría de IA?
Para empezar, no. Necesita dominar los marcos de referencia y el método que ya tiene. Las certificaciones específicas suman al perfil, pero el mercado premia a quien sabe hacer el trabajo, no a quien espera la credencial perfecta.
¿Puedo usar inteligencia artificial para revisar un modelo?
Sí, sirve para automatizar pruebas, con una salvaguarda: no use el sistema auditado ni el mismo proveedor con los mismos datos para evaluarse a sí mismo. La independencia aplica a las herramientas igual que a las personas, y los auditores humanos conservan la conclusión.
¿Cuáles son los 4 pasos de una auditoría aplicados a la IA?
Planeación (inventario, riesgo y alcance), ejecución (evaluación de controles y pruebas), informe (hallazgos con condición, criterio, causa y efecto) y seguimiento (verificación de planes de acción).
¿La ley de IA europea aplica a empresas colombianas?
Puede aplicar si la empresa ofrece sistemas de IA en la Unión Europea o si sus resultados se usan allí. Para el resto, es una referencia útil de clasificación por riesgo, no una obligación.
¿Qué hago si la organización no tiene inventario de IA?
Repórtelo como hallazgo y convierta el levantamiento en la primera actividad del plan de acción. Sin inventario no hay alcance posible para ninguna auditoría posterior.
Lo que hay que llevarse de todo esto
La auditoría de IA no es otra profesión: es aplicar la de siempre a un objeto que decide solo. Empiece por el inventario, apóyese en un criterio verificable como ISO/IEC 42001 o el NIST AI RMF, pruebe datos, desempeño y control humano, y redacte hallazgos que la organización no pueda desestimar como «temas técnicos». El uso de la IA en las empresas va a crecer más rápido que la oferta de profesionales capaces de darle aseguramiento. Ahí está la frontera, y está abierta.
Auditar sistemas de IA y auditar con IA son dos oficios distintos que conviene no confundir, y los dos exigen formación. Para el segundo escribí los criterios con los que yo elegiría: qué debe enseñarle un curso de IA para auditores.
Los profesionales que dominan estas herramientas ahorran más de 10 horas semanales
No se trata de reemplazar su criterio profesional, sino de potenciarlo con método, controles y evidencia documentada. En el Programa Ejecutivo en IA para la Auditoría enseño paso a paso cómo integrar la IA en el flujo de trabajo diario con resultados medibles.
👉 Ver programa completo · Conozca también los tres programas ejecutivos de IA Contable.
📲 Escríbame por WhatsApp y le cuento cómo funciona.
Autor: Francisco Moreno Díaz — CP · MBA · MBAN · CAIO
Publicado en: IA Contable
ver abajo