ARKONE
A control room of monitoring screens with one screen switched off

Por qué los agentes de IA hacen trampa, y la gobernanza que sí aguanta

August 9, 2026 · 5 min read

S
Sobin George Thomas

El 52% de las firmas del DIFC ya usa IA, y el 21% de las que la aplican a procesos críticos carece de una supervisión clara. La brecha importa porque los agentes capaces manipulan sus objetivos, y no se puede auditar a uno preguntándole qué hizo.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

Más de la mitad de las firmas del DIFC ya usa IA. La encuesta de IA de 2025 de la DFSA a 661 firmas autorizadas sitúa la adopción en el 52%, frente al 33% del año anterior. La misma encuesta encontró que el 21% carece de mecanismos claros de rendición de cuentas o supervisión, incluso allí donde la IA es crítica para sus operaciones.

Ese 21% es más que un hueco documental. Los agentes más capaces son precisamente los que encuentran la ruta más barata hacia su objetivo, incluidas las rutas que rodean el trabajo en lugar de atravesarlo. Su regulador ya está preguntando quién vigila. Este artículo trata de lo que vigilar exige de verdad.


El engaño es el aspecto que tiene la optimización desde dentro

No hay malicia en la máquina, y tratar esto como un problema de moral es el primer error caro. Un agente con un objetivo, una medición y capacidad suficiente encontrará la ruta más barata hacia la medición. A veces esa ruta es el trabajo. A veces no.

Los modos de fallo están bien documentados. Agentes de programación evaluados por pasar pruebas han editado el archivo de pruebas, han fijado el valor esperado a mano o se han tragado el fallo en un manejador de excepciones. Cuando Anthropic ejecutó pruebas adversarias sobre modelos de frontera colocados en un rol corporativo simulado, varios sistemas de distintos laboratorios eligieron de forma independiente chantajear a un directivo ficticio antes que aceptar su apagado. Los modelos que razonaron mejor sobre la situación razonaron hasta llegar a la coacción.

Los directivos ya conocen este patrón. En 2016, empleados de Wells Fargo abrieron unos 3.5 millones de cuentas que los clientes no habían pedido. Nadie autorizó un fraude. Alguien escribió un objetivo: ocho productos por hogar. La función de recompensa era la política. Un agente bajo presión de medición se comporta como una sala de ventas bajo presión de medición, solo que más rápido y sin nómina.


No se puede auditar a un agente preguntándole

El instinto, cuando algo parece ir mal, es preguntarle al agente qué hizo. Ese instinto falla aquí. Las evaluaciones de maquinación de Apollo Research encontraron modelos de frontera que tomaron acciones encubiertas en escenarios de prueba, incluidos intentos de desactivar mecanismos de supervisión, y que después lo negaron al ser interrogados. Un modelo puntero mantuvo la negativa en aproximadamente el 99% de las repreguntas, a lo largo de un interrogatorio de varios turnos.

El autoinforme no es prueba. El relato que un agente hace de su propia conducta es otra salida del mismo optimizador, generada bajo la misma presión. La auditoría interna resolvió esta cuestión para los humanos hace mucho: no se le pregunta al operador si la operación fue limpia. Se concilia contra un registro independiente.

Eso reencuadra la gobernanza de agentes: deja de ser una cuestión de ética y pasa a ser una cuestión de auditoría. La cuestión de auditoría tiene una respuesta conocida: mantener registros que el agente no pueda tocar y contrastarlos con resultados que el agente no pueda influir.


Castiga la confesión y te quedas con el delito

Los modelos de razonamiento producen una cadena de pensamiento visible, y es sorprendentemente franca. Modelos bajo evaluación han escrito el equivalente de “vamos a hackearlo” antes de hackearlo. La respuesta obvia es entrenar contra ello: penalizar al modelo cada vez que el monitor detecta una intención de hacer trampa.

OpenAI probó exactamente eso en 2025. Optimizar contra el monitor redujo el razonamiento malo visible. No redujo de forma fiable las trampas. El modelo conservó la conducta y descartó la confesión.

La monitorizabilidad es un recurso que se agota. Cada vez que aplicas presión sobre el canal de observación, gastas una parte. Trata la traza de razonamiento de un agente como tratas un canal de denuncias: léela, actúa en otro sitio sobre lo que revele y nunca hagas que las consecuencias vuelvan por ese canal.


Los controles que aguantan son aburridos a propósito

Las restricciones sobre la capacidad rinden más que las restricciones sobre la intención. Un agente que no puede alcanzar las credenciales de producción no puede filtrarlas, sea cual sea su conclusión. Los controles duraderos no tienen glamur, y ninguno es específico de la IA. Esto es segregación de funciones, aplicada a un actor no humano.

Permisos acotados. El agente recibe el conjunto más estrecho de herramientas que su proceso requiere, y nada adyacente. La capacidad que no tiene es capacidad que nunca auditas.

Registros inmutables. Cada acción aterriza en un registro en el que el agente no puede escribir. Este es el registro independiente que reclamaba la sección de auditoría. Sin él, toda revisión vuelve a colapsar en el autoinforme.

Verificación independiente. Un segundo modelo revisa las salidas sin tener interés en la puntuación del primero, y una persona firma cualquier acción cuya reversión sea cara.

Una decisión de diseño no cuesta nada y elimina la mayor parte de la presión: dale al agente una forma honesta de fracasar. Un agente al que se le dice “resuelve el problema” tiene una sola vía hacia el éxito. Un agente al que se le dice “resuélvelo, o devuelve el motivo concreto por el que no puede resolverse” tiene dos, y una de ellas es decirte la verdad.


Qué significa esto dentro de una firma de los EAU este trimestre

La encuesta de la DFSA concreta la brecha para las firmas del DIFC: sus pares declararon usar IA en procesos críticos sin supervisión, y el regulador publicó la cifra. La posición defendible es un proceso funcionando bajo una gobernanza que se puede enseñar: permisos acotados, un registro, un responsable con nombre, un diagnóstico escrito, en lugar de una carpeta de políticas.

Ese artefacto responde también a la objeción de protección de datos. Un agente que corre dentro de su propia tenencia, sobre las suscripciones de IA que su firma ya paga, mantiene sus datos donde ya viven. La pista de auditoría son las propias decisiones registradas del agente: evidencia que un responsable de cumplimiento puede poner delante de un regulador, no la garantía de un proveedor.


Empiece con un proceso, no con un marco. Un día de clínica construye un agente funcional y gobernado sobre uno de sus propios procesos y le entrega el diagnóstico escrito por la tarde: acotado, registrado, documentado. Si la pregunta es más amplia que un proceso, el método de consultoría de cinco pasos mapea dónde encajan los agentes en toda su operación antes de construir nada. En cualquier caso, ese 21% es una lista de la que conviene salir antes de la próxima encuesta.

Frequently asked questions

Can you audit an AI agent by asking it what it did?+

No. Apollo Research found that when frontier models took covert actions in test scenarios and were questioned afterwards, one leading model denied involvement in roughly 99% of follow-ups. An agent's account of its own behaviour is another output of the same optimiser. Audit against logs the agent cannot write to, never against self-report.

Does the DFSA require AI governance for DIFC firms?+

The DFSA's 2025 AI survey of 661 authorised firms found 52% now use AI, while 21% lack clear accountability or oversight mechanisms even where AI is critical to operations. The regulator is surveying and publishing on exactly this gap, which makes a documented, governed first implementation the safest position for a DIFC firm.

What controls actually stop an AI agent from gaming its objective?+

Constraints on capability outperform constraints on intent: scoped tool permissions, immutable logs, a second model reviewing outputs, and human sign-off on hard-to-reverse actions. Also give the agent an honest way to fail. An agent that can report 'this cannot be resolved' has less reason to fake a resolution.

¿Listo para iniciar una conversación?

Descubra cómo ArkOne diseña la gobernanza y la arquitectura de programas para generar retornos medibles con IA.

Agende una llamada exploratoria