¿Qué pasa cuando una IA hace lo que le pediste, pero no como esperabas?

Durante mucho tiempo, interactuar con inteligencia artificial significaba algo bastante sencillo: hacer una pregunta y esperar una respuesta.

Los agentes de IA están cambiando esa dinámica.

Ahora pueden recibir un objetivo y utilizar diferentes herramientas para cumplirlo. Pueden consultar información, conectarse con aplicaciones, utilizar APIs y ejecutar acciones sin esperar una instrucción humana para cada paso.

Esta capacidad abre enormes posibilidades para automatizar procesos. También introduce una pregunta que hasta hace poco no era necesaria:

¿Qué ocurre cuando el objetivo es correcto, pero la forma de alcanzarlo comienza a desviarse de lo esperado?

Una instrucción puede convertirse en muchas acciones

Imaginemos un agente encargado de ayudar a resolver solicitudes de clientes.

Para realizar su trabajo podría consultar el CRM, revisar información de facturación, abrir un ticket, actualizar algún dato y, si fuera necesario, iniciar un proceso de reembolso.

Para una persona, esto representa varias tareas. Para un agente, puede convertirse en una secuencia de llamadas a diferentes APIs ejecutadas en segundos.

El problema es que cada acción podría parecer legítima cuando se observa por separado.

Radware plantea precisamente este escenario en una publicación reciente: un agente de soporte utilizó distintas APIs que funcionaban aparentemente como habían sido diseñadas. Sin embargo, una combinación de validaciones insuficientes provocó que procesara un reembolso sobre una cuenta incorrecta. Durante el proceso realizó 340 llamadas de API en menos de dos minutos sin generar una alerta.

No hubo necesariamente una petición evidentemente maliciosa. El riesgo apareció en la secuencia y en el contexto.

Cuando una acción válida produce un resultado inesperado

Las APIs permiten que aplicaciones y servicios intercambien información y ejecuten funciones. En un entorno con agentes, también se convierten en uno de los mecanismos que permiten a la IA actuar.

Por eso, conocer qué APIs existen sigue siendo importante, pero ya no cuenta toda la historia.

También necesitamos entender qué acciones permiten ejecutar, quién o qué las utiliza y qué sucede cuando varias acciones aparentemente válidas se combinan.

Un agente puede tener autorización para consultar determinada información y utilizar una herramienta. Sin embargo, eso no significa que cualquier combinación de esas capacidades produzca necesariamente el resultado que la organización esperaba.

La seguridad empieza entonces a mirar algo más que solicitudes individuales: necesita comprender el comportamiento completo.

La intención se convierte en una señal de seguridad

Aquí aparece un concepto interesante dentro del enfoque de Radware: Intent-Based Security.

En lugar de observar únicamente si una acción coincide con un ataque conocido, la propuesta consiste en analizar si el comportamiento del agente continúa alineado con el objetivo para el que fue autorizado.

La diferencia es importante.

Un agente puede comenzar con una tarea perfectamente válida y descubrir nuevas maneras de cumplirla. Puede utilizar otras herramientas, buscar recursos adicionales o modificar su estrategia. Esa capacidad de adaptación es precisamente parte de su valor, pero también puede provocar que se aleje gradualmente de los límites previstos.

Por eso, Radware plantea que la seguridad de los agentes también debe considerar su objetivo, los recursos permitidos, las herramientas autorizadas y las rutas de comunicación esperadas.

Observar lo que sucede mientras la IA trabaja

Con aplicaciones tradicionales, muchas decisiones de seguridad pueden establecerse antes de que una persona ingrese.

Los agentes añaden otra dimensión: lo que sucede durante su ejecución.

¿Qué herramientas está utilizando? ¿Con qué sistemas se comunica? ¿Qué recursos consulta? ¿Las acciones que está encadenando continúan teniendo relación con la tarea original?

Esto explica la importancia de la protección en runtime, es decir, mientras el agente está operando.

Dentro de su enfoque de Agentic AI Protection, Radware incorpora monitoreo de las acciones e intenciones de los agentes, control de herramientas MCP y mapas que permiten visualizar relaciones entre agentes, herramientas y flujos de ejecución.

La intención no es supervisar manualmente cada movimiento. Se trata de contar con suficiente contexto para detectar cuándo una secuencia comienza a comportarse de una manera distinta a la esperada.

Proteger una IA que ya puede actuar

La conversación sobre seguridad de inteligencia artificial está evolucionando al mismo tiempo que sus capacidades.

Cuando una IA únicamente respondía preguntas, gran parte de la atención estaba en la información que recibía y generaba. Cuando empieza a utilizar herramientas, conectarse con APIs y ejecutar procesos, también necesitamos observar qué hace mientras intenta cumplir una tarea.

Esto no significa que los agentes deban perder autonomía.

Significa que esa autonomía necesita acompañarse de visibilidad, contexto y controles capaces de entender el comportamiento durante la operación.

Radware aborda esta parte del problema desde la protección de agentes, APIs y runtime, buscando identificar cuándo las acciones comienzan a separarse de la intención para la que fueron autorizadas.

Porque conforme la IA adquiere capacidad para actuar, la pregunta ya no es solamente si tiene permiso para hacerlo.

También necesitamos saber si la manera en que está cumpliendo su objetivo sigue siendo la que esperábamos.

Para mantenerte informado y protegido, sigue las redes sociales de Nova en: Instagram, Facebook y LinkedIn, donde puedes encontrar más noticias y conocer las soluciones en ciberseguridad que ofrecemos.

#NovaInforma