Un agente de IA planifica, elige herramientas y ejecuta acciones. Esa autonomía abre una superficie de riesgo nueva: contenido malicioso que lo desvía, herramientas usadas con permisos de más, bucles sin control y efectos irreversibles. Confiar en él exige defensa en profundidad.
Superficie de ataque
- Inyección de prompts indirecta: instrucciones ocultas en el contenido que el agente lee.
- Abuso de herramientas: que llame a lo que no debe con los permisos que tiene.
- Exfiltración: sacar datos sensibles hacia el exterior.
- Bucles: iteraciones interminables que consumen presupuesto.
Guardrails: defensa en profundidad
Ninguna medida basta sola. Se combinan validaciones de entrada y salida, un allowlist de herramientas, permisos mínimos, límites de pasos y coste, y ejecución en sandbox para contener lo que escape de las demás.

Control humano (HITL)
Para acciones sensibles o irreversibles, el agente debe pedir confirmación humana antes de ejecutar. El punto de interrupción se coloca en el poder, no en la sugerencia: leer no requiere permiso, transferir dinero sí.
Fiabilidad del razonamiento
- Descomponer la tarea en pasos verificables.
- Comprobar resultados parciales, no asumir el salto.
- Reflexionar: revisar y corregir antes de accionar.
| Riesgo | Ejemplo | Mitigación |
|---|---|---|
| Inyección indirecta | un email dice "ignora tus reglas" | aislar contenido externo de instrucciones |
| Exceso de permisos | puede borrar en toda la cuenta | permisos mínimos y scope por tarea |
| Bucle sin control | mil llamadas a una API | límite de pasos y presupuesto |
| Acción irreversible | envía un correo incorrecto | confirmación humana |
Errores frecuentes
- Dar al agente credenciales totales por comodidad.
- No fijar límites de iteración ni de coste.
- Tratar el contenido externo como instrucciones de confianza.
Ejemplo resuelto: agente con acceso al correo
- Separar instrucciones del usuario de los datos del correo (contenido no confiable).
- Restringir las herramientas: leer sí, enviar y borrar requieren confirmación.
- Poner tope de pasos y presupuesto por tarea.
- Registrar acciones en un log auditable con métricas de errores.
¿Para qué sirve en la realidad?
El salto de un chatbot a un agente es operativo, no solo de capacidad: el mismo modelo es útil y seguro cuando se rodea de guardrails y control humano bien colocados.
¿Qué riesgo introduce principalmente que un agente ejecute acciones con herramientas?
Una inyección de prompts indirecta puede llegar disfrazada en contenido externo que el agente lee.
La práctica de pedir la aprobación de una persona antes de una acción sensible se abrevia (human in the loop).
Clasifica cada medida como control de acceso o control del razonamiento.
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Une cada concepto con su defensa.
Seguridad de agentes
Toca una tarjeta para ver la respuesta.
Seguridad y control en agentes
- Agentes seguros
- Riesgos
- inyeccion indirecta
- inyeccion indirecta
- exceso de permisos
- Riesgos
- bucles
- validar entrada y salida
- HITL sensible
ReAct: razonar y actuar con modelos de lenguajePatrón de razonamiento y uso de herramientas sobre el que se apoyan los agentes.
Te piden desplegar un agente que lee correos y redacta respuestas. Sin quitarle utilidad, ¿en qué punto exacto del flujo pondrías el control humano y qué permisos le negarías por diseño?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.