← Lumbre

Agentes de IA · 8.º Confiabilidad, seguridad y control en agentes

← Volver a todos los contenidos
Portada de Confiabilidad, seguridad y control en agentes

Confiabilidad, seguridad y control en agentes

✦ El agente que actúa convierte un error en una consecuencia: inyección de prompts, abuso de herramientas, límites de coste y confirmación humana · Agentes de IA · IA · 8 minutos que valen la pena

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Identificar los riesgos de un agente que ejecuta acciones y aplicar guardrails, permisos mínimos, límites y control humano.

8 min 18–30 años
Autoevaluación
Más
Confiabilidad, seguridad y control en agentes

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Confiabilidad, seguridad y control en agentes

Guardrails para agentes confiables
Video explicativo (inglés): cómo construir agentes de IA más seguros y confiables con guardrails y validación de salida.

Un agente de IA planifica, elige herramientas y ejecuta acciones. Esa autonomía abre una superficie de riesgo nueva: contenido malicioso que lo desvía, herramientas usadas con permisos de más, bucles sin control y efectos irreversibles. Confiar en él exige defensa en profundidad.

Superficie de ataque

  • Inyección de prompts indirecta: instrucciones ocultas en el contenido que el agente lee.
  • Abuso de herramientas: que llame a lo que no debe con los permisos que tiene.
  • Exfiltración: sacar datos sensibles hacia el exterior.
  • Bucles: iteraciones interminables que consumen presupuesto.

Guardrails: defensa en profundidad

Ninguna medida basta sola. Se combinan validaciones de entrada y salida, un allowlist de herramientas, permisos mínimos, límites de pasos y coste, y ejecución en sandbox para contener lo que escape de las demás.

Diagrama de tres bandas: el bucle del agente (razonar, elegir herramienta, actuar) en la parte superior; una franja central de guardrails (validar, permisos mínimos, límites de coste y pasos, confirmación humana); abajo el entorno controlado con sandbox, logs y métricas.
Cada barrera reduce la superficie; ninguna por sí sola resuelve el riesgo.

Control humano (HITL)

Para acciones sensibles o irreversibles, el agente debe pedir confirmación humana antes de ejecutar. El punto de interrupción se coloca en el poder, no en la sugerencia: leer no requiere permiso, transferir dinero sí.

Fiabilidad del razonamiento

  • Descomponer la tarea en pasos verificables.
  • Comprobar resultados parciales, no asumir el salto.
  • Reflexionar: revisar y corregir antes de accionar.
Identificar el riesgo manda la defensa: cada mitigación apunta a un vector.
RiesgoEjemploMitigación
Inyección indirectaun email dice "ignora tus reglas"aislar contenido externo de instrucciones
Exceso de permisospuede borrar en toda la cuentapermisos mínimos y scope por tarea
Bucle sin controlmil llamadas a una APIlímite de pasos y presupuesto
Acción irreversibleenvía un correo incorrectoconfirmación humana

Errores frecuentes

  • Dar al agente credenciales totales por comodidad.
  • No fijar límites de iteración ni de coste.
  • Tratar el contenido externo como instrucciones de confianza.

Ejemplo resuelto: agente con acceso al correo

  1. Separar instrucciones del usuario de los datos del correo (contenido no confiable).
  2. Restringir las herramientas: leer sí, enviar y borrar requieren confirmación.
  3. Poner tope de pasos y presupuesto por tarea.
  4. Registrar acciones en un log auditable con métricas de errores.

¿Para qué sirve en la realidad?

El salto de un chatbot a un agente es operativo, no solo de capacidad: el mismo modelo es útil y seguro cuando se rodea de guardrails y control humano bien colocados.

¿Qué riesgo introduce principalmente que un agente ejecute acciones con herramientas?

Una inyección de prompts indirecta puede llegar disfrazada en contenido externo que el agente lee.

La práctica de pedir la aprobación de una persona antes de una acción sensible se abrevia (human in the loop).

Clasifica cada medida como control de acceso o control del razonamiento.

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Une cada concepto con su defensa.

      Seguridad de agentes

      Instrucciones maliciosas en datos que el agente lee
      inyección indirecta
      Dar solo los permisos estrictamente necesarios
      permisos mínimos
      Pedir aprobación humana en acciones sensibles
      HITL
      Tope de iteraciones y gasto
      límite de presupuesto
      Ejecutar en entorno contenido
      sandbox

      Toca una tarjeta para ver la respuesta.

      Seguridad y control en agentes

      • Agentes seguros
        • Riesgos
          • inyeccion indirecta
            • exceso de permisos
              • bucles
              • Guardrails
                • validar entrada y salida
                  • permisos minimos
                    • limites de coste
                    • Control
                      • HITL sensible
                        • logs y sandbox

                      Te piden desplegar un agente que lee correos y redacta respuestas. Sin quitarle utilidad, ¿en qué punto exacto del flujo pondrías el control humano y qué permisos le negarías por diseño?

                      Tu texto se guarda sólo en este dispositivo.

                      Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

                      Autoevaluación

                      Comprueba lo que aprendiste

                      2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

                      Iniciar autoevaluación
                      Más sobre esta lección

                      Llegaste aquí desde otro camino. Puedes seguir aquí el tiempo que quieras.

                      Volver a «Sistemas multiagente»

                      Rutas vivas

                      ¿Y ahora qué? Elige el camino por lo que necesitas

                      No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

                      Explora temas relacionados

                      Conceptos

                      Comentarios

                      Inicia sesión para comentar.

                      Todavía no hay comentarios. Sé la primera persona en opinar.