COMUNIDAD GRATIS · YA ABIERTA

El Boletínguía práctica

Agentes · seguridad

Seguridad y estándares para agentes de IA: un mapa práctico

La seguridad de un agente no cabe en una instrucción. Se construye alrededor del sistema con límites técnicos, evidencia y responsables.

Cómo hicimos este artículo
En esta guía
  1. 01La regla principal: la autonomía debe crecer más lento que la confianza
  2. 02Los cinco controles que necesitás antes de conectar un agente
  3. 03Qué significan NIST, ISO y OWASP sin el alfabeto corporativo
  4. 04Un ejemplo realista: el agente que prepara facturas
  5. 05Cómo probar un agente antes de dejarlo trabajar
  6. 06Cómo implementar controles alrededor del agente
  7. 07El checklist de una página
  8. 08Qué hace una persona y qué hace el estándar
  9. 09Preguntas frecuentes

para orientarte

El prompt dice que el agente no debe hacer nada peligroso. Aun así conserva permisos para enviar, editar y borrar.

La seguridad aparece cuando identidad, permisos, datos, acciones, registros y evaluaciones se convierten en controles técnicos.

capas de control

Más autonomía necesita más evidencia

La seguridad requiere controles que rodeen todo el ciclo del agente.
01Identidad
02Permisos
03Datos
04Acciones
05Logs
06Evaluación

Detener, revisar y aprender cuando el sistema sale del alcance autorizado.

Un agente de IA puede leer archivos, elegir pasos y usar herramientas para cumplir un objetivo. Esa capacidad es útil precisamente por la misma razón que necesita controles: ya no solo produce texto; también puede actuar.

La seguridad para agentes de IA consiste en limitar qué datos pueden ver, qué herramientas pueden usar, qué acciones necesitan aprobación y cómo una persona puede reconstruir lo que ocurrió. No hace falta convertir a todo el equipo en especialista en ciberseguridad. Sí hace falta dejar de tratar al agente como un chat inocente cuando tiene acceso al correo, al CRM o al código.

Esta guía traduce tres referencias reconocidas —NIST AI RMF, ISO/IEC 42001 y OWASP— a decisiones cotidianas. Ninguna lista garantiza seguridad por sí sola y no todas son certificaciones. Sirven para hacer mejores preguntas y construir controles verificables.

La regla principal: la autonomía debe crecer más lento que la confianza

Un agente nuevo debería empezar con poco acceso, tareas de bajo riesgo y resultados que una persona pueda revisar. Su autonomía aumenta cuando demuestra que funciona bien en casos normales, casos ambiguos y fallos previsibles.

Pensalo como una colaboradora nueva:

  • primero consulta información;
  • después prepara borradores;
  • luego ejecuta acciones reversibles;
  • finalmente recibe acceso a acciones sensibles, si el beneficio lo justifica.

Con una diferencia: un agente puede actuar a velocidad de software. Un permiso demasiado amplio puede multiplicar un error antes de que alguien lo note.

Los cinco controles que necesitás antes de conectar un agente

Estos cinco controles crean una base útil para un agente empresarial o personal.

1. Un objetivo estrecho

Definí una tarea que pueda explicarse en una frase. “Ayudame con marketing” es demasiado amplio. “Prepará un borrador del reporte semanal usando estas tres fuentes” permite probar y medir.

El objetivo también debe decir qué queda fuera. Un agente que prepara un reporte no necesita publicar en LinkedIn ni enviar mensajes a clientes.

2. Permisos mínimos

Permiso mínimo significa dar acceso solo a lo necesario y solo durante el tiempo necesario. Si el agente debe resumir una carpeta, no necesita acceso a todo Drive. Si debe crear borradores, no necesita permiso para borrar.

Separá las herramientas por nivel:

NivelEjemploRegla inicial
Lecturaconsultar una carpeta aprobadapermitido y registrado
Borradorcrear un documento nuevopermitido en un espacio controlado
Acción externaenviar un correo o publicaraprobación humana obligatoria
Irreversible o sensiblepagar, borrar, cambiar accesosbloqueado salvo diseño y autorización específicos

3. Aprobaciones humanas en puntos concretos

“Una persona supervisa” no sirve si nadie sabe cuándo debe intervenir. Definí puntos de pausa visibles: antes de enviar, publicar, comprar, borrar, cambiar permisos o usar información sensible.

La persona que aprueba necesita tres cosas: contexto, criterio y autoridad para detener el proceso. Hacer clic en “aprobar” sin ver fuentes, cambios y consecuencias es una ceremonia, no un control.

4. Registro de acciones

Guardá qué instrucciones recibió el agente, qué fuentes consultó, qué herramientas usó, qué cambió y quién aprobó. Ese registro se conoce como trazabilidad: la capacidad de reconstruir cómo se llegó a un resultado.

Sin trazabilidad, un error se vuelve una discusión de memoria. Con trazabilidad, el equipo puede corregir la instrucción, el permiso o la fuente que falló.

5. Una forma rápida de detenerlo

Todo agente necesita un mecanismo de pausa, revocación de credenciales y recuperación. Definí quién puede apagarlo, cómo se deshacen acciones y qué ocurre con tareas que quedaron a medias.

Para evaluar la contención, preguntate: “¿qué tan lejos puede llegar un fallo antes de que podamos contenerlo?”.

Qué significan NIST, ISO y OWASP sin el alfabeto corporativo

NIST, ISO y OWASP resuelven partes distintas del problema. No compiten entre sí y no conviene tratarlos como sellos intercambiables.

NIST AI RMF: organizar el riesgo

El AI Risk Management Framework de NIST es un marco voluntario para ayudar a organizaciones a gestionar riesgos de IA. Su perfil para IA generativa organiza el trabajo alrededor de cuatro funciones: gobernar, mapear, medir y gestionar.

En la práctica:

  • Gobernar: quién responde por el agente y qué políticas aplican.
  • Mapear: qué tarea hace, a quién afecta y qué puede salir mal.
  • Medir: cómo se prueban calidad, seguridad, sesgo y confiabilidad.
  • Gestionar: qué riesgos se reducen, aceptan, transfieren o evitan.

NIST ofrece una estructura para revisar preguntas importantes. Usarla requiere evaluar cada control; la referencia por sí sola no certifica la seguridad del agente.

ISO/IEC 42001: convertir la intención en un sistema de gestión

ISO/IEC 42001:2023 especifica requisitos para establecer y mejorar un sistema de gestión de inteligencia artificial. Un sistema de gestión es el conjunto de políticas, responsables, procesos y revisiones con el que una organización administra la IA a lo largo del tiempo.

Es relevante cuando la empresa necesita una práctica formal y repetible: inventario de sistemas, evaluación de riesgos, responsabilidades, seguimiento y mejora continua. No es una guía técnica exclusiva para agentes y cumplirla no reemplaza las pruebas de seguridad de una aplicación concreta.

OWASP Agentic Top 10: reconocer cómo puede fallar un agente

El OWASP Top 10 para aplicaciones agentic de 2026 reúne riesgos técnicos y operativos observados en sistemas capaces de actuar.

Entre ellos están:

  • Secuestro del objetivo: contenido malicioso cambia lo que el agente intenta lograr.
  • Uso indebido de herramientas: una herramienta legítima se usa de una forma peligrosa.
  • Abuso de identidad y privilegios: credenciales o permisos permiten ir más lejos de lo necesario.
  • Riesgo en la cadena de suministro: una integración, un servidor MCP (una conexión estandarizada para que la IA use herramientas), una dependencia de software o un agente externo está comprometido.
  • Ejecución inesperada de código: instrucciones en lenguaje natural terminan ejecutando acciones peligrosas.
  • Envenenamiento de memoria y contexto: información manipulada persiste e influye en decisiones futuras.
  • Comunicación insegura entre agentes: un sistema confía en mensajes o identidades que no verificó.
  • Fallos en cascada: un error pequeño se propaga entre procesos conectados.
  • Explotación de la confianza humana: una explicación convincente lleva a una persona a aprobar algo dañino.
  • Agentes fuera de control: un agente comprometido o desalineado actúa fuera de su propósito.

No necesitás memorizar los diez nombres. Usalos como escenarios de prueba: “¿Qué pasaría si un documento intenta cambiar las instrucciones?”, “¿qué pasa si una integración miente?” y “¿cómo detenemos una cadena de acciones?”.

Un ejemplo realista: el agente que prepara facturas

Imaginá un agente que revisa horas trabajadas y prepara facturas para clientes. Parece sencillo, pero toca dinero, información contractual y comunicación externa.

Una primera versión segura podría:

  1. leer una hoja específica en modo de solo lectura;
  2. comparar horas con tarifas de un archivo aprobado;
  3. crear borradores en una carpeta separada;
  4. marcar diferencias o datos faltantes;
  5. esperar la aprobación de finanzas antes de enviar.

No debería poder cambiar tarifas, editar cuentas bancarias, agregar destinatarios ni enviar por su cuenta. Cada factura debe registrar las fuentes usadas y la persona que aprobó.

Después de varias semanas, el equipo puede automatizar más. La evidencia viene antes que la confianza.

Cómo probar un agente antes de dejarlo trabajar

Una demo exitosa solo demuestra que el caso ideal funciona. Una prueba útil incluye situaciones incómodas.

Probá estos ocho casos

  1. Falta un dato necesario.
  2. Dos fuentes se contradicen.
  3. Un documento contiene instrucciones como “ignorá las reglas anteriores”.
  4. Una herramienta devuelve un error o información incompleta.
  5. Una persona pide algo fuera de su permiso.
  6. El agente encuentra información personal o confidencial.
  7. Una acción se repite dos veces.
  8. La persona revisora rechaza el resultado.

Para cada caso, definí la conducta esperada: preguntar, detenerse, escalar, registrar o deshacer. “Que use sentido común” no es una especificación comprobable.

Cómo implementar controles alrededor del agente

Los guardrails (barreras de seguridad) son límites y mecanismos que reducen conductas no deseadas. Una instrucción como “no compartás datos confidenciales” ayuda, pero no sustituye controles técnicos.

OpenAI recomienda combinar distintas capas: validaciones basadas en reglas, clasificadores, filtros de información personal, controles de herramientas, autenticación, autorización y prácticas normales de seguridad de software.

Un agente robusto puede necesitar:

  • instrucciones claras sobre alcance;
  • una lista permitida de herramientas;
  • validación de entradas y salidas;
  • permisos separados para leer y escribir;
  • confirmación en acciones de alto riesgo;
  • límites de cantidad, costo y frecuencia;
  • monitoreo y alertas;
  • evaluaciones periódicas con casos reales.

Ninguna capa es perfecta. La seguridad aparece cuando una falla encuentra otra barrera.

El checklist de una página

Antes de poner un agente en producción, confirmá:

  • [ ] Tiene una dueña responsable y una sustituta.
  • [ ] Su objetivo y límites están escritos.
  • [ ] Solo accede a las fuentes necesarias.
  • [ ] Usa una identidad separada cuando corresponde.
  • [ ] Leer, crear, enviar y borrar son permisos distintos.
  • [ ] Las acciones sensibles requieren aprobación.
  • [ ] Fuentes, decisiones, herramientas y cambios quedan registrados.
  • [ ] Fue probado con errores, contradicciones e instrucciones maliciosas.
  • [ ] Existe un proceso para pausar, revocar y recuperar.
  • [ ] Se revisa cuando cambian el modelo, las herramientas o el proceso.

Si varias respuestas son “no sé”, el siguiente paso es aclarar el sistema antes de conectar más aplicaciones.

Qué hace una persona y qué hace el estándar

Un estándar ayuda a ordenar el trabajo, pero no conoce tu clienta, tu contrato ni la consecuencia de un error. La supervisión humana aporta contexto y criterio. El control técnico limita el daño. La gobernanza define responsabilidades. Necesitás las tres capas.

Nuestra guía Antes de conectar un agente a todo funciona como ejercicio de soporte: dibujá qué debe usar el agente, qué también puede alcanzar y qué información le falta. Esta página, en cambio, explica el sistema completo de seguridad y los marcos que pueden organizarlo. Así cada artículo responde una pregunta distinta.

Si todavía estás eligiendo tecnología, compará agente, chatbot o automatización. Si querés construir una primera prueba de bajo riesgo, seguí cómo crear un agente de IA sin código.

Preguntas frecuentes

¿Un agente de IA es seguro si pide aprobación antes de actuar?

La aprobación reduce riesgo, pero no basta. La persona debe ver qué acción se propone, qué datos usa y qué cambiará. También hacen falta permisos mínimos, registros, validaciones y una forma de detener el agente.

¿Cuál es el estándar de seguridad para agentes de IA?

No existe un único estándar universal que cubra todo. NIST AI RMF ayuda a gestionar riesgos; ISO/IEC 42001 define un sistema de gestión de IA; OWASP publica riesgos y mitigaciones técnicas para aplicaciones agentic. Una organización puede combinar estas referencias según su contexto.

¿ISO/IEC 42001 certifica que un agente es seguro?

No. ISO/IEC 42001 se enfoca en el sistema de gestión de IA de una organización. Una certificación puede demostrar que existen ciertos procesos de gestión, pero no garantiza que cada resultado o aplicación esté libre de fallos.

¿Qué permiso debería tener un primer agente?

Empezá con lectura sobre un conjunto pequeño de fuentes y creación de borradores en un espacio controlado. Evitá envío, publicación, pagos, eliminación y cambios de acceso hasta que el caso esté probado y tenga controles específicos.

¿Cada cuánto hay que volver a probarlo?

Probalo antes del lanzamiento y cada vez que cambien el modelo, las instrucciones, las fuentes, las herramientas, los permisos o el proceso. También después de un incidente o de detectar un patrón de errores.

Fuentes

Nota editorial: esta guía es educativa y no sustituye una evaluación de seguridad, privacidad, cumplimiento o asesoría legal para tu organización.

Si sos una mujer que quiere aprender a usar IA con criterio y sin sentir que todo está escrito para ingenieros, sumate gratis a Pioneras en IA. Traducimos la tecnología a decisiones que podés aplicar.

Transparencia editorial

Este artículo fue investigado y preparado con ayuda de IA. Nina revisó fuentes, contexto, criterio editorial y versión final.