Saltar al contenido
Todo nominal
AI / ML

Seguridad de IA.

Tu modelo es un usuario de un tipo nuevo: lee texto no confiable y tiene credenciales reales. Atacamos el modelo, su contexto y todo aquello a lo que se le permite llegar.

Solicitar una operaciónApps LLM · agentes · RAG · cadena de suministro del modelo
// 01 — Qué es

El prompt es una entrada. Trátalo como tal.

Las funciones de IA fallan como fallaban las primeras aplicaciones web: entrada no confiable que llega a un intérprete con privilegios. Un documento recuperado se convierte en una instrucción. Un agente con una herramienta legítima se convierte en un confused deputy. Un resumidor con acceso a la base de datos se convierte en una vía de exfiltración.

Probamos el sistema completo, no el modelo aislado: prompts, fuentes de recuperación, permisos de herramientas, tratamiento de la salida y el código de aplicación que confía en la respuesta. Cada hallazgo llega con la cadena que lo produjo y un caso de evaluación que demuestra la corrección.

  • Prompt injection directa e indirecta a través de contenido recuperado y de usuario
  • Abuso de agentes y de herramientas: confused deputy, tokens con alcance excesivo y acciones sin límite
  • Exposición de datos en RAG: recuperación entre tenants, fuga por embeddings y envenenamiento del índice
  • Tratamiento de la salida en la aplicación: HTML renderizado, código ejecutado y llamadas posteriores
  • Cadena de suministro del modelo: procedencia de los pesos, plugins de terceros e higiene de los datos de fine-tuning
  1. Contexto envenenadoInstrucción escondida en un documento recuperado, un ticket o una página webAcceso inicial
  2. La inyección entraEl modelo trata el texto recuperado como instrucción, no como datoEjecución
  3. Abuso de herramientasEl agente llama a una herramienta permitida con argumentos elegidos por el atacanteEscalada
  4. Alcance de credencialesLa herramienta se ejecuta con un token de servicio más amplio que el alcance del propio usuarioPrivilegio
  5. Exfiltración de datosRegistros privados resumidos en una respuesta, un webhook o una llamada salienteObjetivo
  • APPS LLMChat · copilotos
  • AGENTESHerramientas · autonomía
  • RAGRecuperación · índices
// 02 — Cómo lo ejecutamos

Cinco fases, del mapa del sistema a la suite de regresión.

  1. Mapeo del sistema

    Modelos, prompts, fuentes de recuperación, herramientas y permisos posteriores, documentados antes de enviar una sola petición. Qué se le puede pedir al sistema, a qué puede llamar y hasta dónde alcanza.

  2. Modelado de amenazas

    Modelamos contra MITRE ATLAS y el OWASP LLM Top 10, y después acotamos a los casos de abuso que de verdad importan para tu producto y tus datos.

  3. Pruebas adversariales

    Prompt injection directa e indirecta, cadenas de jailbreak, abuso de herramientas, envenenamiento de RAG y fallos en el tratamiento de la salida en la aplicación que rodea al modelo.

  4. Reproducción de la cadena

    Cada éxito se reproduce con el prompt exacto, el contexto recuperado y las llamadas a herramientas, para que tu equipo pueda repetirlo de forma determinista.

  5. Guardrails y evaluación

    Cambios en los guardrails, diffs de permisos de herramientas y una suite de evaluación de regresión que falla de forma ruidosa si el comportamiento vuelve.

// 03 — Qué recibes

Cadenas cerradas. Regresiones detectadas en CI.

// siguiente paso

Encontramos aquello a lo que se puede convencer a tu agente.

Llamada de alcance · corpus de ataque · entrega de la suite de evaluación.

Agendar una llamada de alcance