Corpus de ataque
Todos los prompts, payloads de contexto y cadenas que ejecutamos, los que pasaron y los que no, entregados como conjunto reejecutable.
Tu modelo es un usuario de un tipo nuevo: lee texto no confiable y tiene credenciales reales. Atacamos el modelo, su contexto y todo aquello a lo que se le permite llegar.
Las funciones de IA fallan como fallaban las primeras aplicaciones web: entrada no confiable que llega a un intérprete con privilegios. Un documento recuperado se convierte en una instrucción. Un agente con una herramienta legítima se convierte en un confused deputy. Un resumidor con acceso a la base de datos se convierte en una vía de exfiltración.
Probamos el sistema completo, no el modelo aislado: prompts, fuentes de recuperación, permisos de herramientas, tratamiento de la salida y el código de aplicación que confía en la respuesta. Cada hallazgo llega con la cadena que lo produjo y un caso de evaluación que demuestra la corrección.
Modelos, prompts, fuentes de recuperación, herramientas y permisos posteriores, documentados antes de enviar una sola petición. Qué se le puede pedir al sistema, a qué puede llamar y hasta dónde alcanza.
Modelamos contra MITRE ATLAS y el OWASP LLM Top 10, y después acotamos a los casos de abuso que de verdad importan para tu producto y tus datos.
Prompt injection directa e indirecta, cadenas de jailbreak, abuso de herramientas, envenenamiento de RAG y fallos en el tratamiento de la salida en la aplicación que rodea al modelo.
Cada éxito se reproduce con el prompt exacto, el contexto recuperado y las llamadas a herramientas, para que tu equipo pueda repetirlo de forma determinista.
Cambios en los guardrails, diffs de permisos de herramientas y una suite de evaluación de regresión que falla de forma ruidosa si el comportamiento vuelve.
Todos los prompts, payloads de contexto y cadenas que ejecutamos, los que pasaron y los que no, entregados como conjunto reejecutable.
Cambios concretos en system prompts, alcances de herramientas y tratamiento de la salida. Nada de "añade un filtro".
Casos de prueba conectados a tu CI, para que un cambio de prompt o de modelo no pueda reabrir un hallazgo en silencio.
Qué registrar y sobre qué alertar: firmas de inyección, llamadas anómalas a herramientas y salida de tráfico desde rutas de agente.
// siguiente paso
Llamada de alcance · corpus de ataque · entrega de la suite de evaluación.