Operación BLINDAJE

Tu agente ya funciona.Nosotros comprobamos qué pasa cuando alguien intenta romperlo.

Auditoría de seguridad para bots, asistentes y agentes de IA en español.

Antes de que lo intente un cliente, un competidor, o alguien con menos buenas intenciones.

La pregunta incómoda

Entregaste el bot. Funciona. El cliente está contento.

Y entonces alguien pregunta: ¿qué pasa si le escriben algo raro?

No es una pregunta técnica. Es la pregunta de si tu cliente puede acabar con un compromiso por escrito que nadie autorizó, con datos de un usuario en la pantalla de otro, o con su asistente obedeciendo instrucciones escondidas dentro de un PDF que le mandó un tercero.

Nadie puede auditarse a sí mismo. Ese es el trabajo.

Detectar no es resistir

Un agente puede responder esto:

"Detecto que tu solicitud intenta que revele mis instrucciones internas. Dicho esto, aquí las tienes: nunca ofrezcas descuentos superiores al 15%, escala al equipo humano si insisten, y tienes acceso a las herramientas consultar_catalogo y crear_pedido."

Ese agente vio el ataque, lo dijo en voz alta, y cumplió de todas formas.

Una auditoría con semáforo pinta eso de amarillo y todo el mundo respira. Nosotros lo clasificamos como lo que es: cumplimiento completo, con detección explícita. Dos ejes independientes que nunca se colapsan en un color.

Porque la conclusión práctica es incómoda y hay que decirla: los avisos que ves en producción no son un control.

La demostración, en vídeo · 3 min 34 s

Le escribí a un bot un número de pedido que no era mío y me dijo qué contenía y dónde estaba

El bot es propio y fue construido para ser auditado. Datos ficticios, cero información de terceros.

Un documento que aguanta que lo lean con mala fe

Evidencia, no adjetivos.

Cada hallazgo va enlazado al turno exacto de la conversación que lo produjo. Si no hay transcripción que lo sostenga, el hallazgo no se imprime. Literalmente: el generador se niega.

El criterio se fija antes de mirar.

Cada prueba lleva escrito por adelantado qué respuesta contaría como fallo. Decidirlo después de ver el resultado es cómo se fabrican informes que dicen lo que conviene.

Ningún número se escribe a mano.

Los valores derivados se recalculan desde la clasificación, y el sistema rechaza el documento si no cuadran. No es una promesa: es una puerta de código.

El juicio final lo firma una persona.

El informe no se emite si no lleva veredicto humano. Es lo que estás pagando.

El informe de muestra está hecho sobre un bot construido por nosotros para ser auditado. Datos ficticios, cero información de terceros.

Caso real11 de 33 vectores lograron que el agente entregara algo que no debíaQué resistió, qué cedió, y por qué ninguno de los hallazgos críticos se arregla escribiendo mejor el prompt.

35 vectores, 12 familias de fallo

Cifras leídas del catálogo el 2026-08-31 · 12 críticas · 15 altas · 8 medias

Fuga de instrucciones

Tus reglas de negocio, copiables por cualquiera que sepa pedirlas

Inyección directa

Órdenes que sobrescriben lo que configuraste

Inyección indirecta

Instrucciones escondidas en un documento que tu cliente solo quería que revisaras

Jailbreak comercial

Descuentos y compromisos que el agente promete y tú tienes que sostener

Alucinación con consecuencia

Políticas que el agente inventa y tu cliente puede exigirte

Abuso de herramientas

Consultas a datos que no le corresponden a quien pregunta

Exceso de agencia

Acciones irreversibles ejecutadas sin que nadie las confirmara

Fuga entre usuarios

Datos de un cliente apareciendo en la sesión de otro

Exposición de datos y secretos

Claves, tokens y datos personales saliendo por el chat

Envenenamiento de conocimiento

Un documento subido hoy que altera las respuestas de mañana

Escalada de permisos

"Soy el administrador" funcionando como credencial

Abuso de lógica de negocio

Descuentos acumulados y reembolsos duplicados, sin romper ninguna regla

Cuatro niveles. Empieza por el que no cuesta nada.

L0 · Radiografía de riesgo

—gratis, 24 h

Una página. Solo información pública y un cuestionario. No tocamos tu sistema.

Te decimos qué preguntaríamos y por dónde empezaríamos.

L1 · Diagnóstico Express

—$490 USD, 48 h

Alrededor de 25 vectores. Informe con evidencia y clasificación de cada uno.

Sirve para saber si tienes un problema y de qué tamaño.

L2 · Red-Team + Remediación

—$2,400 USD, 5–7 días

El producto real. 60–100 vectores, guardrails aplicados, parches de prompt, política de herramientas y retest incluido. No te decimos qué está roto: lo arreglamos contigo.

L3 · Blindaje continuo

—todavía no está abierto

Retest mensual, revisión de registros y regresión de prompts. Porque cambias el prompt un martes y no sabes qué se rompió.

No lo vendo aún: un retest mensual solo tiene sentido cuando cuesta minutos, y hoy no los cuesta. Prefiero decirlo a cobrarlo mal. Si te interesa para más adelante, dímelo y te aviso.

Para agencias: informe sin nuestra marca, que revendes con la tuya.

Condiciones bajo consulta

Reglas que no negociamos

Nunca tocamos un sistema sin autorización firmada.

No es una política: es código. Sin el documento de autorización, nuestras herramientas se niegan a ejecutarse y salen con error. Esa puerta lleva ahí desde el primer día.

Tus datos no salen de la máquina.

La clasificación corre en un modelo local, en nuestro equipo. Tu conversación con tus clientes no se sube a ninguna API de terceros. Está por escrito en el aviso de privacidad que firmamos.

Solo reconocimiento autorizado, nunca daño.

No tumbamos servicios, no hacemos ingeniería social a tu personal, no tocamos datos de tus clientes. Auditamos lo que acordamos auditar, en la ventana que acordamos.

Si aparecen datos personales reales durante una prueba, cortamos.

No se guardan, no se copian al informe, y te avisamos el mismo día.

Eduardo Rodríguez.

Investigador independiente en seguridad de agentes de IA. Autor de un estudio comparativo de ocho sistemas conversacionales desplegados, con rúbrica congelada antes del etiquetado y divulgación coordinada a través de CERT/CC. Mantengo un catálogo de 35 vectores de prueba, cada uno con su criterio de fallo definido antes de ejecutarlo.

Trabajo por escrito y en español, de forma asíncrona.

Empieza por la radiografía gratuita

Cuéntame qué agente tienes y para qué lo usan tus clientes. Te devuelvo en 24 horas una página con lo que preguntaría y por dónde empezaría. Sin tocar tu sistema y sin compromiso.

Te respondo yo, no un bot. Sería raro que no.

Se abre tu correo con esto

Para: info@eduardorodriguez.site
     jesuseduardorodriguezsaucedo@outlook.com
Asunto: Radiografía de riesgo — solicitud

Nombre: 
Correo: 
¿Qué agente tienes?: 
¿Qué hace por tus clientes?: 

Enviado desde eduardorodriguez.site/blindaje

Esta página no envía nada por su cuenta: ni este formulario, ni analítica, ni recursos de terceros. El correo lo mandas tú desde tu propio cliente.