IA y proteccion de datos: plataformas agenticas seguras
Un proyecto de agentes IA rara vez se cae por el modelo. Se cae por el dato: que ve el agente, donde se copia y quien puede pedirselo despues. Cuando eso no esta resuelto en la plataforma, el piloto se queda parado en legal.
El problema real: el agente ve mas de lo que necesita
La forma rapida de montar un agente es indexar todo y dejar que busque. Un repositorio de documentos entero, el CRM completo, el historico de tickets. Funciona en la demo y crea el problema en produccion: cualquier usuario que hable con el agente puede tirar de informacion que en su sistema de origen no tenia permiso para abrir.
El indice vectorial es el punto ciego habitual. Una vez que un contrato con nombres, DNI o datos de salud entra en el indice, deja de estar protegido por los permisos de la carpeta de la que salio. La plataforma tiene que replicar ese control, no heredarlo por casualidad.
El segundo punto es la salida. Un agente que redacta correos, resume llamadas o rellena formularios genera copias nuevas de datos personales en sitios que nadie ha inventariado. Sin registro, no hay forma de responder a un ejercicio de supresion.
Arquitectura: decidir donde se procesa antes de conectar nada
Hay tres modelos de despliegue y cada uno cambia el analisis de riesgo. Modelo gestionado via API, con region de procesamiento en la UE, retencion cero de prompts y compromiso contractual de no entrenar con los datos del cliente. Modelo desplegado en infraestructura propia o en la nube privada de la empresa, donde el dato no sale del perimetro. Y enrutado hibrido: la plataforma clasifica cada peticion y manda al modelo local solo lo que lleva datos sensibles.
El hibrido es el que mejor encaja en la mayoria de implantaciones. El coste por token de un modelo local no compensa para tareas triviales, y la latencia tampoco. Lo que se enruta por criticidad es un porcentaje pequeno del trafico.
Sea cual sea la opcion, la plataforma debe documentar sus subencargados. Si el proveedor no publica quien procesa que y donde, el contrato de encargo de tratamiento no se puede firmar con garantias.
Controles que la plataforma debe traer de serie
Estos controles no se anaden despues con un desarrollo a medida. O forman parte del producto o el proyecto acaba con capas de parches que nadie mantiene.
- →Identidad propia por agente y herencia de los permisos del usuario que lanza la tarea, no un superusuario compartido
- →Filtrado de entrada y salida: deteccion y enmascarado de identificadores antes de que el texto salga hacia el modelo
- →Registro completo de cada ejecucion: peticion, herramientas invocadas, documentos consultados y respuesta generada
- →Retencion configurable por tipo de dato y borrado en cascada que alcance tambien al indice vectorial y a los logs
- →Aprobacion humana obligatoria en acciones con efecto sobre terceros: enviar, publicar, modificar un registro de cliente
- →Aislamiento entre departamentos o clientes, sin indices ni memoria compartida entre ellos
Como se implanta sin bloquear el proyecto
El orden que funciona empieza por el inventario. Que fuentes va a tocar el agente, que categorias de datos hay en cada una y cual es la base legal de cada tratamiento. Es trabajo aburrido y es el que decide si el resto avanza.
Despues, un caso piloto de riesgo bajo y valor medible: busqueda documental interna sobre normativa, generacion de propuestas comerciales, clasificacion de tickets. Nada de datos especialmente protegidos en la primera iteracion.
En paralelo, la documentacion formal. Registro de actividades de tratamiento actualizado con el nuevo tratamiento, evaluacion de impacto cuando el uso lo requiera y contrato de encargo con el proveedor de la plataforma. Con el piloto ya funcionando, esa documentacion se escribe con datos reales de comportamiento en lugar de con suposiciones.
Solo entonces se amplia a procesos con datos de clientes. Cada ampliacion reutiliza los mismos controles: si hay que reinventarlos, la arquitectura estaba mal.
Que agentes se pueden lanzar ya con riesgo bajo
No todo agente toca datos personales. Los que trabajan sobre informacion publica de la empresa tienen un perfil de riesgo muy distinto y sirven para rodar la plataforma antes de acercarla a sistemas criticos.
Ahi entran los agentes de contenido, catalogo y datos estructurados, que operan sobre material ya publicado; ese caso concreto lo desarrollamos en plataforma de agentes IA para SEO, GEO y datos estructurados. El equipo aprende a supervisar agentes, a revisar trazas y a definir aprobaciones sin exponer nada.
Cuando ese circuito funciona, mover el mismo modelo operativo a soporte, facturacion o recursos humanos deja de ser un salto al vacio.
Este tema tambien se trata, desde otro enfoque, en GEOySEO.
La proteccion de datos en agentes IA se decide en la arquitectura, no en el aviso legal. Si estas evaluando una plataforma agentica para tu empresa, empieza por el inventario de fuentes y por un caso de uso acotado: en pocas semanas sabras que controles necesitas de verdad. Podemos revisar contigo ese primer caso y el modelo de despliegue que le encaja.
Preguntas frecuentes
¿Puede una plataforma de agentes IA cumplir el RGPD?
Si, siempre que el tratamiento tenga base legal, este recogido en el registro de actividades y la plataforma permita ejercer los derechos de acceso, rectificacion y supresion sobre todos los sitios donde el dato acaba: base de datos, indice vectorial, memoria del agente y logs. El punto que suele fallar no es el modelo, sino que el borrado no alcance a las copias derivadas.
¿Que ocurre con los datos que envio a un modelo comercial?
Depende del contrato, no del modelo. En los planes empresariales de los principales proveedores el contenido no se usa para entrenar y la retencion se puede reducir o anular, con procesamiento en region europea. Hay que verificarlo en el acuerdo de tratamiento firmado y no darlo por hecho: las condiciones de un plan de consumo y las de un contrato empresarial no son las mismas.
¿Hace falta evaluacion de impacto para desplegar agentes IA?
Es obligatoria cuando el tratamiento puede suponer un alto riesgo para los derechos de las personas: perfilado a gran escala, decisiones automatizadas con efecto juridico, tratamiento sistematico de categorias especiales de datos. Un agente que resume documentacion interna sin datos personales normalmente no la necesita. Uno que puntua candidatos o clientes, si.
¿Como se borra un dato personal que ya esta en un indice vectorial?
Con trazabilidad desde el fragmento indexado hasta el documento de origen. La plataforma debe guardar esa relacion para poder localizar y eliminar todos los vectores derivados de un documento concreto, ademas de purgar las conversaciones y los logs que lo citen. Si el indice no conserva ese vinculo, la unica salida es reconstruirlo entero, y eso no es una respuesta valida ante una solicitud de supresion.