Cifrado Contextual para Tuberías de LLM y Bases de Datos Vectoriales
Una plataforma de IA empresarial necesitaba habilitar funciones potenciadas por LLM (chat, búsqueda, análisis de documentos) mientras aseguraba que los datos sensibles — PII, registros financieros, información de salud — permanecieran cifrados a lo largo de la tubería, incluso cuando se almacenaran como incrustaciones vectoriales en una base de datos vectorial.
Discuta Su Proyecto
El Desafío
El uso de LLMs y bases de datos vectoriales con datos sensibles introdujo nuevos riesgos de seguridad:
- Ataques de Inversión de Incrustaciones — La investigación mostró que las incrustaciones vectoriales podían ser revertidas para reconstruir el texto original, exponiendo PII almacenada en bases de datos vectoriales
- Fuga de Contexto de LLM — Los datos sensibles enviados a LLMs podrían aparecer en respuestas a otros usuarios si no se aíslan adecuadamente
- Requisitos de Cumplimiento — GDPR, HIPAA y SOC2 exigían cifrado en reposo y en tránsito, pero las bases de datos vectoriales almacenaban representaciones matemáticas, no campos de texto tradicionales
- Funcionalidad de Búsqueda — Cifrar el texto antes de incrustarlo destruía el significado semántico, haciendo inútil la búsqueda de similitud
- Gestión de Claves — Las claves de cifrado por inquilino necesitaban rotación sin re-incrustar conjuntos de datos completos
- Registro de Auditoría — Cada acceso a datos sensibles descifrados necesitaba ser registrado para cumplimiento
Nuestra Solución
Implementamos una arquitectura de cifrado contextual que cifra selectivamente campos sensibles antes del almacenamiento mientras preserva la capacidad de búsqueda semántica a través de un enfoque por capas — cifrando PII en metadatos mientras se mantiene contenido saneado, no sensible, disponible para incrustación.
Arquitectura
- Motor de Cifrado: AES-256-GCM con claves de cifrado por inquilino
- Gestión de Claves: AWS KMS para generación, rotación y control de acceso de claves
- Detección de PII: Clasificador de PII basado en NER (Reconocimiento de Entidades Nombradas)
- Base de Datos Vectorial: Milvus para búsqueda de similitud en incrustaciones saneadas
- Capa LLM: Contexto saneado enviado a LLM, campos sensibles reinyectados post-generación
- Sistema de Auditoría: Cada evento de descifrado registrado con usuario, marca de tiempo y propósito
- Base de Datos: PostgreSQL para metadatos cifrados
Estrategia de Cifrado Contextual
Clasificación de Datos
Antes de que cualquier dato entre en la tubería, un clasificador de PII categoriza cada campo por nivel de sensibilidad:
- Altamente Sensible (por ejemplo, identificaciones gubernamentales, números de cuentas financieras, identificaciones médicas) — Cifrado, nunca incrustado, nunca enviado a LLM
- PII Sensible (por ejemplo, nombres completos, direcciones de correo electrónico, números de teléfono) — Cifrado en reposo, reemplazado por marcadores de posición antes de incrustación
- Contextual (por ejemplo, títulos de trabajo, nombres de empresas) — Cifrado en reposo, disponible para incrustación con consentimiento
- No Sensible (por ejemplo, descripciones de productos, información pública) — Almacenado e incrustado tal cual
Capas de Cifrado
Capa 1: Cifrado a Nivel de Campo en ReposoLos campos sensibles son cifrados con AES-256-GCM antes del almacenamiento. Cada inquilino obtiene una clave de cifrado de datos (DEK) dedicada, gestionada a través de una jerarquía de claves mediante AWS KMS. Los campos sombra almacenan hashes buscables para búsquedas de coincidencia exacta sin requerir descifrado.
Capa 2: Saneamiento Antes de IncrustaciónSe detecta PII y se reemplaza con marcadores de posición que preservan el tipo antes de que el texto se envíe al modelo de incrustación. Esto preserva el significado semántico para la búsqueda de similitud mientras se elimina la información identificable. El mapeo original a marcador de posición se almacena cifrado junto al registro vectorial.
Capa 3: Inyección de Contexto Después de la Generación de LLMEl LLM recibe contexto saneado con marcadores de posición para generar respuestas. Después de la generación, el sistema reinserta valores reales desde el almacenamiento cifrado en la respuesta. Esto evita que los datos sensibles ingresen en los datos de entrenamiento de LLM o sean almacenados en caché por el proveedor.
Seguridad de la Base de Datos Vectorial
Diseño de Colección
Las colecciones vectoriales almacenan incrustaciones saneadas junto a metadatos originales cifrados. El aislamiento de inquilinos se aplica mediante claves de partición, con los metadatos de cada inquilino cifrados usando su propia clave. La capa API valida la propiedad del inquilino antes de cualquier operación de descifrado.
Gestión y Rotación de Claves
Jerarquía de Claves
Se utiliza una jerarquía de claves multinivel: una clave maestra en AWS KMS envuelve claves de cifrado por inquilino, que a su vez envuelven claves de cifrado de datos por inquilino utilizadas para el cifrado a nivel de campo. Esto permite una rotación de claves eficiente sin volver a cifrar toda la cadena de claves.
Proceso de Rotación de Claves
- Nueva DEK Generada — Nueva clave de cifrado de datos creada bajo la clave de cifrado existente
- Nuevas Escrituras — Todos los nuevos datos cifrados con la nueva clave; la clave antigua sigue siendo válida para lecturas
- Re-cifrado en Segundo Plano — Trabajo por lotes re-cifra registros existentes con la nueva clave
- Retiro de la Antigua DEK — Una vez migrados todos los registros, la clave antigua se marca como inactiva
- Registro de Auditoría — Evento de rotación registrado con marcas de tiempo y conteos de registros afectados
Auditoría y Cumplimiento
Registro de Auditoría de Descifrado
Cada evento de descifrado captura quién lo solicitó, qué se descifró, cuándo, por qué (contexto de la solicitud) y qué clave se utilizó — proporcionando un rastro de cumplimiento completo.
Derecho de Supresión de GDPR
El sistema admite la eliminación completa de datos tanto en la base de datos relacional como en la base de datos vectorial, con rotación de claves opcional para asegurar criptográficamente que no haya acceso residual. Todas las operaciones de eliminación se registran en un rastro de auditoría de GDPR.
Características Clave
- Cifrado a Nivel de Campo — AES-256-GCM en campos sensibles, no en registros completos
- Saneamiento de PII — Los marcadores de posición preservan el significado semántico para las incrustaciones
- Re-inyección Post-LLM — Los datos sensibles nunca se envían a proveedores de LLM
- Claves por Inquilino — Claves de cifrado aisladas con gestión de AWS KMS
- Rotación de Claves — Rotación sin tiempo de inactividad con re-cifrado en segundo plano
- Seguridad de Incrustaciones — Incrustaciones saneadas previenen ataques de inversión en PII
- Registro de Auditoría — Cada descifrado registrado para informes de cumplimiento
- Cumplimiento de GDPR — Borrado automatizado en almacenes cifrados y base de datos vectorial
Resultados
Stack Tecnológico
caseStudyDetail.more Casos de Estudio
Explore más de nuestras implementaciones técnicas
Catant Plataforma de Gestión de RRHH y Fuerza Laboral
Catant es una plataforma modular de gestión de RRHH y fuerza laboral que ayuda a las empresas a gestionar empleados, nóminas, asistencia y cumplimiento desde un único panel.
Kickly: Plataforma de Proyectos Impulsada por AI para Startups
Kickly es una plataforma de gestión de proyectos impulsada por AI diseñada para startups, que combina automatización inteligente de tareas, colaboración en equipo y seguimiento del progreso en tiempo real en un solo producto.
¿Listo para Transformar su Negocio?
Hablemos sobre cómo podemos aplicar soluciones similares a sus desafíos.