Ir al contenido

Anonimización para LLM

Escriba puede eliminar o reemplazar datos personales antes de que el texto llegue a un LLM — y volver a colocarlos después. El pesado modelo NER corre en un servicio aparte, de uso interno (Anonimal, que integra el OpenAI Privacy Filter), que se habilita apuntando ANONIMAL_URL hacia él.

Alta exhaustividad por diseño — varios detectores se apilan unos sobre otros:

  • Modelo NER — nombres, organizaciones, ubicaciones, fechas.
  • Campos de factura sensibles a la maquetación — lee etiqueta → valor por las coordenadas del PDF (nombre de la empresa, identificación fiscal, dirección…), enmascarando documentos estructurados campo por campo.
  • 20 detectores conmutables, por usuario — universales (correo, URL, IP, MAC, tarjeta de crédito validada por Luhn, IBAN mod-97), regionales (por ejemplo, CUIT/CUIL/CBU/DNI/direcciones de Argentina) y agresivos (números largos, secuencias de nombres).
  • Reglas propias — suba un JSON con sus propios patrones/etiquetas/lista de excepciones. Sus expresiones regulares corren sobre RE2 (tiempo lineal → inmune a ReDoS), con análisis JSON estricto y límites firmes.
  • Propagación de entidades — cualquier cosa detectada una vez se enmascara en todas sus apariciones.
ModoSalidaUso
Tipado<PRIVATE_PERSON>, <ACCOUNT_NUMBER>mantener visible la categoría
Anónimo<<ANOM_DATA>>aplanarlo todo
Seudonimizar«PERSONA_1» + un mapa token→originalla puerta de enlace al LLM — anonimizar → enviar → volver a hidratar localmente
Máscara parcial••••-3456, j•••@domain.comconservar una pista útil — irreversible
Hash estable«PERSONA_7590fc»mismo dato → mismo seudónimo entre documentos — irreversible

Dos intensidades (Equilibrada / Estricta), todas configurables por navegador. El mapa de restauración y sus reglas personalizadas nunca salen de su máquina.

El modo seudonimizar es la pieza central:

  1. Convierta con Seudonimizar — los nombres se vuelven «PERSONA_1», las identificaciones se vuelven «ID_2», etc.
  2. Envíe el texto seguro a cualquier LLM. El modelo nunca ve los datos reales.
  3. Pegue la respuesta en Volver a hidratar — Escriba restaura los valores reales, enteramente en su navegador, usando un mapa que nunca tocó el servidor.

Para PDF e imágenes escaneadas, la tarjeta de resultado ofrece una descarga de “PDF censurado”: cada entidad detectada queda tachada en la página mediante censura real — apply_redactions elimina el texto subyacente y los píxeles de la imagen debajo de cada recuadro, de modo que el dato deja de existir en el archivo de salida. Los metadatos del PDF también se borran (DocInfo + XMP), de modo que un archivo censurado no puede filtrar el nombre o la identificación a través de Propiedades o exiftool. A los documentos escaneados se les aplica OCR primero. La misma pila de detección, cero RAM extra.