Salta ai contenuti

Anonimizzazione per LLM

Escriba può rimuovere o sostituire i dati personali prima che il testo arrivi a un LLM — e rimetterli dopo. Il pesante modello NER gira in un servizio separato e accessibile solo internamente (Anonimal, che include l’OpenAI Privacy Filter), abilitato puntando ANONIMAL_URL su di esso.

Alto recall per progettazione — diversi rilevatori si sovrappongono l’uno all’altro:

  • Modello NER — nomi, organizzazioni, luoghi, date.
  • Campi delle fatture sensibili all’impaginazione — legge etichetta → valore in base alle coordinate del PDF (ragione sociale, codice fiscale, indirizzo…), mascherando i documenti strutturati campo per campo.
  • 20 rilevatori attivabili, per utente — universali (email, URL, IP, MAC, carta di credito validata con Luhn, IBAN mod-97), regionali (ad es. CUIT/CUIL/CBU/DNI/indirizzi argentini) e aggressivi (numeri lunghi, sequenze di nomi).
  • Regole tue (Bring Your Own Rules) — carica un JSON con i tuoi pattern/etichette/lista da conservare. Le tue regex girano su RE2 (tempo lineare → a prova di ReDoS), con parsing JSON rigoroso e limiti rigidi.
  • Propagazione delle entità — qualsiasi cosa rilevata una volta viene mascherata in ogni occorrenza.
ModalitàOutputUso
Tipizzata<PRIVATE_PERSON>, <ACCOUNT_NUMBER>mantieni visibile la categoria
Anonima<<ANOM_DATA>>appiattisci tutto
Pseudonimizza«PERSONA_1» + una mappa token→originaleil gateway verso l’LLM — anonimizza → invia → re-idrata in locale
Mascheramento parziale••••-3456, j•••@domain.commantieni un indizio utilizzabile — irreversibile
Hash stabile«PERSONA_7590fc»stessi dati → stesso pseudonimo tra documenti — irreversibile

Due intensità (Bilanciata / Rigorosa), tutte configurabili per ogni browser. La mappa di ripristino e le tue regole personalizzate non lasciano mai la tua macchina.

La modalità pseudonimizza è il fulcro:

  1. Converti con Pseudonimizza — i nomi diventano «PERSONA_1», i documenti diventano «ID_2», ecc.
  2. Invia il testo sicuro a qualsiasi LLM. Il modello non vede mai i dati reali.
  3. Incolla la risposta in Re-idrata — Escriba ripristina i valori reali, interamente nel tuo browser, usando una mappa che non ha mai toccato il server.

Per i PDF e le immagini scansionate, la scheda del risultato offre un download «PDF redatto»: ogni entità rilevata viene oscurata sulla pagina con una vera redazione — apply_redactions rimuove il testo sottostante e i pixel dell’immagine sotto ogni riquadro, così i dati non esistono più nel file di output. Anche i metadati del PDF vengono cancellati (DocInfo + XMP), così un file redatto non può rivelare il nome o il documento tramite Proprietà o exiftool. I documenti scansionati vengono prima sottoposti a OCR. Stesso stack di rilevamento, zero RAM aggiuntiva.