Anonimizzazione per LLM
Escriba può rimuovere o sostituire i dati personali prima che il testo arrivi a un LLM — e
rimetterli dopo. Il pesante modello NER gira in un servizio separato e accessibile solo internamente
(Anonimal, che include l’OpenAI Privacy Filter),
abilitato puntando ANONIMAL_URL su di esso.
Rilevamento a strati
Sezione intitolata “Rilevamento a strati”Alto recall per progettazione — diversi rilevatori si sovrappongono l’uno all’altro:
- Modello NER — nomi, organizzazioni, luoghi, date.
- Campi delle fatture sensibili all’impaginazione — legge etichetta → valore in base alle coordinate del PDF (ragione sociale, codice fiscale, indirizzo…), mascherando i documenti strutturati campo per campo.
- 20 rilevatori attivabili, per utente — universali (email, URL, IP, MAC, carta di credito validata con Luhn, IBAN mod-97), regionali (ad es. CUIT/CUIL/CBU/DNI/indirizzi argentini) e aggressivi (numeri lunghi, sequenze di nomi).
- Regole tue (Bring Your Own Rules) — carica un JSON con i tuoi pattern/etichette/lista da conservare. Le tue regex girano su RE2 (tempo lineare → a prova di ReDoS), con parsing JSON rigoroso e limiti rigidi.
- Propagazione delle entità — qualsiasi cosa rilevata una volta viene mascherata in ogni occorrenza.
Cinque modalità di output
Sezione intitolata “Cinque modalità di output”| Modalità | Output | Uso |
|---|---|---|
| Tipizzata | <PRIVATE_PERSON>, <ACCOUNT_NUMBER>… | mantieni visibile la categoria |
| Anonima | <<ANOM_DATA>> | appiattisci tutto |
| Pseudonimizza | «PERSONA_1» + una mappa token→originale | il gateway verso l’LLM — anonimizza → invia → re-idrata in locale |
| Mascheramento parziale | ••••-3456, j•••@domain.com | mantieni un indizio utilizzabile — irreversibile |
| Hash stabile | «PERSONA_7590fc» | stessi dati → stesso pseudonimo tra documenti — irreversibile |
Due intensità (Bilanciata / Rigorosa), tutte configurabili per ogni browser. La mappa di ripristino e le tue regole personalizzate non lasciano mai la tua macchina.
Il pattern del gateway verso l’LLM
Sezione intitolata “Il pattern del gateway verso l’LLM”La modalità pseudonimizza è il fulcro:
- Converti con Pseudonimizza — i nomi diventano
«PERSONA_1», i documenti diventano«ID_2», ecc. - Invia il testo sicuro a qualsiasi LLM. Il modello non vede mai i dati reali.
- Incolla la risposta in Re-idrata — Escriba ripristina i valori reali, interamente nel tuo browser, usando una mappa che non ha mai toccato il server.
Redazione visiva
Sezione intitolata “Redazione visiva”Per i PDF e le immagini scansionate, la scheda del risultato offre un download «PDF redatto»:
ogni entità rilevata viene oscurata sulla pagina con una vera redazione —
apply_redactions rimuove il testo sottostante e i pixel dell’immagine sotto ogni
riquadro, così i dati non esistono più nel file di output. Anche i metadati del PDF vengono
cancellati (DocInfo + XMP), così un file redatto non può rivelare il nome o il documento tramite Proprietà o
exiftool. I documenti scansionati vengono prima sottoposti a OCR. Stesso stack di rilevamento, zero RAM aggiuntiva.