SafeAI
Evidenza SafeAI Office · Linux

Benchmark del filtro privacy di SafeAI Office

Abbiamo messo alla prova il filtro privacy manuale di SafeAI Office con 200 casi sintetici in italiano e inglese, su 8 categorie di dati personali. Qui pubblichiamo i risultati completi: numeri, metodo e limiti.

casi sintetici
200
lingue
2
categorie testate
8
punteggio F1
96,0%

Il risultato in breve

In questo benchmark sintetico di 200 casi, il filtro manuale di SafeAI Office ha ottenuto una precisione del 95,7%, un recall del 96,3% e un punteggio F1 del 96,0%.

  • 154 rilevazioni corrette su 160 informazioni sensibili presenti nel test.
  • 7 rilevazioni in eccesso — valori segnalati che non erano sensibili.
  • 6 informazioni non individuate — tutte nomi di città isolati (vedi sotto).
  • Segnaposto atteso nel 95,5% dei casi (147 su 154): quasi sempre il filtro ha usato esattamente l’etichetta prevista.
  • 0 errori del motore e nessun rilevamento nei 40 casi «puliti» senza dati sensibili (40 su 40).

Precisione: quanto spesso una rilevazione effettuata dal filtro era effettivamente corretta.

Recall: quante delle informazioni sensibili presenti nel test sono state effettivamente individuate.

F1: una misura sintetica che bilancia precisione e recall.

I risultati per categoria

Otto categorie, 20 casi ciascuna. La colonna «segnaposto atteso» indica in quanti casi il filtro ha usato esattamente l’etichetta prevista dal test.

Risultati del benchmark per categoria: casi, precisione, recall e accuratezza del segnaposto
CategoriaCasiPrecisioneRecallSegnaposto atteso
Nome / persona NAME20100%100%100%
Email EMAIL20100%100%100%
Telefono PHONE20100%100%100%
Indirizzo ADDRESS2090,9%100%95%
Città / luogo CITY2093,3%70%64,3%
IBAN IBAN20100%100%100%
Codice fiscale CODICE_FISCALE2083,3%100%100%
Data DATE20100%100%95%

La riga delle città è la più debole del test — ed è pubblicata come le altre. I dettagli sono nella sezione sui limiti.

Italiano e inglese

Il test comprendeva 100 casi in italiano e 100 in inglese.

Italiano

100 casi · 78 rilevazioni corrette · 3 in eccesso · 2 mancate

Precisione 96,3% · Recall 97,5%

Inglese

100 casi · 76 rilevazioni corrette · 4 in eccesso · 4 mancate

Precisione 95,0% · Recall 95,0%

In questo insieme di test l’italiano ha ottenuto risultati leggermente migliori dell’inglese. È un’osservazione limitata a questi 200 casi: non significa che SafeAI funzioni sempre meglio in italiano.

Le sei mancate

Delle 160 informazioni sensibili attese, 154 sono state individuate. Le 6 non individuate erano tutte nomi di città presentati da soli, senza contesto:

  • Napoli
  • Genova
  • Vienna
  • Lisbon
  • Prague
  • Oslo

Lo diciamo chiaramente: in questo test una piccola parte di informazioni sensibili non è stata intercettata. È il motivo per cui il filtro resta uno strumento di aiuto — la revisione finale resta sempre alla persona.

Protetto non significa etichettato alla perfezione

Nel test contano due cose diverse: se il valore sensibile è stato protetto e se il filtro ha usato esattamente l’etichetta prevista. L’accuratezza del segnaposto è stata del 95,5%.

  • Alcuni nomi di città sono stati protetti come STATE invece che come CITY: il valore era protetto, l’etichetta era diversa da quella attesa.
  • Una data di nascita è stata protetta come DATEOFBIRTH invece che come DATE: di nuovo, protezione corretta con etichetta più specifica.
  • In alcuni casi la logica deterministica per i nomi completi ha prodotto rilevazioni NAME aggiuntive rispetto a quelle attese.

Dove il test ha mostrato dei limiti

Un benchmark è utile solo se mostra anche dove il filtro fatica. Ecco i limiti emersi — e i confini del test stesso.

  • Il rilevamento di nomi di città isolati è il punto più debole: recall del 70% sulla categoria CITY e 6 entità non individuate.
  • Alcune città sono state classificate come STATE invece che come CITY.
  • La logica deterministica per i nomi completi a volte interpreta due parole con iniziale maiuscola come nome di persona, generando rilevazioni in eccesso.
  • I dati erano sintetici: non rappresentano tutti i documenti reali possibili.
  • Test eseguito solo su Linux, solo in italiano e inglese, su 8 categorie: i risultati non coprono tutte le 54 categorie disponibili nel filtro.
  • Si tratta di un test interno SafeAI, non di una certificazione indipendente: non dimostra conformità legale di alcun tipo.

Come abbiamo eseguito il test

Il benchmark ha esercitato la vera pipeline privacy di SafeAI Office — la stessa integrazione usata dal filtro privacy manuale — non un semplice test del modello isolato.

  • Dati sintetici, 200 casi: 160 casi positivi con informazioni sensibili e 40 casi «puliti» senza, in italiano e inglese, su 8 categorie (nome, email, telefono, indirizzo, città, IBAN, codice fiscale, data).
  • Misura a livello di entità: ogni informazione sensibile attesa è stata confrontata con le rilevazioni del filtro — corrette, in eccesso o mancate — e con l’etichetta usata.
  • Tempi secondari: su 200 chiamate, media e mediana di 928 ms con p95 intorno a 1.007 ms (caricamento del modello incluso in ogni chiamata). Sono tempi misurati su un singolo sistema Linux di test: non vanno letti come prestazioni universali su hardware diversi.
Configurazione tecnica del test
  • SafeAI Office su Linux, componente privacy 1.0.0
  • Soglia di rilevamento 0,5, controlli deterministici abilitati
  • 54 categorie di modello configurate, 8 categorie testate
  • Stessa integrazione protectText usata dal filtro privacy manuale

La prova nelle app di SafeAI Office

Oltre al test automatico e ripetibile, abbiamo verificato il filtro direttamente nelle tre superfici di SafeAI Office — con esempi rappresentativi, non passando a mano tutti i 200 casi.

Documenti

Mario Rossi → [NAME]
giulia.bianchi@studio.it → [EMAIL]
RSSMRA85M01H501Z → [CODICE_FISCALE]

La sostituzione nel documento era disponibile.

PDF

Verificati NAME, EMAIL e IBAN. Il PDF resta di sola lettura: nessuna sostituzione, nessun pulsante di sostituzione, file originale invariato.

Fogli di calcolo

Verificati NAME, EMAIL e ADDRESS. L’applicazione delle celle protette ha funzionato: solo le celle selezionate sono cambiate.

Cosa dimostra — e cosa non dimostra

Cosa dimostra

  • Il filtro manuale intercetta la grande maggioranza dei dati personali comuni nei documenti d’ufficio.
  • Funziona in modo comparabile in italiano e in inglese.
  • I casi senza dati sensibili non generano falsi allarmi (40 su 40).
  • La stessa protezione è verificata nelle app Documenti, PDF e Fogli di calcolo.

Cosa non dimostra

  • Non è una certificazione e non dimostra conformità a GDPR, AI Act o altre norme.
  • Non è perfetto: 6 entità su 160 non sono state rilevate, quindi la revisione umana resta necessaria.
  • Non copre tutte le 54 categorie, tutte le lingue o altri sistemi operativi.
  • Non è una validazione indipendente o accademica: è un test interno SafeAI.