Benchmark del filtro privacy di SafeAI Office
Abbiamo messo alla prova il filtro privacy manuale di SafeAI Office con 200 casi sintetici in italiano e inglese, su 8 categorie di dati personali. Qui pubblichiamo i risultati completi: numeri, metodo e limiti.
- casi sintetici
- 200
- lingue
- 2
- categorie testate
- 8
- punteggio F1
- 96,0%
I risultati per categoria
Otto categorie, 20 casi ciascuna. La colonna «segnaposto atteso» indica in quanti casi il filtro ha usato esattamente l’etichetta prevista dal test.
| Categoria | Casi | Precisione | Recall | Segnaposto atteso |
|---|---|---|---|---|
| Nome / persona NAME | 20 | 100% | 100% | 100% |
| Email EMAIL | 20 | 100% | 100% | 100% |
| Telefono PHONE | 20 | 100% | 100% | 100% |
| Indirizzo ADDRESS | 20 | 90,9% | 100% | 95% |
| Città / luogo CITY | 20 | 93,3% | 70% | 64,3% |
| IBAN IBAN | 20 | 100% | 100% | 100% |
| Codice fiscale CODICE_FISCALE | 20 | 83,3% | 100% | 100% |
| Data DATE | 20 | 100% | 100% | 95% |
La riga delle città è la più debole del test — ed è pubblicata come le altre. I dettagli sono nella sezione sui limiti.
Italiano e inglese
Il test comprendeva 100 casi in italiano e 100 in inglese.
In questo insieme di test l’italiano ha ottenuto risultati leggermente migliori dell’inglese. È un’osservazione limitata a questi 200 casi: non significa che SafeAI funzioni sempre meglio in italiano.
Le sei mancate
Delle 160 informazioni sensibili attese, 154 sono state individuate. Le 6 non individuate erano tutte nomi di città presentati da soli, senza contesto:
Lo diciamo chiaramente: in questo test una piccola parte di informazioni sensibili non è stata intercettata. È il motivo per cui il filtro resta uno strumento di aiuto — la revisione finale resta sempre alla persona.
Dove il test ha mostrato dei limiti
Un benchmark è utile solo se mostra anche dove il filtro fatica. Ecco i limiti emersi — e i confini del test stesso.
- Il rilevamento di nomi di città isolati è il punto più debole: recall del 70% sulla categoria CITY e 6 entità non individuate.
- Alcune città sono state classificate come STATE invece che come CITY.
- La logica deterministica per i nomi completi a volte interpreta due parole con iniziale maiuscola come nome di persona, generando rilevazioni in eccesso.
- I dati erano sintetici: non rappresentano tutti i documenti reali possibili.
- Test eseguito solo su Linux, solo in italiano e inglese, su 8 categorie: i risultati non coprono tutte le 54 categorie disponibili nel filtro.
- Si tratta di un test interno SafeAI, non di una certificazione indipendente: non dimostra conformità legale di alcun tipo.
Come abbiamo eseguito il test
Il benchmark ha esercitato la vera pipeline privacy di SafeAI Office — la stessa integrazione usata dal filtro privacy manuale — non un semplice test del modello isolato.
La prova nelle app di SafeAI Office
Oltre al test automatico e ripetibile, abbiamo verificato il filtro direttamente nelle tre superfici di SafeAI Office — con esempi rappresentativi, non passando a mano tutti i 200 casi.
Cosa dimostra — e cosa non dimostra
Cosa dimostra
- Il filtro manuale intercetta la grande maggioranza dei dati personali comuni nei documenti d’ufficio.
- Funziona in modo comparabile in italiano e in inglese.
- I casi senza dati sensibili non generano falsi allarmi (40 su 40).
- La stessa protezione è verificata nelle app Documenti, PDF e Fogli di calcolo.
Cosa non dimostra
- Non è una certificazione e non dimostra conformità a GDPR, AI Act o altre norme.
- Non è perfetto: 6 entità su 160 non sono state rilevate, quindi la revisione umana resta necessaria.
- Non copre tutte le 54 categorie, tutte le lingue o altri sistemi operativi.
- Non è una validazione indipendente o accademica: è un test interno SafeAI.