Benchmark dei filtri
Ogni filtro, misurato.
Un corpus pubblico di 1.000 documenti fittizi misura cosa ti dà ogni filtro Sluis: tasso di rilevamento, falsi positivi e latenza. Riproducibile da chiunque.
Metodologia
Ogni documento è fittizio e porta annotazioni di riferimento: stringhe da oscurare e quasi coincidenze che devono sopravvivere. Un filtro che oscura tutto raggiunge il 100 % di recall; la colonna dei falsi positivi tiene onesto il numero.
- 1.000 documenti generati: PII strutturate, nomi e organizzazioni, secret, prompt injection e negativi difficili.
- Sei lingue: olandese, inglese, tedesco, francese, italiano e spagnolo, in testo, e-mail, codice/log, DOCX e PDF con livello di testo.
- Per funzione e per preset: tasso di rilevamento (recall) E falsi positivi per 1.000 parole, più l'impatto sulla latenza.
- Un modello Claude fissato giudica inoltre l'identificabilità residua e arbitra i falsi positivi; entrambi i punteggi sono pubblicati.
Risultati
Risultati in attesa di pubblicazione
La prima matrice completa contro una release taggata di Sluis non è ancora pubblicata. I risultati appariranno qui, per filtro e per preset, con la prossima release.
dataset / pending
Il dataset è in arrivo
Il corpus del benchmark non è ancora scaricabile. Scrivici e ti invieremo il link appena sarà online.
Scrivici