Benchmark dei filtri

Ogni filtro, misurato.

Un corpus pubblico di 1.000 documenti fittizi misura cosa ti dà ogni filtro Sluis: tasso di rilevamento, falsi positivi e latenza. Riproducibile da chiunque.

Metodologia

Ogni documento è fittizio e porta annotazioni di riferimento: stringhe da oscurare e quasi coincidenze che devono sopravvivere. Un filtro che oscura tutto raggiunge il 100 % di recall; la colonna dei falsi positivi tiene onesto il numero.

  • 1.000 documenti generati: PII strutturate, nomi e organizzazioni, secret, prompt injection e negativi difficili.
  • Sei lingue: olandese, inglese, tedesco, francese, italiano e spagnolo, in testo, e-mail, codice/log, DOCX e PDF con livello di testo.
  • Per funzione e per preset: tasso di rilevamento (recall) E falsi positivi per 1.000 parole, più l'impatto sulla latenza.
  • Un modello Claude fissato giudica inoltre l'identificabilità residua e arbitra i falsi positivi; entrambi i punteggi sono pubblicati.

Risultati

Risultati in attesa di pubblicazione

La prima matrice completa contro una release taggata di Sluis non è ancora pubblicata. I risultati appariranno qui, per filtro e per preset, con la prossima release.

dataset / pending

Il dataset è in arrivo

Il corpus del benchmark non è ancora scaricabile. Scrivici e ti invieremo il link appena sarà online.

Scrivici