Benchmark des filtres
Chaque filtre, mesuré.
Un corpus public de 1 000 documents fictifs mesure ce que chaque filtre Sluis vous apporte : taux de détection, faux positifs et latence. Reproductible par tous.
Méthodologie
Chaque document est fictif et porte des annotations de référence : des chaînes à caviarder et des quasi-doublons qui doivent survivre. Un filtre qui caviarde tout atteint 100 % de rappel ; la colonne des faux positifs garde le chiffre honnête.
- 1 000 documents générés : PII structurées, noms et organisations, secrets, injections de prompt et négatifs difficiles.
- Six langues : néerlandais, anglais, allemand, français, italien et espagnol, en texte, e-mail, code/journal, DOCX et PDF avec couche de texte.
- Par fonction et par préréglage : taux de détection (rappel) ET faux positifs pour 1 000 mots, plus l'impact sur la latence.
- Un modèle Claude épinglé juge en plus l'identifiabilité résiduelle et arbitre les faux positifs ; les deux scores sont publiés.
Résultats
Résultats en attente de publication
La première matrice complète contre une version taguée de Sluis n'est pas encore publiée. Les résultats apparaîtront ici, par filtre et par préréglage, avec la prochaine version.
dataset / pending
Le jeu de données arrive
Le corpus du benchmark n'est pas encore téléchargeable. Laissez-nous un mot et nous vous enverrons le lien dès qu'il sera en ligne.
Écrivez-nous