Benchmark des filtres

Chaque filtre, mesuré.

Un corpus public de 1 000 documents fictifs mesure ce que chaque filtre Sluis vous apporte : taux de détection, faux positifs et latence. Reproductible par tous.

Méthodologie

Chaque document est fictif et porte des annotations de référence : des chaînes à caviarder et des quasi-doublons qui doivent survivre. Un filtre qui caviarde tout atteint 100 % de rappel ; la colonne des faux positifs garde le chiffre honnête.

  • 1 000 documents générés : PII structurées, noms et organisations, secrets, injections de prompt et négatifs difficiles.
  • Six langues : néerlandais, anglais, allemand, français, italien et espagnol, en texte, e-mail, code/journal, DOCX et PDF avec couche de texte.
  • Par fonction et par préréglage : taux de détection (rappel) ET faux positifs pour 1 000 mots, plus l'impact sur la latence.
  • Un modèle Claude épinglé juge en plus l'identifiabilité résiduelle et arbitre les faux positifs ; les deux scores sont publiés.

Résultats

Résultats en attente de publication

La première matrice complète contre une version taguée de Sluis n'est pas encore publiée. Les résultats apparaîtront ici, par filtre et par préréglage, avec la prochaine version.

dataset / pending

Le jeu de données arrive

Le corpus du benchmark n'est pas encore téléchargeable. Laissez-nous un mot et nous vous enverrons le lien dès qu'il sera en ligne.

Écrivez-nous