Filterbenchmark

Elk filter, gemeten.

Een publiek corpus van 1.000 fictieve documenten meet wat elk Sluis-filter je oplevert: detectiegraad, valse positieven en latentie. Door iedereen te reproduceren.

Methodologie

Elk document is fictief en draagt goud-annotaties: strings die weggelakt moeten worden en bijna-treffers die moeten overleven. Een filter dat alles weglakt haalt 100 % recall; de kolom valse positieven houdt het cijfer eerlijk.

  • 1.000 gegenereerde documenten: gestructureerde PII, namen en organisaties, secrets, prompt injections en lastige negatieven.
  • Zes talen: Nederlands, Engels, Duits, Frans, Italiaans en Spaans, als tekst, e-mail, code/log, DOCX en PDF met tekstlaag.
  • Per functie en per preset: detectiegraad (recall) EN valse positieven per 1.000 woorden, plus het latentie-effect.
  • Een vastgepind Claude-model beoordeelt daarnaast rest-identificeerbaarheid en arbitreert valse positieven; beide scores worden gepubliceerd.

Resultaten

Resultaten wachten op publicatie

De eerste volledige matrixrun tegen een getagde Sluis-release is nog niet gepubliceerd. De resultaten verschijnen hier, per filter en per preset, met de volgende release.

dataset / pending

De dataset komt eraan

Het benchmarkcorpus is nog niet te downloaden. Stuur ons een bericht en we delen de link zodra hij online staat.

Mail ons