Filterbenchmark
Elk filter, gemeten.
Een publiek corpus van 1.000 fictieve documenten meet wat elk Sluis-filter je oplevert: detectiegraad, valse positieven en latentie. Door iedereen te reproduceren.
Methodologie
Elk document is fictief en draagt goud-annotaties: strings die weggelakt moeten worden en bijna-treffers die moeten overleven. Een filter dat alles weglakt haalt 100 % recall; de kolom valse positieven houdt het cijfer eerlijk.
- 1.000 gegenereerde documenten: gestructureerde PII, namen en organisaties, secrets, prompt injections en lastige negatieven.
- Zes talen: Nederlands, Engels, Duits, Frans, Italiaans en Spaans, als tekst, e-mail, code/log, DOCX en PDF met tekstlaag.
- Per functie en per preset: detectiegraad (recall) EN valse positieven per 1.000 woorden, plus het latentie-effect.
- Een vastgepind Claude-model beoordeelt daarnaast rest-identificeerbaarheid en arbitreert valse positieven; beide scores worden gepubliceerd.
Resultaten
Resultaten wachten op publicatie
De eerste volledige matrixrun tegen een getagde Sluis-release is nog niet gepubliceerd. De resultaten verschijnen hier, per filter en per preset, met de volgende release.
dataset / pending
De dataset komt eraan
Het benchmarkcorpus is nog niet te downloaden. Stuur ons een bericht en we delen de link zodra hij online staat.
Mail ons