Benchmark filtrów
Każdy filtr, zmierzony.
Publiczny korpus 1000 fikcyjnych dokumentów mierzy, co daje każdy filtr Sluis: skuteczność wykrywania, fałszywe alarmy i opóźnienie. Odtwarzalny przez każdego.
Metodologia
Każdy dokument jest fikcyjny i ma złote adnotacje: ciągi, które trzeba zaczernić, oraz bliskie pomyłki, które muszą przetrwać. Filtr zaczerniający wszystko osiąga 100 % czułości; kolumna fałszywych alarmów utrzymuje liczbę uczciwą.
- 1000 wygenerowanych dokumentów: ustrukturyzowane PII, nazwiska i organizacje, sekrety, prompt injection i trudne negatywy.
- Sześć języków: niderlandzki, angielski, niemiecki, francuski, włoski i hiszpański, jako tekst, e-mail, kod/log, DOCX i PDF z warstwą tekstową.
- Na funkcję i na preset: skuteczność wykrywania (czułość) ORAZ fałszywe alarmy na 1000 słów, plus wpływ na opóźnienie.
- Przypięty model Claude dodatkowo ocenia resztkową identyfikowalność i rozstrzyga fałszywe alarmy; publikowane są oba wyniki.
Wyniki
Wyniki czekają na publikację
Pierwszy pełny przebieg macierzy na otagowanym wydaniu Sluis nie został jeszcze opublikowany. Wyniki pojawią się tutaj, na filtr i na preset, wraz z następnym wydaniem.
dataset / pending
Zbiór danych wkrótce
Korpus benchmarku nie jest jeszcze dostępny do pobrania. Napisz do nas, a wyślemy link, gdy tylko będzie online.
Napisz do nas