Benchmark filtrów

Każdy filtr, zmierzony.

Publiczny korpus 1000 fikcyjnych dokumentów mierzy, co daje każdy filtr Sluis: skuteczność wykrywania, fałszywe alarmy i opóźnienie. Odtwarzalny przez każdego.

Metodologia

Każdy dokument jest fikcyjny i ma złote adnotacje: ciągi, które trzeba zaczernić, oraz bliskie pomyłki, które muszą przetrwać. Filtr zaczerniający wszystko osiąga 100 % czułości; kolumna fałszywych alarmów utrzymuje liczbę uczciwą.

  • 1000 wygenerowanych dokumentów: ustrukturyzowane PII, nazwiska i organizacje, sekrety, prompt injection i trudne negatywy.
  • Sześć języków: niderlandzki, angielski, niemiecki, francuski, włoski i hiszpański, jako tekst, e-mail, kod/log, DOCX i PDF z warstwą tekstową.
  • Na funkcję i na preset: skuteczność wykrywania (czułość) ORAZ fałszywe alarmy na 1000 słów, plus wpływ na opóźnienie.
  • Przypięty model Claude dodatkowo ocenia resztkową identyfikowalność i rozstrzyga fałszywe alarmy; publikowane są oba wyniki.

Wyniki

Wyniki czekają na publikację

Pierwszy pełny przebieg macierzy na otagowanym wydaniu Sluis nie został jeszcze opublikowany. Wyniki pojawią się tutaj, na filtr i na preset, wraz z następnym wydaniem.

dataset / pending

Zbiór danych wkrótce

Korpus benchmarku nie jest jeszcze dostępny do pobrania. Napisz do nas, a wyślemy link, gdy tylko będzie online.

Napisz do nas