Zum Inhalt springen

Leistung

Vergleichen Sie Sluis, LiteLLM und Bifrost auf identischer Hardware: Gateway-Overhead, Durchsatz, Tail-Latenz und Methodik mit einem echten Modell.

Ein Upstream. Identische Hardware. Dieselbe Last.

Jedes Gateway steht vor demselben Keep-Alive-Mock bei gleicher Nebenläufigkeit und trennt so den Gateway-Overhead von der Anbieter-Varianz. Gemessen wird der OpenAI-Protokollpfad; die Anthropic-Oberfläche fügt einen Übersetzungsschritt hinzu.

Ein geteilter Mock-Upstream

Alle vier Gateways treffen denselben Node-Mock: Keep-Alive an, eine feste Verzögerung von 60 ms.

Isoliert, identische Hardware

Jedes läuft in einem CPU/Speicher-gepinnten Container, belastet von oha mit 256 Verbindungen.

Basislinie bei offener Schleuse

Alles-erlauben-Richtlinie, DLP nur beobachtend, Audit-Inhalt aus: Sluis als reiner OpenAI-kompatibler Proxy.

Geschlossene Schleuse: das echte Produkt

EU-Residenz, DLP-Maskierung, Inhaltsaufbewahrung, hash-verketteter Audit: jede Schleuse auf dem heißen Pfad.

Die Zahlen, genau wie gemessen.

Zwei Sluis-Spalten: offene Schleuse, ein Äpfel-mit-Äpfeln-Proxy-Vergleich; geschlossene Schleuse, der Compliance-Overhead gegenüber unserer eigenen Basislinie.

2026-07-04 · oha 1.14 · c=256 · 30 s

MetrikSluis offene SchleuseSluis geschlossene SchleuseLiteLLMBifrost
Durchsatz (RPS)4,0463,6782983,148
Latenz p50 (ms)626374380
Latenz p99 (ms)771304,584118
Spitzen-RSS (MiB)TBDTBDTBDTBD
Erfolgsquote100%100%100%100%

Die Latenz wird Ende-zu-Ende durch das Gateway über denselben Mock mit fester Latenz gemessen: die Unterschiede sind der Eigen-Overhead der Gateways.

Die Spalte geschlossene Schleuse ist Compliance-Overhead gegenüber offener Schleuse, kein Duell.

Gegen ein echtes Modell (ratenbegrenzt auf 10 RPS, damit der Anbieter nie drosselt) kostet die Schleuse im Median nichts: 305 ms geschlossen gegenüber 304 ms offen. Die p99-Ausläufer dieser Bahn gehören dem Anbieter, nicht den Gateways.

Eine ehrliche Aussage, oder gar keine.

Ein Benchmark, dem man nicht trauen kann, ist schlimmer als keiner; darum legen wir die Regeln vor jeder Zahl fest.

  • Die „am schnellsten“-Aussage gilt nur bei offener Schleuse: Sluis als reiner Proxy gegen LiteLLM und Bifrost.
  • Geschlossene Schleuse ist Overhead gegenüber unserer Basislinie: eine Millisekunde im Median, neun Prozent Durchsatz, p99 130 ms gegenüber 77 ms.
  • Die ratenbegrenzte Live-Bahn kostet im Median nichts; ihre p99-Ausläufer sind Anbieter-Varianz.
  • Ist Sluis offen nicht klar schneller, lautet die Schlagzeile „Compliance zu vernachlässigbaren Kosten“.