Prestaties

Een sluis die je niet voelt.

Eén milliseconde op de mediaan, gemeten, met elke compliance-sluis actief.

CONTROLLED FAST PATH · GATE ON
requestproviderinspect01route02seal03out04requestproviderinspect01route02seal03out04

De inspectie draait in-process, het herstel gebeurt in de stream en het data plane is Rust: de sluis kost één milliseconde op de mediaan.

4,046 RPSPiekdoorvoer
+1 msMediane sluis-overhead
13.6×Doorvoer vs LiteLLM

Eén upstream. Identieke hardware. Dezelfde belasting.

Elke gateway staat voor dezelfde keep-alive mock bij dezelfde gelijktijdigheid en isoleert zo de gateway-overhead van de providervariantie.

  • Eén gedeelde mock-upstream

    Alle vier de gateways raken dezelfde Node-mock: keep-alive aan, één vaste vertraging van 60 ms.

  • Geïsoleerd, identieke hardware

    Elk draait in een op CPU/geheugen vastgezette container, belast door oha met 256 verbindingen.

  • Sluis-open-basislijn

    Alles-toestaan-beleid, DLP alleen observeren, auditinhoud uit: Sluis als kale OpenAI-compatibele proxy.

  • Sluis dicht: het echte product

    EU-residentie, DLP-maskering, contentbewaring, hash-geketende audit: elke sluis op het hete pad.

01 / PRODUCT

Wat je niet inlevert.

Een sluis laat het schip door: niets waarop je bouwt lever je in voor compliance.

  • Streaming blijft streaming: tokens vertrekken zodra ze binnenkomen, hersteld in de stream.
  • De cache beantwoordt herhalingen: exacte en semantische cache, per tenant, versleuteld in rust.
  • Failover blijft binnen het beleid: Sluis verlegt alleen naar een toegestane uitwijk.
02 / METHOD

Zo gebouwd dat het resultaat niet stilletjes te sjoemelen is.

Elke configuratie is vastgezet en identiek over alle gateways, zodat de vergelijking niet stilletjes scheef te trekken is.

  • Alle gateways vastgezet op identieke CPU- en geheugen-cgroups.
  • De mock-upstream is byte-identiek en gedeeld; één vaste vertraging voor iedereen.
  • LiteLLM en Bifrost draaien identieke configuraties, zonder verborgen vlaggen.
  • Gelijke verworpen opwarming en gelijk meetvenster per gateway.
  • Elke run wordt getoetst op zijn statuscodes: alles wat geen 100 % HTTP 200 is wordt verworpen.
Resultaten

De cijfers, precies zoals gemeten.

Twee Sluis-kolommen: sluis open, een gelijke-monniken-proxyvergelijking; sluis dicht, de compliance-overhead tegen onze eigen basislijn.

Gemeten op 2026-07-04 op identieke hardware (één Apple Silicon-Mac, Docker) met 256 verbindingen; een relatieve vergelijking. Elke run geverifieerd op 100 % HTTP 200, herhaalvariantie onder 1 %. Piek-RSS is bij deze run niet vastgelegd, dus die rij blijft TBD.
MetriekSluis openSluis dichtLiteLLMBifrost
Doorvoer (RPS)4,046
3,678
298
3,148
Latentie p50 (ms)62
63
743
80
Latentie p99 (ms)77
130
4,584
118
Piek-RSS (MiB)TBD
TBD
TBD
TBD
Slagingspercentage100%
100%
100%
100%

Latentie is end-to-end door de gateway gemeten, over dezelfde mock met vaste latentie: de verschillen zijn de eigen overhead van de gateways.

De kolom sluis dicht is compliance-overhead tegenover sluis open, geen duel.

Tegen een echt model (begrensd op 10 RPS zodat de provider nooit afknijpt) voegt de sluis niets toe op de mediaan: 305 ms sluis dicht tegenover 304 ms sluis open. De p99-staarten van die baan horen bij de provider, niet bij de gateways.

Een eerlijke claim, of geen.

Een benchmark die je niet kunt vertrouwen is erger dan geen; daarom leggen we de regels vast vóór elk getal.

  • De “snelste”-claim geldt alleen voor sluis open: Sluis als kale proxy tegen LiteLLM en Bifrost.
  • Sluis dicht is overhead tegen onze eigen basislijn: één milliseconde op de mediaan, negen procent doorvoer, p99 130 ms tegenover 77 ms.
  • De begrensde live-baan voegt niets toe op de mediaan; de p99-staarten zijn providervariantie.
  • Is Sluis open niet duidelijk sneller, dan wordt de kop “compliance tegen verwaarloosbare kosten”.

Gebouwd voor de toezichthouder in de kamer, niet alleen voor de loadtest.

Lees hoe de gateway werkt en zie dan hoe de compliance-sluis presteert.