Rendimiento

Una esclusa que no se nota.

Un milisegundo en la mediana, medido, con cada compuerta de cumplimiento activa.

CONTROLLED FAST PATH · GATE ON
requestproviderinspect01route02seal03out04requestproviderinspect01route02seal03out04

La inspección se ejecuta en el proceso, la restauración ocurre dentro del flujo y el plano de datos es Rust: la compuerta cuesta un milisegundo en la mediana.

4,046 RPSRendimiento máximo
+1 msSobrecarga mediana de la compuerta
13.6×Rendimiento vs LiteLLM

Un upstream. Hardware idéntico. La misma carga.

Cada gateway se sitúa ante el mismo mock keep-alive con la misma concurrencia, aislando la sobrecarga del gateway de la varianza del proveedor.

  • Un único upstream simulado compartido

    Los cuatro gateways golpean el mismo mock de Node: keep-alive activo, un retardo fijo de 60 ms.

  • Aislado, hardware idéntico

    Cada uno corre en un contenedor fijado en CPU/memoria, cargado por oha con 256 conexiones.

  • Línea base con compuerta abierta

    Política de permitir todo, DLP solo observación, contenido de auditoría desactivado: Sluis como proxy simple compatible con OpenAI.

  • Compuerta cerrada: el producto real

    Residencia UE, enmascarado DLP, retención de contenido, auditoría encadenada por hash: cada compuerta en la ruta crítica.

01 / PRODUCT

A lo que no renuncia.

Una esclusa deja pasar el barco: nada de lo que usted necesita se sacrifica por el cumplimiento.

  • El streaming sigue siendo streaming: los tokens salen según llegan, restaurados dentro del flujo.
  • La caché responde a las repeticiones: cachés exacta y semántica, por inquilino, cifradas en reposo.
  • La conmutación se queda en la política: Sluis solo reencamina a un respaldo permitido.
02 / METHOD

Construido para que el resultado no pueda amañarse en silencio.

Cada configuración está fijada y es idéntica en todos los gateways, de modo que la comparación no puede inclinarse en silencio.

  • Todos los gateways fijados a cgroups idénticos de CPU y memoria.
  • El upstream simulado es idéntico byte a byte y compartido; un único retardo fijo para todos.
  • LiteLLM y Bifrost corren configuraciones idénticas, sin banderas ocultas.
  • Igual calentamiento descartado e igual ventana de medición por gateway.
  • Cada ejecución se valida por sus códigos de estado: todo lo que no sea 100 % HTTP 200 se descarta.
Resultados

Las cifras, exactamente como se midieron.

Dos columnas de Sluis: compuerta abierta, una comparación de proxy en igualdad de condiciones; compuerta cerrada, la sobrecarga de cumplimiento frente a nuestra propia línea base.

Medido el 2026-07-04 en un hardware idéntico (un solo Mac Apple Silicon, Docker) con 256 conexiones; una comparación relativa. Cada ejecución verificada al 100 % HTTP 200, con varianza entre ejecuciones inferior al 1 %. El RSS máximo no se capturó en esta ejecución, así que esa fila queda en TBD.
MétricaSluis compuerta abiertaSluis compuerta cerradaLiteLLMBifrost
Rendimiento (RPS)4,046
3,678
298
3,148
Latencia p50 (ms)62
63
743
80
Latencia p99 (ms)77
130
4,584
118
RSS máximo (MiB)TBD
TBD
TBD
TBD
Tasa de éxito100%
100%
100%
100%

La latencia se mide de extremo a extremo a través del gateway, sobre el mismo mock de latencia fija: las diferencias son la sobrecarga propia de los gateways.

La columna de compuerta cerrada es sobrecarga de cumplimiento frente a compuerta abierta, no un duelo.

Frente a un modelo real (con tasa limitada a 10 RPS para que el proveedor nunca estrangule), la compuerta no añade nada en la mediana: 305 ms cerrada frente a 304 ms abierta. Las colas p99 de ese carril pertenecen al proveedor, no a los gateways.

Una afirmación honesta, o ninguna.

Un benchmark en el que no se puede confiar es peor que ninguno; por eso fijamos las reglas antes de cualquier cifra.

  • La afirmación de «el más rápido» solo vale con compuerta abierta: Sluis como proxy simple frente a LiteLLM y Bifrost.
  • Compuerta cerrada es sobrecarga frente a nuestra línea base: un milisegundo en la mediana, un nueve por ciento de rendimiento, p99 de 130 ms frente a 77 ms.
  • El carril en vivo, con tasa limitada, no añade nada en la mediana; sus colas p99 son varianza del proveedor.
  • Si Sluis con compuerta abierta no es claramente más rápido, el titular pasa a «cumplimiento a coste insignificante».

Hecho para el regulador en la sala, no solo para la prueba de carga.

Lea cómo funciona el gateway y luego vea cómo se comporta la compuerta de cumplimiento.