Budgets & Caching
Rate-Limits und Budgets pro Schlüssel, Organisations-Obergrenzen und die beiden Antwort-Caches.
Budgets & Limits
Jeder Key trägt Rate-Limits (Requests und Tokens pro Minute) und ein Ausgabenbudget mit einem Zeitraum: total, daily oder monthly. Eine organisationsweite Gesamtobergrenze steht über jedem Key.
Die Durchsetzung erfolgt am Gateway, in echtem Geld: jede Anfrage wird anhand des Live-Preisbuchs bepreist und vor dem Versand abgebucht. Über dem Rate-Limit gibt der Aufruf 429 zurück; über dem Budget 402. Die Anfrage erreicht nie einen Anbieter. Sind die Zähler einmal nicht erreichbar, schlägt die Prüfung nach dem Fail-closed-Prinzip fehl und gleicht sich mit dem unveränderlichen Audit-Register ab, statt zu raten.
# past the key's rate limit — the request never reaches a provider { "error": { "message": "rate limit exceeded for this key", "type": "rate_limit_error", "param": null, "code": "rate_limit_exceeded" } }
# budget reached or no active plan — activate a plan or raise the budget { "error": { "message": "spend budget reached for this key", "type": "insufficient_quota", "param": null, "code": "insufficient_quota" } }
Caching
Zwei optionale Response-Caches: exakt (Treffer bei normalisiertem Request) und semantisch (Vektorähnlichkeit mit konservativem Schwellenwert). Beide sind streng pro Organisation isoliert, im Ruhezustand verschlüsselt und setzen Inhaltsaufbewahrung voraus. Aktivieren Sie sie in der Cache-Ansicht der Console.
Jede Audit-Zeile hält fest, wie der Aufruf bedient wurde: none | exact | semantic.
# identical request twice — the second is served from the exact cache curl https://api.sluis.ai/v1/chat/completions \ -H "Authorization: Bearer $SLUIS_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }' # audit row of call #2: cache_hit: exact · no provider dispatch, no token cost