Presupuestos y caché
Límites de velocidad y presupuestos por clave, topes de organización y las dos cachés de respuesta.
Presupuestos y límites
Cada clave lleva límites de tasa (peticiones y tokens por minuto) y un presupuesto de gasto con un periodo: total, daily o monthly. Un límite agregado para toda la organización se sitúa por encima de cada clave.
La aplicación ocurre en la pasarela, en dinero real: cada petición se tarifica con el libro de precios en vivo y se descuenta antes de despachar. Superado el límite de tasa, la llamada devuelve 429; superado el presupuesto, 402. La petición nunca llega a un proveedor. Si los contadores llegan a ser inaccesibles, la comprobación falla en cerrado y se reconcilia con el registro de auditoría inmutable en lugar de adivinar.
# past the key's rate limit — the request never reaches a provider { "error": { "message": "rate limit exceeded for this key", "type": "rate_limit_error", "param": null, "code": "rate_limit_exceeded" } }
# budget reached or no active plan — activate a plan or raise the budget { "error": { "message": "spend budget reached for this key", "type": "insufficient_quota", "param": null, "code": "insufficient_quota" } }
Caché
Dos cachés de respuesta opcionales: exacta (una coincidencia de petición normalizada) y semántica (similitud vectorial con un umbral conservador). Ambas están estrictamente aisladas por organización, cifradas en reposo y requieren retención de contenido. Actívelas en la vista Cache de la Consola.
Cada fila de auditoría registra cómo se sirvió la llamada: none | exact | semantic.
# identical request twice — the second is served from the exact cache curl https://api.sluis.ai/v1/chat/completions \ -H "Authorization: Bearer $SLUIS_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }' # audit row of call #2: cache_hit: exact · no provider dispatch, no token cost