SDK npm · OpenAI · Anthropic · Mammouth

Arrête de
cramer ton
budget IA.

APIGuard met tes réponses en cache et route les requêtes simples vers des modèles 30× moins chers. Puis il t'affiche un seul chiffre : ce que tu as économisé.

// 3 lignes. Tes clés ne quittent jamais ton code. import { OptimizedClient } from "apiguard-sdk"; const ia = new OptimizedClient({ provider: "openai", cache: { enabled: true } }); await ia.chat({ messages, model: "gpt-4o" }); // routé, mis en cache, tracké

npm i apiguard-sdk · gratuit jusqu'à 10 000 requêtes/mois

coût cumulé · l'écart = tes € économisés
Économisé ce mois
0,00
−97% sur le routing
Pas un proxy./ Tes clés API restent dans ton code/ Zéro infra à déployer/ Le tracking ne bloque jamais tes appels

Comment ça marche

Trois leviers. Une facture allégée.

Rien à héberger, rien à maintenir. Tu remplaces ton client IA par le nôtre, le reste est automatique.

01 · CACHE

La même question deux fois ?

Tu la paies une fois. Une réponse déjà connue ressort du cache (mémoire ou Redis) en 1 ms, sans rappeler l'API.

réponse en cache = 0 €
02 · ROUTING

Chaque requête sur le bon modèle.

« Traduis ce mot » n'a pas besoin de Claude Opus. Des règles simples envoient les requêtes triviales vers un modèle bien moins cher.

jusqu'à −97%
03 · DASHBOARD

Le gros chiffre vert.

Les autres te montrent ce que tu dépenses. APIGuard te montre ce que tu économises — par jour, par modèle, par feature.

ce que tu gardes

La preuve, pas le pitch

Sur une grosse requête, ça se compte en euros.

Une vraie conversation de plusieurs centaines de messages — ~150 000 tokens de contexte — envoyée à un modèle premium. C'est là que ta facture se joue, pas sur des fractions de centime.

1 grosse requête · conversation ~300 messages (≈150K tokens) · Claude Fable 5
Sans optimisation · Fable 5 (premium)$1.70
Routée vers Claude Sonnet$0.51
Question déjà posée · servie par le cache$0.00
Sur cette requête−70% à −100%

Tu décides quand une réponse peut partir sur un modèle capable moins cher (−70%), et une question déjà posée ressort du cache (−100%). Sur du volume, ces euros s'empilent vite.

1 000 grosses requêtes / mois · exemple
Sans APIGuard≈ $1 700
100%
Avec APIGuard≈ $510
30% ≈ $1 190 économisés

Exemple sur du volume premium. La baisse réelle (60 à 90%) dépend de ta part de requêtes routables et répétées. Tu paies toujours quelque chose — juste beaucoup moins. Ton chiffre exact s'affiche dans le dashboard.

Pourquoi pas un autre

Les gateways voient tes clés. Pas nous.

  APIGuard Portkey Helicone Cloudflare AI LiteLLM
Montre ce que tu économisesOuiNonNonNonNon
Pas un proxy — tes clés restent chez toiOuiNonNonNonOui
3 lignes · zéro infraOui~OuiOuiNon
Prix public et simpleOuiNon~OuiOui
Supporte Mammouth.aiOuiNonNonNonNon

Prix

L'outil se paie tout seul. Ou tu ne paies pas.

Free
0 € / mois
  • 10 000 requêtes / mois
  • Cache mémoire + routing
  • Dashboard économies
  • 7 jours de rétention
Créer un compte
Pro
9 € / mois
  • 250 000 requêtes / mois
  • Cache Redis + règles avancées
  • 90 jours de rétention
  • Alertes de budget
Passer Pro

Si ton chiffre vert dépasse 9 €, le Pro est déjà rentabilisé. Sinon, reste sur Free — c'est le principe.

Questions directes

FAQ

C'est un proxy ? Mes prompts passent chez vous ?
Non. APIGuard est un SDK qui tourne dans ton code. Tes appels vont directement chez OpenAI/Anthropic avec tes clés — elles ne transitent jamais par nos serveurs. On ne reçoit que des métriques anonymes (coût, modèle, cache hit) pour ton dashboard.
Ça marche avec quels providers ?
OpenAI, Anthropic (Claude) et Mammouth.ai aujourd'hui. L'architecture est extensible — d'autres providers arrivent. C'est d'ailleurs le seul outil du marché à supporter Mammouth.
Le routing peut dégrader la qualité de mes réponses ?
Tu écris les règles. Une requête ne part sur un modèle moins cher que si tu l'as décidé (longueur, mots-clés). Chaque décision est loggée dans le dashboard, avec la raison. Rien n'est automatique dans ton dos.
Et si le tracking tombe en panne ?
Il est en « fire-and-forget » : l'envoi des métriques ne bloque jamais et ne casse jamais ton appel IA. Backend éteint = tes appels fonctionnent quand même, tu perds juste les stats de la période.
Combien je vais vraiment économiser ?
Ça dépend de ton trafic. Sur des workloads mixtes, cache + routing réduisent la facture de 60 à 90%. Tu paies toujours quelque chose — mais beaucoup moins. Le dashboard te donne le chiffre exact pour TON app, pas une promesse marketing.

Dernière ligne

Ta prochaine facture IA
peut être 3× plus petite.

Installer le SDK — gratuit →