Sign in Start free
Contrôle des coûts IA

Faites en sorte que chaque exécution d'agent d'IA compte.

Lematev se place entre vos agents et les fournisseurs de modèles. Il décide du modèle dont chaque appel a réellement besoin, refuse ceux qui ne mènent nulle part, et découpe la facture par agent et par tâche.

1 ligneà changer dans votre code
~10 minavant de voir vos propres chiffres
4ᵉ appelidentique, refusé — pas signalé
Sans carteOption auto-hébergée Compatible OpenAI

Une couche, au-dessus de tous

  • OpenAI
  • Anthropic
  • Google
  • Groq
  • Mistral
  • DeepSeek

Votre dépense, ce qu'elle aurait coûté sans nous, et ce que les économies coûtent en taux de complétion — par agent et par tâche. Chaque chiffre est calculé par le moteur à partir de votre propre trafic.

Qu'est-ce que le contrôle de coût pour agents IA ?

C'est piloter la dépense que crée un système agentique — appels d'outils, retries, boucles et tâches multi-étapes qui multiplient les requêtes de façon imprévisible. La plupart des outils lisent les données de facturation de votre fournisseur et vous alertent une fois l'argent parti. Lematev se place dans le chemin de la requête, ce qui lui permet de refuser un appel au lieu de le rapporter.

Le vocabulaire

Agent, modèle, tâche — trois choses différentes

On emploie ces mots l'un pour l'autre, et ça rend le coût impossible à discuter. Voici ce que chacun désigne.

model

Un modèle, c'est ce qui vous facture

GPT-5, Claude, llama-3.3 sur Groq. Vous lui envoyez du texte, il en renvoie, et il facture au token. Il n'a aucune mémoire de votre produit et aucune idée de la tâche dont il fait partie.

agent

Un agent, c'est votre code

La boucle que vous avez écrite, qui appelle un modèle plusieurs fois, utilise des outils et tente de finir un travail. « support-triage » est un agent. Votre fournisseur n'en a jamais entendu parler — et c'est exactement pour ça que votre facture ne peut pas vous dire ce qu'il coûte.

task

Une tâche, c'est une tentative sur un travail

Un ticket trié, un document extrait. Cela prend en général plusieurs appels au modèle. C'est la seule unité qui ait un sens pour votre métier, et la seule que personne ne mesure.

Alors Lematev contrôle quoi ?
La dépense modèle, pilotée au niveau de l'agent et de la tâche. L'argent part sur un appel au modèle ; la décision de savoir si cet appel valait le coup appartient à l'agent. Contrôler l'un sans voir l'autre, c'est pour ça que les factures d'IA paraissent aléatoires.
La différence

Basculez entre ce à quoi ressemble votre installation aujourd'hui et ce à quoi elle ressemble avec Lematev dans le chemin. Les chiffres des puces sortent du moteur.

Vos agents

Fournisseurs de modèles

Le problème

Votre fournisseur facture par clé. Vos coûts arrivent par agent.

Une ligne sur la facture pour douze agents. Personne dans l'entreprise ne peut dire lequel coûte quoi — c'est pour ça qu'une facture d'IA paraît aléatoire plutôt que chère.

Un retry qui n'aboutit jamais est indistinguable du trafic normal, jusqu'à l'arrivée de la facture.

Ce que votre fournisseur vous montre
Usage API — septembre$492.03
1 line · 12 agents · no attribution
Ce que Lematev vous montre
compliance-reviewer$149.35
code-reviewer$26.93
log-analyst$20.24
data-enricher$15.72
Chiffres par agent, calculés par le moteur.
La différence

Lire la facture, ou se mettre en travers

Les outils de coût se placent à deux endroits, et l'endroit décide de ce qu'ils peuvent faire face à un agent emballé.

Outils en lecture seuleLematev

La dernière ligne est à leur avantage, pas au nôtre. Si vous voulez seulement savoir, un outil en lecture seule vous demande moins. Si vous voulez que ça s'arrête, il faut bien que quelque chose soit en travers.

Comment ça marche

Trois étapes, environ dix minutes

1

Changez une ligne

Pointez votre client sur Lematev au lieu de votre fournisseur. Même forme de requête, même forme de réponse. Rien d'autre ne bouge dans votre code.

2

Nommez vos agents

Ajoutez un en-tête avec le nom de votre choix. C'est ce nom qui sert de regroupement dans le tableau de bord — aucune configuration par agent, aucune intégration à construire. Un agent apparaît dès son premier appel.

3

Déclarez ce qu'un échec vous coûte

« Un triage de ticket raté me coûte 3 € de traitement humain. » À partir de là, le routage suit l'arithmétique et non notre opinion.

python
# before
client = OpenAI(api_key=OPENAI_KEY)

# after
client = OpenAI(
    base_url="https://gw.lematev.dev/v1",
    api_key=LEMATEV_KEY,
)
Le routage

Pourquoi notre routage n'est pas juste « prends le modèle pas cher »

La plupart des routeurs choisissent le modèle le moins cher qui passe une barre de qualité. Nous avons construit ça d'abord et nous l'avons mesuré sur 41 364 appels d'agents : 2,2 % d'économies, en baisse semaine après semaine. Une barre traite tous les appels d'une exécution comme aussi critiques, et c'est faux — rater un appel d'outil coûte un retry, rater la réponse finale coûte la tâche entière.

Les modèles bon marché prennent le travail récupérable, les modèles forts le travail pivot, et la politique s'améliore à mesure que les preuves s'accumulent au lieu de s'effondrer sur un seul modèle. Sur la même charge : 42 % d'économies, 2,3 points de complétion cédés, 34 % de mieux sur le coût par tâche réussie.

Une vraie décision de routage
requestedopenai/gpt-5
routed toopenai/gpt-5-mini
expected cost$0.0080 vs $0.0153
Prise directement dans le moteur, reproduite telle quelle.
Un garde-fou qui se déclenche
identical_repeatstopped
prevented$58.77 / 30 d
La dépense évitée est affichée et jamais facturée.
La ventilation

Votre facture dit 4 218 $. Elle ne dit pas quel agent.

Une ligne par agent, et une colonne qui compte : le coût par tâche réussie. Un modèle bon marché qui échoue et repart en retry coûte plus cher qu’un seul appel premium qui aboutit.

Les badges rouges sont des exécutions que le garde-fou a arrêtées avant qu’elles ne dépensent davantage.

Pour qui

Conçu pour les équipes dont les agents sont déjà en production

Les chiffres

L’écart se creuse à mesure que le trafic grandit

Trente jours, les mêmes appels facturés deux fois : la ligne pointillée, c’est ce que le modèle déclaré aurait coûté ; la ligne pleine, ce que le routeur a réellement dépensé.

Dépense quotidienne, 30 jours
Modèle déclaré — 492 $ au total Routé par Lematev — 312 $ au total
Jour 1 Jour 30
La preuve

Comment vous savez que les économies sont réelles

Nous vous demandons de croire un chiffre que nous seuls pouvons calculer. Nous l'avons donc rendu vérifiable de trois façons différentes.

  • Il se réconcilie à l'écranL'économie affichée est égale à votre dépense de référence moins votre dépense réelle, sur la même page. Il existe un champ d'écart et un test qui échoue si ce chiffre bouge.
  • La méthodologie est publiéeRéférence = le modèle que vous avez déclaré, facturé sur les tokens que vous avez réellement envoyés. Nous retenons la longueur de sortie observée, ce qui sous-estime la référence puisque les modèles premium sont plus bavards — le chiffre est donc conservateur par construction.
  • Mesuré, pas modéliséUn échantillon de vos requêtes re-routées est rejoué sur votre modèle d'origine et les réponses sont comparées. Cela nous coûte de l'argent volontairement, et transforme « faites-nous confiance » en preuve que vous pouvez lire.
  • Nous excluons ce que nous ne pouvons pas défendreLe gaspillage évité en arrêtant un agent emballé est affiché mais jamais compté comme une économie. Les appels où votre propre code a forcé un modèle sont exclus entièrement — c'était votre décision, pas la nôtre.
Questions

Les questions qu'un CTO pose vraiment

Faites en sorte que chaque exécution d'agent d'IA compte.

Pas d’appel commercial, pas d’essai à demander. La passerelle demande une ligne.

Sans carteOption auto-hébergée Compatible OpenAI