De quoi a besoin votre serveur ?

CLEVYA installe chez vous une équipe d'agents IA, un par collaborateur. Vos données ne quittent pas votre serveur : les informations sensibles (noms, montants, IBAN) sont remplacées par des codes en local avant le moindre appel à une IA externe. Cette page montre les ressources estimées pour héberger vos agents, d'une PME de cinq personnes à un groupe de plusieurs centaines.

Paliers de dimensionnement

Estimations pour des agents enregistrés sur une instance. Vous branchez votre propre abonnement IA (Anthropic, OpenAI, Mistral, Gemini...), on ne revend pas de tokens (BYOAK). Ce sont des points de départ que nous affinons avec vous selon votre usage réel.

Agents
Processeur
Mémoire
Disque
50 agents
2 à 4 vCPU
8 Go RAM
40 Go SSD
500 agents
4 à 8 vCPU
16 à 32 Go RAM
100 Go SSD
jusqu'à 1 000 agents
8 à 16 vCPU
64 Go RAM
250 Go SSD

Estimations d'ingénierie, en cours de validation par nos propres tests de charge. La mémoire grimpe surtout avec la mémoire sémantique de chaque agent (vos données vectorielles) : un poste que nous ajustons ensemble.

Agents enregistrés ou agents qui travaillent en même temps ?

C'est la vraie question, et elle est honnête : avoir mille agents qui existent coûte peu. Ce qui compte, c'est combien raisonnent à la même seconde.

Agents enregistrés

Vos agents existent, gardent leur mémoire et attendent. Au repos, ils consomment très peu : quelques mégaoctets pour mille connexions. Un serveur modeste suffit.

Agents actifs en même temps

Quand un agent raisonne, il appelle un modèle IA. Le nombre d'agents simultanés dépend d'abord de votre forfait chez votre fournisseur IA, pas de la taille de votre serveur.

Le vrai plafond : votre forfait IA, pas votre serveur

En modèle BYOAK, vous branchez la clé du LLM de votre choix (Anthropic, OpenAI, Mistral, Gemini... ou un modèle 100 % local). Votre fournisseur limite le nombre d'appels par minute selon votre forfait. C'est ce qui borne combien d'agents travaillent en parallèle, bien avant votre matériel. Et c'est vous qui pilotez ce curseur.

Vous payez vos tokens
En direct chez votre fournisseur IA. CLEVYA ne prend aucune marge sur votre consommation. La facture dépend de votre usage : un agent peut faire quelques échanges ou plusieurs centaines par jour.
Vous montez le curseur
Plus d'agents actifs en même temps = un forfait IA un peu plus gros chez votre fournisseur. C'est un choix de budget, rien à débloquer côté CLEVYA.
Vous répartissez
CLEVYA est multi-fournisseur : vos agents peuvent se répartir entre plusieurs providers pour augmenter le débit total.
Comment marche le débit chez Anthropic Le palier monte avec le crédit consommé, beaucoup l'ignorent

Votre débit d'appels par minute dépend d'un palier qui monte automatiquement avec le crédit que vous avez déjà consommé. Ce n'est pas un abonnement en plus, c'est du crédit qui paie vos tokens et qui débloque mécaniquement plus de débit. Voici les repères publics pour le modèle léger (juin 2026).

Palier
Crédit consommé pour l'atteindre
Appels par minute
Palier 1
5 $
50 / min
Palier 2
40 $
1 000 / min
Palier 3
200 $
2 000 / min
Palier 4
400 $
4 000 / min

Concrètement, dès 40 $ de crédit consommé, votre débit passe de 50 à 1 000 appels par minute, de quoi faire travailler beaucoup d'agents en parallèle. CLEVYA lit votre palier chez le fournisseur et cale sa file d'attente juste en dessous, pour éviter de taper le plafond et de voir vos appels rejetés. Vous gardez la main : un réglage dans l'administration ajuste cette marge, ou plafonne plus bas si vous voulez réserver du débit à d'autres usages de votre clé. Ces repères Anthropic sont donnés à titre indicatif (ils peuvent évoluer), et les autres fournisseurs ont leurs propres paliers, que vous pouvez cumuler en répartissant vos agents.

Combien ça coûte vraiment ? On l'a mesuré.

Nous avons mesuré une journée complète d'agent sur de vrais appels (API Anthropic, juin 2026), pas une décision isolée. Voici le coût par jour et par agent selon l'intensité d'usage et le modèle choisi.

Profil d'agent / jour
Modèle léger (Haiku)
Haut de gamme (Sonnet)
Léger
~2,5 ct / jour
~5,5 ct / jour
Standard
~5,8 ct / jour
~15,8 ct / jour
Intensif
~13,8 ct / jour
~31,2 ct / jour

Ce que contient une journée mesurée, par intensité d'usage (un « tour » = un message de l'employé et la réponse de son agent) : profil léger = 15 tours de discussion, 2 décisions, 1 échange entre agents, 1 document lu ; standard = 40 tours, 4 décisions, 3 échanges, 2 documents ; intensif = 100 tours (un collaborateur qui sollicite son agent en continu toute la journée), 10 décisions, 10 échanges, 6 documents. Les décisions à risque sont recoupées trois fois plutôt qu'une, ce qui coûte un peu plus mais fiabilise (voir la page fiabilité). Ces montants sont une moyenne volontairement prudente (légèrement majorée), pour que vous puissiez budgéter sans mauvaise surprise : un agent inactif un jour ne consomme rien, et vous dosez le modèle agent par agent. Concrètement, une équipe de 20 personnes en usage standard sur Haiku, c'est de l'ordre de 1,20 € de tokens par jour pour toute la boîte, payés en direct à votre fournisseur.

Pourquoi le coût reste maîtrisé même sur de longues conversations : à chaque message, tout l'historique de l'échange est habituellement renvoyé au modèle, ce qui ferait grimper la facture et nuirait à la fiabilité (un contexte trop long fait dériver l'IA). CLEVYA garde vos consignes mot pour mot et résume le reste, qu'il archive hors-ligne et relit au besoin. Sur une longue conversation (mesuré : une centaine d'allers-retours), cette compaction divise la consommation par deux (−54 % sur le modèle léger, −58 % sur le modèle haut de gamme dans nos mesures), tout en gardant l'agent fidèle à ce que vous lui avez demandé.

Mesuré au tarif public Anthropic de juin 2026 (Haiku 1 $/5 $, Sonnet 3 $/15 $ par million de jetons, susceptible d'évoluer). Le chef d'orchestre qui supervise la flotte tourne sur un modèle haut de gamme et s'ajoute à ce coût. Tokens payés en direct à votre fournisseur, sans marge CLEVYA. La mise en cache et le traitement de nuit groupé réduisent encore la facture.

100 % chez vous : VPS + Ollama, sans aucun fournisseur externe

Vous voulez zéro dépendance et zéro limite d'appels externe ? Installez CLEVYA sur un simple VPS et faites tourner un modèle local avec Ollama. Vos agents raisonnent alors entièrement sur votre machine.

Un VPS suffit pour démarrer

Pas besoin d'un cluster. Un serveur dédié ou un VPS chez votre hébergeur, Docker Compose, et la stack CLEVYA tourne. Sauvegardes et mises à jour incluses.

Ollama local : l'option sans facture de tokens

Avec un modèle local (Ollama), aucun appel externe et aucun token facturé. C'est une option avancée : un modèle local est moins puissant qu'un grand modèle cloud comme Claude. Un modèle comme Qwen3 8B tourne sur un VPS sans GPU (environ 50 €/mois) à un rythme adapté aux tâches de fond ; pour de l'interactif rapide, prévoyez un GPU. On vous aide à dimensionner.

Cloud rapide, local pour le sensible : mélangez les deux

Par défaut, nous recommandons un modèle cloud comme Claude Haiku : meilleure performance, coût très faible. Pour les données qui ne doivent jamais sortir, basculez ces agents-là en local. Souvent, le bon choix est un mélange des deux selon la sensibilité de chaque donnée.

Quel matériel pour le modèle en local ? Si vous faites tourner l'IA chez vous avec Ollama

Important à distinguer : les paliers en haut de page dimensionnent la plateforme CLEVYA en mode cloud (l'IA tourne chez votre fournisseur). Si vous faites tourner le modèle IA chez vous avec Ollama, il faut ajouter la puissance pour le modèle lui-même. Cette partie est à votre charge, et nous vous aidons à la dimensionner.

Matériel
Modèle local
Mémoire requise
Vitesse indicative
VPS / serveur sans carte graphique
Modèle léger (7 à 8 milliards de paramètres)
8 à 16 Go de RAM dédiés au modèle
4 à 10 mots par seconde : pour le travail de fond
Serveur avec carte graphique grand public
Modèle léger à moyen
16 à 24 Go de mémoire graphique
environ 70 mots par seconde : confortable, interactif
Carte graphique professionnelle (datacenter)
Modèle léger à grand
40 à 80 Go de mémoire graphique
150 mots par seconde et plus : temps réel

Ordres de grandeur issus de benchmarks publics 2026 (Ollama, retours de la communauté llama.cpp), à confirmer selon le modèle et la quantification choisis. La règle simple : sans carte graphique, l'IA locale convient au travail de fond (résumer, classer, extraire) ; pour des réponses instantanées, une carte graphique est nécessaire. Le dimensionnement de cette partie IA dépend de vos modèles et de votre volume : nous le cadrons avec vous.

Transparence sur la performance locale

Nos mesures de performance ont été réalisées avec les modèles Claude (Anthropic, en cloud). En local, la vitesse dépend entièrement de votre matériel et peut être lente, parfois plusieurs dizaines de secondes par réponse sur un serveur sans carte graphique. Nous ne nous engageons pas sur la performance d'un modèle local : c'est une option de souveraineté, à réserver au travail de fond, et à valider sur votre propre matériel. Le cloud reste notre recommandation pour la rapidité et la performance.

On dimensionne votre installation ensemble