Inférence dédiée

La passerelle mutualise des GPU entre tous les clients : c’est le meilleur rapport coût-usage tant que la file reste courte. Un point de service dédié réserve des cartes pour vous seul — latence stable, débit garanti, facturé à l’heure de GPU et non au jeton.

Points de service

3

GPU réservés

11

H100, L40S, L40S

Coût horaire cumulé

35 600 FCFA

Les points en veille ne sont pas facturés

Occupation moyenne

45 %

Sous 30 %, une carte de moins suffirait

Réserver des GPU

Le modèle détermine la carte : un 70 milliards de paramètres ne tient pas dans 48 Go de mémoire vidéo.

Type de carte

Réplicas2 réplica(s)

Autoriser la mise en veille hors trafic

Estimé à 42 % du coût plein sur un profil de charge en heures ouvrées. Premier appel après une veille : une à trois minutes selon la taille du modèle.

Impact sur votre prochaine facture

  • L40S réservés × 22 réplica(s) × 5 400 FCFA l’heure3 265 920 FCFA
  • Stockage des poids du modèleRéplication sur les deux sites12 000 FCFA
Sous-total mensuel HT3 277 920 FCFA
TVA 18 %590 026 FCFA
Total mensuel TTC3 867 946 FCFA

Prorata du mois en cours : 1 622 042 FCFA, ajouté à votre prochaine facture. La facturation complète démarre au 1er du mois suivant.

Comparez avant de réserver

À 3 265 920 FCFA par mois, la réservation ne se rentabilise qu’au-delà d’environ 7 776 000 millions de jetons mensuels au tarif mutualisé. En dessous, la file partagée coûte moins cher — même si elle fait parfois attendre.