llama70b-prod
Llama 3.3 70B Instruct servi sur H100 ×2 par réplica, à Abidjan · Synertech Vallon. Facturé à l’heure de GPU, pas au jeton.
llama70b-prod
Llama 3.3 70B Instruct servi sur H100 ×2 par réplica, à Abidjan · Synertech Vallon.
- Modèle servi
- synelia/llama-3.3-70b-instruct
- Matériel
- H100 — 2 carte(s) par réplica
- Réplicas
- 3 en service, entre 2 et 6
- Site
- Abidjan · Synertech Vallon
- Mise en veille
- Interdite — au moins un réplica reste chaud en permanence
- Créé le
- 11 mars 2026
- Coût horaire actuel
- 24 800 FCFA
Mise à l’échelle
Un réplica se réserve entier : les GPU ne se partagent pas à la demi-carte.
Réplicas minimum2 réplica(s)
Réplicas maximum6 réplica(s)
Autoriser la mise en veille
À zéro réplica, plus rien n’est facturé, mais la première requête attend 220 secondes le temps de charger les poids en mémoire vidéo. À éviter sur un chemin utilisateur.
Occupation observée
72 % en moyenne sur sept jours. La marge est correcte : assez de réserve pour absorber un pic, pas de carte payée pour rien.
Occupation des cartes
72.00 %SLA 80 %
GPU
68.00 %SLA 90 %
Mémoire vidéo