llama70b-prod

Llama 3.3 70B Instruct servi sur H100 ×2 par réplica, à Abidjan · Synertech Vallon. Facturé à l’heure de GPU, pas au jeton.

llama70b-prod

Llama 3.3 70B Instruct servi sur H100 ×2 par réplica, à Abidjan · Synertech Vallon.

Modèle servi
synelia/llama-3.3-70b-instruct
Matériel
H100 — 2 carte(s) par réplica
Réplicas
3 en service, entre 2 et 6
Site
Abidjan · Synertech Vallon
Mise en veille
Interdite — au moins un réplica reste chaud en permanence
Créé le
11 mars 2026
Coût horaire actuel
24 800 FCFA

Mise à l’échelle

Un réplica se réserve entier : les GPU ne se partagent pas à la demi-carte.

Réplicas minimum2 réplica(s)
Réplicas maximum6 réplica(s)

Autoriser la mise en veille

À zéro réplica, plus rien n’est facturé, mais la première requête attend 220 secondes le temps de charger les poids en mémoire vidéo. À éviter sur un chemin utilisateur.

Occupation observée

72 % en moyenne sur sept jours. La marge est correcte : assez de réserve pour absorber un pic, pas de carte payée pour rien.

Occupation des cartes

72.00 %SLA 80 %

GPU

68.00 %SLA 90 %

Mémoire vidéo

Inférence dédiée