La plupart des guides de déploiement de modèles de langage (LLM) reposent sur une hypothèse implicite : connexion fibre optique permanente, datacenters à proximité immédiate et GPU NVIDIA professionnels au coût astronomique.
Cette hypothèse est déconnectée du terrain.
Pour une entreprise, une banque ou une administration basée à Ouagadougou, Bamako, Cotonou, Douala ou sur des sites industriels et maritimes isolés, la réalité est tout autre : délestages électriques, coupures de câbles sous-marins internationaux, surcoût du fret matériel et bande passante satellitaire saturée.
Dans ce guide d’ingénierie, nous présentons l’architecture Yevi Core v1.0 Edge & Off-Grid : une solution éprouvée pour fonctionner sur Appliance basse consommation (35 Watts) ou serveurs CPU quantifiés sans connexion Internet.
1. La quantification GGUF : 8B de paramètres sur une carte 35W
Section intitulée « 1. La quantification GGUF : 8B de paramètres sur une carte 35W »La tentation est souvent de viser des clusters multi-GPU très gourmands. Dans un environnement à ressources contraintes, c’est l’erreur classique qui conduit à l’arrêt des opérations au premier délestage.
graph LR ModelFP16["Modèle Llama 3.3 (16-bit / 32GB VRAM)"] --> QuantEngine["Quantification GGUF Q4_K_M (Yevi Engine)"] QuantEngine --> EdgeAppliance["Appliance YEVI-BOX (4-bit / 8GB VRAM / 35 Watts)"] EdgeAppliance --> LocalRAG["RAG In-Situ 100% Autonome Hors-Ligne"]- Quantification GGUF 4-bit (Q4_K_M) : Divise par 4 les besoins en mémoire VRAM sans perte perceptible sur les tâches d’extraction contractuelle et d’analyse documentaire (Modèles open source 2026).
- Inférence sur NPU / CPU / GPU grand public : Un modèle 8B quantifié atteint plus de 25 tokens/seconde sur une carte NPU basse consommation gérée par notre moteur d’hébergement local en entreprise.
- Alimentation sur onduleur ou panneau solaire : Consommant moins de 50W au total, l’Appliance YEVI-BOX tourne sans interruption même lors de coupures réseau prolongées en zone UEMOA.
[!NOTE] Le coût énergétique d’un cluster GPU classique peut dépasser 400 000 XOF/mois en Afrique subsaharienne. L’architecture 35W de Yevi réduit cette dépense à une fraction négligeable.
2. Zéro dépendance à la bande passante internationale
Section intitulée « 2. Zéro dépendance à la bande passante internationale »Les architectures cloud SaaS s’effondrent dès qu’un câble sous-marin (WACS, ACE, SAT-3) subit une rupture technique. Vos équipes se retrouvent au chômage technique.
Grâce à l’approche Zero Cloud Leak de Yevi Core v1.0 :
- Base vectorielle locale (ChromaDB) : Indexation sémantique et recherche hybride BM25 + Dense s’exécutent intégralement sur le stockage local NVMe.
- Privacy Vault en RAM : Le module Privacy Vault anonymise les données nominatives en mémoire vive sans requérir d’API externe.
- Fonctionnement Air-Gapped à 100 % : L’assistant documentaire répond instantanément en réseau local (LAN), que le pays soit connecté au reste du monde ou non.
3. Exemple de déploiement CLI Yevi sur serveur limité
Section intitulée « 3. Exemple de déploiement CLI Yevi sur serveur limité »# Lancement du moteur Yevi avec modèle 8B quantifié GGUF Q4yevi serve --model llama3.3-8b-instruct-q4.gguf --threads 4 --ram-limit 8GB
# Ingestion locale sans aucun flux sortantyevi ingest ./rapports_locaux --chunk-size 256