Guide d'Inférence LLM Locale : vLLM, Ollama & DeepSeek R1
Le choix et le calibrage du moteur d’inférence délimitent la latence et le débit de requêtes qu’une infrastructure Yevi Core v1.0 (Licence MIT) peut soutenir en production.
Un mauvais moteur gaspille 70 % de la mémoire VRAM. Un moteur optimisé quadruple votre débit.
Ce guide couvre la configuration industrielle des deux moteurs d’inférence recommandés : vLLM (haute concurrence GPU, PagedAttention) et Ollama (postes locaux, NPU et Appliance basse consommation 35W).
1. Comparatif technique des moteurs d’inférence
Section intitulée « 1. Comparatif technique des moteurs d’inférence »| Critère d’évaluation | vLLM (Moteur Haute Concurrence GPU) | Ollama (Inférence Edge & NPU) |
|---|---|---|
| Cas d’usage cible | Serveurs GPU dédiés, multi-utilisateurs | Postes de travail, Appliance 35W, Mode hors-ligne |
| Optimisation mémoire | PagedAttention, Continuous Dynamic Batching | Quantification GGUF (Q4_K_M, Q8_0) |
| Performances de débit | 200+ tokens/sec (Par carte GPU) | 25 à 50 tokens/sec (Selon processeur NPU) |
| Modèles recommandés | DeepSeek R1 Distill 14B/32B, Llama 3.3 70B AWQ | Llama 3.3 8B, Qwen 2.5 7B, Mistral 7B |
2. Déploiement et configuration de vLLM
Section intitulée « 2. Déploiement et configuration de vLLM »vLLM est le moteur de référence pour les cabinets et banques exigeant une latence minimale au premier token (TTFT < 300 ms) sous forte charge simultanée.
Installation avec support CUDA 12
Section intitulée « Installation avec support CUDA 12 »pip install vllmLancement du serveur vLLM pour DeepSeek R1 (14B Distill)
Section intitulée « Lancement du serveur vLLM pour DeepSeek R1 (14B Distill) »python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \ --tensor-parallel-size 1 \ --gpu-memory-utilization 0.90 \ --max-model-len 8192 \ --port 8000Intégration dans Yevi Core v1.0
Section intitulée « Intégration dans Yevi Core v1.0 »Dans votre fichier yevi.config.yaml ou via les variables d’environnement :
llm: provider: "vllm" base_url: "http://localhost:8000/v1" model_name: "deepseek-ai/DeepSeek-R1-Distill-Qwen-14B" temperature: 0.1 max_tokens: 20483. Déploiement et configuration d’Ollama (GGUF / NPU)
Section intitulée « 3. Déploiement et configuration d’Ollama (GGUF / NPU) »Ollama simplifie le déploiement sur les postes de travail locaux et sur l’Appliance physique YEVI-BOX (35W).
Téléchargement et lancement d’un modèle quantifié
Section intitulée « Téléchargement et lancement d’un modèle quantifié »# Lancement d'Ollama avec Llama 3.3 8B quantifié Q4ollama run llama3.3:8b-instruct-q4_K_MInterrogation via la CLI Yevi
Section intitulée « Interrogation via la CLI Yevi »yevi query "Synthétiser la clause de résiliation sous droit OHADA" --provider ollama[!TIP] Optimisation VRAM avec AWQ et GGUF Pour faire tourner DeepSeek R1 14B sur une carte GPU grand public de 12 Go VRAM (RTX 4070/4080), activez la version quantifiée AWQ 4-bit (
--quantization awq) pour diviser l’empreinte mémoire par 3,5 sans dégradation sémantique.
💻 Ressources & prochaines étapes
Section intitulée « 💻 Ressources & prochaines étapes »Prêt à sécuriser vos données avec l'IA ?
Ne laissez pas vos documents confidentiels sur des serveurs publics. Réservez un échange de 30 minutes avec nos experts pour évaluer la faisabilité d'un LLM Souverain dans votre infrastructure.
Planifier un Audit Gratuit