Aller au contenu
100% exécutable hors-ligne
Rechercher…Réserver un auditAudit

Guide d'Inférence LLM Locale : vLLM, Ollama & DeepSeek R1

30 minvLLM 0.6+Ollama 0.4+NVIDIA CUDA 12 / ROCm / NPU

Le choix et le calibrage du moteur d’inférence délimitent la latence et le débit de requêtes qu’une infrastructure Yevi Core v1.0 (Licence MIT) peut soutenir en production.

Un mauvais moteur gaspille 70 % de la mémoire VRAM. Un moteur optimisé quadruple votre débit.

Ce guide couvre la configuration industrielle des deux moteurs d’inférence recommandés : vLLM (haute concurrence GPU, PagedAttention) et Ollama (postes locaux, NPU et Appliance basse consommation 35W).


1. Comparatif technique des moteurs d’inférence

Section intitulée « 1. Comparatif technique des moteurs d’inférence »
Critère d’évaluation vLLM (Moteur Haute Concurrence GPU) Ollama (Inférence Edge & NPU)
Cas d’usage cible Serveurs GPU dédiés, multi-utilisateurs Postes de travail, Appliance 35W, Mode hors-ligne
Optimisation mémoire PagedAttention, Continuous Dynamic Batching Quantification GGUF (Q4_K_M, Q8_0)
Performances de débit 200+ tokens/sec (Par carte GPU) 25 à 50 tokens/sec (Selon processeur NPU)
Modèles recommandés DeepSeek R1 Distill 14B/32B, Llama 3.3 70B AWQ Llama 3.3 8B, Qwen 2.5 7B, Mistral 7B

vLLM est le moteur de référence pour les cabinets et banques exigeant une latence minimale au premier token (TTFT < 300 ms) sous forte charge simultanée.

Fenêtre de terminal
pip install vllm

Lancement du serveur vLLM pour DeepSeek R1 (14B Distill)

Section intitulée « Lancement du serveur vLLM pour DeepSeek R1 (14B Distill) »
Fenêtre de terminal
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.90 \
--max-model-len 8192 \
--port 8000

Dans votre fichier yevi.config.yaml ou via les variables d’environnement :

llm:
provider: "vllm"
base_url: "http://localhost:8000/v1"
model_name: "deepseek-ai/DeepSeek-R1-Distill-Qwen-14B"
temperature: 0.1
max_tokens: 2048

3. Déploiement et configuration d’Ollama (GGUF / NPU)

Section intitulée « 3. Déploiement et configuration d’Ollama (GGUF / NPU) »

Ollama simplifie le déploiement sur les postes de travail locaux et sur l’Appliance physique YEVI-BOX (35W).

Téléchargement et lancement d’un modèle quantifié

Section intitulée « Téléchargement et lancement d’un modèle quantifié »
Fenêtre de terminal
# Lancement d'Ollama avec Llama 3.3 8B quantifié Q4
ollama run llama3.3:8b-instruct-q4_K_M
Fenêtre de terminal
yevi query "Synthétiser la clause de résiliation sous droit OHADA" --provider ollama

[!TIP] Optimisation VRAM avec AWQ et GGUF Pour faire tourner DeepSeek R1 14B sur une carte GPU grand public de 12 Go VRAM (RTX 4070/4080), activez la version quantifiée AWQ 4-bit (--quantization awq) pour diviser l’empreinte mémoire par 3,5 sans dégradation sémantique.


Prêt à sécuriser vos données avec l'IA ?

Ne laissez pas vos documents confidentiels sur des serveurs publics. Réservez un échange de 30 minutes avec nos experts pour évaluer la faisabilité d'un LLM Souverain dans votre infrastructure.

Planifier un Audit Gratuit
Projet IA Souveraine ?Audit Gratuit ➔