La mémoire des modèles, simplement

Quelle carte graphique et combien de VRAM pour un LLM local ?

La mémoire rapide doit accueillir les poids du modèle, le cache de contexte, le moteur d’inférence et une marge de sécurité. Ce guide relie les classes 8B, 14B, 32B et 70B à des capacités réalistes, sans confondre mémoire système, VRAM et mémoire unifiée.

La formule utile

Poids + cache KV + moteur + marge

Le nombre de paramètres n’est pas à lui seul une quantité de mémoire. La quantification réduit les poids, tandis que le contexte, les fonctions multimodales et les sessions simultanées ajoutent de nouvelles allocations.

Poidsparamètres × quantificationCache KVcontexte × architectureMoteurtampons et backendMargesystème et autres outils

Poids du modèle

Une quantification Q4 occupe beaucoup moins de place que le FP16. Les métadonnées et le format font toutefois qu’un poids « 4 bits » ne représente pas exactement 0,5 octet par paramètre.

Cache de contexte

Le cache KV conserve les informations du contexte courant. Il augmente avec la fenêtre de contexte, le nombre de conversations actives et l’architecture du modèle.

Moteur d’inférence

Ollama, LM Studio, llama.cpp et leurs backends utilisent des tampons de travail. Le niveau d’offloading GPU et certaines optimisations modifient le total.

Marge pratique

Une configuration qui tient seulement sur le papier est fragile. Le système d’exploitation, l’affichage, le RAG et les autres services doivent conserver de l’espace.

Repères avec marge

Besoins typiques des modèles de texte quantifiés

Ces fourchettes correspondent approximativement à une quantification proche de Q4 et à une marge courante. Un très long contexte, un modèle MoE, la vision ou plusieurs utilisateurs peuvent demander davantage.

Classe du modèlePoids approximatifsClasse de mémoire rapide raisonnableUsages courants
7B–8Benviron 5–6 Go12–16 Gochat, résumé, assistants simples
12B–14Benviron 8–10 Go16 Gogénéralistes plus capables, code
20B–32Benviron 14–22 Go24–32 Goprogrammation, RAG, agents
65B–70Benviron 40–45 Go64 Go au minimum, 96–128 Go plus confortablesqualité supérieure, tâches complexes
100B–120Benviron 65–80 Go96–128 Go ou davantagecapacité professionnelle

« Le modèle tient » ne signifie pas « le modèle est rapide ». La bande passante, le calcul, le moteur et la répartition de l’offloading déterminent le débit.

Choisir selon le modèle

Quel GPU choisir pour une IA locale ?

Le bon GPU n’est pas nécessairement le plus cher. Il garde le modèle et son contexte dans une mémoire rapide et bénéficie d’une prise en charge fiable dans votre logiciel.

12–16 Go : entrée pratique

Adapté à de nombreux modèles 7B à 14B correctement quantifiés. La marge devient vite limitée pour la vision, les très longs contextes ou les modèles 20B et plus.

Chat et premiers assistants de code

24–32 Go : priorité à la vitesse

Une classe solide pour des modèles 20B à 32B rapides. La RTX 5090 possède 32 Go de VRAM dédiée ; un 70B exige généralement une partie des calculs en RAM.

Code, RAG et agentsExaminer les PC RTX 5090

64–128 Go : priorité à la capacité

Les mini-PC à mémoire unifiée et certaines stations spécialisées accueillent des modèles 70B quantifiés. La mémoire réservée au système et le backend restent déterminants.

Grands modèles et contexte longComparer les mini-PC IA

Deux voies mémoire

VRAM dédiée et mémoire unifiée ne sont pas équivalentes

VRAM dédiée

Elle est directement reliée à une carte graphique distincte. Sa forte bande passante favorise la vitesse tant que la charge complète y tient.

  • excellent débit d’inférence
  • capacité fixe et facile à identifier
  • offloading en RAM souvent beaucoup plus lent

Mémoire unifiée

Le CPU et le GPU intégré partagent une grande réserve. Elle peut contenir un modèle plus volumineux, mais le système et les applications utilisent la même mémoire.

  • 64 à 128 Go dans un format compact
  • allocation UMA ou VGM à vérifier
  • bande passante inférieure aux gros GPU dédiés

Questions fréquentes

Éviter les erreurs de dimensionnement

8 Go de VRAM suffisent-ils pour une IA locale ?

Ils peuvent suffire à un petit modèle 7B ou 8B avec une quantification économe et un contexte modéré. La marge est toutefois faible pour la vision, les longs contextes ou les services parallèles.

16 Go de VRAM suffisent-ils pour un LLM local ?

Oui pour de nombreux modèles 7B à 14B. Un 32B, un encodeur d’images ou une longue fenêtre de contexte peuvent dépasser cette capacité.

Peut-on augmenter la VRAM d’une carte graphique ?

La VRAM physique est normalement fixe. L’offloading vers la RAM peut lancer un modèle trop grand, mais au prix d’une baisse de vitesse. Une architecture à mémoire unifiée utilise une autre approche.

Peut-on lancer un 70B avec 32 Go de VRAM ?

Souvent oui avec une forte quantification ou un offloading partiel. Le modèle ne réside alors pas entièrement dans la VRAM et le débit peut chuter sensiblement.

128 Go de RAM signifient-ils 128 Go pour le GPU ?

Non. Seules certaines architectures partagent une grande partie de cette réserve. Le système, le moteur et les applications conservent une part, et l’allocation maximale dépend du firmware et du pilote.

Une NPU est-elle indispensable ?

Pour les grands LLM locaux, la capacité de mémoire, sa bande passante et la compatibilité du backend comptent généralement davantage qu’un chiffre de TOPS NPU.

Passer de la mémoire au système

Calculez la classe adaptée à votre modèle et à son contexte

Le configurateur applique ces principes et explique chaque recommandation.

Lancer le configurateur