Poids du modèle
Une quantification Q4 occupe beaucoup moins de place que le FP16. Les métadonnées et le format font toutefois qu’un poids « 4 bits » ne représente pas exactement 0,5 octet par paramètre.
La mémoire des modèles, simplement
La mémoire rapide doit accueillir les poids du modèle, le cache de contexte, le moteur d’inférence et une marge de sécurité. Ce guide relie les classes 8B, 14B, 32B et 70B à des capacités réalistes, sans confondre mémoire système, VRAM et mémoire unifiée.
La formule utile
Le nombre de paramètres n’est pas à lui seul une quantité de mémoire. La quantification réduit les poids, tandis que le contexte, les fonctions multimodales et les sessions simultanées ajoutent de nouvelles allocations.
Une quantification Q4 occupe beaucoup moins de place que le FP16. Les métadonnées et le format font toutefois qu’un poids « 4 bits » ne représente pas exactement 0,5 octet par paramètre.
Le cache KV conserve les informations du contexte courant. Il augmente avec la fenêtre de contexte, le nombre de conversations actives et l’architecture du modèle.
Ollama, LM Studio, llama.cpp et leurs backends utilisent des tampons de travail. Le niveau d’offloading GPU et certaines optimisations modifient le total.
Une configuration qui tient seulement sur le papier est fragile. Le système d’exploitation, l’affichage, le RAG et les autres services doivent conserver de l’espace.
Repères avec marge
Ces fourchettes correspondent approximativement à une quantification proche de Q4 et à une marge courante. Un très long contexte, un modèle MoE, la vision ou plusieurs utilisateurs peuvent demander davantage.
| Classe du modèle | Poids approximatifs | Classe de mémoire rapide raisonnable | Usages courants |
|---|---|---|---|
| 7B–8B | environ 5–6 Go | 12–16 Go | chat, résumé, assistants simples |
| 12B–14B | environ 8–10 Go | 16 Go | généralistes plus capables, code |
| 20B–32B | environ 14–22 Go | 24–32 Go | programmation, RAG, agents |
| 65B–70B | environ 40–45 Go | 64 Go au minimum, 96–128 Go plus confortables | qualité supérieure, tâches complexes |
| 100B–120B | environ 65–80 Go | 96–128 Go ou davantage | capacité professionnelle |
« Le modèle tient » ne signifie pas « le modèle est rapide ». La bande passante, le calcul, le moteur et la répartition de l’offloading déterminent le débit.
Choisir selon le modèle
Le bon GPU n’est pas nécessairement le plus cher. Il garde le modèle et son contexte dans une mémoire rapide et bénéficie d’une prise en charge fiable dans votre logiciel.
Adapté à de nombreux modèles 7B à 14B correctement quantifiés. La marge devient vite limitée pour la vision, les très longs contextes ou les modèles 20B et plus.
Chat et premiers assistants de codeUne classe solide pour des modèles 20B à 32B rapides. La RTX 5090 possède 32 Go de VRAM dédiée ; un 70B exige généralement une partie des calculs en RAM.
Code, RAG et agentsExaminer les PC RTX 5090Les mini-PC à mémoire unifiée et certaines stations spécialisées accueillent des modèles 70B quantifiés. La mémoire réservée au système et le backend restent déterminants.
Grands modèles et contexte longComparer les mini-PC IADeux voies mémoire
Elle est directement reliée à une carte graphique distincte. Sa forte bande passante favorise la vitesse tant que la charge complète y tient.
Le CPU et le GPU intégré partagent une grande réserve. Elle peut contenir un modèle plus volumineux, mais le système et les applications utilisent la même mémoire.
Questions fréquentes
Ils peuvent suffire à un petit modèle 7B ou 8B avec une quantification économe et un contexte modéré. La marge est toutefois faible pour la vision, les longs contextes ou les services parallèles.
Oui pour de nombreux modèles 7B à 14B. Un 32B, un encodeur d’images ou une longue fenêtre de contexte peuvent dépasser cette capacité.
La VRAM physique est normalement fixe. L’offloading vers la RAM peut lancer un modèle trop grand, mais au prix d’une baisse de vitesse. Une architecture à mémoire unifiée utilise une autre approche.
Souvent oui avec une forte quantification ou un offloading partiel. Le modèle ne réside alors pas entièrement dans la VRAM et le débit peut chuter sensiblement.
Non. Seules certaines architectures partagent une grande partie de cette réserve. Le système, le moteur et les applications conservent une part, et l’allocation maximale dépend du firmware et du pilote.
Pour les grands LLM locaux, la capacité de mémoire, sa bande passante et la compatibilité du backend comptent généralement davantage qu’un chiffre de TOPS NPU.
Passer de la mémoire au système
Le configurateur applique ces principes et explique chaque recommandation.