Pesi del modello
Una quantizzazione Q4 usa molto meno spazio del formato FP16. Metadati e formato fanno però sì che “4 bit” non equivalga esattamente a 0,5 byte per parametro.
La memoria dei modelli, spiegata bene
La memoria veloce deve contenere pesi del modello, cache del contesto, runtime e un margine di sicurezza. Questa guida collega le classi 8B, 14B, 32B e 70B a capacità realistiche, distinguendo RAM, VRAM e memoria unificata.
La formula utile
Il numero di parametri non equivale direttamente alla memoria occupata. La quantizzazione riduce i pesi, mentre contesto lungo, funzioni multimodali e sessioni parallele aggiungono altre allocazioni.
Una quantizzazione Q4 usa molto meno spazio del formato FP16. Metadati e formato fanno però sì che “4 bit” non equivalga esattamente a 0,5 byte per parametro.
La cache KV conserva le informazioni del contesto corrente. Cresce con la finestra, le conversazioni attive e l’architettura del modello.
Ollama, LM Studio e llama.cpp usano buffer di lavoro. Il backend GPU e il livello di offloading modificano il totale.
Una configurazione che entra solo sulla carta è fragile. Sistema operativo, desktop, RAG e altri servizi devono conservare spazio.
Valori con margine
Le fasce ipotizzano una quantizzazione vicina a Q4 e un margine comune. Contesti molto lunghi, modelli MoE, visione o più utenti possono richiedere di più.
| Classe del modello | Pesi indicativi | Memoria veloce ragionevole | Impieghi comuni |
|---|---|---|---|
| 7B–8B | circa 5–6 GB | 12–16 GB | chat, riassunti, assistenti semplici |
| 12B–14B | circa 8–10 GB | 16 GB | modelli generalisti e codice |
| 20B–32B | circa 14–22 GB | 24–32 GB | programmazione, RAG, agenti |
| 65B–70B | circa 40–45 GB | 64 GB minimi; 96–128 GB più comodi | compiti complessi e qualità maggiore |
| 100B–120B | circa 65–80 GB | 96–128 GB o più | carichi professionali |
“Il modello entra” non significa “il modello è veloce”. Larghezza di banda, potenza di calcolo, runtime e offloading determinano il throughput.
Scegliere per dimensione
La GPU giusta non è necessariamente la più costosa: deve contenere modello e contesto in memoria veloce ed essere supportata in modo affidabile dal software scelto.
Adatti a molti 7B–14B quantizzati. Il margine si riduce con visione, contesti lunghi o modelli più grandi.
Chat e primi assistenti di codiceUna classe solida per 20B–32B veloci. La RTX 5090 offre 32 GB dedicati; un 70B richiede in genere offloading.
Codice, RAG e agentiEsamina i PC RTX 5090Mini PC a memoria unificata e sistemi specializzati possono contenere 70B quantizzati. Restano decisivi il margine di sistema e il backend.
Grandi modelli e contesto lungoConfronta i mini PC AIDue architetture di memoria
È collegata direttamente a una scheda grafica distinta. L’elevata larghezza di banda favorisce la velocità finché tutto il carico entra.
CPU e GPU integrata condividono una grande riserva. Può contenere un modello più voluminoso, ma sistema e applicazioni usano la stessa memoria.
Domande frequenti
Possono bastare per un piccolo 7B o 8B ben quantizzato e con contesto moderato. Il margine è limitato per visione e contesti lunghi.
Sì, per molti 7B–14B. Un 32B, un encoder di immagini o una finestra di contesto molto lunga possono superare questa capacità.
La VRAM fisica di una scheda è normalmente fissa. L’offloading in RAM consente di avviare modelli più grandi, ma riduce la velocità.
Spesso sì con quantizzazione forte o offloading parziale, ma il modello non risiede interamente in VRAM e il throughput può calare molto.
No. Solo alcune architetture permettono un’ampia condivisione. Sistema, runtime e applicazioni conservano una parte, mentre firmware e driver limitano l’allocazione.
Per grandi LLM locali, capacità di memoria, larghezza di banda e compatibilità del backend contano generalmente più dei TOPS della NPU.
Dalla memoria al sistema
Il Finder applica questi principi, mostra ogni ipotesi e confronta il risultato con sistemi concreti.