La memoria dei modelli, spiegata bene

Quanta VRAM serve per eseguire un LLM in locale?

La memoria veloce deve contenere pesi del modello, cache del contesto, runtime e un margine di sicurezza. Questa guida collega le classi 8B, 14B, 32B e 70B a capacità realistiche, distinguendo RAM, VRAM e memoria unificata.

La formula utile

Pesi + cache KV + runtime + margine

Il numero di parametri non equivale direttamente alla memoria occupata. La quantizzazione riduce i pesi, mentre contesto lungo, funzioni multimodali e sessioni parallele aggiungono altre allocazioni.

Pesiparametri × quantizzazioneCache KVcontesto × architetturaRuntimebuffer e backendMarginesistema e altri strumenti

Pesi del modello

Una quantizzazione Q4 usa molto meno spazio del formato FP16. Metadati e formato fanno però sì che “4 bit” non equivalga esattamente a 0,5 byte per parametro.

Cache del contesto

La cache KV conserva le informazioni del contesto corrente. Cresce con la finestra, le conversazioni attive e l’architettura del modello.

Motore di inferenza

Ollama, LM Studio e llama.cpp usano buffer di lavoro. Il backend GPU e il livello di offloading modificano il totale.

Margine pratico

Una configurazione che entra solo sulla carta è fragile. Sistema operativo, desktop, RAG e altri servizi devono conservare spazio.

Valori con margine

Memoria tipica per modelli di testo quantizzati

Le fasce ipotizzano una quantizzazione vicina a Q4 e un margine comune. Contesti molto lunghi, modelli MoE, visione o più utenti possono richiedere di più.

Classe del modelloPesi indicativiMemoria veloce ragionevoleImpieghi comuni
7B–8Bcirca 5–6 GB12–16 GBchat, riassunti, assistenti semplici
12B–14Bcirca 8–10 GB16 GBmodelli generalisti e codice
20B–32Bcirca 14–22 GB24–32 GBprogrammazione, RAG, agenti
65B–70Bcirca 40–45 GB64 GB minimi; 96–128 GB più comodicompiti complessi e qualità maggiore
100B–120Bcirca 65–80 GB96–128 GB o piùcarichi professionali

“Il modello entra” non significa “il modello è veloce”. Larghezza di banda, potenza di calcolo, runtime e offloading determinano il throughput.

Scegliere per dimensione

Quale GPU scegliere per l’AI locale?

La GPU giusta non è necessariamente la più costosa: deve contenere modello e contesto in memoria veloce ed essere supportata in modo affidabile dal software scelto.

12–16 GB: ingresso pratico

Adatti a molti 7B–14B quantizzati. Il margine si riduce con visione, contesti lunghi o modelli più grandi.

Chat e primi assistenti di codice

24–32 GB: velocità

Una classe solida per 20B–32B veloci. La RTX 5090 offre 32 GB dedicati; un 70B richiede in genere offloading.

Codice, RAG e agentiEsamina i PC RTX 5090

64–128 GB: capacità

Mini PC a memoria unificata e sistemi specializzati possono contenere 70B quantizzati. Restano decisivi il margine di sistema e il backend.

Grandi modelli e contesto lungoConfronta i mini PC AI

Due architetture di memoria

VRAM dedicata e memoria unificata non sono equivalenti

VRAM dedicata

È collegata direttamente a una scheda grafica distinta. L’elevata larghezza di banda favorisce la velocità finché tutto il carico entra.

  • throughput di inferenza elevato
  • capacità fissa e semplice da identificare
  • offloading in RAM spesso molto più lento

Memoria unificata

CPU e GPU integrata condividono una grande riserva. Può contenere un modello più voluminoso, ma sistema e applicazioni usano la stessa memoria.

  • 64–128 GB in formato compatto
  • allocazione UMA o VGM da verificare
  • larghezza di banda inferiore alle grandi GPU discrete

Domande frequenti

Evitare errori nel dimensionamento

8 GB di VRAM bastano per l’AI locale?

Possono bastare per un piccolo 7B o 8B ben quantizzato e con contesto moderato. Il margine è limitato per visione e contesti lunghi.

16 GB bastano per un LLM locale?

Sì, per molti 7B–14B. Un 32B, un encoder di immagini o una finestra di contesto molto lunga possono superare questa capacità.

Si può aumentare la VRAM?

La VRAM fisica di una scheda è normalmente fissa. L’offloading in RAM consente di avviare modelli più grandi, ma riduce la velocità.

Un 70B può funzionare con 32 GB di VRAM?

Spesso sì con quantizzazione forte o offloading parziale, ma il modello non risiede interamente in VRAM e il throughput può calare molto.

128 GB di RAM significano 128 GB per la GPU?

No. Solo alcune architetture permettono un’ampia condivisione. Sistema, runtime e applicazioni conservano una parte, mentre firmware e driver limitano l’allocazione.

La NPU è indispensabile?

Per grandi LLM locali, capacità di memoria, larghezza di banda e compatibilità del backend contano generalmente più dei TOPS della NPU.

Dalla memoria al sistema

Calcola la classe adatta al modello e al contesto

Il Finder applica questi principi, mostra ogni ipotesi e confronta il risultato con sistemi concreti.

Avvia il Finder