Scegli la dimensione
Un modello 8B quantizzato richiede poco spazio; 32B e 70B offrono più capacità, ma aumentano nettamente il fabbisogno di memoria.
AI locale. Il tuo hardware. I tuoi dati.
Calcola quanta memoria serve davvero al modello e confronta sistemi completi in base a dimensione del LLM, velocità, spazio e budget.
Tre passi per scegliere bene
Per un LLM locale bisogna far entrare nella memoria veloce i pesi del modello, la cache del contesto e il margine del runtime. Il solo valore TOPS della NPU non risponde a questa domanda.
Un modello 8B quantizzato richiede poco spazio; 32B e 70B offrono più capacità, ma aumentano nettamente il fabbisogno di memoria.
Una GPU discreta di fascia alta privilegia la velocità. Una grande memoria unificata può contenere modelli più voluminosi, con prestazioni diverse.
Raffreddamento, limite UMA, SSD, possibilità di espansione e configurazione precisa contano quanto il nome del processore.
Classi di memoria
Un punto di partenza pratico per molti modelli 7B–14B quantizzati e contesti normali.
Chat · riassunti · primi assistenti di codiceAdatta a modelli 20B–32B quantizzati o a più componenti piccoli con un margine utile.
Programmazione · RAG · agentiLa classe di capacità per modelli 70B e contesti lunghi, in funzione di runtime e quantizzazione.
70B · contesto lungo · più serviziLe fasce includono un margine pratico, ma non sono una garanzia. Architettura, quantizzazione, cache KV e runtime modificano il consumo reale.
Sistemi completi concreti
Confronta due mini PC Ryzen AI Max+ orientati alla capacità, una workstation professionale e un sistema NVIDIA dedicato allo sviluppo AI.
Capacità · formato compatto
Ryzen AI Max+ 395, 128 GB di memoria unificata e configurazione da 2 TB: indicato quando contenere un grande modello quantizzato conta più della velocità massima.
Capacità e rete · compatto
Un sistema da 128 GB con SSD da 2 TB e doppia 10GbE, adatto a servire un LLM a più dispositivi della rete domestica.
Workstation · supporto professionale
Ryzen AI Max+ PRO 395, fino a 128 GB, alimentatore interno e Thunderbolt 4 in uno chassis compatto progettato per il lavoro.
Stack NVIDIA · sistema AI
GB10 Grace Blackwell, 128 GB coerenti e ambiente NVIDIA basato su Ubuntu. È pensato per CUDA e non come comune desktop Windows.
* Link pubblicitario. Se acquisti, potremmo ricevere una commissione; il prezzo per te non cambia. In qualità di Affiliati Amazon, riceviamo un compenso per gli acquisti idonei. Verifica sempre configurazione e disponibilità presso il venditore.
Conta il tuo carico di lavoro
Il Finder considera classe del modello, contesto, uso principale e priorità. Restituisce una classe hardware spiegata e sistemi concreti compatibili.
Scegli in base all’obiettivo
Per modelli 8B–32B, una RTX 5090 con 32 GB di VRAM privilegia il throughput. Abbinala ad almeno 64 GB di RAM e 2 TB NVMe.
Controlli per un PC RTX 5090128 GB di memoria unificata possono contenere molti 70B quantizzati con margine, anche se la velocità resta inferiore a grandi GPU professionali.
Confronta le opzioni per 70BUn SSD da 2 TB è un buon inizio; più famiglie, quantizzazioni e dati RAG lo riempiono presto. Controlla il secondo slot M.2.
Confronta spazio ed espansione