Classe minima stretta
Può bastare per una quantizzazione compatta e contesto ridotto, con poco spazio operativo.
Richiede una configurazione accurataGuida ai modelli 70B · aggiornata il 21 agosto 2026
Per un modello 70B quantizzato conta prima la capacità di memoria. 32 GB di VRAM sono veloci, ma in genere non bastano per pesi più contesto. Le soluzioni realistiche iniziano da circa 48–64 GB e diventano più comode con 96–128 GB.
Perché il file non è tutto
Un 70B in Q4 occupa spesso circa 40–45 GB per i pesi. Cache KV, buffer, sistema operativo e strumenti RAG si aggiungono durante l’uso.
Può bastare per una quantizzazione compatta e contesto ridotto, con poco spazio operativo.
Richiede una configurazione accurataConsente un margine migliore per runtime, contesto e attività parallele.
Controlla quanta memoria è davvero assegnabileAdatta a contesti più lunghi, RAG e più servizi, senza promettere la velocità di grandi GPU professionali.
Ideale nei sistemi a memoria unificataTre percorsi
Mini PC Ryzen AI Max+ 395: molta capacità, ingombro ridotto e piattaforma x86. La velocità dipende dal backend Radeon.
Scelta equilibrata per capacitàVedi i PC Ryzen AI Max+ASUS Ascent GX10 combina grande memoria e stack CUDA, ma utilizza Arm/Linux e richiede software compatibile.
Per sviluppo NVIDIAEsamina GX10Una RTX 5090 è molto veloce sulle parti residenti in GPU, ma un 70B deve usare anche RAM di sistema e perde throughput.
Per chi privilegia modelli più piccoli velociGuida RTX 5090Confronto pratico
| Hardware | Il 70B entra? | Velocità attesa | Controllo decisivo |
|---|---|---|---|
| 64 GB unificati | spesso, ma con margine ridotto | dipende molto da backend e contesto | allocazione UMA e memoria libera |
| 128 GB unificati | sì per molti Q4 | moderata, orientata alla capacità | supporto GPU del runtime |
| RTX 5090 32 GB | solo con offloading | molto variabile | RAM, bus e percentuale in VRAM |
| GPU professionale 48–96 GB | sì secondo quantizzazione | elevata | costo, alimentazione e raffreddamento |
Prima dell’acquisto
Q4, Q5 e Q8 cambiano molto memoria e qualità.
32K o 128K possono ampliare sensibilmente la cache KV.
Il backend deve supportare bene la GPU e il formato scelti.
Sessioni parallele aggiungono cache e carico di calcolo.
Entrare in memoria non basta se il tempo di risposta è troppo alto.
Domande frequenti
Possono bastare con Q4, contesto limitato e runtime efficiente, ma il margine è ridotto. Su memoria non unificata, la RAM non equivale alla VRAM.
No automaticamente. Offrono capacità e margine; banda di memoria, GPU, backend e architettura determinano i token al secondo.
È eccellente per modelli che entrano nei suoi 32 GB. Per un 70B, l’offloading riduce la velocità e rende essenziali RAM e configurazione.
Non sempre. Un 14B o 32B recente può offrire qualità sufficiente con risposte più veloci e costi inferiori. Prova prima il modello reale.
Dal fabbisogno al sistema
Il Finder considera contesto, priorità e budget e mostra solo configurazioni che raggiungono la classe di memoria calcolata.