Guida ai modelli 70B · aggiornata il 21 agosto 2026

Quale PC serve per eseguire un LLM 70B in locale?

Per un modello 70B quantizzato conta prima la capacità di memoria. 32 GB di VRAM sono veloci, ma in genere non bastano per pesi più contesto. Le soluzioni realistiche iniziano da circa 48–64 GB e diventano più comode con 96–128 GB.

Perché il file non è tutto

Pesi del modello + contesto + margine

Un 70B in Q4 occupa spesso circa 40–45 GB per i pesi. Cache KV, buffer, sistema operativo e strumenti RAG si aggiungono durante l’uso.

48 GB

Classe minima stretta

Può bastare per una quantizzazione compatta e contesto ridotto, con poco spazio operativo.

Richiede una configurazione accurata
128 GB

Capacità e flessibilità

Adatta a contesti più lunghi, RAG e più servizi, senza promettere la velocità di grandi GPU professionali.

Ideale nei sistemi a memoria unificata

Tre percorsi

Come far girare un 70B a casa

128 GB unificati

Mini PC Ryzen AI Max+ 395: molta capacità, ingombro ridotto e piattaforma x86. La velocità dipende dal backend Radeon.

Scelta equilibrata per capacitàVedi i PC Ryzen AI Max+

128 GB NVIDIA coerenti

ASUS Ascent GX10 combina grande memoria e stack CUDA, ma utilizza Arm/Linux e richiede software compatibile.

Per sviluppo NVIDIAEsamina GX10

32 GB VRAM + offloading

Una RTX 5090 è molto veloce sulle parti residenti in GPU, ma un 70B deve usare anche RAM di sistema e perde throughput.

Per chi privilegia modelli più piccoli velociGuida RTX 5090

Confronto pratico

Capacità, velocità e compromessi

HardwareIl 70B entra?Velocità attesaControllo decisivo
64 GB unificatispesso, ma con margine ridottodipende molto da backend e contestoallocazione UMA e memoria libera
128 GB unificatisì per molti Q4moderata, orientata alla capacitàsupporto GPU del runtime
RTX 5090 32 GBsolo con offloadingmolto variabileRAM, bus e percentuale in VRAM
GPU professionale 48–96 GBsì secondo quantizzazioneelevatacosto, alimentazione e raffreddamento

Prima dell’acquisto

Cinque domande che evitano una scelta sbagliata

Quale quantizzazione?

Q4, Q5 e Q8 cambiano molto memoria e qualità.

Quanto contesto?

32K o 128K possono ampliare sensibilmente la cache KV.

Quale runtime?

Il backend deve supportare bene la GPU e il formato scelti.

Quanti utenti?

Sessioni parallele aggiungono cache e carico di calcolo.

Quale velocità minima?

Entrare in memoria non basta se il tempo di risposta è troppo alto.

Domande frequenti

Un 70B locale nella pratica

64 GB di RAM bastano per un modello 70B?

Possono bastare con Q4, contesto limitato e runtime efficiente, ma il margine è ridotto. Su memoria non unificata, la RAM non equivale alla VRAM.

128 GB rendono il 70B veloce?

No automaticamente. Offrono capacità e margine; banda di memoria, GPU, backend e architettura determinano i token al secondo.

Una RTX 5090 è una buona scelta per 70B?

È eccellente per modelli che entrano nei suoi 32 GB. Per un 70B, l’offloading riduce la velocità e rende essenziali RAM e configurazione.

Serve davvero un 70B?

Non sempre. Un 14B o 32B recente può offrire qualità sufficiente con risposte più veloci e costi inferiori. Prova prima il modello reale.

Dal fabbisogno al sistema

Confronta i PC da 128 GB disponibili nel catalogo

Il Finder considera contesto, priorità e budget e mostra solo configurazioni che raggiungono la classe di memoria calcolata.

Trova il sistema