Coding locale · repository privato · il tuo hardware

Scegliere il miglior LLM locale e il PC giusto per il coding

Parti dal lavoro: l’autocomplete rapido richiede risorse diverse da un agente che legge un repository, modifica file, esegue test e mantiene almeno 64K di contesto.

  • prima il workflow
  • contesto incluso
  • agente sicuro

Risposta breve

Il miglior modello locale è quello adatto all’intero workflow

Qualità del modello, memoria veloce, contesto utilizzabile, tool call affidabili e tempi dei cicli devono funzionare insieme.

Autocomplete

Suggerimenti brevi durante la scrittura. Conta più la latenza che un modello enorme.

Piano: 8–16 GB

Chat e debugging

Spiegare codice, creare test e analizzare file scelti con modelli 14B–32B.

Piano: 16–32 GB

Agente repository

Legge, cerca, modifica ed esegue comandi. Tool e almeno 64K di contesto sono centrali.

Piano: 24–32 GB o più

Agenti paralleli

Ogni sessione aggiunge cache KV e buffer. La memoria condivisa ampia aumenta soprattutto la capacità.

Piano: 64–128 GB

Memoria prima dell’etichetta AI

Classi hardware per LLM di coding locali

Sono fasce di pianificazione. Quantizzazione, cache del contesto, runtime, sistema operativo e sessioni condividono la memoria.

ClasseUso adattoPercorso modelliLimite principale
12–16 GB VRAMAutocomplete e chat mirataModelli 7B–14B quantizzatiRepository grandi e contesto lungo riducono presto il margine.
24 GB VRAMSingolo agente capaceMolti modelli 20B–30B quantizzati64K di contesto possono rendere il sistema stretto.
32 GB VRAMAgenti veloci e coding più impegnativoClasse 20B–32B con più cacheI pesi 70B in genere richiedono offload.
64–128 GB unificatiModelli grandi, contesto lungo, più serviziDa 32B a 70B quantizzati, capacità primaEntrare in memoria non equivale alla velocità di una GPU discreta.

Modello di riferimento

Qwen3-Coder 30B-A3B mostra perché il nome non basta

La scheda ufficiale indica 30,5 miliardi di parametri totali, 3,3 miliardi attivi e 262.144 token di contesto nativo. In un mixture-of-experts il dato attivo descrive il calcolo per token, ma in memoria vanno comunque caricati tutti i pesi degli esperti.

  • progettato per coding e tool call
  • il contesto nativo massimo ha un costo di memoria
  • la quantizzazione cambia dimensione e talvolta qualità
  • ridurre il contesto in caso di memoria insufficiente
Scheda modello ufficiale

Contesto reale dell’agente

Un modello che entra a 8K può fallire a 64K

Gli agenti aggiungono schemi dei tool, estratti dei file, output dei comandi e cronologia. Le sessioni parallele moltiplicano la cache.

Pesi modellodopo la quantizzazioneCache KVcontesto × architettura × sessioniMargine runtimetool, sistema e buffer

Agente e modello sono scelte separate

Scegli l’interfaccia in base al lavoro consentito

OpenCode

Agente da terminale che legge, modifica ed esegue comandi.

Per:repository e terminaleGuida locale

Continue

Estensione IDE con ruoli distinti per chat, modifica e autocomplete.

Per:VS Code e JetBrainsGuida ufficiale

Cline

Agente nell’IDE con supporto per modelli locali.

Per:lavoro guidato nell’editorGuida ufficiale

VRAM dedicata per velocità

RTX 5090 offre 32 GB di VRAM rapida e riduce i cicli modifica–test quando modello e contesto entrano interamente.

  • ottima classe 20B–32B
  • ampio ecosistema CUDA
  • capacità fissa di 32 GB
Confronta PC RTX 5090

Memoria unificata per capacità

Un Ryzen AI Max+ 395 con 128 GB contiene modelli quantizzati più grandi e più contesto. È una scelta di capacità, non una promessa di velocità RTX 5090.

  • modelli più grandi
  • sistemi compatti
  • runtime e UMA da verificare
Confronta sistemi 128 GB

Un modello locale può usare tool pericolosi

Quattro protezioni prima del primo agente

L’inferenza locale protegge il trattamento del prompt, non automaticamente file e comandi autorizzati.

Branch pulito

Fai commit e lavora in un branch o worktree reversibile.

Segreti esclusi

Tieni chiavi e dati di produzione fuori dalla cartella accessibile.

Permessi limitati

Non eseguire come amministratore e controlla i comandi sensibili.

Patch verificata

Controlla diff, test, lint e sicurezza prima del merge.

Tre percorsi di PC completo

Scegli la priorità prima del case

PrioritàSistemaVantaggioDa verificare
Agente veloceTower RTX 509032 GB di VRAM dedicata e CUDAGPU desktop esatta, 64 GB+ RAM, raffreddamento e PSU
Grande capacitàBeelink GTR9 Pro o MS-S1 Max128 GB unificati in formato compattoVersione 128 GB, allocazione grafica, OS e backend
Appliance NVIDIAASUS Ascent GX10128 GB coerenti e ambiente NVIDIACompatibilità Arm64/Linux di ogni dipendenza

Documentazione primaria

Fonti su modelli, agenti e contesto

HW

Passo successivo

Usa il selettore PC con classe del modello e contesto.

Passa a un test reale

Configura OpenCode in locale e prova un task piccolo e reversibile

Misura prima se i test passano, poi cerca il limite tra modello, contesto e velocità.

Apri la guida OpenCode