Autocomplete
Suggerimenti brevi durante la scrittura. Conta più la latenza che un modello enorme.
Piano: 8–16 GBCoding locale · repository privato · il tuo hardware
Parti dal lavoro: l’autocomplete rapido richiede risorse diverse da un agente che legge un repository, modifica file, esegue test e mantiene almeno 64K di contesto.
Risposta breve
Qualità del modello, memoria veloce, contesto utilizzabile, tool call affidabili e tempi dei cicli devono funzionare insieme.
Suggerimenti brevi durante la scrittura. Conta più la latenza che un modello enorme.
Piano: 8–16 GBSpiegare codice, creare test e analizzare file scelti con modelli 14B–32B.
Piano: 16–32 GBLegge, cerca, modifica ed esegue comandi. Tool e almeno 64K di contesto sono centrali.
Piano: 24–32 GB o piùOgni sessione aggiunge cache KV e buffer. La memoria condivisa ampia aumenta soprattutto la capacità.
Piano: 64–128 GBMemoria prima dell’etichetta AI
Sono fasce di pianificazione. Quantizzazione, cache del contesto, runtime, sistema operativo e sessioni condividono la memoria.
| Classe | Uso adatto | Percorso modelli | Limite principale |
|---|---|---|---|
| 12–16 GB VRAM | Autocomplete e chat mirata | Modelli 7B–14B quantizzati | Repository grandi e contesto lungo riducono presto il margine. |
| 24 GB VRAM | Singolo agente capace | Molti modelli 20B–30B quantizzati | 64K di contesto possono rendere il sistema stretto. |
| 32 GB VRAM | Agenti veloci e coding più impegnativo | Classe 20B–32B con più cache | I pesi 70B in genere richiedono offload. |
| 64–128 GB unificati | Modelli grandi, contesto lungo, più servizi | Da 32B a 70B quantizzati, capacità prima | Entrare in memoria non equivale alla velocità di una GPU discreta. |
Modello di riferimento
La scheda ufficiale indica 30,5 miliardi di parametri totali, 3,3 miliardi attivi e 262.144 token di contesto nativo. In un mixture-of-experts il dato attivo descrive il calcolo per token, ma in memoria vanno comunque caricati tutti i pesi degli esperti.
Contesto reale dell’agente
Gli agenti aggiungono schemi dei tool, estratti dei file, output dei comandi e cronologia. Le sessioni parallele moltiplicano la cache.
Agente e modello sono scelte separate
Agente da terminale che legge, modifica ed esegue comandi.
Per:repository e terminaleGuida localeEstensione IDE con ruoli distinti per chat, modifica e autocomplete.
Per:VS Code e JetBrainsGuida ufficialeAgente nell’IDE con supporto per modelli locali.
Per:lavoro guidato nell’editorGuida ufficialePair programmer da terminale con disciplina Git.
Per:modifiche mirateGuida ufficialeRTX 5090 offre 32 GB di VRAM rapida e riduce i cicli modifica–test quando modello e contesto entrano interamente.
Un Ryzen AI Max+ 395 con 128 GB contiene modelli quantizzati più grandi e più contesto. È una scelta di capacità, non una promessa di velocità RTX 5090.
Un modello locale può usare tool pericolosi
L’inferenza locale protegge il trattamento del prompt, non automaticamente file e comandi autorizzati.
Fai commit e lavora in un branch o worktree reversibile.
Tieni chiavi e dati di produzione fuori dalla cartella accessibile.
Non eseguire come amministratore e controlla i comandi sensibili.
Controlla diff, test, lint e sicurezza prima del merge.
Tre percorsi di PC completo
| Priorità | Sistema | Vantaggio | Da verificare |
|---|---|---|---|
| Agente veloce | Tower RTX 5090 | 32 GB di VRAM dedicata e CUDA | GPU desktop esatta, 64 GB+ RAM, raffreddamento e PSU |
| Grande capacità | Beelink GTR9 Pro o MS-S1 Max | 128 GB unificati in formato compatto | Versione 128 GB, allocazione grafica, OS e backend |
| Appliance NVIDIA | ASUS Ascent GX10 | 128 GB coerenti e ambiente NVIDIA | Compatibilità Arm64/Linux di ogni dipendenza |
Documentazione primaria
Architettura, parametri, contesto e tool nella scheda ufficiale.
Avvio diretto e contesto locale nella guida ufficiale.
Endpoint Ollama e diagnosi dei tool nella documentazione ufficiale.
Usa il selettore PC con classe del modello e contesto.
Passa a un test reale
Misura prima se i test passano, poi cerca il limite tra modello, contesto e velocità.