LM Studio
Interfaccia grafica per cercare modelli compatibili, regolare contesto e offloading, chattare e avviare un server locale.
Ideale per iniziareDocumentazione ufficialeDal PC alla prima risposta
Un’installazione affidabile parte da un modello adatto alla memoria, un runtime supportato e una configurazione sicura. Questa procedura accompagna Windows, macOS e Linux dalla verifica hardware al primo test.
Scegli il percorso
Interfaccia grafica per cercare modelli compatibili, regolare contesto e offloading, chattare e avviare un server locale.
Ideale per iniziareDocumentazione ufficialeInstallazione semplice, gestione dei modelli da terminale e API locale comoda per applicazioni, editor e automazioni.
Ideale per integrazioniDocumentazione ufficialePiù controllo su formati GGUF, backend, livelli GPU e parametri. Richiede maggiore familiarità tecnica.
Ideale per controllo fineProgetto ufficialeProcedura in sei passi
Installa gli aggiornamenti stabili del sistema operativo e il driver ufficiale della GPU. Riavvia prima di valutare accelerazione e memoria rilevate.
Verifica VRAM o memoria unificata effettivamente disponibile e lascia spazio per modello, download temporaneo e dati. Un SSD quasi pieno peggiora la gestione.
Inizia con LM Studio oppure Ollama. Riduci le variabili: aggiungi altri strumenti solo dopo avere ottenuto una sessione stabile.
Per il primo test usa un 7B–8B in Q4 da una fonte affidabile. Controlla licenza, formato e prompt template previsto.
Osserva il log del runtime e l’utilizzo della GPU. Se il modello gira solo sulla CPU, controlla backend, driver e numero di layer offloadati.
Prova contesto più lungo o un modello più grande uno alla volta. Misura memoria, tempo alla prima risposta, token al secondo e stabilità.
Primo modello
| Memoria veloce | Primo test consigliato | Passo successivo |
|---|---|---|
| 8 GB | 7B–8B Q4, contesto breve | riduci il contesto prima di aumentare il modello |
| 12–16 GB | 8B–14B Q4 | prova RAG o un contesto moderato |
| 24–32 GB | 20B–32B Q4 | misura l’offloading prima di tentare 70B |
| 64 GB condivisi | 32B Q4 con margine | un 70B può essere stretto secondo sistema e contesto |
| 128 GB condivisi | 70B Q4 | aumenta contesto e servizi con misurazioni |
Privacy locale
Un runtime locale protegge i dati solo se non lo esponi involontariamente. Ascolta su localhost o sulla LAN, applica autenticazione e firewall, aggiorna il software e non inoltrare porte dal router senza una reale necessità.
Controllo delle prestazioni
Registra tempo alla prima risposta, token al secondo, memoria massima e temperatura in una conversazione realistica. Un benchmark breve non mostra throttling o crescita della cache.
Problemi comuni
Riduci contesto, usa una quantizzazione più piccola o scegli un modello meno grande. Chiudi applicazioni che occupano la stessa memoria.
Controlla driver, backend compatibile, log e impostazione dei layer GPU. Su memoria unificata verifica anche il limite UMA nel firmware.
Il caricamento iniziale dipende da SSD, dimensione del modello e compilazione dei kernel. Confronta anche le richieste successive.
La cache KV cresce con il contesto. Riduci la finestra, avvia una nuova sessione o usa un modello con gestione del contesto più efficiente.
Prima del download
Il Finder stima la classe di memoria e la collega a sistemi completi con vantaggi e compromessi espliciti.