Dal PC alla prima risposta

Come installare ed eseguire un LLM in locale

Un’installazione affidabile parte da un modello adatto alla memoria, un runtime supportato e una configurazione sicura. Questa procedura accompagna Windows, macOS e Linux dalla verifica hardware al primo test.

Scegli il percorso

Interfaccia grafica o riga di comando?

LM Studio

Interfaccia grafica per cercare modelli compatibili, regolare contesto e offloading, chattare e avviare un server locale.

Ideale per iniziareDocumentazione ufficiale

Ollama

Installazione semplice, gestione dei modelli da terminale e API locale comoda per applicazioni, editor e automazioni.

Ideale per integrazioniDocumentazione ufficiale

llama.cpp

Più controllo su formati GGUF, backend, livelli GPU e parametri. Richiede maggiore familiarità tecnica.

Ideale per controllo fineProgetto ufficiale

Procedura in sei passi

Preparare l’AI locale senza tentativi alla cieca

1

Aggiorna sistema e driver

Installa gli aggiornamenti stabili del sistema operativo e il driver ufficiale della GPU. Riavvia prima di valutare accelerazione e memoria rilevate.

2

Controlla memoria e spazio libero

Verifica VRAM o memoria unificata effettivamente disponibile e lascia spazio per modello, download temporaneo e dati. Un SSD quasi pieno peggiora la gestione.

3

Installa un solo runtime

Inizia con LM Studio oppure Ollama. Riduci le variabili: aggiungi altri strumenti solo dopo avere ottenuto una sessione stabile.

4

Scegli un modello piccolo e quantizzato

Per il primo test usa un 7B–8B in Q4 da una fonte affidabile. Controlla licenza, formato e prompt template previsto.

5

Verifica l’accelerazione GPU

Osserva il log del runtime e l’utilizzo della GPU. Se il modello gira solo sulla CPU, controlla backend, driver e numero di layer offloadati.

6

Aumenta gradualmente

Prova contesto più lungo o un modello più grande uno alla volta. Misura memoria, tempo alla prima risposta, token al secondo e stabilità.

Primo modello

Una partenza coerente con la memoria

Memoria velocePrimo test consigliatoPasso successivo
8 GB7B–8B Q4, contesto breveriduci il contesto prima di aumentare il modello
12–16 GB8B–14B Q4prova RAG o un contesto moderato
24–32 GB20B–32B Q4misura l’offloading prima di tentare 70B
64 GB condivisi32B Q4 con margineun 70B può essere stretto secondo sistema e contesto
128 GB condivisi70B Q4aumenta contesto e servizi con misurazioni

Privacy locale

Mantieni l’API nella rete privata

Un runtime locale protegge i dati solo se non lo esponi involontariamente. Ascolta su localhost o sulla LAN, applica autenticazione e firewall, aggiorna il software e non inoltrare porte dal router senza una reale necessità.

  • nessuna porta pubblica predefinita
  • token o proxy autenticato per più utenti
  • backup separato dei documenti RAG

Controllo delle prestazioni

Misura ciò che conta

Registra tempo alla prima risposta, token al secondo, memoria massima e temperatura in una conversazione realistica. Un benchmark breve non mostra throttling o crescita della cache.

  • stesso prompt e stessa quantizzazione
  • contesto iniziale documentato
  • test di almeno 20–30 minuti sotto carico

Problemi comuni

Quando il modello non parte o è lento

Il runtime segnala memoria insufficiente

Riduci contesto, usa una quantizzazione più piccola o scegli un modello meno grande. Chiudi applicazioni che occupano la stessa memoria.

La GPU non viene utilizzata

Controlla driver, backend compatibile, log e impostazione dei layer GPU. Su memoria unificata verifica anche il limite UMA nel firmware.

La prima risposta richiede molto tempo

Il caricamento iniziale dipende da SSD, dimensione del modello e compilazione dei kernel. Confronta anche le richieste successive.

La velocità cala durante chat lunghe

La cache KV cresce con il contesto. Riduci la finestra, avvia una nuova sessione o usa un modello con gestione del contesto più efficiente.

Prima del download

Verifica che il PC abbia memoria e software compatibili

Il Finder stima la classe di memoria e la collega a sistemi completi con vantaggi e compromessi espliciti.

Trova il PC adatto