Van pc naar eerste antwoord

Een LLM lokaal installeren en uitvoeren

Een betrouwbare installatie begint met een model dat in het geheugen past, een ondersteunde runtime en veilige instellingen. Deze stappen begeleiden Windows, macOS en Linux van hardwarecontrole tot eerste test.

Kies je werkwijze

Grafische interface of opdrachtregel?

LM Studio

Grafische interface om compatibele modellen te zoeken, context en offloading in te stellen, te chatten en een lokale server te starten.

Handig om te beginnenOfficiële documentatie

Ollama

Eenvoudige installatie, modelbeheer via de terminal en een lokale API voor toepassingen, editors en automatisering.

Handig voor integratiesOfficiële documentatie

llama.cpp

Meer controle over GGUF-formaten, backends, GPU-lagen en parameters. Vereist meer technische ervaring.

Voor nauwkeurige controleOfficieel project

Zes stappen

Lokale AI voorbereiden zonder blind proberen

1

Werk systeem en drivers bij

Installeer stabiele updates en de officiële GPU-driver. Start opnieuw op voordat je gedetecteerde versnelling en geheugen beoordeelt.

2

Controleer geheugen en vrije opslag

Controleer werkelijk beschikbare VRAM of unified memory en houd ruimte vrij voor het model, tijdelijke download en gegevens.

3

Installeer eerst één runtime

Begin met LM Studio of Ollama. Voeg pas andere tools toe nadat één stabiele sessie goed werkt.

4

Kies een klein gekwantiseerd model

Gebruik voor de eerste test een betrouwbare 7B–8B in Q4. Controleer licentie, formaat en verwacht prompttemplate.

5

Controleer GPU-versnelling

Bekijk runtimelog en GPU-gebruik. Werkt alleen de CPU, controleer dan backend, driver en het aantal offloadlagen.

6

Schaal stap voor stap op

Verhoog context of modelgrootte één voor één. Meet geheugen, tijd tot eerste token, tokens per seconde en stabiliteit.

Eerste model

Een start die bij het geheugen past

Snel geheugenAanbevolen eerste testVolgende stap
8 GB7B–8B Q4, korte contextverkort context voor je het model vergroot
12–16 GB8B–14B Q4test RAG of gematigde context
24–32 GB20B–32B Q4meet offloading voor je 70B probeert
64 GB gedeeld32B Q4 met reserve70B kan krap zijn, afhankelijk van context en systeem
128 GB gedeeld70B Q4vergroot context en diensten met metingen

Lokale privacy

Houd de API in het privénetwerk

Een lokale runtime beschermt gegevens alleen als je hem niet onbedoeld blootstelt. Luister op localhost of LAN, gebruik authenticatie en firewall en stuur geen routerpoort door zonder noodzaak.

  • standaard geen openbare poort
  • token of geauthenticeerde proxy voor meerdere gebruikers
  • aparte back-up van RAG-documenten

Prestaties controleren

Meet wat werkelijk telt

Noteer tijd tot eerste token, tokens per seconde, piekgeheugen en temperatuur in een realistisch gesprek. Een korte benchmark toont geen throttling of groeiende cache.

  • dezelfde prompt en kwantisatie
  • gedocumenteerde startcontext
  • minimaal 20–30 minuten belasting

Veelvoorkomende problemen

Wanneer het model niet start of langzaam is

De runtime meldt onvoldoende geheugen

Verkort de context, gebruik een kleinere kwantisatie of kies een kleiner model. Sluit toepassingen die hetzelfde geheugen gebruiken.

De GPU wordt niet gebruikt

Controleer driver, compatibele backend, log en GPU-laaginstelling. Controleer bij unified memory ook de UMA-limiet in de firmware.

Het eerste antwoord duurt lang

De eerste laadbeurt hangt af van SSD, modelgrootte en kernelcompilatie. Vergelijk ook latere aanvragen.

De snelheid daalt in lange chats

De KV-cache groeit met de context. Verklein het venster, start een nieuwe sessie of kies een model met efficiënter contextbeheer.

Voor je downloadt

Controleer geheugen en softwarecompatibiliteit

De pc-kiezer schat de geheugenklasse en koppelt deze aan complete systemen met duidelijke voordelen en compromissen.

Vind een passende pc