LM Studio
Grafische interface om compatibele modellen te zoeken, context en offloading in te stellen, te chatten en een lokale server te starten.
Handig om te beginnenOfficiële documentatieVan pc naar eerste antwoord
Een betrouwbare installatie begint met een model dat in het geheugen past, een ondersteunde runtime en veilige instellingen. Deze stappen begeleiden Windows, macOS en Linux van hardwarecontrole tot eerste test.
Kies je werkwijze
Grafische interface om compatibele modellen te zoeken, context en offloading in te stellen, te chatten en een lokale server te starten.
Handig om te beginnenOfficiële documentatieEenvoudige installatie, modelbeheer via de terminal en een lokale API voor toepassingen, editors en automatisering.
Handig voor integratiesOfficiële documentatieMeer controle over GGUF-formaten, backends, GPU-lagen en parameters. Vereist meer technische ervaring.
Voor nauwkeurige controleOfficieel projectZes stappen
Installeer stabiele updates en de officiële GPU-driver. Start opnieuw op voordat je gedetecteerde versnelling en geheugen beoordeelt.
Controleer werkelijk beschikbare VRAM of unified memory en houd ruimte vrij voor het model, tijdelijke download en gegevens.
Begin met LM Studio of Ollama. Voeg pas andere tools toe nadat één stabiele sessie goed werkt.
Gebruik voor de eerste test een betrouwbare 7B–8B in Q4. Controleer licentie, formaat en verwacht prompttemplate.
Bekijk runtimelog en GPU-gebruik. Werkt alleen de CPU, controleer dan backend, driver en het aantal offloadlagen.
Verhoog context of modelgrootte één voor één. Meet geheugen, tijd tot eerste token, tokens per seconde en stabiliteit.
Eerste model
| Snel geheugen | Aanbevolen eerste test | Volgende stap |
|---|---|---|
| 8 GB | 7B–8B Q4, korte context | verkort context voor je het model vergroot |
| 12–16 GB | 8B–14B Q4 | test RAG of gematigde context |
| 24–32 GB | 20B–32B Q4 | meet offloading voor je 70B probeert |
| 64 GB gedeeld | 32B Q4 met reserve | 70B kan krap zijn, afhankelijk van context en systeem |
| 128 GB gedeeld | 70B Q4 | vergroot context en diensten met metingen |
Lokale privacy
Een lokale runtime beschermt gegevens alleen als je hem niet onbedoeld blootstelt. Luister op localhost of LAN, gebruik authenticatie en firewall en stuur geen routerpoort door zonder noodzaak.
Prestaties controleren
Noteer tijd tot eerste token, tokens per seconde, piekgeheugen en temperatuur in een realistisch gesprek. Een korte benchmark toont geen throttling of groeiende cache.
Veelvoorkomende problemen
Verkort de context, gebruik een kleinere kwantisatie of kies een kleiner model. Sluit toepassingen die hetzelfde geheugen gebruiken.
Controleer driver, compatibele backend, log en GPU-laaginstelling. Controleer bij unified memory ook de UMA-limiet in de firmware.
De eerste laadbeurt hangt af van SSD, modelgrootte en kernelcompilatie. Vergelijk ook latere aanvragen.
De KV-cache groeit met de context. Verklein het venster, start een nieuwe sessie of kies een model met efficiënter contextbeheer.
Voor je downloadt
De pc-kiezer schat de geheugenklasse en koppelt deze aan complete systemen met duidelijke voordelen en compromissen.