Lokaal coderen · privé-repository · eigen hardware

Kies de beste lokale LLM en pc voor programmeren

Begin bij het werk: snelle autocomplete vraagt iets anders dan een agent die een repository leest, bestanden wijzigt, tests uitvoert en minimaal 64K context vasthoudt.

  • workflow eerst
  • context meegerekend
  • veilige agent

Kort antwoord

De beste lokale coding-LLM past bij de hele workflow

Modelkwaliteit, snel geheugen, bruikbare context, betrouwbare tool calls en aanvaardbare doorlooptijd moeten samen kloppen.

Autocomplete

Korte suggesties tijdens het typen. Lage vertraging telt meer dan een zeer groot model.

Plan: 8–16 GB

Codechat en debugging

Code uitleggen, tests schrijven en geselecteerde bestanden onderzoeken met 14B–32B.

Plan: 16–32 GB

Repository-agent

Leest, zoekt, wijzigt en voert opdrachten uit. Tools en minimaal 64K context staan centraal.

Plan: 24–32 GB of meer

Parallelle agents

Elke sessie voegt KV-cache en buffers toe. Een groot gedeeld geheugen levert vooral capaciteit.

Plan: 64–128 GB

Geheugen vóór het AI-label

Hardwareklassen voor lokale coding-LLM’s

Dit zijn planningsbanden. Kwantisatie, contextcache, runtime, besturingssysteem en gelijktijdige sessies delen het geheugen.

KlasseGoede toepassingPraktisch modelpadBelangrijkste grens
12–16 GB VRAMAutocomplete en gerichte chatGekwantiseerde 7B–14B-modellenGrote repositories en lange context gebruiken de reserve snel.
24 GB VRAMEén capabele agentVeel gekwantiseerde 20B–30B-modellen64K context kan een passende configuratie krap maken.
32 GB VRAMSnelle agents en zwaardere codetakenSterke 20B–32B-klasse met extra cache70B-gewichten vereisen meestal offload.
64–128 GB unified memoryGrote modellen, lange context, meerdere dienstenCapaciteitsgericht van 32B tot gekwantiseerde 70BEen passend model is niet automatisch even snel als op een losse GPU.

Nuttig referentiemodel

Qwen3-Coder 30B-A3B laat zien waarom de naam niet genoeg is

De officiële modelkaart noemt 30,5 miljard parameters totaal, 3,3 miljard actief en 262.144 tokens native context. Bij mixture-of-experts beschrijft actief de berekening per token; alle expertgewichten moeten toch worden geladen.

  • ontworpen voor code en tool calls
  • maximale native context kost extra geheugen
  • kwantisatie verandert grootte en mogelijk kwaliteit
  • verlaag de context bij geheugentekort
Officiële modelkaart

Werkelijke agentcontext

Een model dat bij 8K past, kan bij 64K vastlopen

Agents voegen toolschema’s, bestandsfragmenten, opdrachtuitvoer en geschiedenis toe. Meerdere sessies vermenigvuldigen de cache.

Modelgewichtenna kwantisatieKV-cachecontext × architectuur × sessiesRuntime-reservetools, systeem en buffers

Agent en model zijn aparte keuzes

Kies de interface op basis van het toegestane werk

OpenCode

Terminalagent die kan lezen, wijzigen en opdrachten uitvoeren.

Voor:repositories en terminalLokale installatie

Continue

IDE-extensie met aparte rollen voor chat, edit en autocomplete.

Voor:VS Code en JetBrainsOfficiële gids

Cline

IDE-agent met ondersteuning voor lokale modellen.

Voor:begeleid werk in de editorOfficiële gids

Losse VRAM voor snelheid

Een RTX 5090 heeft 32 GB snelle VRAM en verkort wijzig–test-lussen wanneer model en context volledig passen.

  • sterke 20B–32B-klasse
  • breed CUDA-ecosysteem
  • vaste capaciteit van 32 GB
RTX 5090-pc’s vergelijken

Unified memory voor capaciteit

Een Ryzen AI Max+ 395 met 128 GB houdt grotere gekwantiseerde modellen en meer context vast. Dat is capaciteit, geen belofte van RTX 5090-snelheid.

  • grotere modellen
  • compacte systemen
  • runtime en UMA controleren
128GB-systemen vergelijken

Een lokaal model kan gevaarlijke tools uitvoeren

Vier veiligheidsregels vóór de eerste agent

Lokale inferentie beschermt de promptverwerking, niet automatisch bestanden of toegestane opdrachten.

Schone branch

Commit vooraf en werk in een omkeerbare branch of worktree.

Geen geheimen

Houd sleutels en productiegegevens buiten de toegankelijke map.

Beperkte rechten

Werk niet als beheerder en controleer gevoelige opdrachten.

Patch verifiëren

Bekijk de diff en voer tests, lint en beveiligingschecks uit.

Drie paden naar een complete pc

Kies de prioriteit vóór de kast

PrioriteitSysteemSterkteControleren
Snelle agentRTX 5090-tower32 GB losse VRAM en CUDAExacte desktop-GPU, 64 GB+ RAM, koeling en voeding
Grote capaciteitBeelink GTR9 Pro of MS-S1 Max128 GB unified memory in klein formaat128GB-versie, grafische toewijzing, OS en backend
NVIDIA-applianceASUS Ascent GX10128 GB coherent geheugen en NVIDIA-omgevingArm64/Linux-compatibiliteit van elke afhankelijkheid

Primaire documentatie

Bronnen voor modellen, agents en context

HW

Volgende stap

Gebruik de pc-kiezer met modelklasse en context.

Test een echte taak

Stel OpenCode lokaal in en probeer een kleine omkeerbare wijziging

Meet eerst of de tests slagen en bepaal daarna of model, context of hardware de grens vormt.

Open de OpenCode-gids