Lokales Coding · privates Repository · eigene Hardware

Das passende lokale LLM und den richtigen PC fürs Programmieren wählen

Beginne mit dem Arbeitsablauf: Schnelles Autocomplete braucht andere Hardware als ein Repository-Agent, der Dateien liest, Tests ausführt und mindestens 64K Kontext hält.

  • Workflow zuerst
  • Kontext eingerechnet
  • Agent sicher betreiben

Die kurze Antwort

Das beste lokale Coding-Modell passt zum gesamten Workflow

Modellqualität allein genügt nicht. Für ein brauchbares Ergebnis braucht es ausreichend schnellen Speicher, nutzbaren Kontext, zuverlässige Tool-Aufrufe und vertretbare Schleifenzeiten. Wähle die Zeile, die deiner Arbeit am nächsten kommt.

Autocomplete

Kurze Vorschläge während des Tippens. Niedrige Latenz ist wichtiger als ein sehr großes Modell oder projektweiter Kontext.

Plan: 8–16 GB schneller Speicher

Code-Chat und Debugging

Code erklären, Tests entwerfen und ausgewählte Dateien prüfen. Ein gutes Modell der 14B–32B-Klasse profitiert von 16–32 GB.

Plan: 16–32 GB

Repository-Agent

Liest und ändert Dateien, sucht und führt Befehle aus. Tool-Zuverlässigkeit und mindestens 64K nutzbarer Kontext werden zentral.

Plan: 24–32 GB oder mehr

Parallele Agenten

Mehrere Sitzungen vervielfachen KV-Cache und Laufzeitpuffer. Große Shared-Memory-Pools helfen bei der Kapazität, dedizierte GPUs bei der Geschwindigkeit.

Plan: 64–128 GB Kapazität

Speicher statt Marketingbegriff

Hardwareklassen für lokale Coding-LLMs

Die Bereiche dienen zur Planung und sind keine Modellgarantie. Quantisierung, Kontext-Cache, Laufzeit, Betriebssystem und parallele Sitzungen teilen sich den verfügbaren Speicher.

HardwareklasseGeeignet fürPraktischer ModellpfadWichtigste Grenze
12–16 GB VRAMAutocomplete, fokussierter Code-ChatKleinere 7B–14B-Coding-Modelle in passender QuantisierungGroße Repositories und langer Agentenkontext verbrauchen den Puffer schnell.
24 GB VRAMLeistungsfähiger einzelner Coding-AgentViele quantisierte 20B–30B-Modelle; Datei und Kontext konkret prüfen64K Kontext kann ein sonst passendes Modell knapp machen.
32 GB VRAMSchnelle Repo-Agenten und anspruchsvoller Code-ChatStarke 20B–32B-Klasse mit mehr Platz für Cache und ToolsGroße 70B-Gewichte benötigen meist Offloading.
64–128 GB Unified MemoryGroße Modelle, langer Kontext, mehrere DiensteKapazitätsorientiert von 32B bis zu quantisierten 70BEin passendes Modell ist nicht automatisch so schnell wie auf einer dedizierten GPU.
128 GB kohärenter NVIDIA-SpeicherCUDA-orientierte Modell-ApplianceGroße Modelle und serverartige EntwicklungsarbeitArm64-/Linux-Kompatibilität muss für die gesamte Software stimmen.

Ein nützliches Referenzmodell

Qwen3-Coder 30B-A3B zeigt, warum Modellnamen erklärt werden müssen

Die offizielle Modellkarte nennt 30,5 Milliarden Gesamtparameter, 3,3 Milliarden aktivierte Parameter und 262.144 Token nativen Kontext. Beim Mixture-of-Experts-Modell beschreibt die aktive Zahl den Rechenaufwand je Token; beim Laden benötigen dennoch alle Expertengewichte Speicher.

  • für Coding und Tool-Aufrufe entwickelt
  • nativer Langkontext bedeutet nicht, dass jeder PC ihn vollständig nutzen kann
  • Quantisierung verändert Gewichtsspeicher und möglicherweise Qualität
  • bei Speichermangel zuerst den Kontext kontrolliert reduzieren
Offizielle Modellkarte öffnen

Nicht nur nach Parametern kaufen

Der Kontext kann die Hardwareklasse verschieben

Ein Modell, das mit 8K lädt, kann bei 64K scheitern oder deutlich langsamer werden. Repository-Agenten halten zusätzlich Tool-Schemata, Dateiauszüge, Befehlsausgaben und Gesprächsverlauf im Prompt.

Modellgewichtealle geladenen Experten nach QuantisierungKV-CacheKontextlänge × Architektur × SitzungenLaufzeitreserveTools, Betriebssystem, Anzeige und Puffer

Agent und Modell getrennt wählen

Die Oberfläche muss den gewünschten Auftrag sicher ausführen können

OpenCode

Terminal-Agent, der ein Repository prüfen, Dateien ändern und Befehle ausführen kann. Ollama bietet einen direkten Startweg.

Geeignet für:Repo-Arbeit und Terminal-WorkflowsLokale Einrichtung öffnen

Continue

IDE-Erweiterung mit getrennten Rollen für Chat, Bearbeitung und Autocomplete. Ollama-Modelle lassen sich erkennen oder genau konfigurieren.

Geeignet für:VS Code und JetBrainsOffizieller Ollama-Ratgeber

Cline

IDE-Agent mit lokalen Modellen. Der eigene Ratgeber verbindet Hardwareplanung mit kompakten Prompts.

Geeignet für:geführte Agentenarbeit in der IDEOffizieller Ratgeber

Aider

Git-bewusster Pair Programmer im Terminal. Der Ollama-Ratgeber betont den Chat-Endpunkt und die Prüfung des eingestellten Kontexts.

Geeignet für:fokussierte Änderungen mit GitOffizieller Ollama-Ratgeber

Dedizierten VRAM für Geschwindigkeit wählen

Eine RTX 5090 bietet 32 GB dedizierten VRAM und ist stark, wenn gewähltes Modell und Kontext hineinpassen. Schnellere Prompt-Verarbeitung und Ausgabe verkürzen Bearbeiten–Testen–Korrigieren-Schleifen.

  • starke 20B–32B-Klasse
  • breites CUDA-Ökosystem
  • feste Grenze von 32 GB
RTX-5090-Komplett-PCs vergleichen

Unified Memory für Kapazität wählen

Ein Ryzen-AI-Max+-395-System mit 128 GB kann größere quantisierte Modelle und mehr Kontext in einem kompakten Gehäuse halten. Das ist eine Kapazitätsentscheidung, keine Zusage für RTX-5090-Durchsatz.

  • Platz für größere Modelle
  • kompakte Komplettsysteme
  • Runtime und UMA-Einstellung entscheidend
128-GB-Systeme vergleichen

Auch ein lokales Modell kann gefährliche Tools ausführen

Jeden Coding-Agenten mit vier Schutzmaßnahmen starten

Lokale Inferenz begrenzt den Ort der Prompt-Verarbeitung. Ein Agent kann dennoch Geheimnisse lesen, Befehle ausführen oder Netzwerk-Tools nutzen, wenn du es erlaubst.

Sauberer Branch

Vorher committen und in Branch oder Worktree arbeiten, damit jede Änderung prüfbar und reversibel bleibt.

Geheimnisse ausschließen

Zugangsdaten, Produktivdaten und private Schlüssel außerhalb des erreichbaren Arbeitsbereichs halten.

Rechte begrenzen

Agenten nicht als Administrator starten. Destruktive Befehle und externen Netzwerkzugriff bewusst freigeben.

Prüfung verlangen

Diff ansehen und Tests, Linter sowie Sicherheitsprüfungen ausführen, bevor Änderungen übernommen werden.

Komplettsysteme in der engeren Auswahl

Drei sinnvolle PC-Wege für lokales Coding

PrioritätSystemwegWarum passendVor dem Kauf prüfen
Schneller EinzelagentRTX-5090-Tower32 GB dedizierter VRAM und hoher CUDA-Durchsatz für passende Modelle.Exakte Desktop-GPU, mindestens 64 GB RAM, Kühlung, Netzteil und SSD.
Große ModellkapazitätBeelink GTR9 Pro oder MINISFORUM MS-S1 Max128 GB Unified Memory im kompakten Ryzen-AI-Max+-395-System.Exakte 128-GB-Version, nutzbare Grafikzuweisung, Betriebssystem und Backend.
NVIDIA-Modell-ApplianceASUS Ascent GX10128 GB kohärenter Speicher und NVIDIA-Softwareumgebung.Arm64-/Linux-Kompatibilität jeder IDE-Erweiterung, jedes Containers und jeder Abhängigkeit.

Fragen vor dem Kauf

FAQ zu lokalen Coding-LLMs

Welches ist das beste lokale LLM fürs Programmieren?

Es gibt keinen Sieger für jeden PC und Workflow. Für Autocomplete zählt ein kleines Modell mit niedriger Latenz. Für Repository-Agenten sind Tool-Aufrufe, Patch-Qualität und ausreichend nutzbarer Kontext wichtiger. Qwen3-Coder 30B-A3B ist eine nützliche aktuelle Referenz für einen leistungsfähigen lokalen Agenten, sollte aber mit deinen Sprachen, deinem Repository und deiner Runtime getestet werden.

Genügen 16 GB VRAM für ein Coding-LLM?

Für viele quantisierte 7B–14B-Modelle und fokussierten Code-Chat: ja. Für ein Modell der 30B-Klasse, 64K Kontext oder parallele Agenten ist es weniger komfortabel. System-RAM ist nicht mit dediziertem VRAM gleichzusetzen, außer die Plattform stellt ausdrücklich einen unterstützten Shared-Memory-Pfad bereit.

Sind 32 GB VRAM oder 128 GB Unified Memory besser?

Wähle 32 GB schnellen dedizierten VRAM, wenn Geschwindigkeit zählt und das Modell passt. Wähle einen 128-GB-Pool, wenn Modellgröße, langer Kontext oder mehrere Dienste 32 GB überschreiten. Die größere Zahl bedeutet nicht automatisch schnellere Inferenz.

Kann ein lokaler Coding-Agent vollständig offline arbeiten?

Die Inferenz kann lokal bleiben. Prüfe zusätzlich Agent, Erweiterungen, Telemetrie, Web-Tools, Paketmanager und ausgeführte Befehle. Vollständig offline ist der Ablauf erst, wenn diese Netzwerkwege deaktiviert oder kontrolliert sind.

Primärdokumentation

Quellen zu Modellen, Agenten und Kontext

QW

Qwen3-Coder-Modellkarte

Gesamt- und Aktivparameter, nativer Kontext, Tool-Aufrufe und Hinweise bei Speichermangel. Offizielle Qwen-Modellkarte.

CL

Dokumentation der Coding-Agenten

Die lokale Einrichtung unterscheidet sich je Oberfläche. Offizielle Ratgeber: Continue, Cline und Aider.

Von der Entscheidung zum arbeitenden Agenten

OpenCode lokal einrichten und an einer echten Repo-Aufgabe testen

Nutze einen kleinen reversiblen Auftrag, miss ob der Patch die Tests besteht und entscheide erst dann, ob Modellqualität, Kontext oder Hardwaregeschwindigkeit der Engpass ist.

Einrichtung öffnen