Autocomplete
Kurze Vorschläge während des Tippens. Niedrige Latenz ist wichtiger als ein sehr großes Modell oder projektweiter Kontext.
Plan: 8–16 GB schneller SpeicherLokales Coding · privates Repository · eigene Hardware
Beginne mit dem Arbeitsablauf: Schnelles Autocomplete braucht andere Hardware als ein Repository-Agent, der Dateien liest, Tests ausführt und mindestens 64K Kontext hält.
Die kurze Antwort
Modellqualität allein genügt nicht. Für ein brauchbares Ergebnis braucht es ausreichend schnellen Speicher, nutzbaren Kontext, zuverlässige Tool-Aufrufe und vertretbare Schleifenzeiten. Wähle die Zeile, die deiner Arbeit am nächsten kommt.
Kurze Vorschläge während des Tippens. Niedrige Latenz ist wichtiger als ein sehr großes Modell oder projektweiter Kontext.
Plan: 8–16 GB schneller SpeicherCode erklären, Tests entwerfen und ausgewählte Dateien prüfen. Ein gutes Modell der 14B–32B-Klasse profitiert von 16–32 GB.
Plan: 16–32 GBLiest und ändert Dateien, sucht und führt Befehle aus. Tool-Zuverlässigkeit und mindestens 64K nutzbarer Kontext werden zentral.
Plan: 24–32 GB oder mehrMehrere Sitzungen vervielfachen KV-Cache und Laufzeitpuffer. Große Shared-Memory-Pools helfen bei der Kapazität, dedizierte GPUs bei der Geschwindigkeit.
Plan: 64–128 GB KapazitätSpeicher statt Marketingbegriff
Die Bereiche dienen zur Planung und sind keine Modellgarantie. Quantisierung, Kontext-Cache, Laufzeit, Betriebssystem und parallele Sitzungen teilen sich den verfügbaren Speicher.
| Hardwareklasse | Geeignet für | Praktischer Modellpfad | Wichtigste Grenze |
|---|---|---|---|
| 12–16 GB VRAM | Autocomplete, fokussierter Code-Chat | Kleinere 7B–14B-Coding-Modelle in passender Quantisierung | Große Repositories und langer Agentenkontext verbrauchen den Puffer schnell. |
| 24 GB VRAM | Leistungsfähiger einzelner Coding-Agent | Viele quantisierte 20B–30B-Modelle; Datei und Kontext konkret prüfen | 64K Kontext kann ein sonst passendes Modell knapp machen. |
| 32 GB VRAM | Schnelle Repo-Agenten und anspruchsvoller Code-Chat | Starke 20B–32B-Klasse mit mehr Platz für Cache und Tools | Große 70B-Gewichte benötigen meist Offloading. |
| 64–128 GB Unified Memory | Große Modelle, langer Kontext, mehrere Dienste | Kapazitätsorientiert von 32B bis zu quantisierten 70B | Ein passendes Modell ist nicht automatisch so schnell wie auf einer dedizierten GPU. |
| 128 GB kohärenter NVIDIA-Speicher | CUDA-orientierte Modell-Appliance | Große Modelle und serverartige Entwicklungsarbeit | Arm64-/Linux-Kompatibilität muss für die gesamte Software stimmen. |
Ein nützliches Referenzmodell
Die offizielle Modellkarte nennt 30,5 Milliarden Gesamtparameter, 3,3 Milliarden aktivierte Parameter und 262.144 Token nativen Kontext. Beim Mixture-of-Experts-Modell beschreibt die aktive Zahl den Rechenaufwand je Token; beim Laden benötigen dennoch alle Expertengewichte Speicher.
Nicht nur nach Parametern kaufen
Ein Modell, das mit 8K lädt, kann bei 64K scheitern oder deutlich langsamer werden. Repository-Agenten halten zusätzlich Tool-Schemata, Dateiauszüge, Befehlsausgaben und Gesprächsverlauf im Prompt.
Agent und Modell getrennt wählen
Terminal-Agent, der ein Repository prüfen, Dateien ändern und Befehle ausführen kann. Ollama bietet einen direkten Startweg.
Geeignet für:Repo-Arbeit und Terminal-WorkflowsLokale Einrichtung öffnenIDE-Erweiterung mit getrennten Rollen für Chat, Bearbeitung und Autocomplete. Ollama-Modelle lassen sich erkennen oder genau konfigurieren.
Geeignet für:VS Code und JetBrainsOffizieller Ollama-RatgeberIDE-Agent mit lokalen Modellen. Der eigene Ratgeber verbindet Hardwareplanung mit kompakten Prompts.
Geeignet für:geführte Agentenarbeit in der IDEOffizieller RatgeberGit-bewusster Pair Programmer im Terminal. Der Ollama-Ratgeber betont den Chat-Endpunkt und die Prüfung des eingestellten Kontexts.
Geeignet für:fokussierte Änderungen mit GitOffizieller Ollama-RatgeberEine RTX 5090 bietet 32 GB dedizierten VRAM und ist stark, wenn gewähltes Modell und Kontext hineinpassen. Schnellere Prompt-Verarbeitung und Ausgabe verkürzen Bearbeiten–Testen–Korrigieren-Schleifen.
Ein Ryzen-AI-Max+-395-System mit 128 GB kann größere quantisierte Modelle und mehr Kontext in einem kompakten Gehäuse halten. Das ist eine Kapazitätsentscheidung, keine Zusage für RTX-5090-Durchsatz.
Auch ein lokales Modell kann gefährliche Tools ausführen
Lokale Inferenz begrenzt den Ort der Prompt-Verarbeitung. Ein Agent kann dennoch Geheimnisse lesen, Befehle ausführen oder Netzwerk-Tools nutzen, wenn du es erlaubst.
Vorher committen und in Branch oder Worktree arbeiten, damit jede Änderung prüfbar und reversibel bleibt.
Zugangsdaten, Produktivdaten und private Schlüssel außerhalb des erreichbaren Arbeitsbereichs halten.
Agenten nicht als Administrator starten. Destruktive Befehle und externen Netzwerkzugriff bewusst freigeben.
Diff ansehen und Tests, Linter sowie Sicherheitsprüfungen ausführen, bevor Änderungen übernommen werden.
Komplettsysteme in der engeren Auswahl
| Priorität | Systemweg | Warum passend | Vor dem Kauf prüfen |
|---|---|---|---|
| Schneller Einzelagent | RTX-5090-Tower | 32 GB dedizierter VRAM und hoher CUDA-Durchsatz für passende Modelle. | Exakte Desktop-GPU, mindestens 64 GB RAM, Kühlung, Netzteil und SSD. |
| Große Modellkapazität | Beelink GTR9 Pro oder MINISFORUM MS-S1 Max | 128 GB Unified Memory im kompakten Ryzen-AI-Max+-395-System. | Exakte 128-GB-Version, nutzbare Grafikzuweisung, Betriebssystem und Backend. |
| NVIDIA-Modell-Appliance | ASUS Ascent GX10 | 128 GB kohärenter Speicher und NVIDIA-Softwareumgebung. | Arm64-/Linux-Kompatibilität jeder IDE-Erweiterung, jedes Containers und jeder Abhängigkeit. |
Fragen vor dem Kauf
Es gibt keinen Sieger für jeden PC und Workflow. Für Autocomplete zählt ein kleines Modell mit niedriger Latenz. Für Repository-Agenten sind Tool-Aufrufe, Patch-Qualität und ausreichend nutzbarer Kontext wichtiger. Qwen3-Coder 30B-A3B ist eine nützliche aktuelle Referenz für einen leistungsfähigen lokalen Agenten, sollte aber mit deinen Sprachen, deinem Repository und deiner Runtime getestet werden.
Für viele quantisierte 7B–14B-Modelle und fokussierten Code-Chat: ja. Für ein Modell der 30B-Klasse, 64K Kontext oder parallele Agenten ist es weniger komfortabel. System-RAM ist nicht mit dediziertem VRAM gleichzusetzen, außer die Plattform stellt ausdrücklich einen unterstützten Shared-Memory-Pfad bereit.
Wähle 32 GB schnellen dedizierten VRAM, wenn Geschwindigkeit zählt und das Modell passt. Wähle einen 128-GB-Pool, wenn Modellgröße, langer Kontext oder mehrere Dienste 32 GB überschreiten. Die größere Zahl bedeutet nicht automatisch schnellere Inferenz.
Die Inferenz kann lokal bleiben. Prüfe zusätzlich Agent, Erweiterungen, Telemetrie, Web-Tools, Paketmanager und ausgeführte Befehle. Vollständig offline ist der Ablauf erst, wenn diese Netzwerkwege deaktiviert oder kontrolliert sind.
Primärdokumentation
Gesamt- und Aktivparameter, nativer Kontext, Tool-Aufrufe und Hinweise bei Speichermangel. Offizielle Qwen-Modellkarte.
Direkter Start, Kontext lokaler Modelle und manuelle Provider-Konfiguration. Offizieller Integrationsratgeber.
Lokaler Ollama-Endpunkt, Modell-IDs und Fehlersuche bei Tool-Aufrufen. Offizielle Provider-Dokumentation.
Von der Entscheidung zum arbeitenden Agenten
Nutze einen kleinen reversiblen Auftrag, miss ob der Patch die Tests besteht und entscheide erst dann, ob Modellqualität, Kontext oder Hardwaregeschwindigkeit der Engpass ist.