Modellgröße wählen
Ein quantisiertes 8B-Modell ist genügsam. 32B und 70B brauchen deutlich mehr Speicher, können dafür komplexere Aufgaben besser abdecken.
Lokale KI. Deine Hardware. Deine Daten.
Finde heraus, wie viel Modellspeicher du wirklich brauchst – und welche Komplettsysteme zu Modellgröße, Tempo, Platz und Budget passen.
In drei Schritten zur passenden Klasse
Für lokale Sprachmodelle zählt vor allem, ob Modell, Kontextspeicher und Laufzeit-Reserve gemeinsam in den schnellen Speicher passen. Eine hohe NPU-TOPS-Zahl allein beantwortet diese Frage nicht.
Ein quantisiertes 8B-Modell ist genügsam. 32B und 70B brauchen deutlich mehr Speicher, können dafür komplexere Aufgaben besser abdecken.
Eine diskrete High-End-GPU bietet sehr hohes Tempo. Große Unified Memory kann größere Modelle aufnehmen – mit einem anderen Leistungsprofil.
Kühlung, RAM-Aufteilung, SSD, Aufrüstbarkeit und die exakte GPU-Konfiguration entscheiden ebenso wie der Prozessorname.
Speicherklassen im Überblick
Guter Startpunkt für 7B bis 14B in geeigneter Quantisierung und normale Kontextlängen.
Chat · Zusammenfassen · erste Coding-WorkflowsInteressant für 20B bis 32B quantisiert oder mehrere kleinere Komponenten mit Reserve.
Coding · RAG · anspruchsvollere AssistentenKapazitätsklasse für 70B-Modelle und große Kontexte – abhängig von Runtime und Quantisierung.
70B · lange Kontexte · Agenten-StacksDie Bereiche enthalten eine praxisnahe Reserve, sind aber keine Garantie. Architektur, Quantisierung, Kontext, KV-Cache und Runtime verändern den Bedarf.
Privaten Coding-Assistenten aufbauen
Ein Coding-Agent benötigt mehr als Modellgewichte: Tool-Aufrufe, 64K Kontext und parallele Sitzungen können die Speicherklasse verschieben. Der neue Ratgeber verbindet den Workflow mit einem passenden Komplett-PC.
OpenCode mit Ollama einrichtenKonkrete Komplettsysteme
Wähle nach Modellgröße und Alltag: 64 GB für 20B bis 32B, 128 GB für viele quantisierte 70B-Modelle oder eine kompakte Business-Workstation.
Kapazitäts-Fokus · kompakt
Ryzen AI Max+ 395, bis zu 128 GB gemeinsam nutzbarer Speicher und 2-TB-Konfiguration: interessant, wenn große quantisierte Modelle wichtiger sind als maximale diskrete GPU-Geschwindigkeit.
Kompakter Einstieg · Unified Memory
Die 64-GB-Konfiguration verbindet ein kleines Gehäuse mit Ryzen AI Max+ 395. Sie bietet mehr gemeinsamen Speicher als typische Gaming-GPUs, bleibt aber unter der 128-GB-Klasse. Varianten vergleichen.
Große Modelle · Unified Memory
Die 128-GB-/2-TB-Konfiguration derselben kompakten Baureihe schafft deutlich mehr Reserve für große Quantisierungen, lange Kontexte und zusätzliche lokale Dienste. Kaufratgeber lesen.
Business-Wahl · kompakt
Die konkrete 64-GB-/2-TB-Konfiguration kombiniert Ryzen AI Max+ PRO 395, Radeon 8060S, Thunderbolt 4 und ein internes Netzteil für den professionellen Windows-Arbeitsplatz. Kaufratgeber lesen.
* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdienen wir an qualifizierten Verkäufen. Exakte Ausstattung und aktuelle Verfügbarkeit bitte beim Anbieter prüfen.
Dein Nutzungsprofil zählt
Der Finder berücksichtigt Modellklasse, Kontextlänge, Einsatzzweck und deine wichtigste Priorität. Das Ergebnis ist eine nachvollziehbare Hardwareklasse statt einer scheinpräzisen Einzelantwort.
Nach deinem Hauptziel wählen
Für überwiegend 8B- bis 32B-Modelle ist eine RTX 5090 mit 32 GB VRAM besonders schnell. Achte zusätzlich auf mindestens 64 GB System-RAM und 2 TB NVMe.
RTX-5090-Kaufcheck128 GB Unified Memory schaffen Platz für viele quantisierte 70B-Modelle samt Reserve. Die Antwortgeschwindigkeit liegt jedoch unter großen professionellen GPUs.
70B-HardwarepfadeEin 64-GB-Mini-PC passt gut zu 20B- bis 32B-Modellen. Plane wegen verlötetem RAM die Endkapazität sofort und nutze einen zweiten M.2-Platz für Modelle.
64 und 128 GB vergleichen