Modellgröße wählen
Ein quantisiertes 8B-Modell ist genügsam. 32B und 70B brauchen deutlich mehr Speicher, können dafür komplexere Aufgaben besser abdecken.
Lokale KI. Deine Hardware. Deine Daten.
Finde heraus, wie viel Modellspeicher du wirklich brauchst – und welche Komplettsysteme zu Modellgröße, Tempo, Platz und Budget passen.
In drei Schritten zur passenden Klasse
Für lokale Sprachmodelle zählt vor allem, ob Modell, Kontextspeicher und Laufzeit-Reserve gemeinsam in den schnellen Speicher passen. Eine hohe NPU-TOPS-Zahl allein beantwortet diese Frage nicht.
Ein quantisiertes 8B-Modell ist genügsam. 32B und 70B brauchen deutlich mehr Speicher, können dafür komplexere Aufgaben besser abdecken.
Eine diskrete High-End-GPU bietet sehr hohes Tempo. Große Unified Memory kann größere Modelle aufnehmen – mit einem anderen Leistungsprofil.
Kühlung, RAM-Aufteilung, SSD, Aufrüstbarkeit und die exakte GPU-Konfiguration entscheiden ebenso wie der Prozessorname.
Schnelle Orientierung
Guter Startpunkt für 7B bis 14B in geeigneter Quantisierung und normale Kontextlängen.
Chat · Zusammenfassen · erste Coding-WorkflowsInteressant für 20B bis 32B quantisiert oder mehrere kleinere Komponenten mit Reserve.
Coding · RAG · anspruchsvollere AssistentenKapazitätsklasse für 70B-Modelle und große Kontexte – abhängig von Runtime und Quantisierung.
70B · lange Kontexte · Agenten-StacksDie Werte sind konservative Orientierung, keine Garantie. Architektur, Quantisierung, Kontext, KV-Cache und Runtime verändern den Bedarf.
Konkrete Komplettsysteme
Wähle nach Modellgröße und Alltag: große Speicherkapazität im kompakten Gerät oder sehr hohe GPU-Geschwindigkeit im Tower.
Kapazitäts-Fokus · kompakt
Ryzen AI Max+ 395, bis zu 128 GB gemeinsam nutzbarer Speicher und 2-TB-Konfiguration: interessant, wenn große quantisierte Modelle wichtiger sind als maximale diskrete GPU-Geschwindigkeit.
Kompakter Einstieg · Unified Memory
Die 64-GB-Konfiguration verbindet ein kleines Gehäuse mit Ryzen AI Max+ 395. Sie bietet mehr gemeinsamen Speicher als typische Gaming-GPUs, bleibt aber unter der 128-GB-Klasse.
Tempo-Fokus · Desktop
Eine GeForce RTX 5090 mit 32 GB VRAM ist eine starke Basis für schnelle Inferenz bis in die 32B-Klasse. Bei größeren Modellen wird CPU-/RAM-Offloading zum Kompromiss.
* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. Exakte Ausstattung und aktuelle Verfügbarkeit bitte beim Anbieter prüfen.
Dein Nutzungsprofil zählt
Der Finder berücksichtigt Modellklasse, Kontextlänge, Einsatzzweck und deine wichtigste Priorität. Das Ergebnis ist eine nachvollziehbare Hardwareklasse statt einer scheinpräzisen Einzelantwort.
Nach deinem Hauptziel wählen
Für überwiegend 8B- bis 32B-Modelle ist eine RTX 5090 mit 32 GB VRAM besonders schnell. Achte zusätzlich auf mindestens 64 GB System-RAM und 2 TB NVMe.
RTX-5090-Kaufcheck128 GB Unified Memory schaffen Platz für viele quantisierte 70B-Modelle samt Reserve. Die Antwortgeschwindigkeit liegt jedoch unter großen professionellen GPUs.
70B-HardwarepfadeEin 64-GB-Mini-PC passt gut zu 20B- bis 32B-Modellen. Plane wegen verlötetem RAM die Endkapazität sofort und nutze einen zweiten M.2-Platz für Modelle.
64 und 128 GB vergleichen