8B bis 14B: viel Reserve
Mehrere kleine Komponenten, längere Kontexte oder parallele Aufgaben sind realistischer, solange die konkrete Runtime den Speicher effizient nutzt.
GPU-Ratgeber für schnelle lokale KI
32 GB GDDR7 und hohe Speicherbandbreite machen die GeForce RTX 5090 zu einer schnellen Einzel-GPU für lokale Inferenz. Sie ist besonders stark, wenn Modell, Kontext und Runtime vollständig in den VRAM passen.
Einsatzprofil
Mehrere kleine Komponenten, längere Kontexte oder parallele Aufgaben sind realistischer, solange die konkrete Runtime den Speicher effizient nutzt.
Geeignet quantisierte Modelle können vollständig im VRAM liegen. Das ist die interessante Klasse für schnelle Coding-Assistenten, RAG und anspruchsvolle lokale Chats.
Ein typisches 70B-Modell passt selbst in starker Quantisierung nicht samt Kontext komfortabel in 32 GB. Teilweises Offloading in System-RAM senkt das Tempo.
NVIDIA nennt für die RTX 5090 offiziell 32 GB GDDR7. Modellarchitektur, Quantisierung und KV-Cache bestimmen, was davon praktisch reicht.
Ausgewogenes Gesamtsystem
| Bauteil | Sinnvoller Ausgangspunkt | Warum es zählt |
|---|---|---|
| GPU | GeForce RTX 5090 Desktop, 32 GB | Mobile oder anders benannte Varianten sind nicht gleichwertig |
| System-RAM | 64 GB; 128 GB bei häufigem Offload | Runtime, RAG-Daten und ausgelagerte Modellschichten brauchen Reserve |
| SSD | mindestens 2 TB NVMe | Modelle und mehrere Quantisierungen belegen schnell viel Platz |
| Netzteil | Herstellerkonfiguration für Dauerlast | GPU, CPU und Lastspitzen müssen gemeinsam abgedeckt sein |
| Kühlung | großer Airflow-Tower, freie Zu- und Abluft | anhaltende Inferenz ist keine kurze Gaming-Last |
| Netzwerk | 2,5-GbE sinnvoll | praktisch als Modellserver für weitere Geräte |
Konfiguration statt Produktname
„RTX 5090“ gehört vollständig in die konkrete Ausstattung. Allgemeine Produktfamilien mit mehreren GPU-Optionen reichen als Nachweis nicht.
64 GB sind der vernünftige Start. Prüfe Modulanzahl, Takt und ob ein späterer Ausbau ohne Komplettaustausch möglich ist.
Eine zweite SSD trennt Modelle und Projektdaten sauber vom Betriebssystem. Freie Slots vereinfachen die Erweiterung.
Wattzahl, Qualitätsklasse und korrekte GPU-Verkabelung müssen zur Herstellerkonfiguration gehören; Mehrfachadapter sind kein Qualitätsmerkmal.
Filter, Lüfterplätze und zugängliche Komponenten sind für einen langlebigen lokalen KI-Rechner wertvoller als reine RGB-Ausstattung.
Wenn 70B ohne spürbares CPU-Offloading dein Kernziel ist, vergleiche 128-GB-Unified-Memory oder professionelle GPUs mit 48 bis 96 GB VRAM.
Passende Angebotsklasse
Bevorzuge eine ausdrücklich genannte Desktop-RTX 5090 mit 32 GB, mindestens 2 TB NVMe, zugänglichen M.2-Plätzen und einem vom Systemhersteller passend ausgelegten Netzteil.
* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. Es gelten die Angaben auf der Zielseite.
Wenn 32 GB reichen
CUDA-Unterstützung ist in vielen lokalen KI-Werkzeugen gut etabliert. Dennoch sollte die gewünschte Runtime vor dem Kauf auf aktuelle Treiber- und Backend-Anforderungen geprüft werden.
Lokale KI einrichtenWenn 70B das Ziel ist
Ein schneller Prozessor und eine RTX 5090 lösen die 32-GB-Grenze nicht. Unser 70B-Ratgeber zeigt drei realistische Speicherpfade.
70B-PCs vergleichen