GPU-Ratgeber für schnelle lokale KI

RTX-5090-Komplettsysteme für lokale LLMs

32 GB GDDR7 und hohe Speicherbandbreite machen die GeForce RTX 5090 zu einer schnellen Einzel-GPU für lokale Inferenz. Sie ist besonders stark, wenn Modell, Kontext und Runtime vollständig in den VRAM passen.

Einsatzprofil

Wofür 32 GB VRAM gut passen

8B bis 14B: viel Reserve

Mehrere kleine Komponenten, längere Kontexte oder parallele Aufgaben sind realistischer, solange die konkrete Runtime den Speicher effizient nutzt.

20B bis 32B: Sweet Spot

Geeignet quantisierte Modelle können vollständig im VRAM liegen. Das ist die interessante Klasse für schnelle Coding-Assistenten, RAG und anspruchsvolle lokale Chats.

70B: nur mit Kompromiss

Ein typisches 70B-Modell passt selbst in starker Quantisierung nicht samt Kontext komfortabel in 32 GB. Teilweises Offloading in System-RAM senkt das Tempo.

NVIDIA nennt für die RTX 5090 offiziell 32 GB GDDR7. Modellarchitektur, Quantisierung und KV-Cache bestimmen, was davon praktisch reicht.

Ausgewogenes Gesamtsystem

Diese Ausstattung sollte ein fertiger PC mitbringen

BauteilSinnvoller AusgangspunktWarum es zählt
GPUGeForce RTX 5090 Desktop, 32 GBMobile oder anders benannte Varianten sind nicht gleichwertig
System-RAM64 GB; 128 GB bei häufigem OffloadRuntime, RAG-Daten und ausgelagerte Modellschichten brauchen Reserve
SSDmindestens 2 TB NVMeModelle und mehrere Quantisierungen belegen schnell viel Platz
NetzteilHerstellerkonfiguration für DauerlastGPU, CPU und Lastspitzen müssen gemeinsam abgedeckt sein
Kühlunggroßer Airflow-Tower, freie Zu- und Abluftanhaltende Inferenz ist keine kurze Gaming-Last
Netzwerk2,5-GbE sinnvollpraktisch als Modellserver für weitere Geräte

Konfiguration statt Produktname

Vor dem Kauf exakt kontrollieren

1

Desktop-GPU und 32 GB müssen genannt sein

„RTX 5090“ gehört vollständig in die konkrete Ausstattung. Allgemeine Produktfamilien mit mehreren GPU-Optionen reichen als Nachweis nicht.

2

RAM-Bestückung und freie Slots

64 GB sind der vernünftige Start. Prüfe Modulanzahl, Takt und ob ein späterer Ausbau ohne Komplettaustausch möglich ist.

3

SSD-Anzahl und freie M.2-Steckplätze

Eine zweite SSD trennt Modelle und Projektdaten sauber vom Betriebssystem. Freie Slots vereinfachen die Erweiterung.

4

Netzteil und Stromanschluss

Wattzahl, Qualitätsklasse und korrekte GPU-Verkabelung müssen zur Herstellerkonfiguration gehören; Mehrfachadapter sind kein Qualitätsmerkmal.

5

Gehäuse und Wartung

Filter, Lüfterplätze und zugängliche Komponenten sind für einen langlebigen lokalen KI-Rechner wertvoller als reine RGB-Ausstattung.

6

Keine 70B-Erwartung aus 32 GB ableiten

Wenn 70B ohne spürbares CPU-Offloading dein Kernziel ist, vergleiche 128-GB-Unified-Memory oder professionelle GPUs mit 48 bis 96 GB VRAM.

Passende Angebotsklasse

RTX-5090-Tower mit mindestens 64 GB RAM vergleichen

Bevorzuge eine ausdrücklich genannte Desktop-RTX 5090 mit 32 GB, mindestens 2 TB NVMe, zugänglichen M.2-Plätzen und einem vom Systemhersteller passend ausgelegten Netzteil.

Passende Systeme ansehen*

* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. Es gelten die Angaben auf der Zielseite.

Wenn 32 GB reichen

Der schnelle Einzel-GPU-Pfad

CUDA-Unterstützung ist in vielen lokalen KI-Werkzeugen gut etabliert. Dennoch sollte die gewünschte Runtime vor dem Kauf auf aktuelle Treiber- und Backend-Anforderungen geprüft werden.

Lokale KI einrichten

Wenn 70B das Ziel ist

Mehr Speicher vor mehr Rechenleistung

Ein schneller Prozessor und eine RTX 5090 lösen die 32-GB-Grenze nicht. Unser 70B-Ratgeber zeigt drei realistische Speicherpfade.

70B-PCs vergleichen