32 GB GDDR7 · hohe Bandbreite · CUDA

RTX 5090 für lokale LLMs: Karte und PC richtig wählen

Die RTX 5090 ist eine starke Einzel-GPU für schnelle lokale Coding-Assistenten, RAG und anspruchsvolle Sprachmodelle. Entscheidend ist nicht das teuerste Kühlerdesign, sondern ob Modell, Quantisierung, Kontext und Runtime gemeinsam in 32 GB VRAM passen.

  • 32 GB dedizierter VRAM
  • stark für 20B–32B
  • Tempo und Speicher getrennt bewertet

Die kurze Kaufantwort

Wann eine RTX 5090 sinnvoll ist – und wann nicht

Ja: schnelle Modelle bis etwa 32B

Wenn ein quantisiertes Modell samt Kontext vollständig im VRAM bleibt, liefert die Karte sehr kurze Antwortzeiten und schnelle Agenten-Loops.

Tempo zuerst

Eher nein: 70B ohne Offloading

Viele 70B-Gewichte benötigen schon in 4-Bit-Form mehr als 32 GB. System-RAM macht sie ausführbar, aber nicht so schnell wie ein vollständig GPU-residentes Modell.

Kapazität zuerst70B-Hardware vergleichen

Herstellerwahl: Kühlung statt „KI-IQ“

ASUS, MSI, GIGABYTE, ZOTAC und PNY verwenden denselben RTX-5090-Chip mit 32 GB. Das Boarddesign beeinflusst Temperatur, Lautstärke, Abmessungen und etwas Tempo – nicht die Grundfähigkeit des geladenen Modells.

Passform und Zuverlässigkeit

Was in 32 GB passt

Modellgröße, Quantisierung und Kontext gemeinsam rechnen

Parameterzahl allein reicht nicht. Zum Gewichtsspeicher kommen KV-Cache, Runtime-Puffer, Vision-Encoder und Sicherheitsreserve. Die Spannen sind Planungswerte; Architektur und Dateiformat können sie verschieben.

ModellklasseTypischer Pfad32-GB-FitPraktische Folge
7B–14BQ4 bis Q8, teils höhere PräzisionkomfortabelViel Reserve für Kontext, RAG, Bildencoder oder parallele Sitzungen.
20B–32BQ4/Q5, FP4 oder FP8 je nach Modell und EngineSweet SpotStarke Coding- und Agentenmodelle können vollständig auf der GPU bleiben.
40B–50Baggressive Quantisierung oder Teil-OffloadknappKontextreserve schrumpft; vor dem Download den realen Speicherbedarf prüfen.
65B–72BQ4-Gewichte oft etwa 35–45+ GBmeist nicht vollständigCPU-/RAM-Offloading senkt den Durchsatz und erhöht die Antwortzeit deutlich.
MoE-ModelleGesamtgewichte müssen gespeichert werdenmodellabhängig„Aktive Parameter“ erklären Rechenaufwand, nicht automatisch den Speicherbedarf.
ModellgewichteParameter × QuantisierungKV-CacheKontext × ArchitekturRuntimeGraphen, Puffer, VisionReservefür stabile Lastspitzen

NVIDIA spezifiziert die Desktop-RTX-5090 mit 32 GB GDDR7 und 512-Bit-Speicherinterface. Eine mobile RTX 5090 ist wegen abweichendem Speicher- und Leistungsrahmen kein gleichwertiger Ersatz.

Coding-Leistung richtig lesen

Die Grafikkarte beschleunigt das Modell – sie ersetzt kein stärkeres Modell

Eine dauerhafte Kaufberatung muss Ergebnisqualität und Rechengeschwindigkeit trennen. Ein fester Satz wie „dieser PC entspricht Cloud-Modell X mit Reasoning-Stufe Y“ veraltet, sobald Modelle, Quantisierungen oder Test-Harnesses wechseln.

Was die Lösungsqualität bestimmt

  • Grundmodell und Trainingsqualität
  • Quantisierung und möglicher Qualitätsverlust
  • Reasoning-Budget und Kontext
  • Agent, Tools, Prompt und Benchmark-Harness

Was die RTX 5090 verbessert

  • Prompt-Verarbeitung und Token-Ausgabe
  • mehr Agentenschritte innerhalb eines Zeitlimits
  • mehr gleichzeitige Sitzungen bei passender Engine
  • kurze Iterationen bei Tests, Builds und Tool-Aufrufen
Vergleichsregel: Erst Pass@1 oder gelöste Repo-Aufgaben vergleichen, dann Gesamtzeit pro gelöster Aufgabe, danach Reasoning-Tokens und Energie pro Lösung. Reine Tokens pro Sekunde sagen nicht, ob der Patch korrekt ist.

Datierter Praxis-Schnappschuss · 26. August 2026

Welche Geschwindigkeit du grob erwarten kannst

Die RTX 5090 kann je nach Modell und Engine völlig unterschiedliche Werte liefern. Die folgenden veröffentlichten Einzel-GPU-Läufe zeigen deshalb eine Spanne statt einer Werbezahl.

BeispielMesspfadVeröffentlichter WertWas daraus folgt
Kompaktes 7B, Q4llama.cpp Vulkan, TG128rund 264 Output-tok/sKleine Modelle sind weit jenseits normaler Lesegeschwindigkeit.
Dichtes 27B, Q4llama.cpp, einzelne Sitzungrund 68–69 Output-tok/sEin konservativer Runtime-Pfad kann bereits gut interaktiv sein.
Dichtes 27B, optimiertes NVFP4vLLM/Blackwell, MTPgrob 100–180 tok/s, je nach Text und CheckpointNative FP4- und Speculative-Decoding-Pfade können die Wartezeit stark senken.

Quellen und Randbedingungen: llama.cpp-Vulkan-Scoreboard, 27B-Q4-Lauf und optimierte 27B-NVFP4-Messungen. Der schnellste Aufbau ist experimentell, teils übertaktet und keine Stock-Garantie. Treiber, Engine, Kontexttiefe, Prompt-/Decode-Anteil, MTP-Akzeptanz und Parallelität müssen für faire Vergleiche identisch sein.

Zeit bis zur Lösung

Warum 150 tok/s bei langen Coding-Agenten mehr als Komfort sind

Lange Reasoning-Läufe können zehntausende Ausgabetokens erzeugen. Höheres Tempo bringt dann mehr Versuche, Tests und Korrekturschleifen in dasselbe Zeitbudget.

150 tok/s≈ 11 Min.
100 tok/s≈ 17 Min.
75 tok/s≈ 22 Min.
30 tok/s≈ 56 Min.
16 tok/s≈ 104 Min.

Rechenbeispiel für 100.000 generierte Tokens, gerundet. Prompt-Verarbeitung, Tool-Aufrufe, Tests, Builds, Cache-Treffer und Warteschlangen kommen hinzu. Ein stärkeres, token-effizienteres Modell kann trotz niedrigerer tok/s früher zur korrekten Lösung gelangen.

RTX-5090-Karten mehrerer Hersteller

Fünf sinnvolle Modellfamilien für einen lokalen KI-PC

Alle folgenden Karten besitzen 32 GB GDDR7. Vergleiche daher Gesamtpreis, Kühler, Abmessungen, BIOS-Profile, Garantie und Verkäufer – nicht vermeintliche Unterschiede bei der Modellintelligenz. Die Angebotslinks führen zum bestätigten exakten Modell oder ersatzweise zu einer eng gefassten, länderspezifischen Suche.

Große Premium-Luftkühlung

ASUS ROG Astral RTX 5090 OC

Vier Lüfter, Vapor Chamber und eine sehr große 3,8-Slot-Bauform zielen auf niedrige Temperaturen bei anhaltender Last.

Speicher
32 GB GDDR7
Abmessungen
357,6 × 149,3 × 76 mm
Kühlung
Luft · 4 Lüfter · 3,8 Slots

Vor dem Kauf: Seitliche Steckerfreiheit, Kartenstütze und Gehäusebreite vorab messen.

Luftkühlung mit Dual-BIOS

MSI RTX 5090 Gaming Trio OC

Die Gaming-Trio-Variante kombiniert drei Lüfter, Vapor Chamber und umschaltbare Gaming-/Silent-Profile.

Speicher
32 GB GDDR7
Abmessungen
359 × 149 × 70 mm
Kühlung
Luft · 3 Lüfter · Dual-BIOS

Vor dem Kauf: Mit 359 mm Länge gehört sie in ein großes Airflow-Gehäuse.

Etwas kürzer, weiterhin sehr breit

GIGABYTE RTX 5090 Gaming OC 32G

Die Gaming-OC-Ausführung nutzt WINDFORCE-Kühlung, Dual-BIOS und eine mitgelieferte Kartenhalterung.

Speicher
32 GB GDDR7
Abmessungen
342 × 152 × 70 mm
Kühlung
Luft · 3 Lüfter · Dual-BIOS

Vor dem Kauf: Die Höhe von 152 mm plus Stromstecker und Kabelbogen einplanen.

Kürzere 3,5-Slot-Option

ZOTAC RTX 5090 Solid OC

Die Solid OC ist mit knapp 330 mm kürzer als mehrere Premiumvarianten, bleibt aber eine breite Hochleistungskarte.

Speicher
32 GB GDDR7
Abmessungen
329,7 × 137,8 × 67,8 mm
Kühlung
Luft · 3 Lüfter · 3,5 Slots

Vor dem Kauf: „Kürzer“ bedeutet nicht kompakt: Slotbreite und benachbarte Steckplätze prüfen.

Geradlinige 3,5-Slot-Karte

PNY RTX 5090 OC Triple Fan

Die OC-Triple-Fan-Variante konzentriert sich auf klassische Luftkühlung ohne externen Radiator.

Speicher
32 GB GDDR7
Abmessungen
328,7 × 137,7 × 70 mm
Kühlung
Luft · 3 Lüfter · 3,5 Slots

Vor dem Kauf: OC- und ARGB-Varianten anhand der vollständigen Teilenummer unterscheiden.

* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdienen wir an qualifizierten Verkäufen. Preis, Zustand, Verkäufer, Lieferumfang und Verfügbarkeit werden ausschließlich auf der Zielseite verbindlich angegeben.

Boardpartner auswählen

Wofür sich ein Aufpreis wirklich lohnen kann

MerkmalNutzen für lokale KIPrüfung vor dem Kauf
Kühler und LüfterkurveStabileres Tempo und weniger Geräusch bei stundenlanger Inferenz.Unabhängige Lastmessungen, Silent-BIOS, Lüfterstillstand und Gehäuse-Airflow betrachten.
AbmessungenKein Geschwindigkeitsgewinn, aber entscheidend für sicheren Einbau und Luftzufuhr.Länge, Höhe, Slotbreite, Seitenwand, Radiator und Kabelbogen in Millimetern messen.
Dual-BIOSPraktisch für einen leisen Dauerbetrieb ohne Softwareprofil.Vor dem Umschalten vollständig herunterfahren und Herstelleranleitung beachten.
Werks-OCMeist nur wenige Prozent Mehrtempo; keine höhere Modellqualität.Mehrpreis gegen Lautstärke, Leistungsaufnahme und reale Inferenzmessung abwägen.
Luft- oder AIO-KühlungAIO kann Abwärme direkt aus dem Gehäuse führen.Radiatorplatz, Pumpengeräusch, Schlauchführung und langfristige Wartbarkeit einplanen.
Garantie und ServiceBei einer teuren Dauerlast-Komponente wichtiger als dekorative Ausstattung.Region, Rechnung, Seriennummer, Verkäuferstatus und Garantiebedingungen prüfen.

Preisregel: Wenn zwei luftgekühlte Karten sicher passen und ähnlich leise arbeiten, ist die günstigere meist die vernünftigere LLM-Wahl. Mehr Takt oder RGB macht das Sprachmodell nicht klüger.

Ausgewogener PC-Build

Diese Komponenten passen zu einer RTX 5090

Für vollständig GPU-residente Inferenz muss nicht die teuerste CPU verbaut sein. Reserve bei RAM, SSD, Netzteil und Kühlung bringt im Alltag meist mehr.

BauteilSinnvoller AusgangspunktWarum
GPUDesktop RTX 5090, 32 GBNative Blackwell-Pfade und hohe Bandbreite für Modelle, die in den VRAM passen.
CPUmoderner 12- bis 16-Kern-ProzessorGenug Reserve für Agent, Builds, Datenaufbereitung und Tool-Aufrufe; Decode bleibt meist GPU-limitiert.
System-RAM64 GB Minimum, 128 GB für Offload/RAGGroße Repositories, Vektordatenbank, Container und ausgelagerte Modellschichten benötigen Reserve.
SSD2 TB Minimum, 4 TB komfortabelMehrere Quantisierungen, Modelle, Container und Projektdaten belegen schnell hunderte Gigabyte.
Netzteilhochwertiges ATX 3.1, mindestens nach Kartenfreigabe; oft 1000–1200 WDie Referenzkarte ist mit 575 W spezifiziert; CPU, Lastspitzen und Alterungsreserve kommen hinzu.
Gehäusegroßer Airflow-Tower mit GPU-Stütze330–359 mm Kartenlänge und bis zu 76 mm Dicke brauchen echte, nicht nur nominelle Freiheit.
Netzwerk2,5-GbE, optional 10GbEPraktisch für NAS-Modelle und die Nutzung als lokaler Inferenzserver.

Dauerlast sicher beherrschen

Stromstecker, Luftstrom und Raumwärme gehören zur Leistung

12V-2x6 sauber anschließen

Bevorzuge das direkte, zum Netzteil gehörende Kabel. Stecker vollständig einsetzen, Zug vermeiden und den vom Hersteller geforderten Biegeradius einhalten. Nach Transport erneut prüfen.

Abwärme abführen

Drei freie Front-/Bodeneinlässe sowie großzügige Heck-/Deckelabluft sind ein guter Start. Radiatoren, Laufwerkskäfige und eine Seitenwand direkt vor den GPU-Lüftern verändern den Luftweg.

Energie pro Lösung messen

700 W Systemleistung über eine Stunde entsprechen 0,7 kWh. Power-Limit oder Undervolting können effizienter sein, müssen aber mit realen Agentenläufen auf Stabilität und Zeit bis zur Lösung geprüft werden.

Die NVIDIA-Einbauanleitung und die Anleitung der konkreten Herstellerkarte haben Vorrang. Öffne Netzteile nicht und improvisiere keine Hochstromkabel.

Runtime vor Hardwarekauf

Blackwell-Unterstützung konkret prüfen

CUDA-Treiber allein garantieren noch keinen optimalen FP4-, Flash-Attention- oder Speculative-Decoding-Pfad. Prüfe die geplante Engine, Modellquantisierung, Betriebssystemversion und benötigte Kontextlänge zusammen. Ein stabiler Q4-Lauf kann nützlicher sein als ein schneller experimenteller Build.

Setup-Ratgeber öffnen

Zwei RTX 5090

64 GB VRAM entstehen nicht automatisch

Die RTX 5090 besitzt kein NVLink. Zwei Karten können mit Tensor-/Pipeline-Parallelität oder getrennten Modellinstanzen arbeiten, doch Runtime, Modell und Mainboard müssen das unterstützen. Puffer werden teils dupliziert; PCIe, Slotabstand, Kühlung und Netzteil werden zum eigenen Workstation-Projekt.

Speicherpfade vergleichen

Vor dem Bezahlen

Der 10-Punkte-Kaufcheck für Karte oder Komplett-PC

01

Desktop RTX 5090 und 32 GB

Keine Laptopvariante, kein ähnlich benanntes Zubehör und keine auswählbare Produktfamilie ohne bestätigte Konfiguration.

02

Vollständige Teilenummer

OC, Liquid, ARGB, White und BTF können andere Abmessungen, Anschlüsse oder Lieferumfänge besitzen.

03

Zustand und Verkäufer

Neuware, Verkäufer, Versandweg, Rechnung und Rückgaberecht müssen bei einer hochpreisigen Komponente eindeutig sein.

04

Gehäuse in drei Achsen

Länge, Höhe und Slotbreite samt Frontlüftern, Radiator, Kabelbogen und Seitenwand messen.

05

Netzteil und Originalkabel

ATX-Version, Leistung, Anschluss und freigegebene Kabel des Netzteilherstellers abgleichen.

06

Mainboard-Freiraum

GPU-Kühler darf wichtige M.2-, Capture-, Netzwerk- oder weitere Erweiterungsplätze nicht unbrauchbar machen.

07

RAM-Bestückung

64 GB sollten erweiterbar sein; 2×32 GB lässt häufig mehr Spielraum als 4×16 GB.

08

SSD-Ausbau

Freie M.2-Slots und Kühlkörper prüfen. Eine separate Modell-SSD erleichtert Neuinstallation und Backup.

09

Garantie in deiner Region

Seriennummer, Händlerstatus und Herstellergarantie müssen zum Lieferland passen.

10

Unrealistische Preise meiden

Bei ungewöhnlich günstigen Angeboten Titel, Kategorie, Bilder, Verkäuferhistorie und Lieferumfang besonders streng prüfen.

Häufige Fragen

RTX 5090 für lokale KI – klar beantwortet

Macht eine teurere RTX-5090-Herstellerkarte das LLM klüger?

Nein. Bei identischem Modell, identischer Quantisierung, demselben Seed und derselben Runtime bleibt die grundlegende Ausgabequalität gleich. Kühlung und Takt können Berechnungen beschleunigen oder stabilisieren, aber keine fehlende Modellfähigkeit hinzufügen.

Reichen 32 GB VRAM für ein 70B-Modell?

Meist nicht für ein komfortables, vollständig GPU-residentes Q4-Setup samt Kontext. Teil-Offloading in 64 oder 128 GB System-RAM ist möglich, kostet jedoch Tempo. Wer 70B regelmäßig nutzt, sollte größere Speicherpools vergleichen.

Sind 64 GB System-RAM genug?

Für 8B–32B, die komplett im VRAM liegen, häufig ja. 128 GB sind sinnvoll, wenn du große Repositories, RAG, mehrere Dienste oder häufiges CPU-Offloading planst.

Bringt eine PCIe-5.0-SSD mehr Tokens pro Sekunde?

Nach dem vollständigen Laden des Modells normalerweise kaum. Eine schnelle SSD verkürzt Start- und Ladezeiten; Decode hängt bei GPU-residenten Modellen vor allem an GPU, Speicherbandbreite und Runtime.

Ist die RTX 5090 automatisch schneller als jede Cloud-API?

Nein. Lokale Ausgabe kann sehr schnell sein, doch ein stärkeres Cloud-Modell kann weniger Reasoning-Tokens benötigen oder öfter im ersten Versuch richtig liegen. Vergleiche korrekte Lösungen und Gesamtzeit, nicht nur sichtbare tok/s.

Welche RTX-5090-Karte ist für lokale LLMs die beste?

Die günstigste seriöse Karte, die sicher in dein Gehäuse passt, unter Dauerlast akzeptabel leise bleibt und eine passende Garantie besitzt, ist meist die beste. Premiumkühler lohnen sich vor allem für Lautstärke, Temperaturreserve oder besondere Einbauanforderungen.

Nächster Schritt

Erst Modell und Kontext wählen, dann die Karte

Unser Rechner berücksichtigt Gewichte, Quantisierung, KV-Cache und Reserve. So erkennst du, ob 32 GB wirklich passen oder ein größerer Speicherpool sinnvoller ist.

VRAM-Bedarf berechnen