Ja: schnelle Modelle bis etwa 32B
Wenn ein quantisiertes Modell samt Kontext vollständig im VRAM bleibt, liefert die Karte sehr kurze Antwortzeiten und schnelle Agenten-Loops.
Tempo zuerst32 GB GDDR7 · hohe Bandbreite · CUDA
Die RTX 5090 ist eine starke Einzel-GPU für schnelle lokale Coding-Assistenten, RAG und anspruchsvolle Sprachmodelle. Entscheidend ist nicht das teuerste Kühlerdesign, sondern ob Modell, Quantisierung, Kontext und Runtime gemeinsam in 32 GB VRAM passen.
Die kurze Kaufantwort
Wenn ein quantisiertes Modell samt Kontext vollständig im VRAM bleibt, liefert die Karte sehr kurze Antwortzeiten und schnelle Agenten-Loops.
Tempo zuerstViele 70B-Gewichte benötigen schon in 4-Bit-Form mehr als 32 GB. System-RAM macht sie ausführbar, aber nicht so schnell wie ein vollständig GPU-residentes Modell.
Kapazität zuerst70B-Hardware vergleichenASUS, MSI, GIGABYTE, ZOTAC und PNY verwenden denselben RTX-5090-Chip mit 32 GB. Das Boarddesign beeinflusst Temperatur, Lautstärke, Abmessungen und etwas Tempo – nicht die Grundfähigkeit des geladenen Modells.
Passform und ZuverlässigkeitWas in 32 GB passt
Parameterzahl allein reicht nicht. Zum Gewichtsspeicher kommen KV-Cache, Runtime-Puffer, Vision-Encoder und Sicherheitsreserve. Die Spannen sind Planungswerte; Architektur und Dateiformat können sie verschieben.
| Modellklasse | Typischer Pfad | 32-GB-Fit | Praktische Folge |
|---|---|---|---|
| 7B–14B | Q4 bis Q8, teils höhere Präzision | komfortabel | Viel Reserve für Kontext, RAG, Bildencoder oder parallele Sitzungen. |
| 20B–32B | Q4/Q5, FP4 oder FP8 je nach Modell und Engine | Sweet Spot | Starke Coding- und Agentenmodelle können vollständig auf der GPU bleiben. |
| 40B–50B | aggressive Quantisierung oder Teil-Offload | knapp | Kontextreserve schrumpft; vor dem Download den realen Speicherbedarf prüfen. |
| 65B–72B | Q4-Gewichte oft etwa 35–45+ GB | meist nicht vollständig | CPU-/RAM-Offloading senkt den Durchsatz und erhöht die Antwortzeit deutlich. |
| MoE-Modelle | Gesamtgewichte müssen gespeichert werden | modellabhängig | „Aktive Parameter“ erklären Rechenaufwand, nicht automatisch den Speicherbedarf. |
NVIDIA spezifiziert die Desktop-RTX-5090 mit 32 GB GDDR7 und 512-Bit-Speicherinterface. Eine mobile RTX 5090 ist wegen abweichendem Speicher- und Leistungsrahmen kein gleichwertiger Ersatz.
Coding-Leistung richtig lesen
Eine dauerhafte Kaufberatung muss Ergebnisqualität und Rechengeschwindigkeit trennen. Ein fester Satz wie „dieser PC entspricht Cloud-Modell X mit Reasoning-Stufe Y“ veraltet, sobald Modelle, Quantisierungen oder Test-Harnesses wechseln.
Datierter Praxis-Schnappschuss · 26. August 2026
Die RTX 5090 kann je nach Modell und Engine völlig unterschiedliche Werte liefern. Die folgenden veröffentlichten Einzel-GPU-Läufe zeigen deshalb eine Spanne statt einer Werbezahl.
| Beispiel | Messpfad | Veröffentlichter Wert | Was daraus folgt |
|---|---|---|---|
| Kompaktes 7B, Q4 | llama.cpp Vulkan, TG128 | rund 264 Output-tok/s | Kleine Modelle sind weit jenseits normaler Lesegeschwindigkeit. |
| Dichtes 27B, Q4 | llama.cpp, einzelne Sitzung | rund 68–69 Output-tok/s | Ein konservativer Runtime-Pfad kann bereits gut interaktiv sein. |
| Dichtes 27B, optimiertes NVFP4 | vLLM/Blackwell, MTP | grob 100–180 tok/s, je nach Text und Checkpoint | Native FP4- und Speculative-Decoding-Pfade können die Wartezeit stark senken. |
Quellen und Randbedingungen: llama.cpp-Vulkan-Scoreboard, 27B-Q4-Lauf und optimierte 27B-NVFP4-Messungen. Der schnellste Aufbau ist experimentell, teils übertaktet und keine Stock-Garantie. Treiber, Engine, Kontexttiefe, Prompt-/Decode-Anteil, MTP-Akzeptanz und Parallelität müssen für faire Vergleiche identisch sein.
Zeit bis zur Lösung
Lange Reasoning-Läufe können zehntausende Ausgabetokens erzeugen. Höheres Tempo bringt dann mehr Versuche, Tests und Korrekturschleifen in dasselbe Zeitbudget.
Rechenbeispiel für 100.000 generierte Tokens, gerundet. Prompt-Verarbeitung, Tool-Aufrufe, Tests, Builds, Cache-Treffer und Warteschlangen kommen hinzu. Ein stärkeres, token-effizienteres Modell kann trotz niedrigerer tok/s früher zur korrekten Lösung gelangen.
RTX-5090-Karten mehrerer Hersteller
Alle folgenden Karten besitzen 32 GB GDDR7. Vergleiche daher Gesamtpreis, Kühler, Abmessungen, BIOS-Profile, Garantie und Verkäufer – nicht vermeintliche Unterschiede bei der Modellintelligenz. Die Angebotslinks führen zum bestätigten exakten Modell oder ersatzweise zu einer eng gefassten, länderspezifischen Suche.
Große Premium-Luftkühlung
Vier Lüfter, Vapor Chamber und eine sehr große 3,8-Slot-Bauform zielen auf niedrige Temperaturen bei anhaltender Last.
Vor dem Kauf: Seitliche Steckerfreiheit, Kartenstütze und Gehäusebreite vorab messen.
Luftkühlung mit Dual-BIOS
Die Gaming-Trio-Variante kombiniert drei Lüfter, Vapor Chamber und umschaltbare Gaming-/Silent-Profile.
Vor dem Kauf: Mit 359 mm Länge gehört sie in ein großes Airflow-Gehäuse.
Etwas kürzer, weiterhin sehr breit
Die Gaming-OC-Ausführung nutzt WINDFORCE-Kühlung, Dual-BIOS und eine mitgelieferte Kartenhalterung.
Vor dem Kauf: Die Höhe von 152 mm plus Stromstecker und Kabelbogen einplanen.
Kürzere 3,5-Slot-Option
Die Solid OC ist mit knapp 330 mm kürzer als mehrere Premiumvarianten, bleibt aber eine breite Hochleistungskarte.
Vor dem Kauf: „Kürzer“ bedeutet nicht kompakt: Slotbreite und benachbarte Steckplätze prüfen.
Geradlinige 3,5-Slot-Karte
Die OC-Triple-Fan-Variante konzentriert sich auf klassische Luftkühlung ohne externen Radiator.
Vor dem Kauf: OC- und ARGB-Varianten anhand der vollständigen Teilenummer unterscheiden.
* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdienen wir an qualifizierten Verkäufen. Preis, Zustand, Verkäufer, Lieferumfang und Verfügbarkeit werden ausschließlich auf der Zielseite verbindlich angegeben.
Boardpartner auswählen
| Merkmal | Nutzen für lokale KI | Prüfung vor dem Kauf |
|---|---|---|
| Kühler und Lüfterkurve | Stabileres Tempo und weniger Geräusch bei stundenlanger Inferenz. | Unabhängige Lastmessungen, Silent-BIOS, Lüfterstillstand und Gehäuse-Airflow betrachten. |
| Abmessungen | Kein Geschwindigkeitsgewinn, aber entscheidend für sicheren Einbau und Luftzufuhr. | Länge, Höhe, Slotbreite, Seitenwand, Radiator und Kabelbogen in Millimetern messen. |
| Dual-BIOS | Praktisch für einen leisen Dauerbetrieb ohne Softwareprofil. | Vor dem Umschalten vollständig herunterfahren und Herstelleranleitung beachten. |
| Werks-OC | Meist nur wenige Prozent Mehrtempo; keine höhere Modellqualität. | Mehrpreis gegen Lautstärke, Leistungsaufnahme und reale Inferenzmessung abwägen. |
| Luft- oder AIO-Kühlung | AIO kann Abwärme direkt aus dem Gehäuse führen. | Radiatorplatz, Pumpengeräusch, Schlauchführung und langfristige Wartbarkeit einplanen. |
| Garantie und Service | Bei einer teuren Dauerlast-Komponente wichtiger als dekorative Ausstattung. | Region, Rechnung, Seriennummer, Verkäuferstatus und Garantiebedingungen prüfen. |
Preisregel: Wenn zwei luftgekühlte Karten sicher passen und ähnlich leise arbeiten, ist die günstigere meist die vernünftigere LLM-Wahl. Mehr Takt oder RGB macht das Sprachmodell nicht klüger.
Ausgewogener PC-Build
Für vollständig GPU-residente Inferenz muss nicht die teuerste CPU verbaut sein. Reserve bei RAM, SSD, Netzteil und Kühlung bringt im Alltag meist mehr.
| Bauteil | Sinnvoller Ausgangspunkt | Warum |
|---|---|---|
| GPU | Desktop RTX 5090, 32 GB | Native Blackwell-Pfade und hohe Bandbreite für Modelle, die in den VRAM passen. |
| CPU | moderner 12- bis 16-Kern-Prozessor | Genug Reserve für Agent, Builds, Datenaufbereitung und Tool-Aufrufe; Decode bleibt meist GPU-limitiert. |
| System-RAM | 64 GB Minimum, 128 GB für Offload/RAG | Große Repositories, Vektordatenbank, Container und ausgelagerte Modellschichten benötigen Reserve. |
| SSD | 2 TB Minimum, 4 TB komfortabel | Mehrere Quantisierungen, Modelle, Container und Projektdaten belegen schnell hunderte Gigabyte. |
| Netzteil | hochwertiges ATX 3.1, mindestens nach Kartenfreigabe; oft 1000–1200 W | Die Referenzkarte ist mit 575 W spezifiziert; CPU, Lastspitzen und Alterungsreserve kommen hinzu. |
| Gehäuse | großer Airflow-Tower mit GPU-Stütze | 330–359 mm Kartenlänge und bis zu 76 mm Dicke brauchen echte, nicht nur nominelle Freiheit. |
| Netzwerk | 2,5-GbE, optional 10GbE | Praktisch für NAS-Modelle und die Nutzung als lokaler Inferenzserver. |
Dauerlast sicher beherrschen
Bevorzuge das direkte, zum Netzteil gehörende Kabel. Stecker vollständig einsetzen, Zug vermeiden und den vom Hersteller geforderten Biegeradius einhalten. Nach Transport erneut prüfen.
Drei freie Front-/Bodeneinlässe sowie großzügige Heck-/Deckelabluft sind ein guter Start. Radiatoren, Laufwerkskäfige und eine Seitenwand direkt vor den GPU-Lüftern verändern den Luftweg.
700 W Systemleistung über eine Stunde entsprechen 0,7 kWh. Power-Limit oder Undervolting können effizienter sein, müssen aber mit realen Agentenläufen auf Stabilität und Zeit bis zur Lösung geprüft werden.
Die NVIDIA-Einbauanleitung und die Anleitung der konkreten Herstellerkarte haben Vorrang. Öffne Netzteile nicht und improvisiere keine Hochstromkabel.
Runtime vor Hardwarekauf
CUDA-Treiber allein garantieren noch keinen optimalen FP4-, Flash-Attention- oder Speculative-Decoding-Pfad. Prüfe die geplante Engine, Modellquantisierung, Betriebssystemversion und benötigte Kontextlänge zusammen. Ein stabiler Q4-Lauf kann nützlicher sein als ein schneller experimenteller Build.
Setup-Ratgeber öffnenZwei RTX 5090
Die RTX 5090 besitzt kein NVLink. Zwei Karten können mit Tensor-/Pipeline-Parallelität oder getrennten Modellinstanzen arbeiten, doch Runtime, Modell und Mainboard müssen das unterstützen. Puffer werden teils dupliziert; PCIe, Slotabstand, Kühlung und Netzteil werden zum eigenen Workstation-Projekt.
Speicherpfade vergleichenVor dem Bezahlen
Keine Laptopvariante, kein ähnlich benanntes Zubehör und keine auswählbare Produktfamilie ohne bestätigte Konfiguration.
OC, Liquid, ARGB, White und BTF können andere Abmessungen, Anschlüsse oder Lieferumfänge besitzen.
Neuware, Verkäufer, Versandweg, Rechnung und Rückgaberecht müssen bei einer hochpreisigen Komponente eindeutig sein.
Länge, Höhe und Slotbreite samt Frontlüftern, Radiator, Kabelbogen und Seitenwand messen.
ATX-Version, Leistung, Anschluss und freigegebene Kabel des Netzteilherstellers abgleichen.
GPU-Kühler darf wichtige M.2-, Capture-, Netzwerk- oder weitere Erweiterungsplätze nicht unbrauchbar machen.
64 GB sollten erweiterbar sein; 2×32 GB lässt häufig mehr Spielraum als 4×16 GB.
Freie M.2-Slots und Kühlkörper prüfen. Eine separate Modell-SSD erleichtert Neuinstallation und Backup.
Seriennummer, Händlerstatus und Herstellergarantie müssen zum Lieferland passen.
Bei ungewöhnlich günstigen Angeboten Titel, Kategorie, Bilder, Verkäuferhistorie und Lieferumfang besonders streng prüfen.
Häufige Fragen
Nein. Bei identischem Modell, identischer Quantisierung, demselben Seed und derselben Runtime bleibt die grundlegende Ausgabequalität gleich. Kühlung und Takt können Berechnungen beschleunigen oder stabilisieren, aber keine fehlende Modellfähigkeit hinzufügen.
Meist nicht für ein komfortables, vollständig GPU-residentes Q4-Setup samt Kontext. Teil-Offloading in 64 oder 128 GB System-RAM ist möglich, kostet jedoch Tempo. Wer 70B regelmäßig nutzt, sollte größere Speicherpools vergleichen.
Für 8B–32B, die komplett im VRAM liegen, häufig ja. 128 GB sind sinnvoll, wenn du große Repositories, RAG, mehrere Dienste oder häufiges CPU-Offloading planst.
Nach dem vollständigen Laden des Modells normalerweise kaum. Eine schnelle SSD verkürzt Start- und Ladezeiten; Decode hängt bei GPU-residenten Modellen vor allem an GPU, Speicherbandbreite und Runtime.
Nein. Lokale Ausgabe kann sehr schnell sein, doch ein stärkeres Cloud-Modell kann weniger Reasoning-Tokens benötigen oder öfter im ersten Versuch richtig liegen. Vergleiche korrekte Lösungen und Gesamtzeit, nicht nur sichtbare tok/s.
Die günstigste seriöse Karte, die sicher in dein Gehäuse passt, unter Dauerlast akzeptabel leise bleibt und eine passende Garantie besitzt, ist meist die beste. Premiumkühler lohnen sich vor allem für Lautstärke, Temperaturreserve oder besondere Einbauanforderungen.
Nächster Schritt
Unser Rechner berücksichtigt Gewichte, Quantisierung, KV-Cache und Reserve. So erkennst du, ob 32 GB wirklich passen oder ein größerer Speicherpool sinnvoller ist.