Zu knapp für Vollbelegung
Teilweises GPU-Offloading ist möglich, verlagert aber Arbeit in langsameren System-RAM.
RTX 5090 · schnell bei kleineren Modellen70B-Kaufberatung für zuhause
Für ein quantisiertes 70B-Modell zählt zuerst die Speicherkapazität. 32 GB VRAM sind schnell, aber meist zu klein für Modell plus Kontext. Realistische Wege beginnen bei einer knappen 48-GB-Klasse und werden ab 64 bis 96 GB deutlich alltagstauglicher.
Warum die Datei nicht alles ist
Eine grobe Q4-Rechnung startet bei etwa einem halben Byte je Parameter. Bei 70 Milliarden Parametern sind das bereits rund 35 GB – vor Format-Overhead, KV-Cache, Runtime und Betriebssystem.
Teilweises GPU-Offloading ist möglich, verlagert aber Arbeit in langsameren System-RAM.
RTX 5090 · schnell bei kleineren ModellenPassend für viele Q4-/Q5-Varianten und normale Kontexte, wenn ein ausreichend großer Anteil wirklich nutzbar ist.
Unified Memory oder professionelle GPUGemeinsamer Systemspeicher schafft Reserve für RAG, Embeddings und weitere Dienste, ist aber nicht vollständig GPU-Speicher.
Kapazitätsfokus · genaue UMA-Grenze prüfenMoE-Modelle, multimodale Encoder, extreme Kontextlängen und höhere Quantisierungen können deutlich mehr Speicher verlangen. Prüfe immer die konkrete Modelldatei und Runtime.
Drei realistische Wege
Stärke: viel Modellkapazität in einem kompakten Komplettsystem. Kompromiss: geringere Bandbreite als eine große diskrete GPU und eine feste Obergrenze für den GPU-Anteil.
Passend für: private 70B-Assistenten, lokale Wissenssysteme und moderate Einzelplatznutzung.
Ryzen-AI-Max-PCs vergleichenStärke: Modell und großer Kontext können vollständig auf einer sehr schnellen GPU liegen. Kompromiss: professionelle Workstations kosten erheblich mehr und benötigen starke Kühlung sowie Stromversorgung.
Passend für: intensive professionelle Nutzung, große Kontexte und hohen Durchsatz.
RTX PRO 6000 mit 96 GB prüfenStärke: sehr schnell für kleinere Modelle und bereits vorhandene Hardware kann genutzt werden. Kompromiss: 70B benötigt Teil-Offload; PCIe und CPU-RAM bremsen die Ausgabe.
Passend für: gelegentliche 70B-Nutzung, wenn 8B bis 32B der Alltag bleiben.
RTX-5090-Pfad verstehenKlare Kaufentscheidung
| Priorität | Empfohlener Pfad | Wichtigste Kontrolle |
|---|---|---|
| 70B möglichst kompakt | 128 GB Unified Memory | maximale UMA-Zuweisung und Runtime-Support |
| Hohes Tempo und Dauerbetrieb | Workstation mit 96 GB VRAM | exakte GPU, Netzteil, Kühlung und Service |
| Meist 8B–32B, selten 70B | RTX 5090 + 128 GB System-RAM | Offload-Unterstützung und erwartetes Tempo |
| Kleines Budget, Geduld vorhanden | CPU-Inferenz mit 128 GB RAM | Speicherbandbreite; deutlich geringeres Tempo akzeptieren |
| Mehrere gleichzeitige Nutzer | professionelle GPU-/Serverklasse | KV-Cache pro Sitzung und Batch-Verhalten |
Komplettsystem auswählen
Wenn lokale 70B-Nutzung das Hauptziel und Spitzentempo zweitrangig ist, ist ein 128-GB-Unified-Memory-System der geradlinigste Komplettsystem-Pfad. Für beruflich zeitkritische Nutzung ist großer diskreter VRAM technisch stärker, aber in einer anderen Preisklasse.
Kapazitätsfokus für zuhause
Kompaktes System mit Ryzen AI Max+ 395, Radeon 8060S und großem gemeinsamen Speicherpool.
Die Konfiguration vermeidet einen Multi-GPU-Aufbau und bietet ausreichend Gesamtspeicher für viele quantisierte 70B-Modelle, Kontext und Systemreserve. Zwei 10-GbE-Ports eignen sich zudem für NAS-Speicher oder mehrere Clients im Heimnetz.
Der fest verlötete Speicher ist nicht erweiterbar, und die Radeon 8060S liefert nicht das Tempo einer großen diskreten GPU. Prüfe vorab die maximale UMA-Zuweisung sowie HIP- oder Vulkan-Unterstützung deiner Runtime.
* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. Die Zielseite ist für die aktuelle Konfiguration und Lieferinformation maßgeblich.
Vor der Auswahl
Unser Finder liefert eine konservative Speicherklasse. Für 70B solltest du anschließend die tatsächliche GGUF-Dateigröße und den geplanten Kontext in deiner Runtime kontrollieren.