Gewichte
Q4 benötigt grob deutlich weniger Speicher als FP16. Metadaten und Quantisierungsformat sorgen aber dafür, dass „4 Bit“ nicht exakt „0,5 Byte je Parameter“ bedeutet.
Modellspeicher verständlich erklärt
Die kurze Antwort: genug schneller Speicher für Modellgewichte, Kontext-Cache und Reserve. Die längere Antwort zeigt, welche GPU- und Speicherklassen typischerweise zu 8B, 14B, 32B oder 70B passen – ohne Marketing-Zahlen mit nutzbarem Modellspeicher zu verwechseln.
Die einfache Formel
Die Parameterzahl allein ist noch keine Speicherangabe. Entscheidend ist, wie viele Bits pro Gewicht gespeichert werden und was während der Nutzung zusätzlich im Speicher liegt.
Q4 benötigt grob deutlich weniger Speicher als FP16. Metadaten und Quantisierungsformat sorgen aber dafür, dass „4 Bit“ nicht exakt „0,5 Byte je Parameter“ bedeutet.
Er hält Informationen aus dem bisherigen Kontext. Lange Prompts, mehrere Sitzungen und manche Architekturen lassen ihn stark wachsen.
Ollama, llama.cpp, LM Studio oder andere Backends benötigen Arbeitsbereiche. Implementierung und GPU-Offload beeinflussen den Bedarf.
Ein Speicherpool, der rechnerisch gerade eben reicht, ist kein guter Kaufplan. Betriebssystem, Display und Zusatzdienste brauchen Luft.
Speicherbedarf mit Reserve
Die Bereiche beziehen sich grob auf Q4-ähnliche Quantisierung plus übliche Laufzeitreserve. Langer Kontext, MoE-Architekturen, Bildencoder oder mehrere Nutzer können darüber liegen.
| Modellklasse | Gewichte grob | Sinnvolle schnelle Speicherklasse | Typischer Einsatz |
|---|---|---|---|
| 7B–8B | etwa 5–6 GB | 12–16 GB | Chat, Zusammenfassen, einfache lokale Helfer |
| 12B–14B | etwa 8–10 GB | 16 GB | bessere Allrounder, Coding-Einstieg |
| 20B–32B | etwa 14–22 GB | 24–32 GB | Coding, RAG, anspruchsvollere Assistenten |
| 65B–70B | etwa 40–45 GB | 64 GB oder mehr | hohe Modellqualität, komplexe Aufgaben |
| 100B–120B | etwa 65–80 GB | 96–128 GB oder mehr | professionelle Kapazitätsklasse |
„Passt in den Speicher“ bedeutet nicht automatisch „läuft schnell“. Bandbreite, Recheneinheiten, Backend und Offload-Verteilung bestimmen das Tempo.
GPU nach Modell wählen
Die beste GPU für ein LLM ist nicht automatisch das teuerste Modell. Sie ist die Hardware, die Modell und Kontext vollständig in schnellem Speicher hält und von deiner Runtime zuverlässig unterstützt wird.
Passend für viele 7B- bis 14B-Modelle in geeigneter Quantisierung. Für 20B+, lange Kontexte, Vision oder parallele Sitzungen wird die Reserve knapp.
Typisch: Chat und erste Coding-HelferStarke Klasse für schnelle 20B- bis 32B-Inferenz. Eine RTX 5090 bietet 32 GB dedizierten VRAM; 70B benötigt dagegen meist System-RAM-Offload.
Typisch: Coding, RAG und AgentenRTX-5090-PCs prüfenUnified-Memory-Mini-PCs und professionelle GPUs schaffen Platz für quantisierte 70B-Modelle. Bandbreite, reservierter Systemspeicher und Backend bestimmen das Tempo.
Typisch: große Modelle und lange KontexteKI-Mini-PCs vergleichenPrüfe nicht nur die GPU-Bezeichnung: Desktop- und Mobilvarianten können unterschiedliche Speichergrößen besitzen. Bei Unified Memory ist außerdem die praktisch nutzbare UMA-/VGM-Zuweisung entscheidend.
Zwei Speicherwege
Eigener Speicher direkt an einer separaten GPU. Hohe Bandbreite und meist der schnellste Weg, solange das Modell hineinpasst.
CPU und integrierte GPU teilen einen großen Pool. Mehr Modellkapazität ist möglich, aber Betriebssystem und Anwendungen nutzen denselben Speicher.
Häufige Fragen
Für kleine 7B- bis 8B-Modelle mit kurzer bis mittlerer Kontextlänge kann das in einer speichersparenden Quantisierung reichen. Die Reserve ist jedoch gering; größere Modelle, Bildverarbeitung und lange Kontexte führen schnell zu Offloading.
12 GB sind ein brauchbarer Einstieg für viele 7B- bis 8B-Modelle und einzelne 12B- bis 14B-Modelle mit passender Quantisierung. Vor dem Kauf sollte die konkrete Modelldatei samt KV-Cache und Runtime-Reserve geprüft werden.
Ja, für viele 7B- bis 14B-Modelle in geeigneter Quantisierung. Für lange Kontexte, große Bildmodelle oder 32B-Modelle kann es eng werden.
Der physische VRAM einer diskreten Grafikkarte lässt sich normalerweise nicht erweitern. System-RAM-Offload kann ein zu großes Modell trotzdem starten, ist aber meist deutlich langsamer. Bei geeigneten Unified-Memory-Systemen lässt sich stattdessen ein größerer Anteil des gemeinsamen Speichers der GPU zuweisen.
Nein. Diskreter VRAM sitzt direkt an einer separaten GPU und bietet hohe Bandbreite. System-RAM gehört zum Hauptspeicher des PCs. Unified Memory ist ein dritter Weg, bei dem CPU und integrierte GPU denselben Pool nutzen.
Oft ja, wenn ein Teil in den System-RAM ausgelagert oder stärker quantisiert wird. Es liegt dann aber nicht vollständig im VRAM; das kann die Geschwindigkeit deutlich reduzieren.
Nein. Nur Systeme mit passender Unified-Memory-Architektur können einen großen Anteil gemeinsam nutzen. Betriebssystem und Runtime benötigen außerdem Reserve, und die maximal konfigurierbare UMA-Zuweisung ist zu prüfen.
Für große lokale LLMs ist die NPU allein meist nicht das entscheidende Kaufkriterium. Relevant sind unterstützte Runtime, Speicherkapazität, Speicherbandbreite und GPU-Leistung.
Vom Speicherbedarf zur Auswahl
Der PC-Finder setzt diese Speicherlogik in eine verständliche Empfehlung um.