Ollama
Einfacher lokaler Modellservice, gute Grundlage für Apps und Automatisierung. Modelle werden über die Runtime verwaltet.
Gut für:Einsteiger, Entwickler, lokale APIsOffizielle DokumentationVom Karton zum ersten Prompt
Ein sicherer, nachvollziehbarer Einstieg für Windows und Linux: Hardware-Anforderungen prüfen, Runtime auswählen, passendes Modell laden, GPU-Offload testen und erst dann optimieren.
Vor der Installation
LM Studio nennt für Windows mindestens 16 GB RAM und empfiehlt 4 GB dedizierten VRAM. Das reicht nur für kleine Modelle. Für einen neuen KI-PC sollte die gewünschte Modellklasse den Speicher bestimmen.
| Bauteil | Technischer Einstieg | Praxisnah für lokale LLMs |
|---|---|---|
| System-RAM | 16 GB für kleine Modelle und kurze Kontexte | 32 GB für 7B–14B; 64 GB oder mehr für größere Modelle und Offload |
| GPU-Speicher | 4 GB als LM-Studio-Empfehlung für den App-Start | 12–16 GB für 7B–14B; 24–32 GB für schnelle 20B–32B-Inferenz |
| CPU | Bei LM Studio benötigt x64 AVX2; Arm64 wird auf unterstützten Systemen angeboten | Moderne Mehrkern-CPU, besonders wenn Modellteile im System-RAM liegen |
| SSD | genug Platz für App und ein kleines Modell | mindestens 1 TB frei planbar, besser 2 TB für mehrere Modellfamilien |
| GPU-Backend | muss zur Hardware und zum Betriebssystem passen | NVIDIA CUDA, unterstütztes AMD ROCm/Vulkan oder ein offiziell gelisteter GB10-/Ryzen-AI-Pfad |
Prüfe die aktuellen Listen vor dem Kauf: Ollama nennt unterstützte NVIDIA-, AMD- und GB10-Hardware; LM Studio dokumentiert Betriebssystem-, CPU-, RAM- und GPU-Anforderungen. Für die konkrete Modellgröße hilft der VRAM-Ratgeber.
Vom Modell zum Komplettsystem
Ollama hat keine einzelne sinnvolle RAM- oder VRAM-Zahl für alle Modelle. Entscheidend sind Modellgröße, Quantisierung, Kontext und der Speicher, den Betriebssystem und weitere Dienste belegen. Die aktuelle Hardwareliste führt unter anderem RTX-50-GPUs, GB10 und Ryzen AI Max+ 395; Betriebssystem und Backend bleiben trotzdem zu prüfen.
| Geplante Modellklasse | Praxisnahe Speicherklasse | Passende Komplettsysteme | Wichtigster Kaufcheck |
|---|---|---|---|
| 7B bis 14B | 12 bis 16 GB dedizierter VRAM; 32 GB System-RAM | GPU-PC der Einstiegsklasse wählen | Das konkrete Modell samt Kontext muss vollständig in den schnellen Speicher passen. |
| 20B bis 32B, tempoorientiert | 24 bis 32 GB dedizierter VRAM; 64 GB System-RAM | RTX-5090-Komplett-PC | Desktop-GPU mit ausgewiesenen 32 GB wählen; Kühlung und Netzteil mitprüfen. |
| 20B bis 32B, kompakt | 64 GB Unified Memory | GMKtec EVO-X2 64 GB oder HP Z2 Mini G1a 64 GB | UMA-/VGM-Zuweisung und Radeon-Pfad für das gewünschte Betriebssystem prüfen. |
| 65B bis 70B, kapazitätsorientiert | 128 GB Unified Memory mit Systemreserve | EVO-X2 128 GB oder MS-S1 Max 128 GB | 128-GB-Variante exakt abgleichen; Speicher ist fest verlötet. |
| 70B mit NVIDIA-Werkzeugen | 128 GB kohärenter Unified Memory | ASUS Ascent GX10 | Arm64, DGX OS und alle benötigten Erweiterungen vor dem Kauf abgleichen. |
Der praktische Ablauf
Die Bedienoberfläche ist Geschmackssache. Treiber, Speicherreserve und ein passendes Modellformat sind die technischen Grundlagen.
Installiere Betriebssystem-Updates sowie aktuelle Grafik- und Chipsatztreiber aus der offiziellen Herstellerquelle. Bei Unified-Memory-Systemen prüfst du zusätzlich BIOS/UEFI und die verfügbare UMA-Zuweisung.
Halte neben dem Modell ausreichend Reserve frei. Mehrere Quantisierungen eines großen Modells können schnell Hunderte Gigabyte belegen.
Starte mit einem seriös dokumentierten 7B- oder 8B-Instruct-Modell aus dem Katalog deiner Runtime. So prüfst du Treiber, GPU-Offload und Bedienung, bevor du große Downloads beginnst.
Kontrolliere GPU-/UMA-Speicher, System-RAM, Temperatur, Lüfterverhalten und ersten Token. Wenn ausgelagert wird, ist ein kleineres oder stärker quantisiertes Modell oft die bessere Lösung.
Binde eine lokale API zunächst nur an 127.0.0.1. Öffne sie nicht ungeprüft im Heimnetz oder Internet. Sensible Dokumente bleiben nur dann lokal, wenn auch Plugins, Websuche und Telemetrie entsprechend konfiguriert sind.
Werkzeugauswahl
Einfacher lokaler Modellservice, gute Grundlage für Apps und Automatisierung. Modelle werden über die Runtime verwaltet.
Gut für:Einsteiger, Entwickler, lokale APIsOffizielle DokumentationGrafische Modellsuche, Chat-Oberfläche und lokaler Server in einer Desktop-Anwendung.
Gut für:visuellen Einstieg, ModellvergleichOffizielle DokumentationLeichtgewichtiges Open-Source-Backend mit vielen Schaltern für Offload, Quantisierung und Plattformen.
Gut für:Kontrolle, Tests, eigene IntegrationenProjektseiteOllama-Hardware kurz beantwortet
Nein, Ollama kann Modelle auch auf der CPU ausführen. Eine unterstützte GPU oder ein passendes Unified-Memory-System beschleunigt die Inferenz jedoch deutlich, wenn ein großer Teil des Modells im schnellen Speicher liegt.
Für kleine 7B- bis 8B-Modelle sind 16 GB technisch möglich; bei einem Neukauf sind 32 GB die vernünftigere Untergrenze. Für größere Modelle, lange Kontexte und CPU-Offload sind 64 oder 128 GB sinnvoll. Maßgeblich bleibt die konkrete Modelldatei plus Reserve.
Ja, mit geeigneter Quantisierung und genügend schnellem Speicher. Für viele Q4-ähnliche 70B-Modelle ist eine 64-GB-Klasse die knappe Untergrenze; 96 bis 128 GB bieten mehr Reserve für Kontext, Runtime und Betriebssystem.
NVIDIA bietet einen verbreiteten CUDA-Pfad, AMD kann mit aktuell unterstützter ROCm- oder Vulkan-Hardware ebenfalls beschleunigen. Entscheidend sind das genaue GPU-Modell, Betriebssystem, Treiber, Ollama-Version und der benötigte Speicher – nicht nur der Herstellername.
Windows
Für Ollama und LM Studio reicht meist die native Installation. WSL2 ist hilfreich, wenn dein Entwicklungs-Stack Linux voraussetzt. Vermeide parallele Dienste, die denselben GPU-Speicher belegen.
Linux
Linux eignet sich gut für headless Betrieb und reproduzierbare Umgebungen. Prüfe vorab, welcher Kernel, GPU-Treiber und welches Backend für deine Hardware offiziell unterstützt werden.
Privat heißt nicht automatisch sicher
Kontrolliere, ob die gewählte Anwendung externe Funktionen oder Telemetrie nutzt.
Nur lokal binden oder mit Authentifizierung und Firewall schützen.
Modelllizenzen können Nutzung und Weitergabe unterschiedlich regeln.
Temperaturen, Staub, Leistungsaufnahme und Geräuschentwicklung im Blick behalten.
Hardware noch offen?
Der Finder übersetzt dein gewünschtes Modell in eine realistische Systemklasse. Wenn mehrere Geräte darauf zugreifen sollen, hilft zusätzlich der Ratgeber zu lokalen KI-Servern.