Vom Karton zum ersten Prompt

Ein lokales LLM mit Ollama oder LM Studio ausführen

Ein sicherer, nachvollziehbarer Einstieg für Windows und Linux: Hardware-Anforderungen prüfen, Runtime auswählen, passendes Modell laden, GPU-Offload testen und erst dann optimieren.

Vor der Installation

Ollama- und LM-Studio-Hardware: Was ist sinnvoll?

LM Studio nennt für Windows mindestens 16 GB RAM und empfiehlt 4 GB dedizierten VRAM. Das reicht nur für kleine Modelle. Für einen neuen KI-PC sollte die gewünschte Modellklasse den Speicher bestimmen.

BauteilTechnischer EinstiegPraxisnah für lokale LLMs
System-RAM16 GB für kleine Modelle und kurze Kontexte32 GB für 7B–14B; 64 GB oder mehr für größere Modelle und Offload
GPU-Speicher4 GB als LM-Studio-Empfehlung für den App-Start12–16 GB für 7B–14B; 24–32 GB für schnelle 20B–32B-Inferenz
CPUBei LM Studio benötigt x64 AVX2; Arm64 wird auf unterstützten Systemen angebotenModerne Mehrkern-CPU, besonders wenn Modellteile im System-RAM liegen
SSDgenug Platz für App und ein kleines Modellmindestens 1 TB frei planbar, besser 2 TB für mehrere Modellfamilien
GPU-Backendmuss zur Hardware und zum Betriebssystem passenNVIDIA CUDA, unterstütztes AMD ROCm/Vulkan oder ein offiziell gelisteter GB10-/Ryzen-AI-Pfad

Prüfe die aktuellen Listen vor dem Kauf: Ollama nennt unterstützte NVIDIA-, AMD- und GB10-Hardware; LM Studio dokumentiert Betriebssystem-, CPU-, RAM- und GPU-Anforderungen. Für die konkrete Modellgröße hilft der VRAM-Ratgeber.

Vom Modell zum Komplettsystem

Welcher PC passt zu Ollama?

Ollama hat keine einzelne sinnvolle RAM- oder VRAM-Zahl für alle Modelle. Entscheidend sind Modellgröße, Quantisierung, Kontext und der Speicher, den Betriebssystem und weitere Dienste belegen. Die aktuelle Hardwareliste führt unter anderem RTX-50-GPUs, GB10 und Ryzen AI Max+ 395; Betriebssystem und Backend bleiben trotzdem zu prüfen.

Geplante ModellklassePraxisnahe SpeicherklassePassende KomplettsystemeWichtigster Kaufcheck
7B bis 14B12 bis 16 GB dedizierter VRAM; 32 GB System-RAMGPU-PC der Einstiegsklasse wählenDas konkrete Modell samt Kontext muss vollständig in den schnellen Speicher passen.
20B bis 32B, tempoorientiert24 bis 32 GB dedizierter VRAM; 64 GB System-RAMRTX-5090-Komplett-PCDesktop-GPU mit ausgewiesenen 32 GB wählen; Kühlung und Netzteil mitprüfen.
20B bis 32B, kompakt64 GB Unified MemoryGMKtec EVO-X2 64 GB oder HP Z2 Mini G1a 64 GBUMA-/VGM-Zuweisung und Radeon-Pfad für das gewünschte Betriebssystem prüfen.
65B bis 70B, kapazitätsorientiert128 GB Unified Memory mit SystemreserveEVO-X2 128 GB oder MS-S1 Max 128 GB128-GB-Variante exakt abgleichen; Speicher ist fest verlötet.
70B mit NVIDIA-Werkzeugen128 GB kohärenter Unified MemoryASUS Ascent GX10Arm64, DGX OS und alle benötigten Erweiterungen vor dem Kauf abgleichen.

Der praktische Ablauf

Sechs Schritte zum lokalen LLM

Die Bedienoberfläche ist Geschmackssache. Treiber, Speicherreserve und ein passendes Modellformat sind die technischen Grundlagen.

  1. 01

    Firmware und Treiber aktualisieren

    Installiere Betriebssystem-Updates sowie aktuelle Grafik- und Chipsatztreiber aus der offiziellen Herstellerquelle. Bei Unified-Memory-Systemen prüfst du zusätzlich BIOS/UEFI und die verfügbare UMA-Zuweisung.

  2. 02

    Speicher und freien SSD-Platz prüfen

    Halte neben dem Modell ausreichend Reserve frei. Mehrere Quantisierungen eines großen Modells können schnell Hunderte Gigabyte belegen.

  3. 03

    Eine Runtime auswählen

    Ollama eignet sich für einen einfachen lokalen Dienst und Kommandozeilen-Workflows. LM Studio bietet eine grafische Oberfläche. llama.cpp gibt erfahrenen Nutzern besonders viel Kontrolle.

  4. 04

    Klein beginnen

    Starte mit einem seriös dokumentierten 7B- oder 8B-Instruct-Modell aus dem Katalog deiner Runtime. So prüfst du Treiber, GPU-Offload und Bedienung, bevor du große Downloads beginnst.

  5. 05

    Auslastung beobachten

    Kontrolliere GPU-/UMA-Speicher, System-RAM, Temperatur, Lüfterverhalten und ersten Token. Wenn ausgelagert wird, ist ein kleineres oder stärker quantisiertes Modell oft die bessere Lösung.

  6. 06

    Zugriff absichern

    Binde eine lokale API zunächst nur an 127.0.0.1. Öffne sie nicht ungeprüft im Heimnetz oder Internet. Sensible Dokumente bleiben nur dann lokal, wenn auch Plugins, Websuche und Telemetrie entsprechend konfiguriert sind.

Werkzeugauswahl

Welche Runtime passt zu dir?

Ollama

Einfacher lokaler Modellservice, gute Grundlage für Apps und Automatisierung. Modelle werden über die Runtime verwaltet.

Gut für:Einsteiger, Entwickler, lokale APIsOffizielle Dokumentation

LM Studio

Grafische Modellsuche, Chat-Oberfläche und lokaler Server in einer Desktop-Anwendung.

Gut für:visuellen Einstieg, ModellvergleichOffizielle Dokumentation

llama.cpp

Leichtgewichtiges Open-Source-Backend mit vielen Schaltern für Offload, Quantisierung und Plattformen.

Gut für:Kontrolle, Tests, eigene IntegrationenProjektseite

Ollama-Hardware kurz beantwortet

Häufige Fragen vor dem PC-Kauf

Braucht Ollama eine GPU?

Nein, Ollama kann Modelle auch auf der CPU ausführen. Eine unterstützte GPU oder ein passendes Unified-Memory-System beschleunigt die Inferenz jedoch deutlich, wenn ein großer Teil des Modells im schnellen Speicher liegt.

Wie viel RAM braucht Ollama?

Für kleine 7B- bis 8B-Modelle sind 16 GB technisch möglich; bei einem Neukauf sind 32 GB die vernünftigere Untergrenze. Für größere Modelle, lange Kontexte und CPU-Offload sind 64 oder 128 GB sinnvoll. Maßgeblich bleibt die konkrete Modelldatei plus Reserve.

Kann Ollama ein 70B-Modell lokal ausführen?

Ja, mit geeigneter Quantisierung und genügend schnellem Speicher. Für viele Q4-ähnliche 70B-Modelle ist eine 64-GB-Klasse die knappe Untergrenze; 96 bis 128 GB bieten mehr Reserve für Kontext, Runtime und Betriebssystem.

Ist NVIDIA oder AMD für Ollama besser?

NVIDIA bietet einen verbreiteten CUDA-Pfad, AMD kann mit aktuell unterstützter ROCm- oder Vulkan-Hardware ebenfalls beschleunigen. Entscheidend sind das genaue GPU-Modell, Betriebssystem, Treiber, Ollama-Version und der benötigte Speicher – nicht nur der Herstellername.

Windows

Direkt starten, WSL bei Bedarf

Für Ollama und LM Studio reicht meist die native Installation. WSL2 ist hilfreich, wenn dein Entwicklungs-Stack Linux voraussetzt. Vermeide parallele Dienste, die denselben GPU-Speicher belegen.

  • aktueller GPU-Treiber
  • Leistungsmodus bei Dauerlast prüfen
  • Autostart lokaler Server bewusst konfigurieren

Linux

Flexibel für Dienste und Entwicklung

Linux eignet sich gut für headless Betrieb und reproduzierbare Umgebungen. Prüfe vorab, welcher Kernel, GPU-Treiber und welches Backend für deine Hardware offiziell unterstützt werden.

  • Runtime nur aus vertrauenswürdiger Quelle
  • API-Dienst nicht öffentlich binden
  • Modelldaten auf ausreichend großer Partition

Privat heißt nicht automatisch sicher

Vier Sicherheitsregeln

Offline prüfen

Kontrolliere, ob die gewählte Anwendung externe Funktionen oder Telemetrie nutzt.

API begrenzen

Nur lokal binden oder mit Authentifizierung und Firewall schützen.

Lizenz lesen

Modelllizenzen können Nutzung und Weitergabe unterschiedlich regeln.

Dauerlast beobachten

Temperaturen, Staub, Leistungsaufnahme und Geräuschentwicklung im Blick behalten.

Hardware noch offen?

Wähle zuerst die richtige Speicherklasse

Der Finder übersetzt dein gewünschtes Modell in eine realistische Systemklasse. Wenn mehrere Geräte darauf zugreifen sollen, hilft zusätzlich der Ratgeber zu lokalen KI-Servern.

PC-Finder öffnen