Ollama
Einfacher lokaler Modellservice, gute Grundlage für Apps und Automatisierung. Modelle werden über die Runtime verwaltet.
Gut für:Einsteiger, Entwickler, lokale APIsOffizielle DokumentationVom Karton zum ersten Prompt
Ein sicherer, nachvollziehbarer Einstieg für Windows und Linux: System prüfen, Runtime auswählen, passendes Modell laden und erst dann optimieren.
Der praktische Ablauf
Die Bedienoberfläche ist Geschmackssache. Treiber, Speicherreserve und ein passendes Modellformat sind die technischen Grundlagen.
Installiere Betriebssystem-Updates sowie aktuelle Grafik- und Chipsatztreiber aus der offiziellen Herstellerquelle. Bei Unified-Memory-Systemen prüfst du zusätzlich BIOS/UEFI und die verfügbare UMA-Zuweisung.
Halte neben dem Modell ausreichend Reserve frei. Mehrere Quantisierungen eines großen Modells können schnell Hunderte Gigabyte belegen.
Starte mit einem seriös dokumentierten 7B- oder 8B-Instruct-Modell aus dem Katalog deiner Runtime. So prüfst du Treiber, GPU-Offload und Bedienung, bevor du große Downloads beginnst.
Kontrolliere GPU-/UMA-Speicher, System-RAM, Temperatur, Lüfterverhalten und ersten Token. Wenn ausgelagert wird, ist ein kleineres oder stärker quantisiertes Modell oft die bessere Lösung.
Binde eine lokale API zunächst nur an 127.0.0.1. Öffne sie nicht ungeprüft im Heimnetz oder Internet. Sensible Dokumente bleiben nur dann lokal, wenn auch Plugins, Websuche und Telemetrie entsprechend konfiguriert sind.
Werkzeugauswahl
Einfacher lokaler Modellservice, gute Grundlage für Apps und Automatisierung. Modelle werden über die Runtime verwaltet.
Gut für:Einsteiger, Entwickler, lokale APIsOffizielle DokumentationGrafische Modellsuche, Chat-Oberfläche und lokaler Server in einer Desktop-Anwendung.
Gut für:visuellen Einstieg, ModellvergleichOffizielle DokumentationLeichtgewichtiges Open-Source-Backend mit vielen Schaltern für Offload, Quantisierung und Plattformen.
Gut für:Kontrolle, Tests, eigene IntegrationenProjektseiteWindows
Für Ollama und LM Studio reicht meist die native Installation. WSL2 ist hilfreich, wenn dein Entwicklungs-Stack Linux voraussetzt. Vermeide parallele Dienste, die denselben GPU-Speicher belegen.
Linux
Linux eignet sich gut für headless Betrieb und reproduzierbare Umgebungen. Prüfe vorab, welcher Kernel, GPU-Treiber und welches Backend für deine Hardware offiziell unterstützt werden.
Privat heißt nicht automatisch sicher
Kontrolliere, ob die gewählte Anwendung externe Funktionen oder Telemetrie nutzt.
Nur lokal binden oder mit Authentifizierung und Firewall schützen.
Modelllizenzen können Nutzung und Weitergabe unterschiedlich regeln.
Temperaturen, Staub, Leistungsaufnahme und Geräuschentwicklung im Blick behalten.
Hardware noch offen?
Der Finder übersetzt dein gewünschtes Modell in eine realistische Systemrichtung.