Lokaler Terminal-Agent · Ollama-Endpunkt · Repository-Tools

OpenCode mit Ollama: lokales Coding-Modell richtig einrichten

Der schnelle Weg besteht aus einem Befehl. Für einen zuverlässigen Aufbau brauchst du zusätzlich ein toolfähiges Modell, mindestens 64K konfigurierten Kontext für Repository-Arbeit, genug Speicher dafür und einen sicheren Git-Arbeitsbereich.

Schnellster unterstützter Weg

OpenCode über Ollama starten

Installiere beide Anwendungen aus offiziellen Quellen, stelle sicher, dass Ollama läuft, und nutze dann den Integrationsbefehl:

ollama launch opencode

Ollama lässt dich ein vorhandenes Modell auswählen und startet OpenCode mit einer lokalen Inline-Konfiguration. Die Integration überschreibt deine dauerhafte OpenCode-Konfiguration nicht.

Die Prüfung gegen die häufigsten Fehlstarts

Vor der Modellwahl mit 64K Kontext planen

Die OpenCode-Dokumentation von Ollama verlangt ein Kontextfenster von mindestens 64K. Darin liegen Repository-Auszüge, Tools, Befehlsausgaben und Verlauf. Ein Modell kann mit kleinerem Fenster laden und bei echter Agentenarbeit dennoch scheitern.

  • Modell mit zuverlässigen Tool-Aufrufen wählen
  • Speicher für KV-Cache und Laufzeitpuffer reservieren
  • mit einem Repository und einem Agenten beginnen
  • Änderungen und Befehle in einem Wegwerf-Branch testen

Reproduzierbare Einrichtung

Sechs Schritte von der Installation zum geprüften Patch

Nutze zuerst den direkten Start. Eine manuelle Konfiguration brauchst du erst für ein festes Modell, einen anderen Host oder explizite Kontextregeln.

  1. 01

    Aus offiziellen Quellen installieren

    Lade Ollama herunter und folge dem OpenCode-Installationsratgeber für dein Betriebssystem. Prüfe beide Befehle in einem neuen Terminal.

  2. 02

    Coding-Modell mit Tools wählen

    Ein Autocomplete-Modell ist nicht automatisch ein guter Agent. Prüfe die Modellkarte auf Instruction Following, Tool- oder Function-Calling und Kontextunterstützung. Qwen3-Coder 30B-A3B ist eine aktuelle Referenz für agentisches Coding.

  3. 03

    Exakte Modell-ID prüfen

    Führe ollama list aus und verwende genau den angezeigten Namen samt Tag. Ein anderer Tag kann eine andere Parameterzahl oder Quantisierung bezeichnen.

  4. 04

    Integration starten

    Führe ollama launch opencode aus, wähle das lokale Modell und öffne ein kleines Test-Repository. Mit ollama launch opencode --config kann Ollama die Konfiguration vorbereiten, ohne sofort eine interaktive Sitzung zu starten.

  5. 05

    Tools statt nur Chat prüfen

    Lass den Agenten eine Datei lesen, eine kleine reversible Änderung vornehmen und einen harmlosen Testbefehl ausführen. Eine flüssige Antwort beweist noch keine funktionierenden strukturierten Tool-Aufrufe.

  6. 06

    Echten Engpass messen

    Beobachte Speicher, Verzögerung bei der Prompt-Verarbeitung, Ausgabegeschwindigkeit und Testerfolg. Reduziere bei Speichermangel Kontext oder Quantisierung; wähle ein stärkeres Modell, wenn Patches schnell, aber falsch sind.

Manuelle Provider-Konfiguration

OpenCode ausdrücklich mit Ollama verbinden

Lege opencode.json an oder erweitere die Datei, wenn du einen festen lokalen Provider möchtest. Ersetze beide Platzhalter durch die exakte ID aus ollama list.

{   "$schema": "https://opencode.ai/config.json",   "provider": {     "ollama": {       "npm": "@ai-sdk/openai-compatible",       "name": "Ollama (local)",       "options": {         "baseURL": "http://localhost:11434/v1"       },       "models": {         "deine-modell-id": {           "name": "Mein lokales Coding-Modell"         }       }     }   } }

Bedeutung der Zeilen

Den lokalen Endpunkt lokal halten

  • baseURL: Ollamas OpenAI-kompatibler Endpunkt auf diesem PC.
  • models: nur tatsächlich in Ollama installierte IDs aufführen.
  • npm: der von OpenCode dokumentierte OpenAI-kompatible Adapter.
  • localhost: verhindert versehentliche Anfragen an einen anderen Rechner.

Ersetze localhost nicht allein für einen bequemen Fernzugriff durch eine öffentliche Bind-Adresse. Dafür sind Authentifizierung, Firewall-Regeln und ein bewusstes Netzwerkkonzept nötig.

Modell + 64K Kontext + Reserve

Wie viel Speicher brauchen OpenCode und Ollama?

OpenCode selbst verbraucht nicht den größten Speicheranteil. Geladenes Modell, Quantisierung, KV-Cache und parallele Sitzungen bestimmen das Hardwareziel.

Lokale ModellklassePraktischer HardwarestartPassender EinsatzVor der Festlegung
7B–14B quantisiert12–16 GB VRAM; 32 GB System-RAMFokussierter Chat, kleine Änderungen, erste AgententestsPrüfen, ob 64K Kontext passt und Tools zuverlässig arbeiten.
20B–24B quantisiert24 GB VRAM; 64 GB System-RAMLeistungsfähigere Arbeit mit einem AgentenReserve für Kontext, Anzeige und Build-Tools lassen.
30B–32B quantisiert32 GB VRAM für Tempo oder mindestens 64 GB Unified Memory für KapazitätRepository-Agenten und stärkere Code-ErzeugungDieselbe Quantisierung kann bei 32K passen und bei 64K knapp werden.
Großes Modell oder mehrere Agenten96–128 GB Unified beziehungsweise kohärenter SpeicherKapazitätsorientierte Workflows und mehrere DiensteRuntime-Unterstützung prüfen und anderes Tempoprofil als bei dedizierter GPU erwarten.

Die Bereiche enthalten bewusst Arbeitsreserve, bleiben aber Schätzwerte. Entscheidend sind Modell-Datei, konfigurierter Kontext und gemessener Spitzenverbrauch. Der PC-Finder übersetzt diese Angaben in eine Hardwareklasse.

Fehlersuche nach Symptom

Die tatsächlich fehlerhafte Ebene reparieren

SymptomWahrscheinliche UrsachePrüfungSinnvoller nächster Schritt
Modell fehlt in der ListeOllama gestoppt, falscher Tag oder Grenze des Start-Pickersollama list und Ollama-DienstExakten Tag laden oder installierte ID in opencode.json definieren.
Chat läuft, Änderungen nichtSchwaches oder inkompatibles Tool-CallingModellkarte und Ein-Datei-Tool-TestToolfähiges Coding-Modell nutzen und keine fehlende Fähigkeit erzwingen.
Nach einiger Zeit SpeichermangelKontext-Cache oder parallele SitzungenKonfigurierten Kontext und SpeichermaximumAndere Sitzungen schließen, Kontext bewusst reduzieren oder kleinere Quantisierung wählen.
Sehr langsam vor dem ersten TokenLange Prompt-Verarbeitung, CPU-Offload oder kalter ModellstartGPU-Offload, Promptlänge und SpeicheraktivitätModell im schnellen Speicher halten, irrelevanten Kontext verkleinern oder schnellere Hardware wählen.
Agent wiederholt sich oder verliert DateienKontext abgeschnitten oder schwache Repository-AuswahlTatsächliche Kontextgrenze und OpenCode-ProtokollKontext nur bei genug Speicher erhöhen, Aufgabe teilen und Anweisungen knapp halten.
Endpunkt nicht erreichbarFalscher Host/Port oder Dienst gestoppthttp://localhost:11434/v1 und lokale FirewallStandard-Endpunkt lokal wiederherstellen, bevor Fernzugriff versucht wird.

Lokale Inferenz ist nur eine Datenschutzschicht

Dem Agenten einen sicheren Arbeitsbereich geben

OpenCode kann Dateien lesen und ändern sowie Terminalbefehle ausführen. Behandle die Modellausgabe wie den Beitrag eines unerfahrenen Teammitglieds: nützlich, schnell und immer zu prüfen.

Vorher committen

Sauberen Branch oder Worktree und einen einfachen Rücksetzpunkt verwenden.

Ordner begrenzen

Nur das benötigte Projekt öffnen; Zugangsdaten und Produktiv-Dumps ausschließen.

Befehle prüfen

Destruktive, privilegierte oder vernetzte Befehle nicht unverstanden freigeben.

Patch verifizieren

Diff prüfen und projektbezogene Tests, Linter sowie Sicherheitschecks ausführen.

FAQ zu OpenCode und Ollama

Antworten vor einem Hardwarewechsel

Kann OpenCode ein Ollama-Modell ohne API-Key verwenden?

Ja. Der lokale Ollama-Endpunkt auf localhost benötigt keinen Cloud-Provider-Key. Halte ihn lokal, solange du nicht bewusst Authentifizierung und Netzwerkschutz ergänzt.

Warum läuft dasselbe Modell im Chat, aber nicht in OpenCode?

Ein Agent braucht strukturierte Tool-Aufrufe, mehr Prompt-Kontext und genug Ausgabedisziplin zum Ändern von Dateien und Ausführen von Befehlen. Ein Modell mit überzeugendem Chattext muss diese Schritte nicht zuverlässig beherrschen.

Braucht OpenCode wirklich 64K Kontext?

Ollamas offizielle OpenCode-Integration empfiehlt für lokale Modelle mindestens 64K. Kleine fokussierte Aufgaben können weniger belegen; bei Repository-Arbeit füllen Tools, Dateien, Ausgaben und Verlauf den Prompt jedoch schnell.

Soll ich RTX 5090 oder einen Mini-PC mit 128 GB wählen?

Wähle die RTX 5090, wenn Modell und Kontext in 32 GB passen und Schleifengeschwindigkeit zählt. Wähle 128 GB Unified Memory, wenn größere Modelle, längerer Kontext oder mehrere Dienste mehr als 32 GB Kapazität benötigen.

Befehle aktuell halten

Offizielle Quellen für die Einrichtung

PC noch nicht gewählt?

Modell und Kontext vor dem Komplettsystem dimensionieren

Gib Modellklasse, Kontext und Workflow an. Das Ergebnis trennt schnellen dedizierten VRAM von größerer Shared-Memory-Kapazität.

PC-Finder öffnen