Kaufberatung für lokale KI

Komplettsysteme für lokale LLMs

Vergleiche konkrete Komplettsysteme danach, welche Modelle in den schnellen Speicher passen, wie gut sich Massenspeicher und Netzwerk erweitern lassen und welche Kompromisse bei Tempo, Platzbedarf und Lautstärke entstehen.

Die wichtigste Entscheidung

Großer Speicherpool oder maximale GPU-Bandbreite?

Unified Memory: mehr Modell im Gerät

64 bis 128 GB gemeinsam nutzbarer Speicher können große quantisierte Modelle aufnehmen. Das ist kapazitätsstark und kompakt, erreicht aber typischerweise nicht das Inferenztempo einer großen diskreten GPU.

Ideal: 32B bis 70B mit Kapazitätsfokus

Diskrete GPU: mehr Tempo

32 GB dedizierter VRAM und hohe Speicherbandbreite sind stark für Modelle, die vollständig auf der GPU liegen. Für 70B sind meist CPU-/RAM-Offloading oder stärkere Quantisierung nötig.

Ideal: schnelle 8B bis 32B Workflows

KI-Appliance: Software-Stack inklusive

Ein spezialisiertes NVIDIA-System kann großen Unified Memory mit CUDA-Werkzeugen verbinden. Dafür sind ARM-Prozessor, Linux und ein stärker auf Entwicklung als auf klassischen Desktop-Alltag zugeschnittenes System einzuplanen.

Ideal: CUDA-native Entwicklung und große Modelle
Markenfreie Darstellung eines Mini-PCs, eines großen GPU-Towers und einer kompakten KI-Appliance
Drei typische Bauformen: Mini-PCs priorisieren Platz und Speicherkapazität, GPU-Tower Tempo und Aufrüstbarkeit, spezialisierte KI-Appliances einen abgestimmten Entwicklungs-Stack.

Konkrete Komplettsysteme

Welche Konfiguration passt zu deinem Alltag?

Die Systeme unterscheiden sich nicht nur beim Modellspeicher: SSD-Ausbau, Netzwerk, Stromversorgung und Gehäuse entscheiden darüber, ob der Rechner am Schreibtisch, als Heimserver oder für häufige große Modelle überzeugt.

Stärke: große Modelle im kompakten Format

MINISFORUM MS-S1 Max

Kompaktes Ryzen-AI-Max+-System mit großem gemeinsamem Speicherpool.

128 GB

Gut für

Quantisierte 70B-Modelle, große lokale Wissenssammlungen und den Betrieb als schneller Heimserver. Zwei 10-GbE-Ports sind besonders praktisch, wenn Modelle auf einem NAS liegen oder mehrere Rechner zugreifen.

Grenzen

Der LPDDR5X-Speicher ist fest verbaut und Unified Memory erreicht nicht die Bandbreite einer großen diskreten GPU. Vor dem Kauf genau 128 GB / 2 TB sowie die benötigte UMA-Zuweisung und Runtime-Unterstützung prüfen.

CPU / Grafik
Ryzen AI Max+ 395 / Radeon 8060S
Speicher
128 GB LPDDR5X, gemeinsam
SSD-Ausbau
2× M.2 2280; 2 TB enthalten
Netzwerk
2× 10GbE, Wi-Fi 7
Anschlüsse
4× USB4, HDMI 2.1, PCIe-Steckplatz
Größe / Strom
222 × 206 × 77 mm; internes 320-W-Netzteil

Stärke: 32B-Kapazität im Mini-PC

GMKtec EVO-X2

Ryzen AI Max+ 395 in einer kleineren 64-GB-Konfiguration.

64 GB

Gut für

20B- bis 32B-Modelle, längere Kontexte und einen sehr kompakten Arbeitsplatz. SD-Kartenleser, zwei USB4-Anschlüsse und zwei M.2-Slots machen das Gerät auch für Daten- und Modellbibliotheken praktisch.

Grenzen

64 GB sind nicht vollständig für das Modell frei und der verlötete RAM ist nicht erweiterbar. Die verlinkte 64-GB-/1-TB-Variante nicht mit anders ausgestatteten EVO-X2-Angeboten verwechseln; 1 TB kann bei mehreren Quantisierungen knapp werden.

CPU / Grafik
Ryzen AI Max+ 395 / Radeon 8060S
Speicher
64 GB LPDDR5X, gemeinsam
SSD-Ausbau
2× M.2 PCIe 4.0; 1 TB enthalten
Netzwerk
2,5GbE, Wi-Fi 7
Anschlüsse
2× USB4, HDMI, DisplayPort, SD-Leser
Größe / Strom
193 × 186 × 77 mm; externes 230-W-Netzteil

Stärke: kompakte Workstation mit Hersteller-Support

HP Z2 Mini G1a

Ryzen AI Max+ PRO 395 mit 64 GB Unified Memory, 2 TB SSD und Windows 11 Pro.

64 GB

Gut für

Lokale 20B- bis 32B-Modelle, RAG und professionelle Arbeitsplätze, an denen ein internes Netzteil, Thunderbolt 4 und ein klar identifizierbares Business-Modell wichtiger sind als das kleinste Gehäuse.

Grenzen

Die 64 GB LPDDR5X sind fest verbaut und müssen Betriebssystem, Runtime, Modell und Kontext gemeinsam tragen. Für 70B ist diese Variante knapp; vor dem Kauf A40MYET#ABD, 64 GB und 2 TB sowie die mögliche UMA-Zuweisung prüfen.

CPU / Grafik
Ryzen AI Max+ PRO 395 / Radeon 8060S
Speicher
64 GB LPDDR5X-8533, gemeinsam
SSD-Ausbau
2× M.2 2280; 2 TB enthalten
Netzwerk
2,5GbE, Wi-Fi 7
Anschlüsse
2× Thunderbolt 4, 2× Mini-DP, USB-C/A
Größe / Strom
85,5 × 168 × 200 mm; internes 300-W-Netzteil

Stärke: hohe Inferenzgeschwindigkeit

Desktop-PCs mit GeForce RTX 5090

32 GB dedizierter VRAM und hohe Bandbreite für schnelle lokale Inferenz.

32 GB

Gut für

Schnelle lokale Chats, Coding-Assistenten und RAG mit 8B- bis 32B-Modellen, sofern Modell und Kontext vollständig in 32 GB VRAM passen. CUDA ist in vielen verbreiteten KI-Werkzeugen der unkomplizierteste Beschleunigungspfad.

Darauf achten

Nur Desktop-RTX-5090-Angebote mit explizit 32 GB GDDR7 vergleichen. 64 GB System-RAM, mindestens 2 TB NVMe, ein passend ausgelegtes Netzteil und freie Zu- und Abluft sind sinnvolle Mindestanforderungen.

Grafik
GeForce RTX 5090 Desktop
GPU-Speicher
32 GB GDDR7
Empfohlener System-RAM
mindestens 64 GB
Empfohlene SSD
mindestens 2 TB NVMe
Passende Richtung
schnelle 8B bis 32B Inferenz

Stärke: großer VRAM für professionelle Dauerlast

Workstations mit RTX PRO

Interessant, wenn großer diskreter VRAM, ECC-orientierte Plattformen oder Dauerlast wichtiger sind.

48–96 GB

Warum interessant

Professionelle GPUs können deutlich mehr dedizierten Speicher bieten als Gamingkarten. Das eröffnet schnellere 70B-Workflows ohne großen Offload-Anteil.

Darauf achten

Diese Systeme liegen preislich in einer anderen Klasse. Modellbezeichnung, VRAM-Ausbau, Treiberanforderungen und Lieferumfang müssen exakt übereinstimmen.

GPU-Klasse
RTX PRO, genaue Variante prüfen
Ziel-Speicher
48 bis 96 GB diskreter VRAM
System-RAM
128 GB oder mehr sinnvoll
Formfaktor
Workstation-Tower
Passende Richtung
professionelle 70B-Nutzung, Dauerlast

* Werbelink. Bei einem Kauf können wir eine Provision erhalten; dein Preis bleibt unverändert. Als Amazon-Partner verdiene ich an qualifizierten Verkäufen. Es gelten die Angaben, Preise und Lieferinformationen auf der Zielseite.

Direktvergleich

Systemwahl nach Modell und Einsatzort

SystemSchneller SpeicherBesonders passendWichtigste Grenze
MINISFORUM MS-S1 Max128 GB gemeinsam70B zuhause, 10-GbE-Server, große ModellbibliothekRAM verlötet; UMA und Runtime prüfen
GMKtec EVO-X264 GB gemeinsamkompakte 20B–32B-Workstation1-TB-Variante und nicht aufrüstbarer RAM
HP Z2 Mini G1a A40MYET64 GB gemeinsam20B–32B, Business-Support, Thunderbolt-Arbeitsplatzfest verlöteter RAM; 70B zu knapp
RTX-5090-Tower32 GB GDDR7sehr schnelle 8B–32B-Inferenz70B benötigt langsameren Offload
RTX-PRO-Workstation48–96 GB VRAMprofessionelle 70B-Dauerlastsehr hohe Anschaffungskosten

Noch unsicher?

Berechne zuerst deinen Speicherbedarf

Modellgröße und Kontext entscheiden stärker als ein Markenname. Unser Finder macht die Annahmen sichtbar.

Zum PC-Finder