Une personne, 7B à 14B
32 Go de RAM et 12 à 16 Go de VRAM forment une entrée exploitable. Pour un serveur neuf, 64 Go et un SSD de 1 à 2 To apportent davantage de souplesse.
Bureau et API légèreUn modèle pour plusieurs appareils
Un serveur LLM local fournit un modèle aux ordinateurs, téléphones et applications de votre réseau. Il lui faut assez de mémoire rapide, un backend compatible, un refroidissement durable, un stockage spacieux et un accès sécurisé.
Choisir une classe
Taille du modèle, contexte et requêtes simultanées déterminent le matériel. Chaque conversation active ajoute du cache KV ; plusieurs clients exigent plus de marge qu’une seule fenêtre de chat.
32 Go de RAM et 12 à 16 Go de VRAM forment une entrée exploitable. Pour un serveur neuf, 64 Go et un SSD de 1 à 2 To apportent davantage de souplesse.
Bureau et API légère64 Go partagés ou un GPU avec 24 à 32 Go de VRAM accueillent de plus grandes quantifications. Gardez une réserve pour les clients concurrents.
Plusieurs appareils du réseau128 Go unifiés constituent la classe compacte de capacité. Une tour RTX 5090 est souvent plus rapide dans 32 Go, mais un 70B demande généralement un offloading.
Grand modèle ou plusieurs servicesCapacité réaliste
| Charge | Matériel pratique | Point à surveiller |
|---|---|---|
| 7B–14B, une ou deux sessions | 12–16 Go VRAM ; 32–64 Go RAM | offloading complet sur GPU et SSD d’au moins 1 To |
| 20B–32B, plusieurs clients | 24–32 Go VRAM ou 64 Go unifiés | marge du cache KV et contexte |
| 65B–70B, une grande session | 96–128 Go unifiés ou offloading GPU/RAM | capacité et vitesse sont deux sujets différents |
| 70B avec RAG et automatisation | 128 Go avec marge ; SSD 2 To ou plus | modèle, embeddings, index et services se partagent la mémoire |
Le configurateur fournit une première estimation ; le guide mémoire détaille quantification, contexte et offloading.
Trois voies complètes
Chaque machine répond à une priorité. Contrôlez toujours la mémoire, le stockage et le GPU exacts de la variante.
Capacité x86 et réseau rapide
128 Go, 2 To et double 10GbE avec Ryzen AI Max+ 395.
La réserve accueille beaucoup de 70B quantifiés ; les deux 10GbE servent un NAS et plusieurs clients rapides.
Contrôlez les pilotes réseau, l’allocation UMA, la compatibilité Radeon et la ventilation prolongée.
Guide du GTR9 ProStation NVIDIA
128 Go cohérents, 10GbE et DGX OS.
GB10, CUDA, 10GbE et ConnectX-7 conviennent aux services de développement et aux grands modèles.
Il s’agit d’une station Arm/Linux. Validez chaque application et choisissez assez de SSD dès le départ.
Guide du GX10Tour GPU à fort débit
32 Go de VRAM, au moins 64 Go de RAM et 2 To NVMe.
CUDA et la forte bande passante favorisent une inférence rapide pour les modèles qui tiennent dans 32 Go.
Un 70B exige normalement un offloading. Vérifiez châssis, bruit, alimentation, stockage extensible et consommation au repos.
Guide des PC RTX 5090* Liens rémunérés. Si vous effectuez un achat, nous pouvons recevoir une commission ; votre prix reste inchangé. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. Vérifiez configuration, vendeur et livraison sur la page de destination.
Au-delà du GPU
Mesurez température, fréquence et bruit après une longue session.
Un serveur accessible attend souvent plus qu’il ne calcule.
Le texte exige peu ; NAS et transferts de modèles profitent du réseau rapide.
Quantifications, embeddings et index occupent des centaines de Go.
Démarrage, mises à jour et reprise doivent fonctionner sans clavier.
Protégez prompts, index, réglages et documents privés.
Une alimentation protégée réduit les arrêts brutaux.
Un second M.2 est souvent plus utile que des sorties vidéo inutilisées.
Sécurité réseau
Ollama écoute par défaut sur 127.0.0.1:11434. Pour d’autres appareils, limitez les réseaux autorisés, configurez le pare-feu, ajoutez une authentification et utilisez un VPN pour l’accès distant.
Validez moteur, modèle et API avant d’ouvrir l’accès au LAN.
Autorisez uniquement les appareils de confiance ou un VLAN dédié.
Extensions, recherche web, télémétrie et embeddings externes peuvent transmettre des données.
Questions fréquentes
Non. Un PC complet bien refroidi est souvent plus pertinent pour un service privé. Mémoire GPU ou unifiée, backend et stockage comptent davantage que l’étiquette « serveur ».
Oui. Les systèmes 64 ou 128 Go sont très compacts. Vérifiez refroidissement, mémoire soudée, réseau, SSD et consommation au repos.
Le modèle, la quantification, le contexte, la vitesse souhaitée et les demandes simultanées déterminent la capacité. Prévoyez nettement plus de marge pour plusieurs clients.