Un modèle pour plusieurs appareils

Quel matériel pour un serveur IA local à la maison ?

Un serveur LLM local fournit un modèle aux ordinateurs, téléphones et applications de votre réseau. Il lui faut assez de mémoire rapide, un backend compatible, un refroidissement durable, un stockage spacieux et un accès sécurisé.

Choisir une classe

Quel serveur correspond à votre charge ?

Taille du modèle, contexte et requêtes simultanées déterminent le matériel. Chaque conversation active ajoute du cache KV ; plusieurs clients exigent plus de marge qu’une seule fenêtre de chat.

Une personne, 7B à 14B

32 Go de RAM et 12 à 16 Go de VRAM forment une entrée exploitable. Pour un serveur neuf, 64 Go et un SSD de 1 à 2 To apportent davantage de souplesse.

Bureau et API légère

Foyer, 20B à 32B

64 Go partagés ou un GPU avec 24 à 32 Go de VRAM accueillent de plus grandes quantifications. Gardez une réserve pour les clients concurrents.

Plusieurs appareils du réseau

70B et services de développement

128 Go unifiés constituent la classe compacte de capacité. Une tour RTX 5090 est souvent plus rapide dans 32 Go, mais un 70B demande généralement un offloading.

Grand modèle ou plusieurs services

Capacité réaliste

Mémoire selon le modèle et les clients

ChargeMatériel pratiquePoint à surveiller
7B–14B, une ou deux sessions12–16 Go VRAM ; 32–64 Go RAMoffloading complet sur GPU et SSD d’au moins 1 To
20B–32B, plusieurs clients24–32 Go VRAM ou 64 Go unifiésmarge du cache KV et contexte
65B–70B, une grande session96–128 Go unifiés ou offloading GPU/RAMcapacité et vitesse sont deux sujets différents
70B avec RAG et automatisation128 Go avec marge ; SSD 2 To ou plusmodèle, embeddings, index et services se partagent la mémoire

Le configurateur fournit une première estimation ; le guide mémoire détaille quantification, contexte et offloading.

Trois voies complètes

Systèmes adaptés à un serveur LLM local

Chaque machine répond à une priorité. Contrôlez toujours la mémoire, le stockage et le GPU exacts de la variante.

Capacité x86 et réseau rapide

Beelink GTR9 Pro

128 Go, 2 To et double 10GbE avec Ryzen AI Max+ 395.

128 Go

Pourquoi comme serveur ?

La réserve accueille beaucoup de 70B quantifiés ; les deux 10GbE servent un NAS et plusieurs clients rapides.

Avant l’achat

Contrôlez les pilotes réseau, l’allocation UMA, la compatibilité Radeon et la ventilation prolongée.

Guide du GTR9 Pro
Mémoire
128 Go partagés
Stockage
2 To ; deux M.2
Réseau
2× 10GbE, Wi-Fi 7

Station NVIDIA

ASUS Ascent GX10

128 Go cohérents, 10GbE et DGX OS.

128 Go

Pourquoi comme serveur ?

GB10, CUDA, 10GbE et ConnectX-7 conviennent aux services de développement et aux grands modèles.

Avant l’achat

Il s’agit d’une station Arm/Linux. Validez chaque application et choisissez assez de SSD dès le départ.

Guide du GX10
Mémoire
128 Go cohérents
Système
DGX OS / Ubuntu
Réseau
10GbE, Wi-Fi 7, ConnectX-7

Tour GPU à fort débit

PC GeForce RTX 5090

32 Go de VRAM, au moins 64 Go de RAM et 2 To NVMe.

32 Go VRAM

Pourquoi comme serveur ?

CUDA et la forte bande passante favorisent une inférence rapide pour les modèles qui tiennent dans 32 Go.

Avant l’achat

Un 70B exige normalement un offloading. Vérifiez châssis, bruit, alimentation, stockage extensible et consommation au repos.

Guide des PC RTX 5090
GPU
RTX 5090 de bureau, 32 Go
RAM
64 Go ou plus
Meilleur usage
8B–32B rapides

* Liens rémunérés. Si vous effectuez un achat, nous pouvons recevoir une commission ; votre prix reste inchangé. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. Vérifiez configuration, vendeur et livraison sur la page de destination.

Au-delà du GPU

Huit critères d’un bon serveur domestique

Refroidissement durable

Mesurez température, fréquence et bruit après une longue session.

Consommation au repos

Un serveur accessible attend souvent plus qu’il ne calcule.

2,5 ou 10GbE

Le texte exige peu ; NAS et transferts de modèles profitent du réseau rapide.

Au moins 2 To

Quantifications, embeddings et index occupent des centaines de Go.

Redémarrage sans écran

Démarrage, mises à jour et reprise doivent fonctionner sans clavier.

Sauvegardes

Protégez prompts, index, réglages et documents privés.

Onduleur

Une alimentation protégée réduit les arrêts brutaux.

Extension

Un second M.2 est souvent plus utile que des sorties vidéo inutilisées.

Sécurité réseau

Ne publiez pas directement l’API sur Internet

Ollama écoute par défaut sur 127.0.0.1:11434. Pour d’autres appareils, limitez les réseaux autorisés, configurez le pare-feu, ajoutez une authentification et utilisez un VPN pour l’accès distant.

Tester en local

Validez moteur, modèle et API avant d’ouvrir l’accès au LAN.

Limiter les clients

Autorisez uniquement les appareils de confiance ou un VLAN dédié.

Auditer les flux

Extensions, recherche web, télémétrie et embeddings externes peuvent transmettre des données.

Questions fréquentes

Un serveur LLM à domicile

Faut-il du matériel serveur professionnel ?

Non. Un PC complet bien refroidi est souvent plus pertinent pour un service privé. Mémoire GPU ou unifiée, backend et stockage comptent davantage que l’étiquette « serveur ».

Un mini-PC peut-il servir de serveur LLM ?

Oui. Les systèmes 64 ou 128 Go sont très compacts. Vérifiez refroidissement, mémoire soudée, réseau, SSD et consommation au repos.

Combien d’utilisateurs peut-il servir ?

Le modèle, la quantification, le contexte, la vitesse souhaitée et les demandes simultanées déterminent la capacité. Prévoyez nettement plus de marge pour plusieurs clients.