Ollama
Gestion simple des modèles et service local utile pour les applications, les scripts et les API.
Pour :débutants, développeurs, automatisationDocumentation officielleDu déballage au premier message
Une procédure sûre pour Windows et Linux : vérifier la mémoire et les pilotes, choisir un moteur, commencer avec un petit modèle, contrôler l’accélération GPU, puis optimiser.
Avant l’installation
LM Studio recommande au moins 16 Go de RAM et 4 Go de VRAM dédiée sous Windows, mais cette base ne convient qu’aux petits modèles. Dimensionnez un nouveau PC selon la classe de modèle réellement prévue.
| Composant | Point de départ technique | Objectif pratique |
|---|---|---|
| RAM système | 16 Go pour de petits modèles | 32 Go pour 7B–14B ; 64 Go ou plus pour offloading et grands modèles |
| Mémoire GPU | 4 Go pour découvrir LM Studio | 12–16 Go pour 7B–14B ; 24–32 Go pour des 20B–32B rapides |
| CPU | AVX2 requis par LM Studio sur x64 | processeur multicœur moderne, surtout si des couches restent en RAM |
| SSD | application et un petit modèle | 1 To utilisable au minimum, idéalement 2 To pour plusieurs familles |
| Backend | compatible avec le matériel et le système | CUDA NVIDIA, voie AMD prise en charge ou plateforme GB10 documentée |
Consultez les listes actuelles : matériel GPU pris en charge par Ollama et configuration requise par LM Studio. Notre guide VRAM aide ensuite à choisir la capacité.
Installation en six étapes
L’interface est un choix personnel. Les pilotes, la marge de mémoire et un format de modèle compatible sont les fondations techniques.
Installez les mises à jour du système, du chipset et du GPU depuis les sources officielles. Sur une machine à mémoire unifiée, vérifiez aussi le BIOS/UEFI et l’allocation UMA disponible.
Gardez de la marge au-delà du fichier du modèle. Plusieurs quantifications d’un grand modèle et une base RAG peuvent rapidement occuper des centaines de gigaoctets.
Téléchargez d’abord un modèle instruct 7B ou 8B bien documenté. Validez le lancement et l’accélération avant de transférer un modèle de plusieurs dizaines de gigaoctets.
Surveillez VRAM ou UMA, RAM, température, ventilation et délai du premier jeton. Un offloading massif indique souvent qu’un modèle plus petit ou plus quantifié sera plus agréable.
Commencez avec une API liée à 127.0.0.1. Ne l’exposez ni au réseau local ni à Internet sans pare-feu, authentification et contrôle précis des clients autorisés.
Choisir son outil
Gestion simple des modèles et service local utile pour les applications, les scripts et les API.
Pour :débutants, développeurs, automatisationDocumentation officielleRecherche de modèles, conversation et serveur local réunis dans une application graphique.
Pour :installation visuelle et comparaisonDocumentation officielleBackend léger et ouvert avec des réglages détaillés pour quantification, offloading et plateformes.
Pour :contrôle, essais et intégrationsPage du projetWindows
Ollama et LM Studio fonctionnent généralement sans WSL. WSL2 devient utile lorsque l’environnement de développement exige Linux. Évitez plusieurs services qui se disputent la même mémoire GPU.
Linux
Linux convient bien à un serveur sans écran et à des environnements reproductibles. Vérifiez le noyau, le pilote et le backend officiellement pris en charge par votre matériel.
Questions avant l’achat
Non, un modèle peut fonctionner sur le CPU. Une carte graphique prise en charge ou une architecture à mémoire unifiée accélère toutefois fortement l’inférence lorsqu’une grande partie du modèle reste en mémoire rapide.
16 Go peuvent lancer de petits 7B ou 8B, mais 32 Go constituent une base plus pratique pour un PC neuf. Les grands modèles, les longs contextes et l’offloading profitent de 64 ou 128 Go.
Oui, avec une quantification adaptée et suffisamment de mémoire. Une classe 64 Go est souvent serrée ; 96 à 128 Go laissent davantage de place au contexte, au moteur et au système.
NVIDIA offre une voie CUDA très répandue. Le matériel AMD actuellement pris en charge peut utiliser ROCm ou Vulkan. Le modèle précis, le système, le pilote, la version du moteur et la mémoire disponible importent plus que la marque seule.
Local ne signifie pas automatiquement sécurisé
Contrôlez les fonctions en ligne et la télémétrie de l’application.
Gardez-la locale ou protégez-la par authentification et pare-feu.
Les licences de modèles imposent des règles différentes.
Contrôlez température, poussière, bruit et consommation.
Matériel encore indécis ?
Le configurateur traduit votre modèle en une configuration réaliste. Pour plusieurs appareils, consultez aussi le guide du serveur IA local.