Du déballage au premier message

Installer un LLM local avec Ollama ou LM Studio

Une procédure sûre pour Windows et Linux : vérifier la mémoire et les pilotes, choisir un moteur, commencer avec un petit modèle, contrôler l’accélération GPU, puis optimiser.

Avant l’installation

Configuration nécessaire pour Ollama et LM Studio

LM Studio recommande au moins 16 Go de RAM et 4 Go de VRAM dédiée sous Windows, mais cette base ne convient qu’aux petits modèles. Dimensionnez un nouveau PC selon la classe de modèle réellement prévue.

ComposantPoint de départ techniqueObjectif pratique
RAM système16 Go pour de petits modèles32 Go pour 7B–14B ; 64 Go ou plus pour offloading et grands modèles
Mémoire GPU4 Go pour découvrir LM Studio12–16 Go pour 7B–14B ; 24–32 Go pour des 20B–32B rapides
CPUAVX2 requis par LM Studio sur x64processeur multicœur moderne, surtout si des couches restent en RAM
SSDapplication et un petit modèle1 To utilisable au minimum, idéalement 2 To pour plusieurs familles
Backendcompatible avec le matériel et le systèmeCUDA NVIDIA, voie AMD prise en charge ou plateforme GB10 documentée

Consultez les listes actuelles : matériel GPU pris en charge par Ollama et configuration requise par LM Studio. Notre guide VRAM aide ensuite à choisir la capacité.

Installation en six étapes

Mettre en route votre LLM local

L’interface est un choix personnel. Les pilotes, la marge de mémoire et un format de modèle compatible sont les fondations techniques.

  1. 01

    Mettre à jour firmware et pilotes

    Installez les mises à jour du système, du chipset et du GPU depuis les sources officielles. Sur une machine à mémoire unifiée, vérifiez aussi le BIOS/UEFI et l’allocation UMA disponible.

  2. 02

    Contrôler mémoire et espace libre

    Gardez de la marge au-delà du fichier du modèle. Plusieurs quantifications d’un grand modèle et une base RAG peuvent rapidement occuper des centaines de gigaoctets.

  3. 03

    Choisir le moteur

    Ollama convient à un service local et aux automatisations. LM Studio propose une interface graphique. llama.cpp offre un contrôle avancé.

  4. 04

    Commencer avec un modèle compact

    Téléchargez d’abord un modèle instruct 7B ou 8B bien documenté. Validez le lancement et l’accélération avant de transférer un modèle de plusieurs dizaines de gigaoctets.

  5. 05

    Observer l’utilisation

    Surveillez VRAM ou UMA, RAM, température, ventilation et délai du premier jeton. Un offloading massif indique souvent qu’un modèle plus petit ou plus quantifié sera plus agréable.

  6. 06

    Sécuriser l’accès

    Commencez avec une API liée à 127.0.0.1. Ne l’exposez ni au réseau local ni à Internet sans pare-feu, authentification et contrôle précis des clients autorisés.

Choisir son outil

Quel moteur correspond à votre usage ?

Ollama

Gestion simple des modèles et service local utile pour les applications, les scripts et les API.

Pour :débutants, développeurs, automatisationDocumentation officielle

LM Studio

Recherche de modèles, conversation et serveur local réunis dans une application graphique.

Pour :installation visuelle et comparaisonDocumentation officielle

llama.cpp

Backend léger et ouvert avec des réglages détaillés pour quantification, offloading et plateformes.

Pour :contrôle, essais et intégrationsPage du projet

Windows

Commencer en natif

Ollama et LM Studio fonctionnent généralement sans WSL. WSL2 devient utile lorsque l’environnement de développement exige Linux. Évitez plusieurs services qui se disputent la même mémoire GPU.

  • pilote graphique à jour
  • profil d’alimentation adapté à la charge continue
  • démarrage automatique configuré volontairement

Linux

Flexible pour les services

Linux convient bien à un serveur sans écran et à des environnements reproductibles. Vérifiez le noyau, le pilote et le backend officiellement pris en charge par votre matériel.

  • logiciels provenant de sources fiables
  • API non accessible publiquement
  • partition assez grande pour les modèles

Questions avant l’achat

Matériel pour Ollama

Ollama exige-t-il une carte graphique ?

Non, un modèle peut fonctionner sur le CPU. Une carte graphique prise en charge ou une architecture à mémoire unifiée accélère toutefois fortement l’inférence lorsqu’une grande partie du modèle reste en mémoire rapide.

Combien de RAM faut-il pour Ollama ?

16 Go peuvent lancer de petits 7B ou 8B, mais 32 Go constituent une base plus pratique pour un PC neuf. Les grands modèles, les longs contextes et l’offloading profitent de 64 ou 128 Go.

Ollama peut-il exécuter un modèle 70B en local ?

Oui, avec une quantification adaptée et suffisamment de mémoire. Une classe 64 Go est souvent serrée ; 96 à 128 Go laissent davantage de place au contexte, au moteur et au système.

NVIDIA ou AMD : lequel choisir ?

NVIDIA offre une voie CUDA très répandue. Le matériel AMD actuellement pris en charge peut utiliser ROCm ou Vulkan. Le modèle précis, le système, le pilote, la version du moteur et la mémoire disponible importent plus que la marque seule.

Local ne signifie pas automatiquement sécurisé

Quatre règles simples

Vérifier le mode hors ligne

Contrôlez les fonctions en ligne et la télémétrie de l’application.

Limiter l’API

Gardez-la locale ou protégez-la par authentification et pare-feu.

Lire la licence

Les licences de modèles imposent des règles différentes.

Surveiller la charge

Contrôlez température, poussière, bruit et consommation.

Matériel encore indécis ?

Choisissez d’abord la bonne classe de mémoire

Le configurateur traduit votre modèle en une configuration réaliste. Pour plusieurs appareils, consultez aussi le guide du serveur IA local.

Ouvrir le configurateur