Code local · dépôt privé · votre matériel

Choisir le meilleur LLM local et le bon PC pour coder

Commencez par la tâche : l’autocomplétion rapide n’a pas les mêmes besoins qu’un agent qui lit un dépôt, modifie des fichiers, lance les tests et conserve au moins 64K de contexte.

  • usage d’abord
  • contexte inclus
  • agent sécurisé

Réponse rapide

Le meilleur modèle de code local est celui qui tient dans tout le workflow

La qualité du modèle ne suffit pas : il faut de la mémoire rapide, un contexte utilisable, des appels d’outils fiables et des boucles assez courtes.

Autocomplétion

Suggestions brèves pendant la saisie. La latence compte plus qu’un très grand modèle.

Prévoir 8–16 Go

Chat et débogage

Expliquer du code, écrire des tests et analyser quelques fichiers avec un modèle 14B–32B.

Prévoir 16–32 Go

Agent de dépôt

Lit, recherche, modifie et exécute des commandes. Les outils et 64K de contexte deviennent essentiels.

Prévoir 24–32 Go ou plus

Agents parallèles

Chaque session ajoute du cache KV et des tampons. Un grand pool partagé apporte surtout de la capacité.

Prévoir 64–128 Go

Mémoire avant l’étiquette « IA »

Classes de matériel pour les LLM de code locaux

Ces fourchettes servent à planifier. Quantification, cache de contexte, runtime, système et sessions simultanées partagent la mémoire.

ClasseBon usageModèles pratiquesLimite principale
12–16 Go de VRAMAutocomplétion, chat cibléModèles 7B–14B quantifiésLes grands dépôts et le long contexte réduisent vite la marge.
24 Go de VRAMUn agent local capableNombreux modèles 20B–30B quantifiésLe contexte 64K peut rendre une configuration très juste.
32 Go de VRAMAgents rapides et code plus complexeClasse 20B–32B avec davantage de cacheLes modèles 70B nécessitent généralement un offload.
64–128 Go unifiésGrands modèles, long contexte, plusieurs servicesDe 32B aux 70B quantifiés, priorité capacitéTenir en mémoire ne garantit pas le débit d’un GPU dédié.

Modèle de référence utile

Qwen3-Coder 30B-A3B explique pourquoi le nom ne suffit pas

La fiche officielle indique 30,5 milliards de paramètres au total, 3,3 milliards activés et 262 144 jetons de contexte natif. C’est un modèle mixture-of-experts : les paramètres activés décrivent le calcul par jeton, mais tous les poids des experts doivent être chargés.

  • conçu pour le code et les appels d’outils
  • le contexte natif maximal n’est pas gratuit en mémoire
  • la quantification change la taille et parfois la qualité
  • réduire le contexte en cas de mémoire insuffisante
Voir la fiche officielle

Contexte réel de l’agent

Un modèle qui tient à 8K peut échouer à 64K

Les agents ajoutent aux fichiers le schéma des outils, les sorties de commandes et l’historique. Plusieurs sessions multiplient le cache.

Poids du modèleaprès quantificationCache KVcontexte × architecture × sessionsMarge runtimeoutils, système et tampons

L’agent et le modèle sont deux choix

Choisir l’interface selon le travail autorisé

Continue

Extension IDE avec rôles distincts pour chat, édition et autocomplétion.

Pour :VS Code et JetBrainsGuide officiel

Cline

Agent dans l’IDE avec prise en charge des modèles locaux.

Pour :travail guidé dans l’éditeurGuide officiel

Aider

Pair programmer en terminal, attentif à Git et aux changements ciblés.

Pour :modifications contrôléesGuide officiel

VRAM dédiée pour la vitesse

Une RTX 5090 fournit 32 Go de VRAM rapide. Elle réduit les boucles modification–test quand le modèle et son contexte tiennent entièrement.

  • excellente classe 20B–32B
  • écosystème CUDA étendu
  • capacité fixe de 32 Go
Comparer les PC RTX 5090

Mémoire unifiée pour la capacité

Un système Ryzen AI Max+ 395 de 128 Go accepte des modèles quantifiés plus grands et davantage de contexte. C’est un choix de capacité, pas une promesse de vitesse RTX 5090.

  • modèles plus grands
  • systèmes compacts
  • runtime et allocation UMA à vérifier
Comparer les systèmes 128 Go

Un modèle local peut exécuter des outils dangereux

Quatre garde-fous avant le premier agent

L’inférence locale protège le traitement du prompt, pas automatiquement les fichiers ni les commandes autorisées.

Branche propre

Commiter avant et travailler dans une branche ou un worktree réversible.

Secrets exclus

Conserver clés et données de production hors du dossier accessible.

Droits limités

Ne pas lancer comme administrateur et vérifier les commandes sensibles.

Patch vérifié

Relire le diff et exécuter tests, lint et contrôles de sécurité.

Trois chemins de PC complet

Choisir la priorité avant le boîtier

PrioritéSystèmeAtoutÀ vérifier
Agent rapideTour RTX 509032 Go de VRAM dédiée et CUDAGPU de bureau exact, 64 Go+ RAM, refroidissement et alimentation
Grande capacitéBeelink GTR9 Pro ou MS-S1 Max128 Go unifiés dans un système compactVersion 128 Go, allocation graphique, OS et backend
Appliance NVIDIAASUS Ascent GX10128 Go cohérents et environnement NVIDIACompatibilité Arm64/Linux de chaque dépendance

Documentation primaire

Sources pour modèles, agents et contexte

QW

Qwen3-Coder

Architecture, paramètres, contexte et outils dans la fiche officielle.

OL

Ollama + OpenCode

Lancement direct et contexte local dans le guide officiel.

HW

Étape suivante

Utilisez le configurateur PC avec votre classe de modèle et votre contexte.

Passer à un test réel

Installer OpenCode localement et essayer une petite tâche réversible

Mesurez d’abord la réussite des tests, puis cherchez si la limite vient du modèle, du contexte ou de la vitesse.

Ouvrir le guide OpenCode