Autocomplétion
Suggestions brèves pendant la saisie. La latence compte plus qu’un très grand modèle.
Prévoir 8–16 GoCode local · dépôt privé · votre matériel
Commencez par la tâche : l’autocomplétion rapide n’a pas les mêmes besoins qu’un agent qui lit un dépôt, modifie des fichiers, lance les tests et conserve au moins 64K de contexte.
Réponse rapide
La qualité du modèle ne suffit pas : il faut de la mémoire rapide, un contexte utilisable, des appels d’outils fiables et des boucles assez courtes.
Suggestions brèves pendant la saisie. La latence compte plus qu’un très grand modèle.
Prévoir 8–16 GoExpliquer du code, écrire des tests et analyser quelques fichiers avec un modèle 14B–32B.
Prévoir 16–32 GoLit, recherche, modifie et exécute des commandes. Les outils et 64K de contexte deviennent essentiels.
Prévoir 24–32 Go ou plusChaque session ajoute du cache KV et des tampons. Un grand pool partagé apporte surtout de la capacité.
Prévoir 64–128 GoMémoire avant l’étiquette « IA »
Ces fourchettes servent à planifier. Quantification, cache de contexte, runtime, système et sessions simultanées partagent la mémoire.
| Classe | Bon usage | Modèles pratiques | Limite principale |
|---|---|---|---|
| 12–16 Go de VRAM | Autocomplétion, chat ciblé | Modèles 7B–14B quantifiés | Les grands dépôts et le long contexte réduisent vite la marge. |
| 24 Go de VRAM | Un agent local capable | Nombreux modèles 20B–30B quantifiés | Le contexte 64K peut rendre une configuration très juste. |
| 32 Go de VRAM | Agents rapides et code plus complexe | Classe 20B–32B avec davantage de cache | Les modèles 70B nécessitent généralement un offload. |
| 64–128 Go unifiés | Grands modèles, long contexte, plusieurs services | De 32B aux 70B quantifiés, priorité capacité | Tenir en mémoire ne garantit pas le débit d’un GPU dédié. |
Modèle de référence utile
La fiche officielle indique 30,5 milliards de paramètres au total, 3,3 milliards activés et 262 144 jetons de contexte natif. C’est un modèle mixture-of-experts : les paramètres activés décrivent le calcul par jeton, mais tous les poids des experts doivent être chargés.
Contexte réel de l’agent
Les agents ajoutent aux fichiers le schéma des outils, les sorties de commandes et l’historique. Plusieurs sessions multiplient le cache.
L’agent et le modèle sont deux choix
Agent de terminal capable de lire, modifier et lancer des commandes.
Pour :dépôts et terminalSuivre l’installation localeExtension IDE avec rôles distincts pour chat, édition et autocomplétion.
Pour :VS Code et JetBrainsGuide officielAgent dans l’IDE avec prise en charge des modèles locaux.
Pour :travail guidé dans l’éditeurGuide officielPair programmer en terminal, attentif à Git et aux changements ciblés.
Pour :modifications contrôléesGuide officielUne RTX 5090 fournit 32 Go de VRAM rapide. Elle réduit les boucles modification–test quand le modèle et son contexte tiennent entièrement.
Un système Ryzen AI Max+ 395 de 128 Go accepte des modèles quantifiés plus grands et davantage de contexte. C’est un choix de capacité, pas une promesse de vitesse RTX 5090.
Un modèle local peut exécuter des outils dangereux
L’inférence locale protège le traitement du prompt, pas automatiquement les fichiers ni les commandes autorisées.
Commiter avant et travailler dans une branche ou un worktree réversible.
Conserver clés et données de production hors du dossier accessible.
Ne pas lancer comme administrateur et vérifier les commandes sensibles.
Relire le diff et exécuter tests, lint et contrôles de sécurité.
Trois chemins de PC complet
| Priorité | Système | Atout | À vérifier |
|---|---|---|---|
| Agent rapide | Tour RTX 5090 | 32 Go de VRAM dédiée et CUDA | GPU de bureau exact, 64 Go+ RAM, refroidissement et alimentation |
| Grande capacité | Beelink GTR9 Pro ou MS-S1 Max | 128 Go unifiés dans un système compact | Version 128 Go, allocation graphique, OS et backend |
| Appliance NVIDIA | ASUS Ascent GX10 | 128 Go cohérents et environnement NVIDIA | Compatibilité Arm64/Linux de chaque dépendance |
Documentation primaire
Architecture, paramètres, contexte et outils dans la fiche officielle.
Lancement direct et contexte local dans le guide officiel.
Endpoint Ollama et diagnostic des outils dans la documentation officielle.
Utilisez le configurateur PC avec votre classe de modèle et votre contexte.
Passer à un test réel
Mesurez d’abord la réussite des tests, puis cherchez si la limite vient du modèle, du contexte ou de la vitesse.