Choisir la taille du modèle
Un modèle quantifié de 7B à 14B reste accessible. Les classes 20B à 32B demandent plus de mémoire, tandis qu’un 70B nécessite généralement une configuration de grande capacité.
Votre IA. Votre matériel. Vos données.
Estimez la mémoire réellement nécessaire, puis comparez des systèmes complets selon la taille du modèle, la vitesse, l’encombrement et votre budget.
Trois décisions essentielles
Pour un modèle de langage local, les poids du modèle, le cache de contexte et la marge du logiciel doivent tenir ensemble dans une mémoire rapide. Le nombre de TOPS de la NPU ne répond pas à cette question et ne remplace ni la VRAM ni une grande mémoire unifiée.
Un modèle quantifié de 7B à 14B reste accessible. Les classes 20B à 32B demandent plus de mémoire, tandis qu’un 70B nécessite généralement une configuration de grande capacité.
Une carte graphique haut de gamme est très rapide tant que le modèle tient dans sa VRAM. Une mémoire unifiée de 64 ou 128 Go accueille des modèles plus grands, avec un profil de performances différent.
La quantité de mémoire réellement allouable, le refroidissement, le SSD, les emplacements d’extension et la compatibilité du moteur d’inférence comptent autant que le nom du processeur.
Repères de mémoire
Un point de départ pratique pour de nombreux modèles 7B à 14B correctement quantifiés et un contexte raisonnable.
Chat · résumé · premiers assistants de codeUne classe intéressante pour des modèles quantifiés de 20B à 32B ou plusieurs petits composants avec une marge utile.
Code · RAG · assistants avancésLa capacité recherchée pour beaucoup de modèles 70B quantifiés, les longs contextes ou une pile d’agents, selon le moteur utilisé.
70B · contexte long · services locauxCes valeurs incluent une marge pratique, mais ne constituent pas une garantie. L’architecture, la quantification, le contexte, le cache KV et le moteur d’inférence modifient la consommation réelle.
Systèmes complets à étudier
Comparez la capacité, la vitesse et l’écosystème logiciel avant de choisir. Les liens de disponibilité ouvrent une recherche correspondant au modèle dans la boutique de votre pays.
Capacité · format compact
Ryzen AI Max+ 395, Radeon 8060S et configurations 64 ou 128 Go. Une piste sérieuse lorsque la capacité du modèle prime sur la vitesse maximale d’un GPU dédié. Lire le guide.
Capacité et réseau · compact
Un système Ryzen AI Max+ 395 avec 128 Go et deux ports 10GbE, intéressant pour servir un modèle à plusieurs appareils du réseau local. Lire le guide.
Vitesse · tour de bureau
Les 32 Go de VRAM conviennent aux modèles qui tiennent entièrement sur le GPU et aux charges où la vitesse par jeton est prioritaire. La mémoire système ne remplace pas la VRAM.
Écosystème NVIDIA · station IA
Le GB10 Grace Blackwell, ses 128 Go cohérents et son environnement Linux ciblent les travaux CUDA et les modèles volumineux. Ce n’est pas un PC Windows généraliste. Lire le guide.
* Lien rémunéré. Si vous effectuez un achat, nous pouvons recevoir une commission ; votre prix reste inchangé. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. Vérifiez toujours la configuration exacte et le prix final chez le vendeur.
Votre usage décide
Le configurateur prend en compte la classe du modèle, le contexte, l’usage principal et votre priorité. Il fournit une classe matérielle expliquée et des systèmes concrets à comparer.
Choisir selon l’objectif
Pour des modèles de 8B à 32B, une grande carte graphique dédiée offre souvent la meilleure vitesse si la charge tient dans sa VRAM.
Vérifier un PC RTX 5090Une mémoire unifiée de 128 Go peut accueillir beaucoup de modèles 70B quantifiés avec une marge raisonnable, à une vitesse inférieure aux gros GPU professionnels.
Comparer les solutions 70BDeux téraoctets constituent un bon départ, mais plusieurs familles, quantifications et bases documentaires remplissent rapidement le SSD. Un second emplacement M.2 est précieux.
Comparer stockage et extensions