Dimensionner un grand modèle

Quel PC pour exécuter un LLM 70B en local ?

Un modèle 70B quantifié demande souvent 40 à 45 Go pour ses poids Q4, auxquels s’ajoutent contexte, moteur et système. Une classe de 64 Go est une limite serrée ; 96 à 128 Go constituent un objectif plus robuste.

Décomposer la mémoire

Pourquoi le fichier GGUF ne suffit pas

Le poids téléchargé n’est que la première partie. Le cache KV augmente avec la fenêtre de contexte et chaque service consomme ses propres tampons.

ÉlémentOrdre de grandeurVariable principale
Poids Q4environ 40–45 Goformat et quantification exacte
Cache KVde quelques Go à beaucoup plusarchitecture, contexte et sessions
Moteurtampons supplémentairesbackend et niveau d’offloading
Système et outilsmarge indispensableOS, RAG, embeddings, applications

64 Go peuvent lancer certains 70B, mais une utilisation fluide avec contexte et services parallèles demande souvent plus de marge.

Trois stratégies

Choisir capacité, vitesse ou écosystème

128 Go Ryzen AI Max+

Un PC x86 compact accueille beaucoup de Q4 70B dans une réserve partagée. Il reste polyvalent sous Windows ou Linux, mais le backend Radeon doit être vérifié.

Capacité compacte et usage général

128 Go NVIDIA GB10

Une station Arm/Linux offre une grande mémoire cohérente et l’environnement CUDA. Elle convient si les outils nécessaires prennent réellement en charge l’architecture.

Développement NVIDIA spécialisé

RTX 5090 avec offloading

Les 32 Go de VRAM accélèrent une partie du modèle, le reste demeure en RAM. Cette voie peut fonctionner mais n’offre pas la vitesse d’un modèle entièrement sur GPU.

GPU rapide, compromis pour 70B

Deux points de départ

Systèmes complets à comparer

Si la capacité 70B prime sur le débit maximal, commencez par 128 Go. Choisissez ensuite la pile logicielle : Radeon sur x86 ou NVIDIA sur Arm/Linux.

PC x86 de grande capacité

GMKtec EVO-X2 · 128 Go

Ryzen AI Max+ 395, Radeon 8060S et deux emplacements M.2.

128 Go

Pourquoi il convient

La grande réserve peut contenir beaucoup de modèles 70B quantifiés avec une marge pour le contexte. Le second M.2 sépare le système de la bibliothèque.

Compromis

La mémoire est soudée et la vitesse n’égale pas un gros GPU dédié. Contrôlez l’UMA et la voie Radeon.

Guide du EVO-X2
Mémoire
128 Go LPDDR5X partagés
SSD
2 To ; second M.2
Système
Windows ou Linux x86

Station NVIDIA spécialisée

ASUS Ascent GX10 · 128 Go

GB10 Grace Blackwell, mémoire cohérente et DGX OS.

128 Go

Pourquoi il convient

La pile CUDA et la mémoire cohérente ciblent les grands modèles, les conteneurs et le prototypage local.

Compromis

Arm/Linux exige de valider chaque application. Le stockage et la mémoire ne sont pas destinés à une extension simple.

Guide du GX10
Mémoire
128 Go LPDDR5X cohérents
Réseau
10GbE et ConnectX-7
Système
DGX OS / Ubuntu Arm

* Liens rémunérés. Si vous effectuez un achat, nous pouvons recevoir une commission ; votre prix reste inchangé. En tant que Partenaire Amazon, nous réalisons un bénéfice sur les achats remplissant les conditions requises. La configuration exacte de la page de destination fait foi.

Avant de télécharger

Vérifier le modèle réel

1

Taille du fichier

Relevez la taille exacte de la quantification choisie, pas seulement le nombre 70B.

2

Fenêtre de contexte

Fixez un contexte réaliste ; 128K peut coûter beaucoup plus de mémoire que 8K ou 32K.

3

Architecture

MoE, vision et cache compressé modifient les besoins. Consultez la fiche du modèle.

4

Backend accéléré

Vérifiez la version du moteur, le pilote et le système avant l’achat du PC.

5

Services parallèles

Embeddings, base vectorielle, interface et utilisateurs concurrents ont besoin de leur propre marge.

Questions courantes

Exécuter un 70B chez soi

64 Go de RAM suffisent-ils pour un 70B ?

Certains modèles fortement quantifiés peuvent tenir, mais système, contexte et moteur réduisent rapidement la marge. 96 à 128 Go constituent une planification plus fiable.

Une RTX 5090 suffit-elle ?

Elle peut exécuter un 70B en déportant des couches vers la RAM. Le débit est alors inférieur à celui d’un modèle entièrement en VRAM.

128 Go rendent-ils automatiquement le modèle rapide ?

Non. La capacité permet le lancement ; bande passante, calcul, moteur et quantification déterminent la vitesse.

Calcul personnalisé

Ajoutez modèle et contexte avant de choisir

Le configurateur renvoie une classe prudente, à confronter ensuite à la taille exacte du fichier GGUF.

Calculer mes besoins