70B-gids · bijgewerkt op 21 augustus 2026

Welke pc heb je nodig om een 70B LLM lokaal te draaien?

Bij een gekwantiseerd 70B-model komt geheugencapaciteit eerst. 32 GB VRAM is snel, maar meestal te klein voor gewichten plus context. Realistische oplossingen beginnen rond 48–64 GB en worden ruimer met 96–128 GB.

Waarom de bestandsgrootte niet alles is

Modelgewichten + context + reserve

Een 70B in Q4 gebruikt vaak ongeveer 40–45 GB voor de gewichten. KV-cache, buffers, besturingssysteem en RAG-tools komen daar tijdens gebruik bij.

48 GB

Krappe minimumklasse

Kan volstaan bij compacte kwantisatie en korte context, met weinig werkruimte.

Vraagt nauwkeurige configuratie
128 GB

Capaciteit en flexibiliteit

Geschikt voor langere context, RAG en meerdere diensten, zonder de snelheid van professionele GPU's te beloven.

Sterk bij systemen met unified memory

Drie paden

Een 70B thuis uitvoeren

128 GB unified memory

Ryzen AI Max+ 395-mini-pc: veel capaciteit, klein formaat en x86. De snelheid hangt af van de Radeon-backend.

Evenwichtige capaciteitskeuzeBekijk Ryzen AI Max+-pc's

128 GB coherent NVIDIA-geheugen

ASUS Ascent GX10 combineert veel geheugen en CUDA, maar gebruikt Arm/Linux en vereist compatibele software.

Voor NVIDIA-ontwikkelingBekijk GX10

32 GB VRAM + offloading

Een RTX 5090 is snel voor het deel in de GPU, maar een 70B gebruikt ook systeem-RAM en verliest doorvoer.

Voor snelle kleinere modellenRTX 5090-gids

Praktische vergelijking

Capaciteit, snelheid en compromissen

HardwarePast een 70B?Verwachte snelheidBeslissende controle
64 GB unifiedvaak, met weinig reservesterk afhankelijk van backend en contextUMA-toewijzing en vrij geheugen
128 GB unifiedja, voor veel Q4gematigd, gericht op capaciteitGPU-ondersteuning van runtime
RTX 5090 32 GBalleen met offloadingzeer wisselendRAM, bus en aandeel in VRAM
Professionele GPU 48–96 GBafhankelijk van kwantisatiehoogprijs, voeding en koeling

Voor je koopt

Vijf vragen die een verkeerde keuze voorkomen

Welke kwantisatie?

Q4, Q5 en Q8 verschillen sterk in geheugen en kwaliteit.

Hoeveel context?

32K of 128K kan de KV-cache flink vergroten.

Welke runtime?

De backend moet GPU en gekozen formaat goed ondersteunen.

Hoeveel gebruikers?

Parallelle sessies voegen cache en rekenbelasting toe.

Welke minimumsnelheid?

Passen is niet genoeg wanneer antwoorden te lang duren.

Veelgestelde vragen

Een lokale 70B in de praktijk

Is 64 GB RAM genoeg voor een 70B-model?

Het kan met Q4, beperkte context en een efficiënte runtime, maar de reserve is klein. Bij apart geheugen is RAM bovendien niet hetzelfde als VRAM.

Maakt 128 GB een 70B snel?

Niet automatisch. Het geeft capaciteit en reserve; geheugenbandbreedte, GPU, backend en architectuur bepalen tokens per seconde.

Is een RTX 5090 goed voor 70B?

Hij is uitstekend voor modellen die in 32 GB passen. Bij 70B verlaagt offloading de snelheid en worden RAM en systeemconfiguratie essentieel.

Heb ik werkelijk een 70B nodig?

Niet altijd. Een recent 14B- of 32B-model kan voldoende kwaliteit leveren met snellere antwoorden en lagere kosten. Test eerst je werkelijke model.

Van behoefte naar systeem

Vergelijk 128GB-pc's uit de catalogus

De pc-kiezer verwerkt context, prioriteit en budget en toont alleen configuraties die de berekende geheugenklasse halen.

Vind het systeem