Guia de 70B · atualizado em 21 de agosto de 2026

Qual PC você precisa para executar um LLM 70B local?

Em um modelo 70B quantizado, a capacidade de memória vem primeiro. 32 GB de VRAM são rápidos, mas em geral insuficientes para pesos e contexto. As opções realistas começam perto de 48–64 GB e ganham margem com 96–128 GB.

Por que o tamanho do arquivo não conta tudo

Pesos + contexto + reserva

Um 70B em Q4 costuma usar aproximadamente 40–45 GB para os pesos. Durante o uso, somam-se cache KV, buffers, sistema operacional e ferramentas de RAG.

48 GB

Mínimo apertado

Pode bastar com quantização compacta e contexto curto, mas deixa pouca margem de trabalho.

Exige configuração precisa
128 GB

Capacidade e flexibilidade

Adequado a contexto longo, RAG e vários serviços, sem prometer a velocidade de GPUs profissionais.

Ponto forte da memória unificada

Três caminhos

Executar um 70B em casa

128 GB de memória unificada

Mini PC Ryzen AI Max+ 395: muita capacidade, pouco espaço e x86. A velocidade depende do backend Radeon.

Opção equilibrada por capacidadeVer PCs Ryzen AI Max+

128 GB coerentes da NVIDIA

O ASUS Ascent GX10 combina memória e CUDA, mas usa Arm/Linux e exige software compatível.

Para desenvolvimento com NVIDIAVer o GX10

32 GB de VRAM + descarga

Uma RTX 5090 é rápida para a parte alojada na GPU, mas o 70B também usa RAM e perde desempenho.

Para modelos menores e rápidosGuia da RTX 5090

Comparação prática

Capacidade, velocidade e compromissos

HardwareUm 70B cabe?Velocidade esperadaConferência decisiva
64 GB unificadosmuitas vezes, com pouca margemmuito dependente de backend e contextoalocação UMA e memória livre
128 GB unificadossim, para muitos Q4moderada, centrada em capacidadesuporte de GPU do runtime
RTX 5090 32 GBsomente com descargamuito variávelRAM, barramento e parcela na VRAM
GPU profissional 48–96 GBconforme a quantizaçãoaltapreço, fonte e refrigeração

Antes da compra

Cinco perguntas que evitam uma escolha ruim

Qual quantização?

Q4, Q5 e Q8 alteram bastante memória e qualidade.

Quanto contexto?

32K ou 128K podem ampliar muito o cache KV.

Qual runtime?

O backend precisa suportar bem a GPU e o formato.

Quantos usuários?

Sessões paralelas acrescentam cache e cálculo.

Qual velocidade mínima?

Caber não basta se a resposta demorar demais.

Perguntas frequentes

Um 70B local na prática

64 GB de RAM bastam para um modelo 70B?

Pode funcionar com Q4, contexto limitado e runtime eficiente, mas a margem é pequena. Em arquiteturas separadas, RAM também não equivale a VRAM.

128 GB tornam um 70B rápido?

Não automaticamente. Eles oferecem capacidade; largura de banda, GPU, backend e arquitetura determinam os tokens por segundo.

Uma RTX 5090 é boa para 70B?

É excelente para modelos que cabem em 32 GB. Com 70B, a descarga reduz a velocidade, e RAM e configuração tornam-se essenciais.

Eu realmente preciso de um 70B?

Nem sempre. Um 14B ou 32B recente pode oferecer qualidade suficiente, respostas mais rápidas e menor custo. Teste primeiro sua tarefa real.

Da necessidade ao sistema

Compare PCs de 128 GB do catálogo

O Finder considera contexto, prioridade e orçamento e mostra apenas configurações que atingem a classe de memória calculada.

Encontrar o sistema