Memória do modelo explicada com clareza

Quanta VRAM você precisa para executar um LLM local?

A memória rápida deve conter pesos, cache de contexto, runtime e margem de segurança. Este guia relaciona classes 8B, 14B, 32B e 70B a capacidades realistas e distingue RAM, VRAM e memória unificada.

A fórmula útil

Pesos + cache KV + runtime + reserva

O número de parâmetros não equivale ao uso de memória. A quantização reduz os pesos; contexto longo, visão e sessões paralelas acrescentam consumo.

Pesosparâmetros × quantizaçãoCache KVcontexto × arquiteturaRuntimebuffers e backendReservasistema e ferramentas

Pesos do modelo

Q4 ocupa muito menos que FP16. Por metadados e formato, “4 bits” não significa exatamente 0,5 byte por parâmetro.

Cache de contexto

O cache KV mantém informações do contexto atual. Cresce com comprimento, conversas ativas e arquitetura.

Runtime de inferência

Ollama, LM Studio e llama.cpp usam buffers. Backend de GPU e proporção descarregada alteram o total.

Reserva prática

Uma configuração que só cabe no papel é frágil. Sistema, desktop, RAG e outros serviços precisam de espaço.

Valores com margem

Memória típica para modelos de texto quantizados

Os intervalos supõem aproximadamente Q4 e reserva normal. Contextos muito longos, modelos MoE, visão ou vários usuários podem exigir mais.

ClassePesos aproximadosMemória rápida razoávelUso comum
7B–8Bcerca de 5–6 GB12–16 GBchat, resumos, assistentes simples
12B–14Bcerca de 8–10 GB16 GBmodelos gerais e programação
20B–32Bcerca de 14–22 GB24–32 GBprogramação, RAG, agentes
65B–70Bcerca de 40–45 GB64 GB mínimo; 96–128 GB com mais margemtarefas complexas e maior qualidade
100B–120Bcerca de 65–80 GB96–128 GB ou maiscargas profissionais

“O modelo cabe” não significa “o modelo é rápido”. Largura de banda, cálculo, runtime e descarga determinam o desempenho.

Escolha conforme o modelo

Qual GPU combina com IA local?

A GPU correta não precisa ser a mais cara. Modelo e contexto devem caber na memória rápida, e o software precisa oferecer bom suporte ao backend.

12–16 GB: início prático

Adequado a muitos 7B–14B quantizados. Visão, contexto longo e modelos maiores reduzem a margem.

Chat e primeiros assistentes

24–32 GB: velocidade

Classe forte para 20B–32B rápidos. A RTX 5090 tem 32 GB de VRAM; 70B costuma exigir descarga.

Código, RAG e agentesVer PCs RTX 5090

64–128 GB: capacidade

Mini PCs com memória unificada e sistemas especializados podem acomodar 70B quantizados. Reserva e backend continuam decisivos.

Modelos grandes e contexto longoComparar mini PCs para IA

Duas arquiteturas de memória

VRAM dedicada e memória unificada não são iguais

VRAM dedicada

Fica ligada diretamente a uma GPU separada. A grande largura de banda oferece velocidade enquanto toda a carga couber.

  • alto desempenho de inferência
  • capacidade fixa e fácil de identificar
  • descarregar para RAM costuma ser muito mais lento

Memória unificada

CPU e GPU integrada compartilham uma grande reserva. Modelos maiores cabem, mas sistema e aplicações usam a mesma memória.

  • 64–128 GB em formato compacto
  • conferir alocação UMA ou VGM
  • menos largura de banda que GPUs dedicadas de ponta

Perguntas frequentes

Evite erros ao escolher memória

8 GB de VRAM bastam para IA local?

Podem bastar para um 7B ou 8B pequeno e bem quantizado com contexto limitado. Para visão e contexto longo, a margem é escassa.

16 GB bastam para um LLM local?

Sim, para muitos 7B–14B. Um 32B, encoder de imagem ou contexto muito longo pode ultrapassar esse valor.

É possível ampliar a VRAM?

A VRAM física de uma placa costuma ser fixa. Descarregar para RAM permite modelos maiores, mas reduz a velocidade.

Um 70B funciona com 32 GB de VRAM?

Muitas vezes, com quantização intensa ou descarga parcial. O modelo não fica inteiro na VRAM, e o desempenho pode cair bastante.

128 GB de RAM significam que a GPU pode usar 128 GB?

Não. Apenas algumas arquiteturas compartilham muita memória. Sistema e aplicações reservam uma parte, e firmware e drivers podem limitar o restante.

Uma NPU é indispensável?

Para LLMs locais grandes, capacidade, largura de banda e compatibilidade do backend normalmente importam mais que os TOPS da NPU.

Da memória ao sistema

Calcule a classe adequada para modelo e contexto

O Finder aplica estes princípios, mostra as premissas e compara o resultado com sistemas concretos.

Abrir o PC Finder