Pesos do modelo
Q4 ocupa muito menos que FP16. Por metadados e formato, “4 bits” não significa exatamente 0,5 byte por parâmetro.
Memória do modelo explicada com clareza
A memória rápida deve conter pesos, cache de contexto, runtime e margem de segurança. Este guia relaciona classes 8B, 14B, 32B e 70B a capacidades realistas e distingue RAM, VRAM e memória unificada.
A fórmula útil
O número de parâmetros não equivale ao uso de memória. A quantização reduz os pesos; contexto longo, visão e sessões paralelas acrescentam consumo.
Q4 ocupa muito menos que FP16. Por metadados e formato, “4 bits” não significa exatamente 0,5 byte por parâmetro.
O cache KV mantém informações do contexto atual. Cresce com comprimento, conversas ativas e arquitetura.
Ollama, LM Studio e llama.cpp usam buffers. Backend de GPU e proporção descarregada alteram o total.
Uma configuração que só cabe no papel é frágil. Sistema, desktop, RAG e outros serviços precisam de espaço.
Valores com margem
Os intervalos supõem aproximadamente Q4 e reserva normal. Contextos muito longos, modelos MoE, visão ou vários usuários podem exigir mais.
| Classe | Pesos aproximados | Memória rápida razoável | Uso comum |
|---|---|---|---|
| 7B–8B | cerca de 5–6 GB | 12–16 GB | chat, resumos, assistentes simples |
| 12B–14B | cerca de 8–10 GB | 16 GB | modelos gerais e programação |
| 20B–32B | cerca de 14–22 GB | 24–32 GB | programação, RAG, agentes |
| 65B–70B | cerca de 40–45 GB | 64 GB mínimo; 96–128 GB com mais margem | tarefas complexas e maior qualidade |
| 100B–120B | cerca de 65–80 GB | 96–128 GB ou mais | cargas profissionais |
“O modelo cabe” não significa “o modelo é rápido”. Largura de banda, cálculo, runtime e descarga determinam o desempenho.
Escolha conforme o modelo
A GPU correta não precisa ser a mais cara. Modelo e contexto devem caber na memória rápida, e o software precisa oferecer bom suporte ao backend.
Adequado a muitos 7B–14B quantizados. Visão, contexto longo e modelos maiores reduzem a margem.
Chat e primeiros assistentesClasse forte para 20B–32B rápidos. A RTX 5090 tem 32 GB de VRAM; 70B costuma exigir descarga.
Código, RAG e agentesVer PCs RTX 5090Mini PCs com memória unificada e sistemas especializados podem acomodar 70B quantizados. Reserva e backend continuam decisivos.
Modelos grandes e contexto longoComparar mini PCs para IADuas arquiteturas de memória
Fica ligada diretamente a uma GPU separada. A grande largura de banda oferece velocidade enquanto toda a carga couber.
CPU e GPU integrada compartilham uma grande reserva. Modelos maiores cabem, mas sistema e aplicações usam a mesma memória.
Perguntas frequentes
Podem bastar para um 7B ou 8B pequeno e bem quantizado com contexto limitado. Para visão e contexto longo, a margem é escassa.
Sim, para muitos 7B–14B. Um 32B, encoder de imagem ou contexto muito longo pode ultrapassar esse valor.
A VRAM física de uma placa costuma ser fixa. Descarregar para RAM permite modelos maiores, mas reduz a velocidade.
Muitas vezes, com quantização intensa ou descarga parcial. O modelo não fica inteiro na VRAM, e o desempenho pode cair bastante.
Não. Apenas algumas arquiteturas compartilham muita memória. Sistema e aplicações reservam uma parte, e firmware e drivers podem limitar o restante.
Para LLMs locais grandes, capacidade, largura de banda e compatibilidade do backend normalmente importam mais que os TOPS da NPU.
Da memória ao sistema
O Finder aplica estes princípios, mostra as premissas e compara o resultado com sistemas concretos.