Mínimo apertado
Pode bastar com quantização compacta e contexto curto, mas deixa pouca margem de trabalho.
Exige configuração precisaGuia de 70B · atualizado em 21 de agosto de 2026
Em um modelo 70B quantizado, a capacidade de memória vem primeiro. 32 GB de VRAM são rápidos, mas em geral insuficientes para pesos e contexto. As opções realistas começam perto de 48–64 GB e ganham margem com 96–128 GB.
Por que o tamanho do arquivo não conta tudo
Um 70B em Q4 costuma usar aproximadamente 40–45 GB para os pesos. Durante o uso, somam-se cache KV, buffers, sistema operacional e ferramentas de RAG.
Pode bastar com quantização compacta e contexto curto, mas deixa pouca margem de trabalho.
Exige configuração precisaOferece mais margem para runtime, contexto e tarefas paralelas.
Confira a memória realmente alocávelAdequado a contexto longo, RAG e vários serviços, sem prometer a velocidade de GPUs profissionais.
Ponto forte da memória unificadaTrês caminhos
Mini PC Ryzen AI Max+ 395: muita capacidade, pouco espaço e x86. A velocidade depende do backend Radeon.
Opção equilibrada por capacidadeVer PCs Ryzen AI Max+O ASUS Ascent GX10 combina memória e CUDA, mas usa Arm/Linux e exige software compatível.
Para desenvolvimento com NVIDIAVer o GX10Uma RTX 5090 é rápida para a parte alojada na GPU, mas o 70B também usa RAM e perde desempenho.
Para modelos menores e rápidosGuia da RTX 5090Comparação prática
| Hardware | Um 70B cabe? | Velocidade esperada | Conferência decisiva |
|---|---|---|---|
| 64 GB unificados | muitas vezes, com pouca margem | muito dependente de backend e contexto | alocação UMA e memória livre |
| 128 GB unificados | sim, para muitos Q4 | moderada, centrada em capacidade | suporte de GPU do runtime |
| RTX 5090 32 GB | somente com descarga | muito variável | RAM, barramento e parcela na VRAM |
| GPU profissional 48–96 GB | conforme a quantização | alta | preço, fonte e refrigeração |
Antes da compra
Q4, Q5 e Q8 alteram bastante memória e qualidade.
32K ou 128K podem ampliar muito o cache KV.
O backend precisa suportar bem a GPU e o formato.
Sessões paralelas acrescentam cache e cálculo.
Caber não basta se a resposta demorar demais.
Perguntas frequentes
Pode funcionar com Q4, contexto limitado e runtime eficiente, mas a margem é pequena. Em arquiteturas separadas, RAM também não equivale a VRAM.
Não automaticamente. Eles oferecem capacidade; largura de banda, GPU, backend e arquitetura determinam os tokens por segundo.
É excelente para modelos que cabem em 32 GB. Com 70B, a descarga reduz a velocidade, e RAM e configuração tornam-se essenciais.
Nem sempre. Um 14B ou 32B recente pode oferecer qualidade suficiente, respostas mais rápidas e menor custo. Teste primeiro sua tarefa real.
Da necessidade ao sistema
O Finder considera contexto, prioridade e orçamento e mostra apenas configurações que atingem a classe de memória calculada.