Escolha o tamanho do modelo
Um modelo 8B quantizado é leve. Modelos 32B e 70B podem entregar mais capacidade, mas consomem muito mais memória.
IA local. Seu hardware. Seus dados.
Calcule quanta memória rápida o modelo realmente exige e compare sistemas completos por tamanho de modelo, velocidade, formato e orçamento.
Escolha melhor em três etapas
Pesos do modelo, cache de contexto e margem operacional precisam caber juntos na memória rápida. A quantidade de TOPS da NPU, sozinha, não responde a essa pergunta.
Um modelo 8B quantizado é leve. Modelos 32B e 70B podem entregar mais capacidade, mas consomem muito mais memória.
Uma GPU dedicada forte prioriza velocidade. Muita memória unificada comporta modelos maiores, mas com outro perfil de desempenho e software.
Refrigeração, limite de UMA, SSD, expansão, fonte e configuração exata importam tanto quanto o nome do processador.
Classes de memória
Um ponto de partida prático para muitos modelos 7B–14B quantizados e contexto moderado.
Chat · resumo · primeiro assistente de códigoAdequado para modelos 20B–32B quantizados ou vários componentes menores com boa margem.
Programação · RAG · agentesA classe de capacidade para modelos 70B e contextos longos, conforme runtime e quantização.
70B · contexto longo · vários serviçosAs faixas incluem reserva prática, mas não são garantia. Arquitetura, quantização, cache KV e runtime alteram o consumo real.
Sistemas completos concretos
Compare dois mini PCs Ryzen AI Max+ de alta capacidade, uma workstation profissional e um sistema NVIDIA voltado ao desenvolvimento de IA.
Capacidade · formato compacto
Ryzen AI Max+ 395, 128 GB de memória unificada e SSD de 2 TB para grandes modelos quantizados em pouco espaço.
Capacidade e rede · compacto
Um sistema de 128 GB, SSD de 2 TB e duas portas 10GbE para compartilhar o LLM com vários dispositivos da casa.
Workstation · suporte profissional
Ryzen AI Max+ PRO 395, até 128 GB, fonte interna e Thunderbolt 4 em um gabinete profissional compacto.
Ecossistema NVIDIA · sistema de IA
GB10 Grace Blackwell, 128 GB de memória coerente e ambiente NVIDIA sobre Ubuntu. É voltado a CUDA, não a um desktop Windows comum.
Os botões abrem buscas no marketplace brasileiro. Confira sempre a configuração, o vendedor, a entrega, a garantia e eventuais custos de importação. Esses links brasileiros não geram comissão para nós atualmente.
Comece pela carga de trabalho
O seletor usa classe do modelo, contexto, aplicação e prioridade. Você recebe uma classe de hardware explicada e sistemas concretos compatíveis.
Escolha pelo seu objetivo
Para 8B–32B, uma RTX 5090 com 32 GB de VRAM prioriza velocidade. Combine-a com ao menos 64 GB de RAM e 2 TB NVMe.
O que conferir em um PC RTX 5090128 GB de memória unificada podem acomodar muitos modelos 70B quantizados com margem, embora sejam mais lentos que GPUs profissionais grandes.
Comparar opções para 70BUm SSD de 2 TB é um bom começo. Várias famílias, quantizações e bases RAG o ocupam rapidamente; confira o segundo slot M.2.
Comparar armazenamento e expansão