64 GB: compacto para 32B
Classe coerente para muitos 20B–32B quantizados, RAG local e contexto longo. Para 70B, normalmente falta margem.
Adequado para: 14B–32BMais memória em menos espaço
Um bom mini PC para IA combina memória rápida utilizável pelo modelo, backend de GPU compatível, SSD suficiente e refrigeração estável. O número de TOPS da NPU, sozinho, não responde se um LLM será executado bem.
Escolha rápida
Classe coerente para muitos 20B–32B quantizados, RAG local e contexto longo. Para 70B, normalmente falta margem.
Adequado para: 14B–32BA escolha de capacidade para 70B quantizados, vários serviços ou bases de conhecimento grandes. A memória costuma ser soldada.
Adequado para: 32B–70BO GX10 combina 128 GB e ferramentas NVIDIA, mas exige Arm64, Linux e conferência do software necessário.
Adequado para: desenvolvimento CUDA
A memória antes do rótulo
| Modelo | Capacidade prática | Motivo |
|---|---|---|
| 7B–14B | 32 GB ou mais | modelo, contexto e desktop; 64 GB dão flexibilidade |
| 20B–32B | 64 GB | pesos, cache e runtime mantêm margem útil |
| 65B–70B | 128 GB | os pesos Q4 costumam ocupar 40–45 GB antes do contexto e do sistema |
| Acima de 70B | 128 GB, com cálculo exato | caber na memória não garante boa velocidade |
Sistemas completos
Compare sempre a RAM e o SSD exatos. O mesmo nome pode abranger versões muito diferentes.
x86 compacto
Até 128 GB, dois M.2, 2,5GbE e gabinete baixo para a mesa.
Ler o guiaServidor x86 em rede
128 GB, dois M.2 e duas portas 10GbE para vários clientes e um NAS rápido.
Ler o guiaWorkstation profissional
Até 128 GB, Thunderbolt 4 e suporte profissional em gabinete integrado.
Ler o guiaWorkstation expansível
128 GB, duas portas 10GbE, quatro USB4 e PCIe x4 para um posto fixo.
Ler o guiaConferência prévia
64 ou 128 GB não podem ser adicionados depois.
Confira firmware, driver e alocação máxima.
O suporte muda conforme GPU e sistema operacional.
2 TB são uma base melhor para vários modelos.
Uma sessão longa importa mais que um teste curto.
10GbE ajuda com NAS e vários clientes.
O mesmo nome pode esconder RAM e SSD diferentes.
Confira importação, fonte, devolução e suporte.
Perguntas frequentes
Alguns modelos muito quantizados iniciam, mas contexto, runtime e sistema deixam pouca margem. 128 GB são mais confiáveis.
Não. CPU e GPU integrada compartilham uma reserva; a parte utilizável depende de sistema, firmware, driver e backend.
Sim, depois de conferir refrigeração, segurança da API, rede, SSD e consumo em repouso.
Para LLMs grandes, memória rápida e backend de GPU compatível pesam mais que a quantidade de TOPS.
Próximo passo
A comparação relaciona cada sistema ao tamanho do modelo, à prioridade e aos limites concretos.