Autocomplete
Sugestões curtas durante a digitação. Baixa latência vale mais que um modelo enorme.
Plano: 8–16 GBCódigo local · repositório privado · seu hardware
Comece pelo trabalho: autocomplete rápido exige recursos diferentes de um agente que lê o repositório, altera arquivos, executa testes e mantém pelo menos 64K de contexto.
Resposta curta
Qualidade, memória rápida, contexto útil, chamadas de ferramentas confiáveis e tempo de resposta precisam funcionar juntos.
Sugestões curtas durante a digitação. Baixa latência vale mais que um modelo enorme.
Plano: 8–16 GBExplicar código, escrever testes e revisar arquivos selecionados com modelos 14B–32B.
Plano: 16–32 GBLê, busca, altera e executa comandos. Ferramentas e 64K de contexto são essenciais.
Plano: 24–32 GB ou maisCada sessão adiciona cache KV e buffers. Um pool compartilhado grande oferece principalmente capacidade.
Plano: 64–128 GBMemória antes do rótulo IA
São faixas de planejamento. Quantização, cache de contexto, runtime, sistema operacional e sessões dividem a memória.
| Classe | Uso adequado | Caminho de modelo | Limite principal |
|---|---|---|---|
| 12–16 GB VRAM | Autocomplete e chat focado | Modelos 7B–14B quantizados | Repositórios grandes e contexto longo consomem a reserva rapidamente. |
| 24 GB VRAM | Um agente capaz | Muitos modelos 20B–30B quantizados | 64K de contexto podem deixar a configuração apertada. |
| 32 GB VRAM | Agentes rápidos e código exigente | Classe 20B–32B com mais cache | Pesos 70B geralmente exigem offload. |
| 64–128 GB unificados | Modelos grandes, contexto longo e vários serviços | De 32B a 70B quantizados, priorizando capacidade | Caber na memória não garante a velocidade de uma GPU dedicada. |
Modelo de referência útil
A ficha oficial informa 30,5 bilhões de parâmetros totais, 3,3 bilhões ativos e 262.144 tokens de contexto nativo. Em mixture-of-experts, o valor ativo descreve o cálculo por token; todos os pesos dos especialistas ainda precisam ser carregados.
Contexto real do agente
Agentes adicionam esquemas de ferramentas, trechos de arquivos, saídas de comandos e histórico. Várias sessões multiplicam o cache.
Agente e modelo são escolhas separadas
Agente de terminal que lê, altera e executa comandos.
Para:repositórios e terminalInstalação localExtensão de IDE com funções distintas para chat, edição e autocomplete.
Para:VS Code e JetBrainsGuia oficialAgente na IDE com suporte a modelos locais.
Para:trabalho guiado no editorGuia oficialPair programmer no terminal com disciplina Git.
Para:alterações controladasGuia oficialRTX 5090 tem 32 GB de VRAM rápida e encurta ciclos editar–testar quando modelo e contexto cabem integralmente.
Ryzen AI Max+ 395 com 128 GB comporta modelos quantizados maiores e mais contexto. É capacidade, não promessa de velocidade RTX 5090.
Um modelo local pode executar ferramentas perigosas
A inferência local protege o processamento do prompt, não automaticamente arquivos e comandos.
Faça commit e trabalhe em branch ou worktree reversível.
Mantenha chaves e dados de produção fora da pasta acessível.
Não execute como administrador e revise comandos sensíveis.
Revise o diff e execute testes, lint e verificações de segurança.
Três caminhos de PC completo
| Prioridade | Sistema | Vantagem | Verificar |
|---|---|---|---|
| Agente rápido | Torre RTX 5090 | 32 GB de VRAM dedicada e CUDA | GPU desktop exata, 64 GB+ RAM, refrigeração e fonte |
| Grande capacidade | Beelink GTR9 Pro ou MS-S1 Max | 128 GB unificados em formato compacto | Versão 128 GB, alocação gráfica, sistema e backend |
| Appliance NVIDIA | ASUS Ascent GX10 | 128 GB coerentes e ambiente NVIDIA | Compatibilidade Arm64/Linux de cada dependência |
Documentação primária
Arquitetura, parâmetros, contexto e ferramentas na ficha oficial.
Inicialização direta e contexto local no guia oficial.
Endpoint Ollama e diagnóstico de ferramentas na documentação oficial.
Use o seletor de PC com modelo e contexto.
Teste uma tarefa real
Meça primeiro se os testes passam e depois localize o limite entre modelo, contexto e velocidade.