Código local · repositório privado · seu hardware

Escolha o melhor LLM local e o PC certo para programar

Comece pelo trabalho: autocomplete rápido exige recursos diferentes de um agente que lê o repositório, altera arquivos, executa testes e mantém pelo menos 64K de contexto.

  • primeiro o fluxo
  • contexto incluído
  • agente seguro

Resposta curta

O melhor modelo local cabe no fluxo completo

Qualidade, memória rápida, contexto útil, chamadas de ferramentas confiáveis e tempo de resposta precisam funcionar juntos.

Autocomplete

Sugestões curtas durante a digitação. Baixa latência vale mais que um modelo enorme.

Plano: 8–16 GB

Chat e depuração

Explicar código, escrever testes e revisar arquivos selecionados com modelos 14B–32B.

Plano: 16–32 GB

Agente de repositório

Lê, busca, altera e executa comandos. Ferramentas e 64K de contexto são essenciais.

Plano: 24–32 GB ou mais

Agentes paralelos

Cada sessão adiciona cache KV e buffers. Um pool compartilhado grande oferece principalmente capacidade.

Plano: 64–128 GB

Memória antes do rótulo IA

Classes de hardware para LLMs locais de código

São faixas de planejamento. Quantização, cache de contexto, runtime, sistema operacional e sessões dividem a memória.

ClasseUso adequadoCaminho de modeloLimite principal
12–16 GB VRAMAutocomplete e chat focadoModelos 7B–14B quantizadosRepositórios grandes e contexto longo consomem a reserva rapidamente.
24 GB VRAMUm agente capazMuitos modelos 20B–30B quantizados64K de contexto podem deixar a configuração apertada.
32 GB VRAMAgentes rápidos e código exigenteClasse 20B–32B com mais cachePesos 70B geralmente exigem offload.
64–128 GB unificadosModelos grandes, contexto longo e vários serviçosDe 32B a 70B quantizados, priorizando capacidadeCaber na memória não garante a velocidade de uma GPU dedicada.

Modelo de referência útil

Qwen3-Coder 30B-A3B mostra por que o nome não basta

A ficha oficial informa 30,5 bilhões de parâmetros totais, 3,3 bilhões ativos e 262.144 tokens de contexto nativo. Em mixture-of-experts, o valor ativo descreve o cálculo por token; todos os pesos dos especialistas ainda precisam ser carregados.

  • projetado para código e chamadas de ferramentas
  • o contexto nativo máximo consome memória
  • a quantização muda tamanho e talvez qualidade
  • reduza o contexto se faltar memória
Ficha oficial do modelo

Contexto real do agente

Um modelo que cabe em 8K pode falhar em 64K

Agentes adicionam esquemas de ferramentas, trechos de arquivos, saídas de comandos e histórico. Várias sessões multiplicam o cache.

Pesos do modeloapós quantizaçãoCache KVcontexto × arquitetura × sessõesReserva do runtimeferramentas, sistema e buffers

Agente e modelo são escolhas separadas

Escolha a interface pelo trabalho permitido

OpenCode

Agente de terminal que lê, altera e executa comandos.

Para:repositórios e terminalInstalação local

Continue

Extensão de IDE com funções distintas para chat, edição e autocomplete.

Para:VS Code e JetBrainsGuia oficial

Cline

Agente na IDE com suporte a modelos locais.

Para:trabalho guiado no editorGuia oficial

Aider

Pair programmer no terminal com disciplina Git.

Para:alterações controladasGuia oficial

VRAM dedicada para velocidade

RTX 5090 tem 32 GB de VRAM rápida e encurta ciclos editar–testar quando modelo e contexto cabem integralmente.

  • forte classe 20B–32B
  • amplo ecossistema CUDA
  • capacidade fixa de 32 GB
Comparar PCs RTX 5090

Memória unificada para capacidade

Ryzen AI Max+ 395 com 128 GB comporta modelos quantizados maiores e mais contexto. É capacidade, não promessa de velocidade RTX 5090.

  • modelos maiores
  • sistemas compactos
  • verificar runtime e UMA
Comparar sistemas de 128 GB

Um modelo local pode executar ferramentas perigosas

Quatro proteções antes do primeiro agente

A inferência local protege o processamento do prompt, não automaticamente arquivos e comandos.

Branch limpo

Faça commit e trabalhe em branch ou worktree reversível.

Sem segredos

Mantenha chaves e dados de produção fora da pasta acessível.

Permissões limitadas

Não execute como administrador e revise comandos sensíveis.

Patch verificado

Revise o diff e execute testes, lint e verificações de segurança.

Três caminhos de PC completo

Escolha a prioridade antes do gabinete

PrioridadeSistemaVantagemVerificar
Agente rápidoTorre RTX 509032 GB de VRAM dedicada e CUDAGPU desktop exata, 64 GB+ RAM, refrigeração e fonte
Grande capacidadeBeelink GTR9 Pro ou MS-S1 Max128 GB unificados em formato compactoVersão 128 GB, alocação gráfica, sistema e backend
Appliance NVIDIAASUS Ascent GX10128 GB coerentes e ambiente NVIDIACompatibilidade Arm64/Linux de cada dependência

Documentação primária

Fontes sobre modelos, agentes e contexto

QW

Qwen3-Coder

Arquitetura, parâmetros, contexto e ferramentas na ficha oficial.

OL

Ollama + OpenCode

Inicialização direta e contexto local no guia oficial.

Teste uma tarefa real

Configure o OpenCode localmente e tente uma alteração pequena e reversível

Meça primeiro se os testes passam e depois localize o limite entre modelo, contexto e velocidade.

Abrir o guia do OpenCode