Do PC à primeira resposta

Como instalar e executar um LLM local

Uma instalação confiável começa com um modelo que cabe na memória, um runtime compatível e ajustes seguros. Estes passos levam Windows, macOS e Linux da conferência do hardware ao primeiro teste.

Escolha como trabalhar

Interface gráfica ou linha de comando?

LM Studio

Interface gráfica para encontrar modelos compatíveis, ajustar contexto e descarga, conversar e abrir um servidor local.

Confortável para começarDocumentação oficial

Ollama

Instalação simples, gestão de modelos pelo terminal e API local para aplicações, editores e automações.

Útil para integraçõesDocumentação oficial

llama.cpp

Mais controle sobre GGUF, backends, camadas de GPU e parâmetros. Exige maior experiência técnica.

Para controle precisoProjeto oficial

Seis passos

Preparar a IA local sem tentativas às cegas

1

Atualize sistema e drivers

Instale atualizações estáveis e o driver oficial da GPU. Reinicie antes de avaliar aceleração e memória detectadas.

2

Confira memória e espaço livre

Verifique a VRAM ou memória unificada realmente disponível e reserve espaço para modelo, download temporário e dados.

3

Instale primeiro um único runtime

Comece com LM Studio ou Ollama. Acrescente outras ferramentas quando uma sessão estável funcionar bem.

4

Escolha um modelo pequeno e quantizado

No primeiro teste, use um 7B–8B Q4 confiável. Confira licença, formato e template de prompt esperado.

5

Confirme a aceleração da GPU

Observe o log do runtime e o uso da GPU. Se somente a CPU trabalhar, confira backend, driver e camadas descarregadas.

6

Aumente passo a passo

Eleve contexto ou tamanho um de cada vez. Meça memória, tempo até o primeiro token, tokens por segundo e estabilidade.

Primeiro modelo

Um início compatível com sua memória

Memória rápidaPrimeiro teste recomendadoPróximo passo
8 GB7B–8B Q4, contexto curtoreduza o contexto antes de aumentar o modelo
12–16 GB8B–14B Q4teste RAG ou contexto moderado
24–32 GB20B–32B Q4meça a descarga antes de testar 70B
64 GB compartilhados32B Q4 com margem70B pode ficar apertado, conforme contexto e sistema
128 GB compartilhados70B Q4aumente contexto e serviços medindo o efeito

Privacidade local

Mantenha a API na rede privada

Um runtime local só protege os dados se não for exposto por acidente. Escute em localhost ou LAN, use autenticação e firewall e não redirecione portas do roteador sem necessidade.

  • nenhuma porta pública por padrão
  • token ou proxy autenticado para vários usuários
  • cópia separada dos documentos de RAG

Conferir o desempenho

Meça o que realmente importa

Anote tempo até o primeiro token, tokens por segundo, pico de memória e temperatura em uma conversa realista. Um teste curto não revela throttling nem crescimento do cache.

  • mesmo prompt e mesma quantização
  • contexto inicial documentado
  • pelo menos 20–30 minutos de carga

Problemas comuns

Quando o modelo não inicia ou fica lento

O runtime informa memória insuficiente

Reduza o contexto, use uma quantização menor ou escolha um modelo menor. Feche aplicações que compartilham memória.

A GPU não é utilizada

Confira driver, backend compatível, log e ajuste de camadas da GPU. Com memória unificada, verifique também o limite de UMA.

A primeira resposta demora muito

O primeiro carregamento depende do SSD, do tamanho e da compilação de kernels. Compare também as solicitações seguintes.

A velocidade cai em conversas longas

O cache KV cresce com o contexto. Reduza a janela, inicie outra sessão ou escolha um modelo com gestão mais eficiente.

Antes do download

Confira memória e compatibilidade de software

O Finder estima a classe de memória e a relaciona a sistemas completos, mostrando vantagens e compromissos.

Encontrar um PC compatível