LM Studio
Interface gráfica para encontrar modelos compatíveis, ajustar contexto e descarga, conversar e abrir um servidor local.
Confortável para começarDocumentação oficialDo PC à primeira resposta
Uma instalação confiável começa com um modelo que cabe na memória, um runtime compatível e ajustes seguros. Estes passos levam Windows, macOS e Linux da conferência do hardware ao primeiro teste.
Escolha como trabalhar
Interface gráfica para encontrar modelos compatíveis, ajustar contexto e descarga, conversar e abrir um servidor local.
Confortável para começarDocumentação oficialInstalação simples, gestão de modelos pelo terminal e API local para aplicações, editores e automações.
Útil para integraçõesDocumentação oficialMais controle sobre GGUF, backends, camadas de GPU e parâmetros. Exige maior experiência técnica.
Para controle precisoProjeto oficialSeis passos
Instale atualizações estáveis e o driver oficial da GPU. Reinicie antes de avaliar aceleração e memória detectadas.
Verifique a VRAM ou memória unificada realmente disponível e reserve espaço para modelo, download temporário e dados.
Comece com LM Studio ou Ollama. Acrescente outras ferramentas quando uma sessão estável funcionar bem.
No primeiro teste, use um 7B–8B Q4 confiável. Confira licença, formato e template de prompt esperado.
Observe o log do runtime e o uso da GPU. Se somente a CPU trabalhar, confira backend, driver e camadas descarregadas.
Eleve contexto ou tamanho um de cada vez. Meça memória, tempo até o primeiro token, tokens por segundo e estabilidade.
Primeiro modelo
| Memória rápida | Primeiro teste recomendado | Próximo passo |
|---|---|---|
| 8 GB | 7B–8B Q4, contexto curto | reduza o contexto antes de aumentar o modelo |
| 12–16 GB | 8B–14B Q4 | teste RAG ou contexto moderado |
| 24–32 GB | 20B–32B Q4 | meça a descarga antes de testar 70B |
| 64 GB compartilhados | 32B Q4 com margem | 70B pode ficar apertado, conforme contexto e sistema |
| 128 GB compartilhados | 70B Q4 | aumente contexto e serviços medindo o efeito |
Privacidade local
Um runtime local só protege os dados se não for exposto por acidente. Escute em localhost ou LAN, use autenticação e firewall e não redirecione portas do roteador sem necessidade.
Conferir o desempenho
Anote tempo até o primeiro token, tokens por segundo, pico de memória e temperatura em uma conversa realista. Um teste curto não revela throttling nem crescimento do cache.
Problemas comuns
Reduza o contexto, use uma quantização menor ou escolha um modelo menor. Feche aplicações que compartilham memória.
Confira driver, backend compatível, log e ajuste de camadas da GPU. Com memória unificada, verifique também o limite de UMA.
O primeiro carregamento depende do SSD, do tamanho e da compilação de kernels. Compare também as solicitações seguintes.
O cache KV cresce com o contexto. Reduza a janela, inicie outra sessão ou escolha um modelo com gestão mais eficiente.
Antes do download
O Finder estima a classe de memória e a relaciona a sistemas completos, mostrando vantagens e compromissos.