Código local · repositorio privado · tu hardware

Elige el mejor LLM local y el PC adecuado para programar

Empieza por la tarea: el autocompletado rápido necesita recursos distintos a un agente que lee el repositorio, modifica archivos, ejecuta pruebas y mantiene al menos 64K de contexto.

  • primero el flujo
  • contexto incluido
  • agente seguro

Respuesta breve

El mejor modelo local encaja en todo el flujo de trabajo

Calidad del modelo, memoria rápida, contexto útil, llamadas a herramientas fiables y tiempos razonables deben funcionar juntos.

Autocompletado

Sugerencias cortas al escribir. Importa más la latencia que un modelo enorme.

Plan: 8–16 GB

Chat y depuración

Explicar código, escribir pruebas y revisar archivos seleccionados con modelos 14B–32B.

Plan: 16–32 GB

Agente de repositorio

Lee, busca, modifica y ejecuta comandos. Herramientas y 64K de contexto son esenciales.

Plan: 24–32 GB o más

Agentes paralelos

Cada sesión añade caché KV y búferes. Una memoria compartida grande aporta sobre todo capacidad.

Plan: 64–128 GB

Memoria antes que la etiqueta IA

Clases de hardware para LLM locales de código

Son rangos de planificación. Cuantización, caché de contexto, runtime, sistema operativo y sesiones comparten la memoria.

ClaseUso adecuadoRuta de modeloLímite principal
12–16 GB VRAMAutocompletado y chat centradoModelos 7B–14B cuantizadosRepositorios grandes y contexto largo consumen pronto el margen.
24 GB VRAMUn agente capazMuchos modelos 20B–30B cuantizados64K de contexto pueden dejar la configuración justa.
32 GB VRAMAgentes rápidos y código exigenteClase 20B–32B con más cachéLos pesos 70B suelen necesitar offload.
64–128 GB unificadosModelos grandes, contexto largo y varios serviciosDesde 32B hasta 70B cuantizados, priorizando capacidadQue el modelo quepa no garantiza la velocidad de una GPU dedicada.

Modelo de referencia útil

Qwen3-Coder 30B-A3B demuestra por qué el nombre no basta

La ficha oficial indica 30.500 millones de parámetros totales, 3.300 millones activos y 262.144 tokens de contexto nativo. En un mixture-of-experts, la cifra activa describe el cálculo por token; aun así se cargan todos los pesos expertos.

  • diseñado para código y llamadas a herramientas
  • el contexto nativo máximo tiene coste de memoria
  • la cuantización cambia tamaño y quizá calidad
  • reducir el contexto si falta memoria
Ficha oficial del modelo

Contexto real del agente

Un modelo que cabe a 8K puede fallar a 64K

Los agentes añaden esquemas de herramientas, fragmentos de archivos, salida de comandos e historial. Varias sesiones multiplican la caché.

Pesos del modelodespués de cuantizarCaché KVcontexto × arquitectura × sesionesMargen del runtimeherramientas, sistema y búferes

Agente y modelo son decisiones separadas

Elige la interfaz por el trabajo que puede realizar

OpenCode

Agente de terminal que lee, modifica y ejecuta comandos.

Para:repositorios y terminalInstalación local

Continue

Extensión de IDE con roles separados para chat, edición y autocompletado.

Para:VS Code y JetBrainsGuía oficial

Cline

Agente en el IDE compatible con modelos locales.

Para:trabajo guiado en el editorGuía oficial

Aider

Programador en pareja desde terminal con disciplina Git.

Para:cambios controladosGuía oficial

VRAM dedicada para velocidad

RTX 5090 ofrece 32 GB de VRAM rápida y acorta los ciclos editar–probar si modelo y contexto caben completos.

  • gran clase 20B–32B
  • amplio ecosistema CUDA
  • capacidad fija de 32 GB
Comparar PC RTX 5090

Memoria unificada para capacidad

Ryzen AI Max+ 395 con 128 GB contiene modelos cuantizados mayores y más contexto. Es capacidad, no una promesa de velocidad RTX 5090.

  • modelos más grandes
  • sistemas compactos
  • comprobar runtime y UMA
Comparar sistemas de 128 GB

Un modelo local puede ejecutar herramientas peligrosas

Cuatro barreras antes del primer agente

La inferencia local protege el procesamiento del prompt, no automáticamente archivos y comandos.

Rama limpia

Haz commit y trabaja en una rama o worktree reversible.

Sin secretos

Mantén claves y datos de producción fuera de la carpeta accesible.

Permisos limitados

No ejecutes como administrador y revisa comandos sensibles.

Parche verificado

Revisa el diff y ejecuta pruebas, lint y controles de seguridad.

Tres rutas de PC completo

Elige la prioridad antes que la caja

PrioridadSistemaVentajaComprobar
Agente rápidoTorre RTX 509032 GB de VRAM dedicada y CUDAGPU de escritorio exacta, 64 GB+ RAM, refrigeración y fuente
Gran capacidadBeelink GTR9 Pro o MS-S1 Max128 GB unificados en formato compactoVersión de 128 GB, asignación gráfica, SO y backend
Appliance NVIDIAASUS Ascent GX10128 GB coherentes y entorno NVIDIACompatibilidad Arm64/Linux de cada dependencia

Documentación primaria

Fuentes sobre modelos, agentes y contexto

QW

Qwen3-Coder

Arquitectura, parámetros, contexto y herramientas en la ficha oficial.

OL

Ollama + OpenCode

Inicio directo y contexto local en la guía oficial.

Prueba una tarea real

Configura OpenCode en local y prueba un cambio pequeño y reversible

Mide primero si pasan las pruebas y después localiza el límite entre modelo, contexto y velocidad.

Abrir la guía de OpenCode