Autocompletado
Sugerencias cortas al escribir. Importa más la latencia que un modelo enorme.
Plan: 8–16 GBCódigo local · repositorio privado · tu hardware
Empieza por la tarea: el autocompletado rápido necesita recursos distintos a un agente que lee el repositorio, modifica archivos, ejecuta pruebas y mantiene al menos 64K de contexto.
Respuesta breve
Calidad del modelo, memoria rápida, contexto útil, llamadas a herramientas fiables y tiempos razonables deben funcionar juntos.
Sugerencias cortas al escribir. Importa más la latencia que un modelo enorme.
Plan: 8–16 GBExplicar código, escribir pruebas y revisar archivos seleccionados con modelos 14B–32B.
Plan: 16–32 GBLee, busca, modifica y ejecuta comandos. Herramientas y 64K de contexto son esenciales.
Plan: 24–32 GB o másCada sesión añade caché KV y búferes. Una memoria compartida grande aporta sobre todo capacidad.
Plan: 64–128 GBMemoria antes que la etiqueta IA
Son rangos de planificación. Cuantización, caché de contexto, runtime, sistema operativo y sesiones comparten la memoria.
| Clase | Uso adecuado | Ruta de modelo | Límite principal |
|---|---|---|---|
| 12–16 GB VRAM | Autocompletado y chat centrado | Modelos 7B–14B cuantizados | Repositorios grandes y contexto largo consumen pronto el margen. |
| 24 GB VRAM | Un agente capaz | Muchos modelos 20B–30B cuantizados | 64K de contexto pueden dejar la configuración justa. |
| 32 GB VRAM | Agentes rápidos y código exigente | Clase 20B–32B con más caché | Los pesos 70B suelen necesitar offload. |
| 64–128 GB unificados | Modelos grandes, contexto largo y varios servicios | Desde 32B hasta 70B cuantizados, priorizando capacidad | Que el modelo quepa no garantiza la velocidad de una GPU dedicada. |
Modelo de referencia útil
La ficha oficial indica 30.500 millones de parámetros totales, 3.300 millones activos y 262.144 tokens de contexto nativo. En un mixture-of-experts, la cifra activa describe el cálculo por token; aun así se cargan todos los pesos expertos.
Contexto real del agente
Los agentes añaden esquemas de herramientas, fragmentos de archivos, salida de comandos e historial. Varias sesiones multiplican la caché.
Agente y modelo son decisiones separadas
Agente de terminal que lee, modifica y ejecuta comandos.
Para:repositorios y terminalInstalación localExtensión de IDE con roles separados para chat, edición y autocompletado.
Para:VS Code y JetBrainsGuía oficialAgente en el IDE compatible con modelos locales.
Para:trabajo guiado en el editorGuía oficialProgramador en pareja desde terminal con disciplina Git.
Para:cambios controladosGuía oficialRTX 5090 ofrece 32 GB de VRAM rápida y acorta los ciclos editar–probar si modelo y contexto caben completos.
Ryzen AI Max+ 395 con 128 GB contiene modelos cuantizados mayores y más contexto. Es capacidad, no una promesa de velocidad RTX 5090.
Un modelo local puede ejecutar herramientas peligrosas
La inferencia local protege el procesamiento del prompt, no automáticamente archivos y comandos.
Haz commit y trabaja en una rama o worktree reversible.
Mantén claves y datos de producción fuera de la carpeta accesible.
No ejecutes como administrador y revisa comandos sensibles.
Revisa el diff y ejecuta pruebas, lint y controles de seguridad.
Tres rutas de PC completo
| Prioridad | Sistema | Ventaja | Comprobar |
|---|---|---|---|
| Agente rápido | Torre RTX 5090 | 32 GB de VRAM dedicada y CUDA | GPU de escritorio exacta, 64 GB+ RAM, refrigeración y fuente |
| Gran capacidad | Beelink GTR9 Pro o MS-S1 Max | 128 GB unificados en formato compacto | Versión de 128 GB, asignación gráfica, SO y backend |
| Appliance NVIDIA | ASUS Ascent GX10 | 128 GB coherentes y entorno NVIDIA | Compatibilidad Arm64/Linux de cada dependencia |
Documentación primaria
Arquitectura, parámetros, contexto y herramientas en la ficha oficial.
Inicio directo y contexto local en la guía oficial.
Endpoint de Ollama y diagnóstico de herramientas en la documentación oficial.
Usa el buscador de PC con modelo y contexto.
Prueba una tarea real
Mide primero si pasan las pruebas y después localiza el límite entre modelo, contexto y velocidad.