LM Studio
Interfaz gráfica para buscar modelos compatibles, ajustar contexto y descarga, chatear y abrir un servidor local.
Cómodo para empezarDocumentación oficialDel PC a la primera respuesta
Una instalación fiable empieza con un modelo que cabe en memoria, un motor compatible y ajustes seguros. Estos pasos llevan Windows, macOS y Linux desde la comprobación de hardware hasta la primera prueba.
Elige cómo trabajar
Interfaz gráfica para buscar modelos compatibles, ajustar contexto y descarga, chatear y abrir un servidor local.
Cómodo para empezarDocumentación oficialInstalación sencilla, gestión de modelos desde terminal y API local para aplicaciones, editores y automatizaciones.
Útil para integracionesDocumentación oficialMás control sobre GGUF, backends, capas GPU y parámetros. Requiere mayor experiencia técnica.
Para control precisoProyecto oficialSeis pasos
Instala actualizaciones estables y el controlador oficial de GPU. Reinicia antes de juzgar aceleración y memoria detectadas.
Revisa la VRAM o memoria unificada realmente disponible y reserva sitio para modelo, descarga temporal y datos.
Empieza con LM Studio u Ollama. Añade otras herramientas cuando una sesión estable funcione bien.
Para la primera prueba usa un 7B–8B Q4 fiable. Comprueba licencia, formato y plantilla de prompt esperada.
Mira el registro del motor y el uso de GPU. Si solo trabaja la CPU, revisa backend, controlador y capas descargadas.
Sube contexto o tamaño de uno en uno. Mide memoria, tiempo al primer token, tokens por segundo y estabilidad.
Primer modelo
| Memoria rápida | Primera prueba recomendada | Siguiente paso |
|---|---|---|
| 8 GB | 7B–8B Q4, contexto corto | reduce contexto antes de aumentar modelo |
| 12–16 GB | 8B–14B Q4 | prueba RAG o contexto moderado |
| 24–32 GB | 20B–32B Q4 | mide descarga antes de probar 70B |
| 64 GB compartidos | 32B Q4 con margen | 70B puede ser justo según contexto y sistema |
| 128 GB compartidos | 70B Q4 | aumenta contexto y servicios midiendo |
Privacidad local
Un motor local solo protege los datos si no lo expones por accidente. Escucha en localhost o LAN, usa autenticación y cortafuegos y no reenvíes puertos del router sin necesidad.
Comprobar el rendimiento
Anota tiempo al primer token, tokens por segundo, pico de memoria y temperatura en una conversación realista. Una prueba corta no muestra throttling ni crecimiento de caché.
Problemas frecuentes
Reduce contexto, usa una cuantización menor o elige un modelo más pequeño. Cierra aplicaciones que comparten memoria.
Revisa controlador, backend compatible, registro y ajuste de capas GPU. Con memoria unificada, comprueba también el límite UMA.
La primera carga depende de SSD, tamaño y compilación de kernels. Compara también las solicitudes posteriores.
La caché KV crece con el contexto. Reduce la ventana, inicia otra sesión o elige un modelo con gestión más eficiente.
Antes de descargar
El buscador estima la clase de memoria y la relaciona con sistemas completos, mostrando ventajas y compromisos.