Del PC a la primera respuesta

Cómo instalar y ejecutar un LLM local

Una instalación fiable empieza con un modelo que cabe en memoria, un motor compatible y ajustes seguros. Estos pasos llevan Windows, macOS y Linux desde la comprobación de hardware hasta la primera prueba.

Elige cómo trabajar

¿Interfaz gráfica o línea de comandos?

LM Studio

Interfaz gráfica para buscar modelos compatibles, ajustar contexto y descarga, chatear y abrir un servidor local.

Cómodo para empezarDocumentación oficial

Ollama

Instalación sencilla, gestión de modelos desde terminal y API local para aplicaciones, editores y automatizaciones.

Útil para integracionesDocumentación oficial

llama.cpp

Más control sobre GGUF, backends, capas GPU y parámetros. Requiere mayor experiencia técnica.

Para control precisoProyecto oficial

Seis pasos

Preparar la IA local sin probar a ciegas

1

Actualiza sistema y controladores

Instala actualizaciones estables y el controlador oficial de GPU. Reinicia antes de juzgar aceleración y memoria detectadas.

2

Comprueba memoria y espacio libre

Revisa la VRAM o memoria unificada realmente disponible y reserva sitio para modelo, descarga temporal y datos.

3

Instala primero un solo motor

Empieza con LM Studio u Ollama. Añade otras herramientas cuando una sesión estable funcione bien.

4

Elige un modelo pequeño cuantizado

Para la primera prueba usa un 7B–8B Q4 fiable. Comprueba licencia, formato y plantilla de prompt esperada.

5

Verifica la aceleración GPU

Mira el registro del motor y el uso de GPU. Si solo trabaja la CPU, revisa backend, controlador y capas descargadas.

6

Aumenta paso a paso

Sube contexto o tamaño de uno en uno. Mide memoria, tiempo al primer token, tokens por segundo y estabilidad.

Primer modelo

Un inicio acorde con la memoria

Memoria rápidaPrimera prueba recomendadaSiguiente paso
8 GB7B–8B Q4, contexto cortoreduce contexto antes de aumentar modelo
12–16 GB8B–14B Q4prueba RAG o contexto moderado
24–32 GB20B–32B Q4mide descarga antes de probar 70B
64 GB compartidos32B Q4 con margen70B puede ser justo según contexto y sistema
128 GB compartidos70B Q4aumenta contexto y servicios midiendo

Privacidad local

Mantén la API en la red privada

Un motor local solo protege los datos si no lo expones por accidente. Escucha en localhost o LAN, usa autenticación y cortafuegos y no reenvíes puertos del router sin necesidad.

  • ningún puerto público por defecto
  • token o proxy autenticado para varios usuarios
  • copia separada de documentos RAG

Comprobar el rendimiento

Mide lo que realmente importa

Anota tiempo al primer token, tokens por segundo, pico de memoria y temperatura en una conversación realista. Una prueba corta no muestra throttling ni crecimiento de caché.

  • mismo prompt y cuantización
  • contexto inicial documentado
  • al menos 20–30 minutos de carga

Problemas frecuentes

Cuando el modelo no arranca o va lento

El motor indica memoria insuficiente

Reduce contexto, usa una cuantización menor o elige un modelo más pequeño. Cierra aplicaciones que comparten memoria.

No se utiliza la GPU

Revisa controlador, backend compatible, registro y ajuste de capas GPU. Con memoria unificada, comprueba también el límite UMA.

La primera respuesta tarda mucho

La primera carga depende de SSD, tamaño y compilación de kernels. Compara también las solicitudes posteriores.

La velocidad baja en chats largos

La caché KV crece con el contexto. Reduce la ventana, inicia otra sesión o elige un modelo con gestión más eficiente.

Antes de descargar

Comprueba memoria y compatibilidad de software

El buscador estima la clase de memoria y la relaciona con sistemas completos, mostrando ventajas y compromisos.

Encontrar un PC compatible