Memoria del modelo explicada con claridad

¿Cuánta VRAM necesitas para ejecutar un LLM local?

La memoria rápida debe contener pesos, caché de contexto, motor y margen de seguridad. Esta guía relaciona clases 8B, 14B, 32B y 70B con capacidades realistas y distingue RAM, VRAM y memoria unificada.

La fórmula útil

Pesos + caché KV + motor + reserva

El número de parámetros no equivale al uso de memoria. La cuantización reduce los pesos; contexto largo, visión y sesiones paralelas añaden consumo.

Pesosparámetros × cuantizaciónCaché KVcontexto × arquitecturaMotorbúferes y backendReservasistema y otras herramientas

Pesos del modelo

Q4 ocupa mucho menos que FP16. Por metadatos y formato, «4 bits» no significa exactamente 0,5 bytes por parámetro.

Caché de contexto

La caché KV conserva información del contexto actual. Crece con longitud, conversaciones activas y arquitectura.

Motor de inferencia

Ollama, LM Studio y llama.cpp usan búferes. Backend GPU y proporción descargada cambian el total.

Reserva práctica

Una configuración que solo cabe sobre el papel es frágil. Sistema, escritorio, RAG y otros servicios necesitan espacio.

Valores con margen

Memoria típica para modelos de texto cuantizados

Los intervalos suponen aproximadamente Q4 y reserva normal. Contextos muy largos, modelos MoE, visión o varios usuarios pueden exigir más.

ClasePesos orientativosMemoria rápida razonableUso habitual
7B–8Bunos 5–6 GB12–16 GBchat, resúmenes, asistentes sencillos
12B–14Bunos 8–10 GB16 GBmodelos generales y código
20B–32Bunos 14–22 GB24–32 GBprogramación, RAG, agentes
65B–70Bunos 40–45 GB64 GB mínimo; 96–128 GB con más margentareas complejas y mayor calidad
100B–120Bunos 65–80 GB96–128 GB o máscargas profesionales

«El modelo cabe» no significa «el modelo es rápido». Ancho de banda, cálculo, motor y descarga determinan el rendimiento.

Elegir según el modelo

¿Qué GPU encaja con la IA local?

La GPU correcta no tiene por qué ser la más cara. Modelo y contexto deben caber en memoria rápida y el software debe soportar bien el backend.

12–16 GB: inicio práctico

Adecuado para muchos 7B–14B cuantizados. Visión, contexto largo y modelos mayores reducen el margen.

Chat y primeros asistentes

24–32 GB: velocidad

Clase fuerte para 20B–32B rápidos. RTX 5090 tiene 32 GB de VRAM; 70B suele requerir descarga.

Código, RAG y agentesVer PC RTX 5090

64–128 GB: capacidad

Mini PC con memoria unificada y sistemas especializados pueden alojar 70B cuantizados. Reserva y backend siguen siendo decisivos.

Modelos grandes y contexto largoComparar mini PC para IA

Dos arquitecturas de memoria

VRAM dedicada y memoria unificada no son lo mismo

VRAM dedicada

Está conectada directamente a una GPU separada. Su gran ancho de banda da velocidad mientras toda la carga quepa.

  • alto rendimiento de inferencia
  • capacidad fija y fácil de identificar
  • descargar a RAM suele ser mucho más lento

Memoria unificada

CPU y GPU integrada comparten una gran reserva. Caben modelos mayores, pero sistema y aplicaciones usan la misma memoria.

  • 64–128 GB en formato compacto
  • comprobar asignación UMA o VGM
  • menos ancho de banda que grandes GPU dedicadas

Preguntas frecuentes

Evita errores al elegir memoria

¿Bastan 8 GB de VRAM para IA local?

Pueden bastar para un 7B u 8B pequeño y bien cuantizado con contexto limitado. Para visión y contexto largo, el margen es escaso.

¿Bastan 16 GB para un LLM local?

Sí, para muchos 7B–14B. Un 32B, codificador de imagen o contexto muy largo puede superarlos.

¿Se puede ampliar la VRAM?

La VRAM física de una gráfica suele ser fija. Descargar a RAM permite modelos mayores, pero reduce la velocidad.

¿Puede funcionar un 70B con 32 GB de VRAM?

A menudo con cuantización intensa o descarga parcial. El modelo no queda íntegro en VRAM y el rendimiento puede bajar mucho.

¿128 GB de RAM significan que la GPU puede usar 128 GB?

No. Solo algunas arquitecturas comparten mucha memoria. Sistema y aplicaciones conservan una parte, y firmware y controladores pueden limitarla.

¿Es imprescindible una NPU?

Para LLM locales grandes, capacidad, ancho de banda y compatibilidad del backend suelen importar más que los TOPS de la NPU.

De la memoria al sistema

Calcula la clase adecuada para modelo y contexto

El buscador aplica estos principios, muestra los supuestos y compara el resultado con sistemas concretos.

Abrir el buscador de PC