Pesos del modelo
Q4 ocupa mucho menos que FP16. Por metadatos y formato, «4 bits» no significa exactamente 0,5 bytes por parámetro.
Memoria del modelo explicada con claridad
La memoria rápida debe contener pesos, caché de contexto, motor y margen de seguridad. Esta guía relaciona clases 8B, 14B, 32B y 70B con capacidades realistas y distingue RAM, VRAM y memoria unificada.
La fórmula útil
El número de parámetros no equivale al uso de memoria. La cuantización reduce los pesos; contexto largo, visión y sesiones paralelas añaden consumo.
Q4 ocupa mucho menos que FP16. Por metadatos y formato, «4 bits» no significa exactamente 0,5 bytes por parámetro.
La caché KV conserva información del contexto actual. Crece con longitud, conversaciones activas y arquitectura.
Ollama, LM Studio y llama.cpp usan búferes. Backend GPU y proporción descargada cambian el total.
Una configuración que solo cabe sobre el papel es frágil. Sistema, escritorio, RAG y otros servicios necesitan espacio.
Valores con margen
Los intervalos suponen aproximadamente Q4 y reserva normal. Contextos muy largos, modelos MoE, visión o varios usuarios pueden exigir más.
| Clase | Pesos orientativos | Memoria rápida razonable | Uso habitual |
|---|---|---|---|
| 7B–8B | unos 5–6 GB | 12–16 GB | chat, resúmenes, asistentes sencillos |
| 12B–14B | unos 8–10 GB | 16 GB | modelos generales y código |
| 20B–32B | unos 14–22 GB | 24–32 GB | programación, RAG, agentes |
| 65B–70B | unos 40–45 GB | 64 GB mínimo; 96–128 GB con más margen | tareas complejas y mayor calidad |
| 100B–120B | unos 65–80 GB | 96–128 GB o más | cargas profesionales |
«El modelo cabe» no significa «el modelo es rápido». Ancho de banda, cálculo, motor y descarga determinan el rendimiento.
Elegir según el modelo
La GPU correcta no tiene por qué ser la más cara. Modelo y contexto deben caber en memoria rápida y el software debe soportar bien el backend.
Adecuado para muchos 7B–14B cuantizados. Visión, contexto largo y modelos mayores reducen el margen.
Chat y primeros asistentesClase fuerte para 20B–32B rápidos. RTX 5090 tiene 32 GB de VRAM; 70B suele requerir descarga.
Código, RAG y agentesVer PC RTX 5090Mini PC con memoria unificada y sistemas especializados pueden alojar 70B cuantizados. Reserva y backend siguen siendo decisivos.
Modelos grandes y contexto largoComparar mini PC para IADos arquitecturas de memoria
Está conectada directamente a una GPU separada. Su gran ancho de banda da velocidad mientras toda la carga quepa.
CPU y GPU integrada comparten una gran reserva. Caben modelos mayores, pero sistema y aplicaciones usan la misma memoria.
Preguntas frecuentes
Pueden bastar para un 7B u 8B pequeño y bien cuantizado con contexto limitado. Para visión y contexto largo, el margen es escaso.
Sí, para muchos 7B–14B. Un 32B, codificador de imagen o contexto muy largo puede superarlos.
La VRAM física de una gráfica suele ser fija. Descargar a RAM permite modelos mayores, pero reduce la velocidad.
A menudo con cuantización intensa o descarga parcial. El modelo no queda íntegro en VRAM y el rendimiento puede bajar mucho.
No. Solo algunas arquitecturas comparten mucha memoria. Sistema y aplicaciones conservan una parte, y firmware y controladores pueden limitarla.
Para LLM locales grandes, capacidad, ancho de banda y compatibilidad del backend suelen importar más que los TOPS de la NPU.
De la memoria al sistema
El buscador aplica estos principios, muestra los supuestos y compara el resultado con sistemas concretos.