Mínimo ajustado
Puede bastar con cuantización compacta y contexto corto, pero deja poca zona de trabajo.
Exige configurar con precisiónGuía de 70B · actualizada el 21 de agosto de 2026
Con un modelo 70B cuantizado, la capacidad de memoria es lo primero. 32 GB de VRAM son rápidos, pero normalmente insuficientes para pesos y contexto. Las opciones realistas empiezan cerca de 48–64 GB y ganan margen con 96–128 GB.
Por qué el tamaño del archivo no lo dice todo
Un 70B en Q4 suele usar unos 40–45 GB para los pesos. Durante el uso se suman caché KV, búferes, sistema operativo y herramientas RAG.
Puede bastar con cuantización compacta y contexto corto, pero deja poca zona de trabajo.
Exige configurar con precisiónDa más margen para motor, contexto y tareas paralelas.
Comprueba la memoria asignable realAdecuado para contexto largo, RAG y varios servicios, sin prometer la velocidad de GPU profesionales.
Punto fuerte de la memoria unificadaTres caminos
Mini PC Ryzen AI Max+ 395: mucha capacidad, poco espacio y x86. La velocidad depende del backend Radeon.
Opción equilibrada por capacidadVer PC Ryzen AI Max+ASUS Ascent GX10 combina memoria y CUDA, pero usa Arm/Linux y exige software compatible.
Para desarrollo con NVIDIAVer GX10Una RTX 5090 es rápida para la parte alojada en GPU, pero el 70B también usa RAM y pierde rendimiento.
Para modelos menores rápidosGuía de RTX 5090Comparación práctica
| Hardware | ¿Cabe un 70B? | Velocidad esperada | Comprobación decisiva |
|---|---|---|---|
| 64 GB unificados | a menudo, con poco margen | muy dependiente de backend y contexto | asignación UMA y memoria libre |
| 128 GB unificados | sí, para muchos Q4 | moderada, centrada en capacidad | soporte GPU del motor |
| RTX 5090 32 GB | solo con descarga | muy variable | RAM, bus y parte alojada en VRAM |
| GPU profesional 48–96 GB | según cuantización | alta | precio, fuente y refrigeración |
Antes de comprar
Q4, Q5 y Q8 cambian mucho memoria y calidad.
32K o 128K pueden aumentar mucho la caché KV.
El backend debe soportar bien GPU y formato.
Sesiones paralelas añaden caché y cálculo.
Caber no basta si las respuestas tardan demasiado.
Preguntas frecuentes
Puede funcionar con Q4, contexto limitado y motor eficiente, pero el margen es pequeño. Cuando la memoria es separada, RAM tampoco equivale a VRAM.
No automáticamente. Aportan capacidad; ancho de banda, GPU, backend y arquitectura determinan los tokens por segundo.
Es excelente para modelos que caben en 32 GB. Con 70B, la descarga reduce la velocidad y RAM y configuración pasan a ser esenciales.
No siempre. Un 14B o 32B reciente puede dar calidad suficiente con respuestas más rápidas y menor coste. Prueba primero tu carga real.
De la necesidad al sistema
El buscador considera contexto, prioridad y presupuesto y solo muestra configuraciones que alcanzan la clase de memoria calculada.