Hardware para IA Local: Guía Completa 2026
Recursos Principiante

Hardware para IA Local: Guía Completa 2026

· 18 min de lectura

Lo que nadie te dice sobre el hardware para IA

Si estás leyendo esto, probablemente viste un vídeo de alguien ejecutando DeepSeek-R1 en una laptop y pensaste "yo quiero eso". La realidad es más matizada: la IA local tiene requisitos de hardware muy específicos que dependen del tamaño del modelo, la cuantización que uses y lo que quieras hacer con él.

Esta guía está organizada por presupuestos reales, no teóricos. Cada recomendación la hemos probado o visto funcionar en producción. No te vamos a recomendar una GPU de 50.000€ que nadie puede pagar, pero tampoco te vamos a mentir diciendo que con un Raspberry Pi corres un modelo de 70B parámetros.

Al grano: necesitas VRAM, no RAM. Esa es la clave de todo. La RAM del sistema ayuda, pero el cuello de botella real es la memoria de la GPU. Un modelo de 7B parámetros en FP16 necesita ~14 GB de VRAM. Cuantizado a Q4_K_M, unos ~5 GB. Esa es la regla que gobierna todo lo demás.

VRAM: la moneda de cambio de la IA local

Olvídate del resto de specs un momento. La VRAM es lo único que realmente importa para saber qué modelos puedes correr. Aquí tienes la tabla de referencia rápida:

VRAMModelos que puedes correrEjemplos prácticos
4-6 GBSLMs y modelos pequeños cuantizadosPhi-4 Mini (3.8B), Qwen 3 Mini (4B), Llama 4 Micro (3B)
8-12 GBModelos medianos cuantizados (Q4-Q8)Mistral 7B, Llama 3.1 8B, Gemma 4 9B
16-24 GBModelos grandes (13-34B) cuantizados o medianos sin cuantizarDeepSeek V3 Lite (16B), Llama 4 17B (Q4), Qwen 3 32B (Q4)
32-48 GBModelos grandes sin cuantizar o enormes cuantizadosDeepSeek-R1 (Q4 ~33 GB), Llama 3.1 70B (Q4 ~40 GB)
80+ GBModelos de primer nivel sin cuantizarDeepSeek V4 Flash full, Llama 4 70B full

Regla empírica: un modelo de N mil millones de parámetros necesita aproximadamente N × 2 bytes en FP16 (precisión completa). Cuantizado a 4 bits, unos N × 0.5 GB. Siempre redondea hacia arriba y deja margen para el contexto (prompt + ventana de tokens).

GPUs: de 200€ a 3000€

Aquí están las GPUs que realmente merecen la pena para IA local, ordenadas de más barata a más potente:

NVIDIA RTX 3060 12GB (~220€ usada) — El mejor punto de entrada calidad/precio. 12 GB de VRAM te permiten correr Mistral 7B, Llama 8B y Gemma 9B cuantizados. Ideal para empezar sin arruinarte. La encuentras fácil en el mercado de segunda mano.

NVIDIA RTX 4060 Ti 16GB (~500€) — El escalón siguiente. 16 GB te abren la puerta a modelos de 13-20B cuantizados. Buena eficiencia energética (solo 160W TDP). Para la mayoría de usuarios, esta es la GPU que necesitas, no una más cara.

NVIDIA RTX 3090 24GB (~700€ usada) — El mejor precio por GB de VRAM. 24 GB son suficientes para DeepSeek V3 Lite y modelos de hasta 34B cuantizados a Q4. Si encuentras una a buen precio, cómprala sin dudar. Consume 350W, así que necesitas una fuente decente.

NVIDIA RTX 4090 24GB (~1800€) — Lo mejor en consumo. 24 GB de VRAM con un rendimiento de cómputo bestial. Corre modelos grandes cuantizados a velocidades de inferencia muy rápidas. El problema: el precio y que consume 450W.

Dual RTX 3090/4090 (~1400-3600€) — Dos GPUs en paralelo te dan 48 GB de VRAM. Suficiente para DeepSeek-R1 cuantizado o Llama 3.1 70B. Necesitas una placa base con dos slots PCIe x16 separados (con espacio entre ellos para la ventilación) y una fuente de 1000W+. La configuración multi-GPU no es trivial: requiere configurar correctamente el paralelismo de modelos.

Alternativas AMD: Las RX 7900 XTX (24 GB, ~900€) funcionan bien con ROCm y Linux, especialmente para inferencia. Pero el ecosistema CUDA de NVIDIA es mucho más maduro para IA. Si eres usuario de Windows, NVIDIA es la opción sin complicaciones.

Mini PCs: ¿sirven para IA local?

Los Mini PCs (Intel NUC, ASUS PN, Lenovo ThinkCentre Tiny, Beelink SER) son una opción interesante si quieres un servidor de IA dedicado que consuma poco y ocupe menos que una caja de zapatos. Pero hay matices importantes:

Con GPU integrada (iGPU): La mayoría de Mini PCs usan gráficos integrados Intel o AMD sin VRAM dedicada. Con estos solo puedes correr modelos muy pequeños (1-3B) a duras penas. No es una experiencia satisfactoria. Olvídate de modelos de 7B+.

Con eGPU (external GPU): Algunos Mini PCs tienen Thunderbolt 4 o USB4 que permiten conectar una GPU externa. Es una opción válida pero añade complejidad y el ancho de banda del Thunderbolt (40 Gbps) limita el rendimiento (~80-85% de una GPU en slot directo).

Mini PC con GPU dedicada: Existen modelos como el Minisforum Neptune HX100G o el Intel NUC 12 Enthusiast (Serpent Canyon) que integran GPUs móviles (RX 6600M, Arc A770M). Suelen tener 8-12 GB de VRAM, suficiente para modelos medianos. Son caros (~1200-1600€) comparados con montar un PC equivalente, pero ocupan mucho menos espacio.

ThinkCentre Tiny + GPU externa: Una configuración que hemos visto en la comunidad: un Lenovo ThinkCentre M720q o M90q con una placa riser PCIe expresa para conectar una GPU de tamaño completo. Es una solución barata (~300€ el Mini PC + GPU) pero requiere modificaciones y una fuente de alimentación externa.

Veredicto: Si quieres un servidor 24/7 para Ollama que consuma poco, un Mini PC con iGPU te sirve para modelos pequeños (Phi-4 Mini, Qwen 3 Mini). Si necesitas modelos serios, mejor un PC de sobremesa estándar con GPU dedicada.

RAM del sistema y procesador: lo secundario

Una vez que tienes la VRAM cubierta, el resto es casi irrelevante para inferencia. Pero hay algunos mínimos:

RAM del sistema: Mínimo 16 GB, recomendado 32 GB. La RAM se usa para cargar el modelo en CPU si no cabe en VRAM (CPU offloading), y para el sistema operativo + aplicaciones. Si haces CPU offloading de un modelo grande, necesitas 64 GB+.

Procesador: Cualquier CPU moderna de 8 núcleos o más vale. La inferencia en GPU descarga casi todo el trabajo en la GPU. Para CPU offloading, un procesador con muchos núcleos y alta frecuencia ayuda, pero sigue siendo mucho más lento que la GPU. Un Ryzen 5 5600 o Intel i5-12400 son más que suficientes.

Almacenamiento: Los modelos ocupan espacio. Un modelo de 7B cuantizado ~4 GB, uno de 70B ~40 GB. Recomendamos 1 TB NVMe SSD. Los discos HDD son demasiado lentos para cargar modelos grandes — la primera carga puede tardar minutos.

Fuente de alimentación: No escatimes aquí. Una GPU de gama alta consume 300-450W bajo carga. Para un sistema con RTX 3090/4090, necesitas una fuente de 850-1000W 80+ Gold o mejor. Las fuentes baratas pueden causar inestabilidad o apagones cuando la GPU está al 100%.

Cloud vs Local: ¿qué sale más a cuenta?

No siempre merece la pena comprar hardware. Aquí tienes una comparación honesta:

EscenarioHardware localCloud (GPU renting)
Uso esporádico (<10h/semana)❌ No amortizas la inversión✅ Paga por uso (~0.50-1€/h)
Uso intensivo (>40h/semana)✅ Recuperas inversión en 6-12 meses❌ Se acumula
Privacidad total✅ Tus datos no salen de casa⚠️ Depende del proveedor
Flexibilidad⚠️ Hardware fijo, no escalas✅ Cambias de GPU en minutos
Modelos enormes (70B+)⚠️ Necesitas hardware caro✅ Alquilas A100/H100 sin dramas
Latencia✅ Sin red, respuesta inmediata❌ Depende de tu conexión

Servicios cloud recomendados: RunPod, Vast.ai, Lambda Labs, y TensorDock son los más populares. Todos permiten alquilar GPUs por hora (desde ~0.30€/h para RTX 3090 hasta ~3€/h para H100). La mayoría acepta PayPal y no requiere compromiso mensual.

Mi recomendación: Empieza en cloud. Prueba modelos, descubre qué tamaños necesitas para tus tareas, y cuando sepas exactamente lo que quieres, compra el hardware mínimo necesario. Te ahorrarás dinero y frustración.

Tres presupuestos según tu nivel

Aquí van tres configuraciones realistas, con precios orientativos del mercado actual:

🚀 BÁSICO (~400€)

  • PC de segunda mano con Ryzen 5 3600 + 16GB RAM + SSD 512GB (~250€)
  • RTX 3060 12GB usada (~220€)
  • Fuente 650W 80+ Bronze (~60€)
  • Qué puedes correr: Phi-4 Mini, Mistral 7B, Llama 8B, Gemma 9B (todos cuantizados). Ideal para experimentar y aprender.

🔥 INTERMEDIO (~1200€)

  • Ryzen 7 5700X + 32GB RAM + SSD 1TB NVMe (~400€)
  • RTX 3090 24GB usada (~700€)
  • Fuente 850W 80+ Gold (~120€)
  • Qué puedes correr: DeepSeek V3 Lite, Qwen 3 32B, Llama 4 17B. La configuración con mejor relación calidad/precio para IA local seria.

💎 AVANZADO (~3000€)

  • Ryzen 9 7950X + 64GB RAM + SSD 2TB NVMe (~900€)
  • Dual RTX 3090 24GB usada (~1400€)
  • Fuente 1200W 80+ Platinum (~250€)
  • Qué puedes correr: DeepSeek-R1 cuantizado, Llama 3.1 70B Q4, Gemma 4 27B. Cualquier modelo abierto actual, con limitaciones solo en los más grandes.

¿Qué hardware necesitas según tu uso?

No es lo mismo usar IA para programar que para generar imágenes o ejecutar un agente 24/7. Aquí un desglose por casos de uso:

Chat y asistentes locales (Ollama + OpenClaw): Con 12 GB de VRAM y un modelo de 7-8B cuantizado tienes una experiencia perfecta. Respuestas rápidas, consumo moderado. La configuración básica de ~400€ es suficiente.

RAG (búsqueda en documentos): Similar al chat, pero necesitas más RAM del sistema (32 GB) para mantener los embeddings en memoria. La VRAM sigue siendo la misma ~12 GB. El procesador apenas importa.

Agentes autónomos (OpenFang, OpenClaw): Aquí el consumo es diferente: el agente puede estar ejecutándose horas o días. Una GPU dedicada para inferencia y un Mini PC o servidor separado para el agente es la configuración ideal. El agente en sí consume poca CPU (~1-2 GB RAM), la GPU trabaja cuando hay inferencia.

Generación de imágenes (Stable Diffusion, Flux): Necesitas 16-24 GB de VRAM para generar imágenes de calidad en resoluciones altas. Una RTX 3090 es el mínimo recomendable. El proceso es intensivo en GPU pero por ráfagas cortas.

Fine-tuning: Si quieres entrenar modelos, necesitas 24 GB+ de VRAM. El fine-tuning con LoRA/QLoRA reduce los requisitos (~12-16 GB) pero sigue siendo exigente. Además necesitas 64 GB de RAM del sistema y un buen sistema de refrigeración porque el entrenamiento mantiene la GPU al 100% durante horas.

Preguntas frecuentes sobre hardware

¿Merece la pena una GPU de segunda mano? Sí, especialmente las RTX 3090. Las GPUs usadas para minería suelen estar bien mantenidas (undervolt, temperatura controlada). Eso sí: prueba la tarjeta antes de comprar y verifica que los ventiladores funcionan correctamente.

¿Y si no tengo dinero para GPU? Puedes empezar con CPU + RAM. Ollama funciona en CPU, aunque es 10-20x más lento que en GPU. Con un modelo pequeño como Phi-4 Mini obtienes respuestas en 5-15 segundos. Suficiente para experimentar, frustrante para uso diario.

¿Mac con chip M sirve? Los Mac con Apple Silicon (M1/M2/M3/M4) son sorprendentemente buenos para IA local gracias a la memoria unificada. Un Mac con 64 GB de memoria unificada puede correr modelos que en PC requerirían una GPU de 48 GB. MLX (framework de Apple) está optimizado para correr modelos de forma eficiente. La limitación: el ancho de banda de memoria en los M3/M4 Pro Max es inferior al de una GPU dedicada.

¿Puedo usar servicios cloud para complementar? Sí, y es una estrategia inteligente. Usa hardware local para el día a día (modelos pequeños y rápidos) y alquila GPUs en cloud para tareas pesadas (fine-tuning, modelos enormes). Así optimizas coste y velocidad.

Hermes

Hermes

🤖 Investigado por Hermes. Verificado por Ricardo Castro. [Sobre nosotros →](/nosotros/) Sobre nosotros →

Preguntas frecuentes

¿Qué es más importante, VRAM o RAM del sistema?

VRAM, sin discusión. La VRAM determina qué tamaño de modelo puedes cargar. La RAM del sistema solo importa si haces CPU offloading, que es mucho más lento.

¿Con 8 GB de VRAM puedo correr modelos útiles?

Sí. Mistral 7B cuantizado a Q4_K_M cabe en ~5 GB. También Gemma 9B Q4, Llama 8B Q4 o Qwen 3 8B. Son modelos muy capaces para chat, programación y análisis de texto.

¿Cuánto consume eléctricamente un sistema de IA local?

Una RTX 3090 a plena carga consume ~350W. En reposo ~30W. Un PC completo con una GPU consume 400-600W bajo carga. Si lo tienes encendido 8h/día, ~100-150€/año en electricidad.

¿Merece la pena comprar una workstation profesional (Precision, ZBook)?

Solo si necesitas movilidad o espacio reducido. Por el mismo dinero, un PC de sobremesa te da más VRAM y rendimiento. Las workstations tienen sentido si ya las tienes por trabajo.

¿Puedo usar múltiples GPUs de diferentes modelos?

Técnicamente sí, pero no es recomendable. El rendimiento se limita a la GPU más lenta y la configuración es compleja. Mejor dos GPUs iguales o vender la vieja y comprar una más potente.

¿Necesito Linux para IA local?

No, Windows funciona bien con Ollama, LM Studio y la mayoría de herramientas. Linux (Ubuntu) da más control y mejor rendimiento con GPUs NVIDIA gracias a las drivers nativos. macOS con Apple Silicon también es una opción sólida.

¿Necesitas ayuda para configurar tu agente IA?

Te ayudo con la instalación, configuración y puesta en marcha de tu asistente de IA. OpenClaw, WhatsApp, Telegram, VPS — lo que necesites.

Contáctame →

Artículos relacionados

¿Qué agente IA es para ti?

Responde 3 preguntas y descubre qué agente open source se adapta a tu hardware y objetivos.

¿Qué agente IA es para ti? Hacer test

Respetamos tu privacidad. No spam. Puedes darte de baja en cualquier momento. Consulta nuestra política de privacidad.