CORRE IA EN SOLO 3GB VRAM: TOP 5 MODELOS PARA OLLAMA
En este vídeo vemos 5 modelos de IA local que puedes ejecutar con alrededor de 3 GB de VRAM utilizando Ollama.
La idea es comprobar hasta dónde podemos llegar con hardware muy limitado, utilizando modelos generalistas, modelos orientados al razonamiento y también opciones especializadas en programación.
──────────────────────────────
1. QWEN 3.5 2B Q8_0 — ~2,7 GB
Modelo compacto y muy completo para su tamaño. Soporta razonamiento, herramientas, capacidades multimodales y una ventana de contexto muy amplia.
Comando Ollama:
ollama run qwen3.5:2b-q8_0
Modelo:
https://ollama.com/library/qwen3.5:2b-q8_0
Todos los modelos Qwen 3.5:
https://ollama.com/library/qwen3.5
──────────────────────────────
2. QWEN 3 4B THINKING 2507 Q4_K_M — ~2,5 GB
Modelo de aproximadamente 4B de parámetros comprimido en Q4. Está especialmente orientado al razonamiento, matemáticas, lógica, programación y problemas que necesitan varios pasos antes de responder.
Comando Ollama:
ollama run qwen3:4b-thinking-2507-q4_K_M
Modelo:
https://ollama.com/library/qwen3:4b-thinking-2507-q4_K_M
Todos los modelos Qwen 3:
https://ollama.com/library/qwen3
──────────────────────────────
3. QWEN 3 1.7B Q8_0 — ~2,2 GB
Modelo generalista muy ligero con cuantización Q8, buscando conservar bastante calidad pese a su reducido tamaño. Puede utilizarse para conversación, generación de texto, código, razonamiento y seguimiento de instrucciones.
Fuente externa: YouTube · ANDO TV ↗



