ENTRAR AL CMS
IANOTICIA

TOP 5 MODELOS PARA IA AGÉNTICA CON MENOS DE 4 GB DE VRAM

En este vídeo enseño 5 LLM locales capaces de funcionar con una GPU de solo 4 GB de VRAM, utilizando Ollama y orientándolos a tareas de IA agéntica.

Miniatura: TOP 5 MODELOS PARA IA AGÉNTICA CON MENOS DE 4 GB DE VRAM

Vídeo relacionado

En este vídeo enseño 5 LLM locales capaces de funcionar con una GPU de solo 4 GB de VRAM, utilizando Ollama y orientándolos a tareas de IA agéntica.

Todos los modelos utilizados son versiones cuantizadas y pueden descargarse directamente desde Ollama.

🔥 1. QWEN 3.5 4B Q4_K_M — 3,4 GB

Modelo multimodal de Qwen con 4,66B de parámetros, soporte para herramientas, razonamiento, visión y capacidades agénticas. La versión Q4_K_M ocupa aproximadamente 3,4 GB.

MODELO ORIGINAL: https://huggingface.co/Qwen/Qwen3.5-4B

OLLAMA: https://ollama.com/library/qwen3.5%3A4b-q4_K_M

DESCARGAR: `ollama pull qwen3.5:4b-q4_K_M`

RUN: `ollama run qwen3.5:4b-q4_K_M`

🔥 2. GEMMA 3 4B IT Q4_K_M — 3,3 GB

Modelo de Google de 4,3B parámetros. Es multimodal, permite trabajar con texto e imágenes y dispone de una ventana de contexto máxima de 128K. La cuantización Q4_K_M ocupa aproximadamente 3,3 GB.

MODELO ORIGINAL: https://huggingface.co/google/gemma-3-4b-it

OLLAMA: https://ollama.com/library/gemma3%3A4b-it-q4_K_M

DESCARGAR: `ollama pull gemma3:4b-it-q4_K_M`

RUN: `ollama run gemma3:4b-it-q4_K_M`

🔥 3. PHI-4 MINI REASONING — 3,2 GB

Modelo de Microsoft con 3,8B parámetros especializado en razonamiento multietapa, lógica, matemáticas y resolución de problemas complejos en entornos con memoria y capacidad de cómputo limitadas. La versión estándar de Ollama ocupa aproximadamente 3,2 GB.

MODELO ORIGINAL: https://huggingface.co/microsoft/Phi-4-mini-reasoning

OLLAMA: https://ollama.com/library/phi4-mini-reasoning

DESCARGAR: `ollama pull phi4-mini-reasoning`

RUN: `ollama run phi4-mini-reasoning`

🔥 4. MINISTRAL 3 3B INSTRUCT 2512 Q4_K_M — 3,0 GB

Modelo de Mistral diseñado específicamente para ejecutarse en dispositivos y hardware limitado. Tiene 3,85B parámetros, visión, function calling nativo, salida JSON y capacidades orientadas a sistemas agénticos. La versión Q4_K_M ocupa aproximadamente 3,0 GB.

MODELO ORIGINAL: https://huggingface.co/mistralai/Ministral-3-3B-Instruct-2512

OLLAMA: https://ollama.com/library/ministral-3%3A3b-instruct-2512-q4_K_M

Fuente externa: YouTube · ANDO TV ↗