IA local con Ollama: ejecuta LLMs en tu propio equipo sin pagar por API
¿Y si pudieras ejecutar un modelo de lenguaje en tu propio equipo, sin API keys, sin suscripciones y sin conexión a internet? Con Ollama v0.30.x, en 2026 basta un comando para descargar un LLM y otro para empezar a chatear, y la API que expone es compatible con el SDK de OpenAI. Esta guía recorre todo el proceso, desde la instalación hasta la interfaz web tipo ChatGPT.
Por qué correr IA en local en 2026
Los modelos abiertos han madurado hasta el punto de que un equipo doméstico puede ejecutar asistentes útiles para programar, redactar o resumir documentos. La ventaja principal es la privacidad: tus conversaciones nunca salen de tu máquina. La segunda es el coste: descargas el modelo una vez y lo usas sin límite, sin pagar por token. La tercera es la independencia: una vez descargado el modelo, todo funciona sin conexión.
Privacidad, coste y trabajo sin conexión
Para equipos que manejan datos sensibles o simplemente prefieren no enviar su código a terceros, la IA local elimina de un plumazo las dudas sobre dónde acaban tus prompts. No hay telemetría de conversación, no hay límite diario de mensajes y no hay factura a fin de mes. El único coste real es el hardware: memoria de vídeo (VRAM) suficiente para el modelo que quieras ejecutar.
Ollama frente a LM Studio y a las APIs en la nube
Ollama y LM Studio son las dos herramientas más citadas en 2026 para el desarrollo de IA centrado en privacidad. Ollama destaca por su línea de comandos simple y su API compatible con OpenAI, ideal para integrarse en scripts y aplicaciones. LM Studio ofrece una interfaz gráfica muy pulida para probar modelos. Las APIs en la nube, por su parte, siguen ganando en modelos de mayor tamaño, pero pierden en privacidad, latencia y coste a largo plazo si tu uso es intensivo.
Instalación de Ollama en Linux, macOS y Windows
Instalar Ollama es directo en los tres sistemas. En Linux y macOS se usa el instalador oficial desde el terminal:
curl -fsSL https://ollama.com/install.sh | shEn Windows se descarga el instalador desde la web oficial y el asistente configura todo, incluido el servicio en segundo plano. Para comprobar que todo funciona, ejecuta:
ollama --versionElegir el modelo según tu hardware (VRAM)
La regla de oro es que el modelo debe caber en tu VRAM con su cuantización. Como referencia aproximada: un modelo de 3B necesita unos 4 GB, uno de 7B unos 8 GB, uno de 13B unos 16 GB y los modelos de 70B cuantizados superan los 40 GB. Con esa cifra en mente, la elección es casi inmediata.
4-8 GB: Llama 4 Scout 8B y modelos 3B/7B
Si tienes una tarjeta de gama media como una RTX 4060, o un Apple M3 con 8 GB unificados, tu techo está en los modelos de 7B/8B. Llama 4 Scout 8B es una opción equilibrada para chat general y tareas cotidianas, y los modelos de 3B sirven para pruebas rápidas en cualquier equipo.
16-24 GB: Qwen3 Coder 30B/32B para programación
Con 24 GB, el panorama cambia por completo. Para desarrollo, qwen3-coder:30b lidera en 2026: usa una arquitectura MoE con 3,3 mil millones de parámetros activos, ocupa unos 19 GB en cuantización Q4_K_M, admite contexto de 256K y ofrece la mejor calidad por GB de VRAM en GPUs de 24-32 GB o en un Mac con 32 GB unificados.
40 GB o más: modelos 70B cuantizados
Si dispones de una GPU de gama alta con 40 GB o más, puedes ejecutar modelos de 70B en cuantización Q4_K_M. Ahí entran razonamiento más profundo y mejores resultados en tareas complejas, aunque a costa de velocidad de generación inferior si el modelo no cabe entero en memoria.
Primeros pasos: pull, run y chat desde el terminal
Descargar un modelo es tan sencillo como pedírselo a Ollama. Por ejemplo, para Llama 4 Scout 8B:
ollama pull llama4-scout:8bY para abrir un chat interactivo directamente en el terminal:
ollama run llama4-scout:8bA partir de ahí puedes conversar como con cualquier chatbot, pero con todo el tráfico local. Para salir del chat, escribe /bye.
La API REST en localhost:11434 y el SDK de OpenAI
Lo que convierte a Ollama en una pieza de desarrollo es su API REST, que escucha en localhost:11434 y es compatible con el SDK de OpenAI. Para usarla desde Python solo tienes que apuntar la base URL a tu máquina:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3-coder:30b",
messages=[{"role": "user", "content": "Explica qué es un Modelfile"}],
)
print(resp.choices[0].message.content)Salida JSON estructurada y tool calling
La API soporta salida JSON estructurada, lo que permite integrar el modelo en flujos de datos sin parsear texto libre, y tool calling, para que el LLM invoque funciones de tu aplicación. Con eso puedes construir agentes locales que consulten bases de datos, ejecuten comandos o rellenen formularios, todo sin salir de tu red.
Modelfiles: crea tus propios modelos
Los Modelfiles permiten definir variantes de un modelo: cambiar el prompt del sistema, ajustar la temperatura o fijar parámetros de contexto. Un ejemplo mínimo:
FROM llama4-scout:8b
SYSTEM "Eres un asistente experto en Laravel. Responde siempre en español."
PARAMETER temperature 0.3Se construye con ollama create mi-asistente -f Modelfile y ya puedes usarlo con ollama run mi-asistente.
Interfaz web: Open WebUI en Docker
Si prefieres una experiencia tipo ChatGPT en el navegador, Open WebUI se conecta a Ollama y se despliega en un minuto con Docker:
docker run -d -p 3000:8080 \
-v open-webui:/app/backend/data \
--add-host=host.docker.internal:host-gateway \
--name open-webui ghcr.io/open-webui/open-webui:mainCon la interfaz en localhost:3000, eliges el modelo, gestionas conversaciones e incluso compartes chats. La combinación Ollama más Open WebUI equivale a tener un ChatGPT privado en casa.
Problemas comunes: GPU que no se usa y errores 500
El problema más habitual es que Ollama use la CPU en lugar de la GPU. En Linux, revisa que el driver de NVIDIA esté instalado y que el paquete nvidia-container-toolkit esté presente si usas contenedores. Los errores 500 al generar suelen deberse a falta de memoria: baja el contexto con PARAMETER num_ctx en el Modelfile o elige un modelo más pequeño. Consultar ollama ps ayuda a ver qué modelo está cargado y cuánta memoria ocupa.
Conclusión
Con Ollama, correr IA local en 2026 es cuestión de minutos: instalas, eliges el modelo según tu VRAM, chateas desde el terminal o desde Open WebUI y, si lo necesitas, integras la API en tus propios proyectos. Privacidad, cero coste por token y funcionamiento offline. Si te ha gustado esta guía, sigue leyendo el blog para más tutoriales de desarrollo y tecnología.