Muse Glimmer: el nuevo modelo local de Meta para agentes de IA siempre activos
Meta ha liberado los pesos de Muse Glimmer, un modelo abierto de 30.000 millones de parámetros diseñado para agentes locales que funcionan de forma continua. Corre en un solo GPU de consumo y, según la compañía, mantiene un rendimiento cercano al de la frontera en tareas agénticas gracias a la destilación desde modelos mucho más grandes.
Qué es Muse Glimmer
Muse Glimmer llegó el 10 de agosto de 2026 de la mano de Meta Superintelligence Labs, con licencia Apache 2.0. Es un modelo denso: utiliza los 30B parámetros en cada inferencia, a diferencia de los modelos de mezcla de expertos que activan solo un subconjunto. Está optimizado para casos de uso como agentes locales, llamadas a funciones, programación asistida y evaluación de modelos (LLM-as-a-judge).
La apuesta de Meta es clara: llevar la IA a los dispositivos para que funcione sin conexión ni infraestructura en la nube, en cualquier momento y lugar.
Cómo se entrenó
En lugar de pre-entrenar sobre datos brutos de internet, el modelo se entrenó con destilación logit sobre las salidas de Muse Spark, el modelo más grande de la misma familia. Después recibió una fase intermedia con datos de contexto largo y orientados a agentes, y un post-entrenamiento que combina fine-tuning supervisado, destilación on-policy y aprendizaje por refuerzo en dominios generales, de razonamiento, código y agentes.
Pensado para agentes
Ejecución de tareas de principio a fin
El modelo está evaluado en benchmarks de tareas completas como DeepSearch QA, MCP-Atlas, tau-Bench y SWE-Bench, que miden su capacidad para trabajar dentro de scaffolds, escribir y depurar código, y resolver peticiones multiturno desde el inicio hasta el final.
Recuperación de errores
Una de sus señas de identidad: cuando una llamada a herramienta falla o devuelve algo inesperado, el modelo diagnostica el error e intenta de nuevo en lugar de detenerse. A esto se suma razonamiento multi-paso de horizonte largo, entrada multimodal (texto e imágenes intercaladas), compatibilidad con orquestadores como OpenClaw y entrenamiento en más de 100 idiomas.
Optimizado para hardware local
En precisión completa, 30B parámetros necesitarían más de 55 GB de memoria, demasiado para un GPU de consumo. Meta usa cuantización a unas 4 bits que reduce el modelo de lenguaje a menos de 20 GB, dejando sitio para la caché KV, el codificador de percepción y el modelo auxiliar de decodificación especulativa dentro de un presupuesto de 24 o 32 GB.
Decodificación especulativa
Para ganar velocidad, Muse Glimmer incluye un drafter ligero basado en DFlash que propone bloques de tokens completos; el modelo principal los verifica en paralelo y corrige los erróneos. El resultado es una generación bastante más rápida con la misma calidad de salida, según las mediciones de Meta en MacBook M4-Max, M5-Max y RTX 5090.
Disponibilidad
Los pesos están en Hugging Face desde el primer día. En los próximos días llegarán integraciones con Ollama, LM Studio, Unsloth, llama.cpp, ExecuTorch, MLX, vLLM y SGLang, además de servicios como Together AI, Fireworks AI y OpenRouter. La cuantización a 4 bits permite ejecutarlo en GPUs como la RTX 3090, RTX 4090 o AMD 9700.
La competencia no descansa
Meta posicionó a Muse Glimmer frente a Qwen3.6-27B y Gemma4-31B, a los que supera en varias pruebas. Pero cuatro días después, Alibaba respondió con Qwen3.8-27B, que supera a Muse Glimmer en todas las pruebas donde ambos fueron evaluados, como Terminal Bench 2.1 (73.0 frente a 51.7).
Conclusión
Muse Glimmer representa un paso importante en la dirección de los agentes locales: un modelo abierto que cabe en un GPU de consumo, entiende imágenes, recupera errores y ejecuta tareas largas sin depender de la nube. La carrera por el mejor modelo local acaba de empezar, y la competencia entre Meta y Alibaba está beneficiando a los desarrolladores.