GLM-5.3-Flash: el primer multimodal nativo de Z.ai con 18B activos
Z.ai lanzó GLM-5.3-Flash, el primer modelo multimodal nativo de la serie GLM-5: 320B de parámetros con solo 18B activos, 1M de contexto y pesos abiertos bajo licencia MIT.
Qué es GLM-5.3-Flash
Presentado el 26 de agosto de 2026, GLM-5.3-Flash es la evolución oficial del preview que el laboratorio chino mostró como Ox Alpha. Según sus creadores, supera a GLM-5.2 en benchmarks y tareas reales a una décima del precio, y se acerca a Claude Opus 4.8 en coding y tareas de agentes. Es el primer modelo de la serie que nace multimodal: entiende imágenes, video y archivos desde el arranque, sin módulos acoplados después.
La arquitectura de GLM-5.3-Flash
Es la primera vez que un modelo frontier open-source adopta una arquitectura híbrida que combina atención sparse y atención lineal. Frente a GLM-5.3, esto reduce el cómputo de atención en 3.01 veces y el tamaño de la caché KV en 4.44 veces, lo que abarata bastante el servicio de contexto largo sin sacrificar precisión. El modelo usa además conexiones hiper-restrictivas con manifold (mHC) para mejorar la eficiencia de escalado, y se entrenó sobre un corpus multimodal de pre-training de 30T tokens. Z.ai lo opera a escala en chips de IA chinos.
Coding visual nativo
Lo distintivo de GLM-5.3-Flash es que la visión entra en el bucle de desarrollo: el modelo observa interfaces, resultados renderizados y feedback de interacción, y prueba y corrige su trabajo de forma continua. Sirve para frontend, creación de juegos e incluso escenas Blender 3D, coordinando código, navegador y entornos gráficos (BUA y CUA) sin cambiar de herramienta.
Más allá del código: trabajo profesional
La multimodalidad también aterriza en tareas de oficina y análisis. GLM-5.3-Flash puede armar documentos PPTX, PDF, DOCX y XLSX revisando visualmente desbordes, desalineaciones y estilos inconsistentes; cubre flujos completos de investigación financiera con modelos auditables y citas de fuente; entiende video largo para edición con subtítulos y atribución de hablantes; y crea escenas 3D editables iterando sobre renders desde cámaras fijas. El thinking no se puede desactivar, e incluye function calling, contexto caching y salida estructurada.
Disponibilidad
GLM-5.3-Flash ya está disponible en la API de Z.ai con ventana de contexto de 1M de tokens, y es el modelo principal del nuevo GLM Coding Plan, con triple de cuota que GLM-5.3. Los pesos están en Hugging Face bajo licencia MIT y se puede servir localmente con SGLang, vLLM, TokenSpeed y KTransformers.
Conclusión
Con GLM-5.3-Flash, Z.ai apuesta por la eficiencia: un modelo de 18B activos con capacidades de frontier a precio Flash. El lanzamiento coincide con el de Qwen3.8-Flash-Next, otra señal de que la carrera de 2026 se juega en el costo por token.