Noticias de Tecnología 5-8 minutos

Qwen3.8-Flash-Next: el MoE abierto de 6B activos que anticipa Qwen 4

Diego Cortés
Diego Cortés
Full Stack Developer & SEO Specialist
Compartir:
Qwen3.8-Flash-Next: el MoE abierto de 6B activos que anticipa Qwen 4
Imagen generada con IA

Alibaba abrió los pesos de Qwen3.8-Flash-Next, un modelo MoE multimodal de 125B de parámetros con solo 6B activos por token que funciona como adelanto oficial de la arquitectura que usará Qwen 4.

Qué es Qwen3.8-Flash-Next

Lanzado el 26 de agosto de 2026, Qwen3.8-Flash-Next juega el mismo papel que Qwen3-Next tuvo para la serie 3.5: abrir temprano los cambios de arquitectura para que la comunidad los examine antes de que la familia Qwen 4 completa se construya sobre ellos. El modelo suma 51B de parámetros en embeddings n-gram y 4B en un módulo MTP, con 48 capas y 512 expertos de los que se activan 10 enrutados más 1 compartido.

La arquitectura de Qwen3.8-Flash-Next

La novedad se concentra en cuatro frentes. En atención, combina Gated DeltaNet (GDN) con Qwen Sparse Attention (QSA): en lugar de seleccionar tokens individuales, QSA indexa el contexto por micro-bloques con un indexador comprimido, lo que reduce bastante el costo de atención en secuencias largas. En residuos, el Gated Residual amplía el stream residual a 4 ramas con compuertas dinámicas de lectura y escritura. El embedding por n-gram consulta una tabla de 20 millones de bigramas y trigramas para escalar capacidad con muy poco cómputo adicional, y además puede descargarse a memoria del host. En optimización, la receta combina los optimizadores Muon y AdamW con scaling laws recalculadas, eliminando el warmup de batch size.

El contexto nativo es de 262.144 tokens, extensible hasta 1 millón, y el modelo es multimodal: incluye un encoder de visión para entrada de imágenes.

Resultados frente a modelos más grandes

Con solo 6B activos, Qwen3.8-Flash-Next rinde por encima de modelos mucho más caros de servir. En DeepSWE 1.1 marca 58.7, frente a 54.4 de DeepSeek-V4-Flash-0731 y 16.5 de Qwen3.7-Plus; en SWE-bench Pro llega a 62.5, superando a Qwen3.7-Plus (55.8) y a Claude Opus 4.6 (53.4); y en SWE-bench Multilingual alcanza 81.0. En tareas de agente multimodal también destaca, con AndroidWorld 84.5 y Vision2Web 64.0.

Eficiencia y costo de entrenamiento

Alibaba reporta que entrenar Qwen3.8-Flash-Next costó aproximadamente la novena parte de Qwen3.7-Plus, con capacidades superiores en coding y tareas de oficina. La versión de producción, Qwen3.8-Flash, añade 1M de contexto por defecto y herramientas integradas listas para usar.

Disponibilidad y ecosistema

Los pesos están publicados en Hugging Face y ModelScope con licencia qwen-community-1.0. Se puede servir con Transformers, llama.cpp, Unsloth, SGLang, vLLM y TokenSpeed, y ya está disponible en QwenWork (modo Standard), en la API de QwenCloud compatible con OpenAI y Anthropic, y en el agente de terminal Qwen Code.

Conclusión

Qwen3.8-Flash-Next confirma la apuesta de Alibaba por modelos abiertos mucho más eficientes y, de paso, deja ver qué esperar de Qwen 4. Si te perdiste el lanzamiento del Qwen3.8-27B, conviene revisar esa noticia para completar el panorama de la serie.

Categorías