Qwen3.8-27B: el nuevo modelo abierto de Alibaba que compite con modelos mucho más grandes
Alibaba ha liberado los pesos de Qwen3.8-27B, su nuevo modelo abierto de 27.000 millones de parámetros con visión nativa y licencia Apache 2.0. Diseñado para ejecutarse en hardware local, se atreve a competir con modelos mucho más grandes en código y trabajo de oficina, y en muchas pruebas sale ganando.
Qué es Qwen3.8-27B
Qwen3.8-27B es el miembro compacto de la generación Qwen3.8, presentado el 14 de agosto de 2026. Se trata de un modelo denso (sin mezcla de expertos) que integra texto, imagen y vídeo de forma nativa, construido sobre la base arquitectónica de Qwen3.5 con una combinación híbrida de atención lineal Gated DeltaNet y atención clásica, además de predicción multitoken. Esa mezcla busca máxima eficiencia en un solo GPU sin renunciar a calidad.
El lanzamiento llegó acompañado de los pesos abiertos de Qwen3.8-2.4T-A95B, la versión Max con mezcla de expertos pensada para cargas agénticas más pesadas. Alibaba cubre así los dos extremos del mercado en un solo movimiento: un modelo ligero para ejecución local y uno de escala frontera con pesos abiertos desde el primer día.
Características principales
Multimodal nativo
El modelo entiende imágenes y vídeos de hasta horas de duración: diagramas científicos, documentos, capturas de pantalla y escenas reales. En pruebas visuales como MathVision alcanza 90.0 (94.6 con formato de respuesta fijo) y en OmniDocBench 1.5 llega a 91.1, por delante de su predecesor Qwen3.6-27B.
Contexto de 262K, ampliable a 1M
La ventana nativa es de 262.144 tokens y puede extenderse hasta un millón aplicando escalado YaRN. Alibaba recomienda ajustar el factor de escalado según la longitud típica de cada caso de uso, porque el YaRN estático puede afectar al rendimiento en textos cortos.
Control de razonamiento flexible
El modo de pensamiento viene activado por defecto y puede desactivarse por petición. El parámetro reasoning_effort permite ajustar la profundidad (xhigh, medium, low) y preserve_thinking conserva el rastro de razonamiento entre mensajes, algo especialmente útil en agentes, donde además mejora el uso de la caché KV.
Resultados en benchmarks
Frente a Muse Glimmer-30B
La comparación más comentada es con Muse Glimmer, el modelo local de 30B que Meta lanzó días antes. En todas las pruebas donde ambos fueron evaluados, Qwen3.8-27B gana: Terminal Bench 2.1 (73.0 frente a 51.7), IFBench (79.5 frente a 77.0) y GPQA Diamond (89.2 frente a 83.5). Meta no reportó resultados en benchmarks más duros como DeepSWE 1.1, JobBench, NL2Repo-Bench o LiveCodeBench v6, lo que limita la comparación global.
Frente a modelos mucho más grandes
Contra Qwen3.7-Plus, un modelo propietario de mayor escala, el 27B gana en la mayoría de las filas: SWE-bench Pro 61.7 frente a 57.6, QwenSWEBench 79.0 frente a 59.2 y Agents' Last Exam (20.4 frente a 13.2 en Pass@1). Contra Opus4.6 Max el resultado es mixto: gana en SWE-bench Pro, IFBench (79.5 frente a 62.5) y LiveCodeBench v6 (90.3 frente a 88.8), pero cede en Terminal Bench 2.1 y en razonamiento científico.
El punto fuerte: trabajo de oficina agéntico
El salto más claro respecto a su predecesor está en tareas de oficina de horizonte largo. En CoWorkBench marca 70.7, por delante de Opus4.6 Max (68.2) y muy lejos de Qwen3.6-27B (61.0). En JobBench, que mide tareas profesionales completas, sube a 33.4 frente a los 21.8 de la generación anterior, casi un 50 por ciento más.
Disponibilidad y ecosistema
Los pesos están en Hugging Face y ModelScope bajo Apache 2.0, con versiones GGUF preparadas por Unsloth para ejecución local. El modelo es compatible con Transformers, vLLM, SGLang y TokenSpeed, y Qwen Cloud prepara una versión alojada con 1M de contexto por defecto y herramientas integradas.
Conclusión
Qwen3.8-27B demuestra que el tamaño no lo es todo: con 27B de parámetros y una arquitectura híbrida eficiente, supera a modelos varias veces más grandes en código y ofimática, y sus pesos abiertos lo convierten en una opción muy atractiva para ejecutar localmente. Si quieres probar modelos de última generación en tu propio hardware, este es un buen candidato para empezar.