Qwen 3.8-Max: la IA china que programa durante 16 días y desafía a OpenAI y Anthropic

Alibaba quiere competir en la élite de la IA con un modelo abierto de gran escala

Qwen 3.8-Max incorpora 2,4 billones de parámetros, un millón de tokens de contexto y la capacidad de mantener proyectos complejos durante más de dos semanas, según Alibaba.

📌 En resumen

  • Alibaba presenta Qwen 3.8-Max con 2,4 billones de parámetros.
  • El modelo puede mantener tareas de programación durante 16 días, según la compañía.
  • Supera a varios modelos de OpenAI y Anthropic en algunos benchmarks, aunque no en todos.
  • Los pesos completos se publicarán como código abierto en Hugging Face y ModelScope.

Alibaba ha anunciado Qwen 3.8-Max, la nueva generación de su familia de modelos de inteligencia artificial con la que pretende competir directamente frente a las propuestas más avanzadas de OpenAI, Anthropic y Google. El modelo combina una arquitectura de 2,4 billones de parámetros, capacidades multimodales y una ventana de contexto de hasta 1.000.000 de tokens.

Qwen 3.8-Max es un modelo de arquitectura Mixture-of-Experts (MoE) que activa únicamente una pequeña parte de sus parámetros durante cada inferencia. Según Alibaba, este diseño permite reducir el coste computacional sin renunciar a un rendimiento competitivo frente a los modelos comerciales más avanzados.

Además, la compañía ha confirmado que liberará los pesos completos del modelo la próxima semana a través de Hugging Face y ModelScope, facilitando su despliegue en infraestructuras privadas y su adaptación para proyectos empresariales o de investigación.

2,4 billones de parámetros, pero solo 95.000 millones activos

Qwen 3.8-Max se basa en la arquitectura Qwen 3.5 y utiliza un diseño Mixture-of-Experts (MoE), una aproximación que se ha convertido en la tendencia dominante entre los modelos de mayor tamaño.

Aunque almacena 2,4 billones de parámetros, durante cada solicitud solo activa aproximadamente 95.000 millones. Esto reduce significativamente la carga de procesamiento respecto a un modelo denso equivalente, mejorando la eficiencia y acelerando las respuestas.

El modelo también admite conversaciones de hasta un millón de tokens, lo que facilita el análisis de grandes repositorios de código, documentación técnica o proyectos de larga duración sin perder contexto.

Una IA capaz de programar durante 16 días seguidos

Uno de los anuncios más llamativos de Alibaba es la capacidad de Qwen 3.8-Max para mantener proyectos de desarrollo durante periodos muy prolongados.

Como demostración, la compañía asegura que el modelo desarrolló de forma completamente autónoma el proyecto Oh My CLI, un agente para terminal orientado a la gestión de archivos y comandos.

Durante 16 días consecutivos, la IA realizó:

  • 265 commits.
  • 127 pull requests.
  • 151 incidencias resueltas.

Según Alibaba, todo este trabajo se completó sin intervención humana, manteniendo el contexto del proyecto durante todo el proceso.

También mejoró un estudio científico

La compañía presentó otra demostración centrada en investigación académica.

Tras reproducir un trabajo sobre selección de datos para entrenar modelos de inteligencia artificial, Qwen 3.8-Max intentó optimizar los resultados originales.

Durante casi cinco días de ejecución autónoma:

  • Escribió alrededor de 7.600 líneas de código.
  • Ejecutó 33 entrenamientos sobre GPU.
  • Mejoró en 2,7 puntos los resultados obtenidos originalmente en el examen matemático AIME24.

Cómo se compara con OpenAI, Anthropic y Google

Alibaba sostiene que Qwen 3.8-Max supera a Claude Fable 5 y GPT-5.6 Sol en siete benchmarks relacionados con programación y capacidades generales.

La compañía también afirma liderar 36 pruebas de visión artificial y multimodalidad frente a modelos de OpenAI y Anthropic.

Entre los resultados publicados destaca:

  • 86,6 puntos en Terminal Bench 2.1.
  • 84,6 puntos obtenidos por Claude Fable 5 y Claude Opus 4.8 en la misma prueba.

Este benchmark evalúa tareas habituales para desarrolladores, como ejecutar comandos, depurar errores o completar proyectos paso a paso.

Claude sigue dominando en ingeniería de software real

No obstante, Alibaba reconoce que su modelo no lidera todas las comparativas.

En pruebas centradas en resolver incidencias reales reportadas por desarrolladores, los modelos de Anthropic mantienen una ventaja clara.

  • Claude Fable 5 obtiene 80 puntos frente a los 67,7 de Qwen 3.8-Max.
  • En FrontierSWE, Claude alcanza 88,8 puntos frente a 73,5 del modelo chino.

Por el contrario, Alibaba asegura obtener mejores resultados en tareas relacionadas con conocimiento médico, razonamiento jurídico y determinados escenarios multimodales.

Gemini mantiene ventaja en vídeo

Google continúa liderando las pruebas centradas en comprensión de vídeo con Gemini 3.1 Pro.

Sin embargo, Alibaba sostiene que esa diferencia se reduce e incluso desaparece cuando los modelos trabajan con vídeos mucho más largos, compuestos por múltiples escenas y secuencias complejas.

Una apuesta decidida por el código abierto

Qwen 3.8-Max ya puede utilizarse mediante la plataforma QwenCloud y, en los próximos días, sus pesos completos estarán disponibles en Hugging Face y ModelScope.

Con este movimiento, Alibaba refuerza la estrategia que está siguiendo buena parte del ecosistema chino: ofrecer modelos abiertos capaces de competir con los sistemas propietarios de OpenAI y Anthropic, permitiendo además que empresas y organizaciones ejecuten la inteligencia artificial dentro de su propia infraestructura.

Aunque las cifras publicadas proceden principalmente de evaluaciones realizadas por la propia Alibaba y conviene interpretarlas junto con benchmarks independientes, Qwen 3.8-Max se perfila como uno de los lanzamientos más relevantes del año en el ámbito de la inteligencia artificial de código abierto.

Sé respetuoso con los demás usuarios y no utilices lenguaje ofensivo o discriminatorio.

Artículo Anterior Artículo Siguiente