DeepSeek V4.1 Flash supera a GPT-5.6 Sol en varias pruebas

DeepSeek ha presentado DeepSeek V4.1 Flash, un nuevo modelo de inteligencia artificial que consigue resultados superiores a GPT-5.6 Sol y Claude Opus 5 en determinadas pruebas de programación, ciberseguridad y automatización.

En resumen: DeepSeek V4.1 Flash dispone de un backbone de 552.000 millones de parámetros, activa una fracción durante cada operación y admite un contexto de un millón de tokens. Supera a sus rivales en pruebas como CyberGym y AutomationBench, aunque queda por detrás en otros benchmarks. Las cifras proceden principalmente de evaluaciones publicadas por DeepSeek y deben interpretarse dentro de su configuración concreta.

DeepSeek V4.1 Flash reduce el consumo de memoria

Uno de los principales avances del modelo se encuentra en la caché KV, la memoria que conserva información sobre los tokens ya procesados para evitar repetir cálculos durante la generación.

DeepSeek V4.1 Flash utiliza aproximadamente 890 bytes de caché KV global por token. La compañía asegura que esta cantidad es cuatro veces menor que la de DeepSeek V4 Flash y unas 437 veces inferior a la empleada por DeepSeek V1.

Esta reducción puede disminuir la memoria necesaria para trabajar con conversaciones extensas y permitir que los proveedores atiendan más solicitudes utilizando una misma infraestructura.

La mejora procede de tecnologías como Compressed Sparse Attention 2 y SWA Bounded Replay. Esta última limita la cantidad de información que debe conservarse permanentemente durante la generación.

Un backbone de 552.000 millones de parámetros

DeepSeek V4.1 Flash utiliza una arquitectura de mezcla de expertos o MoE. Su backbone contiene 552.000 millones de parámetros, pero el modelo solo activa una parte de ellos para procesar cada token.

  • 8.000 millones de parámetros activos durante el procesamiento de la entrada.
  • 16.000 millones de parámetros activos durante la generación de la respuesta.
  • 40 capas divididas entre un codificador causal y un decodificador.
  • Un millón de tokens de ventana de contexto.

El modelo incorpora además una memoria condicional Engram de 196.000 millones de parámetros. Por esta razón, el número total asociado al modelo es superior al de su backbone, aunque no todos esos parámetros intervienen en cada operación.

DeepSeek V4.1 Flash admite texto e imágenes como entrada y genera texto como salida. También permite ajustar el esfuerzo de razonamiento en una escala del 1 al 100.

Resultados frente a GPT-5.6 Sol y Claude Opus 5

Los resultados publicados muestran que DeepSeek V4.1 Flash supera a GPT-5.6 Sol y Claude Opus 5 en algunas evaluaciones relacionadas con agentes y automatización. Sin embargo, la ventaja no se mantiene en todas las pruebas.

Benchmark DeepSeek V4.1 Flash GPT-5.6 Sol Claude Opus 5
CyberGym 88,1 84,5 Sin dato
AutomationBench 54,8 45,8 50,3
Agent’s Last Exam 31,8 26,7 28,6
DeepSWE 1.1 74,2 73,0 74,0
Terminal-Bench 4.0 31,2 39,9 51,8

En CyberGym, DeepSeek obtiene 88,1 puntos frente a los 84,5 de GPT-5.6 Sol. También ocupa la primera posición en AutomationBench y Agent’s Last Exam dentro de la comparativa publicada.

Claude Opus 5 y GPT-5.6 Sol mantienen una ventaja clara en Terminal-Bench 4.0. Claude también supera a DeepSeek en pruebas como GPQA Diamond, ProgramBench, Chartography y ZeroBench.

Los benchmarks fueron ejecutados o recopilados por DeepSeek utilizando sus propios ajustes, herramientas y niveles de razonamiento. Por tanto, sus resultados no demuestran que un modelo sea superior en todos los usos posibles.

Las comparaciones de precio dependen de cada prueba

Algunas comparativas externas sitúan el coste de DeepSeek V4.1 Flash hasta 86 veces por debajo del de determinados modelos rivales. Esta diferencia no constituye una proporción universal, ya que cambia según la longitud de las respuestas, el uso de la caché, el precio aplicado por cada proveedor y el número de intentos necesarios para completar una tarea.

La API oficial de DeepSeek cobra durante el horario de tarifa normal 0,04 yuanes por cada millón de tokens almacenados en caché, 2 yuanes por cada millón de tokens de entrada sin caché y 8 yuanes por cada millón de tokens de salida.

Durante el horario reducido, esos precios bajan a 0,02, 1 y 4 yuanes, respectivamente.

También se ha difundido una comparación según la cual el modelo alcanzaría el 98 % del rendimiento de GPT-6 Astra utilizando el 1,4 % de su coste. Esa cifra corresponde a una evaluación externa y concreta, por lo que no debe interpretarse como el 98 % del rendimiento general del modelo de OpenAI.

La velocidad depende del hardware y del proveedor

DeepSeek V4.1 Flash ha sido asociado con velocidades de hasta 120 tokens por segundo en determinadas configuraciones. No obstante, la documentación oficial no establece esta cifra como un rendimiento garantizado para todas las solicitudes de la API.

La velocidad real puede variar en función del hardware, la carga del servidor, el tamaño del contexto, el esfuerzo de razonamiento, el procesamiento de imágenes y el número de usuarios atendidos simultáneamente.

DeepSeek publica el modelo con licencia MIT

DeepSeek ha publicado los pesos de V4.1 Flash con licencia MIT. Esto permite que investigadores y empresas descarguen el modelo, lo adapten y lo ejecuten en infraestructura propia, siempre que dispongan de los recursos necesarios.

El lanzamiento destaca especialmente por la reducción del consumo de caché KV y por sus resultados en varias pruebas de agentes. Aun así, la tabla completa muestra un rendimiento desigual: DeepSeek V4.1 Flash lidera algunos benchmarks, mientras GPT-5.6 Sol y Claude Opus 5 conservan la ventaja en otros.

Sé respetuoso con los demás usuarios y no utilices lenguaje ofensivo o discriminatorio.

Artículo Anterior Artículo Siguiente