IA
Redacción Teknosfera
IA

DeepSeek 4.1 Flash: el tapado de la IA que está transformando el sector discretamente

A pesar de sus impresionantes pruebas comparativas y de su eficiencia sin precedentes, DeepSeek 4.1 Flash no es un nombre conocido, lo que plantea dudas sobre lo que se necesita para que un modelo de peso abierto irrumpa de verdad entre la élite de la IA.

Publicado
9 de octubre de 2026
Lectura
4 min
Categorías
IA

Imagen generada con IA

¿Por qué la industria tecnológica no habla más de DeepSeek-V4.1-Flash? Este modelo multimodal Mixture-of-Experts (MoE), lanzado el 10 de septiembre de 2026, cuenta con una base de 552 000 millones de parámetros, pero solo activa 8 000 millones de parámetros para la entrada y 16 000 millones para la salida. Presenta una arquitectura Causal Encoder-Decoder (CED), admite una impresionante ventana de contexto de 1 millón de tokens e incluye comprensión visual nativa, todo bajo una licencia MIT que permite un amplio uso comercial.

La tarjeta de modelo oficial de DeepSeek y la documentación de la API pintan una imagen de un modelo notablemente eficiente y capaz. La confianza de la compañía es tal que está eliminando gradualmente su modelo V4 Pro anterior, con todas las solicitudes de deepseek-v4-pro redirigiéndose a V4.1-Flash a partir del 14 de septiembre de 2026. Esta transición se basa en la evaluación de DeepSeek de que V4.1-Flash ha "superado completamente a V4 Pro en todas las métricas clave, incluyendo rendimiento, coste, velocidad y tiempo de finalización de tareas". Este movimiento audaz destaca un cambio significativo en la estrategia de DeepSeek, enfatizando que V4.1-Flash no es solo una actualización, sino un reemplazo superior para su oferta insignia existente.

El manual de eficiencia inigualable

DeepSeek-V4.1-Flash está diseñado para la eficiencia de costes, particularmente para cargas de trabajo de agente. Su diseño MoE es crucial, ya que activa solo una pequeña fracción de sus parámetros totales por token. Esta elección arquitectónica, combinada con técnicas avanzadas de compresión de caché KV como Compressed Sparse Attention 2 (CSA2) y caché KV FP4 en formato E2M1, resulta en una huella de caché KV global de solo 890 bytes por token. Esto es aproximadamente una cuarta parte del modelo V4-Flash anterior y una asombrosa reducción de 437 veces respecto a DeepSeek V1. Dicha compresión es crítica para admitir ventanas de contexto largas de hasta 1 millón de tokens sin que la memoria KV se convierta en un cuello de botella.

El impacto real de esta eficiencia es evidente en su estructura de precios. El precio de la API de DeepSeek es drásticamente más barato que muchos modelos cerrados de frontera. Los tokens de entrada en hora punta cuestan 0,30 $ por millón y fuera de hora punta, 0,15 $, con los aciertos de caché cayendo a fracciones de céntimo (0,006 $ en hora punta, 0,003 $ fuera de hora punta). El precio de salida es de 1,20 $ por millón en hora punta y 0,60 $ fuera de hora punta. Para poner esto en perspectiva, una sesión de codificación de agente típica que consume 2 millones de tokens de entrada y 200 000 tokens de salida costaría 0,42 $ fuera de hora punta en V4.1-Flash, en comparación con 1,72 $ para la misma ejecución en V4 Pro fuera de hora punta, un ahorro de 4,1 veces, según lo informado por Flowtivity.ai. Este nivel de reducción de costes, junto con un límite de concurrencia aumentado de 500 a 2500 solicitudes paralelas, lo convierte en una opción atractiva para implementaciones a gran escala.

Dominio de los "benchmarks"... con advertencias

Imagen generada con IA

Sobre el papel, DeepSeek-V4.1-Flash ofrece resultados de "benchmarks" realmente sólidos en áreas específicas. En el "benchmark" de agente de codificación DeepSWE v1.1, obtiene un 74,2, superando por poco el 73,0 de GPT-5.6 Sol y aproximadamente igualando el 74,0 de Claude Opus 5. También lidera en CyberGym (88,1), AutomationBench (54,8) y Agent’s Last Exam (31,8), superando tanto a GPT-5.6 Sol como a Claude Opus 5 en múltiples evaluaciones clave de agentes según su tarjeta de modelo oficial. Este rendimiento es en gran medida una historia de economía de inferencia: su bajo coste de caché KV hace que releer grandes contextos sea barato, lo cual es ideal para flujos de trabajo de agente con gran cantidad de entradas.

Sin embargo, no es uniformemente dominante. DeepSeek-V4.1-Flash se queda significativamente por detrás de Claude Opus 5 en "benchmarks" de trabajo de terminal de largo plazo como Terminal-Bench 3.0 y 4.0. Las pruebas cualitativas independientes también han revelado inconsistencias, con el modelo supuestamente teniendo dificultades con tareas como una simulación de cubo de Rubik y una prueba de replicación de imágenes al estilo de Microsoft Paint. Esta brecha entre las sólidas puntuaciones de los "benchmarks" y el rendimiento variable en tareas creativas o de razonamiento espacial sirve como un recordatorio crucial de que los "benchmarks", si bien son indicativos, no capturan completamente las capacidades arbitrarias del mundo real de un modelo, como detalla MindStudio.ai.

Un nuevo paradigma de peso abierto

El lanzamiento de DeepSeek-V4.1-Flash bajo una licencia MIT es un paso significativo hacia la democratización de la IA avanzada. Este enfoque de peso abierto permite a cualquier organización autoalojar, ajustar o servir el modelo comercialmente sin regalías ni restricciones de uso. Si bien la implementación local para los consumidores actualmente requiere estaciones de trabajo multi-GPU o instancias en la nube, se espera que la comunidad de código abierto desarrolle versiones cuantificadas adecuadas para tarjetas de consumidor de alta VRAM individuales, lo que ampliará aún más su accesibilidad. Socios oficiales como WorkBuddy (incluido CodeBuddy) y OpenCode ya son totalmente compatibles con V4.1-Flash, lo que demuestra su preparación para la integración en entornos de producción.

Creemos que DeepSeek-V4.1-Flash representa una evolución crítica en el panorama de la IA. Encarna la tendencia de que la mayoría de las cargas de trabajo de IA del mundo real no exigen el modelo de frontera absoluto; en cambio, requieren algo rápido, barato y capaz.

Temas de debate

Aún no hay temas: abre el primero.

Más noticias

Redacción Teknosfera
···
IA

Las nuevas reglas de la IA: más allá del texto y de lo pasivo

Las últimas actualizaciones de GPT-6 y Claude están transformando nuestra interacción con la IA, pasando de conversaciones de texto a experiencias dinámicas e interactivas con una IA que impone límites de comportamiento.

2 min de lectura Español (España)
Redacción Teknosfera
···
IA

Búsqueda con IA en macOS: el fin del acaparamiento digital

Las nuevas herramientas de IA 'local-first' para macOS están revolucionando la gestión de archivos personales, yendo más allá de las etiquetas para una comprensión contextual que hace que las vastas bibliotecas digitales sean fácilmente navegables y buscables.

3 min de lectura Español (España)