Deepseek impulsa la competencia en IA de bajo costo con un modelo Flash más potente

Deepseek ha lanzado una versión actualizada de su modelo de IA económico, V4 Flash “0731”, y las cifras citadas en la fuente proporcionada sugieren un cambio significativo en la competencia entre precio y rendimiento para los modelos de lenguaje grandes de menor costo. Según los datos de benchmark mencionados en el informe, el modelo gana diez puntos en el Artificial Analysis Intelligence Index, alcanzando una puntuación de 50. Eso lo deja un punto por detrás de GPT-5.6 Luna de OpenAI, mientras que, según la misma fuente, opera con un costo por tarea aproximadamente 60 por ciento menor.

Esa combinación es lo que hace notable el lanzamiento. En el mercado de la IA, la distancia entre la capacidad de frontera y el despliegue asequible se ha convertido en uno de los campos de batalla comerciales más importantes. Un modelo no necesita liderar todos los benchmarks de forma absoluta para cambiar el mercado. Si se acerca lo suficiente en calidad mientras reduce de forma material el costo operativo, puede alterar las decisiones de los desarrolladores, las compras empresariales y la economía de escalar productos de IA a grandes volúmenes de solicitudes.

Por qué destaca esta actualización

El informe suministrado presenta V4 Flash “0731” como una actualización importante y no como un ajuste menor. Supuestamente, la puntuación del modelo en el Artificial Analysis Intelligence Index sube de 40 a 50, un salto considerable para un modelo ya situado en el segmento económico. También se describe que mejora en todas las categorías evaluadas frente a la versión anterior lanzada en abril de 2026.

Las mayores mejoras se reportaron en tareas agentic, una categoría especialmente importante porque muchas implementaciones prácticas de IA están pasando de chats de un solo turno al uso de herramientas, la ejecución de flujos de trabajo y la asistencia extendida de múltiples pasos. Si un modelo de menor costo acorta la distancia en esa área, se vuelve más viable para cargas de trabajo reales de oficina y operaciones, no solo para interacciones ligeras de consumo.

La fuente también cita mejoras en GDPval, un benchmark diseñado para evaluar modelos en trabajo de oficina complejo del mundo real. Allí, se dice que Deepseek V4 Flash “0731” pasa de 1,189 a 1,559 puntos Elo. Ese es un aumento importante dentro del marco proporcionado por el artículo y refuerza la afirmación más amplia de que la actualización no se limita a una sola categoría estrecha de benchmark.

Otra mejora práctica mencionada en la fuente es una menor frecuencia de alucinaciones. Para desarrolladores y compradores, eso importa al menos tanto como las ganancias en benchmarks brutos. Un modelo barato que produce respuestas inventadas con frecuencia puede volverse caro una vez que se añaden validación, lógica de reintentos y revisión humana. Las tasas reducidas de alucinación, si se mantienen en producción, pueden tener un impacto directo en la calidad del despliegue y en el costo total de propiedad.

La economía puede ser la historia más grande

El precio es central en el encuadre del artículo. El informe dice que el modelo de Deepseek cuesta alrededor de 60 por ciento menos por tarea que GPT-5.6 Luna de OpenAI, incluso después de que OpenAI ya hubiera recortado el precio de Luna en un 80 por ciento. También señala un descuento de caché del 98 por ciento por parte de Deepseek, frente al 90 por ciento estándar de la industria, como una razón importante de la ventaja. Además, el nuevo modelo supuestamente usa 12 por ciento menos tokens que su predecesor.

Esos detalles importan porque la economía de la IA está cada vez más determinada por los patrones de uso, no solo por los precios de lista. Los descuentos de caché recompensan los prompts repetidos y los flujos de trabajo predecibles. Un menor uso de tokens reduce al mismo tiempo el costo y la latencia. En conjunto, esos factores pueden hacer que un modelo parezca mucho más barato en la práctica de lo que sugeriría una simple comparación de precios de entrada y salida.

The Artificial Analysis Intelligence Index shows Deepseek V4 Flash "0731" scoring 50 points after its update, nearly matching OpenAI's GPT-5.6 Luna while claiming the top spot for price-to-performance ratio. | Image: Artificial Analysis
The Artificial Analysis Intelligence Index shows Deepseek V4 Flash "0731" scoring 50 points after its update, nearly matching OpenAI's GPT-5.6 Luna while claiming the top spot for price-to-performance ratio. | Image: Artificial Analysis

Para los equipos que despliegan agentes, asistentes de programación, ampliación de búsqueda o herramientas internas de conocimiento, este tipo de estructura de precios puede cambiar de forma significativa las decisiones de arquitectura. Un modelo un poco más débil en un índice pero mucho más barato de ejecutar suele convertirse en el caballo de batalla por defecto para tareas de alto volumen, dejando el modelo más caro solo para los casos más difíciles.

Los pesos abiertos y el contexto largo añaden presión

La fuente dice que la arquitectura sigue sin cambios, con 284 mil millones de parámetros totales, 13 mil millones de parámetros activos y una ventana de contexto de un millón de tokens. El informe también señala que los pesos del modelo están disponibles en Hugging Face bajo una licencia MIT.

Esa combinación refuerza la posición estratégica de Deepseek. Las ventanas de contexto largas siguen siendo atractivas para trabajos intensivos en documentos, y una licencia MIT reduce la fricción para la adopción, la experimentación y la integración comercial. En el mercado actual de IA, los términos de licencia pueden ser casi tan importantes como las puntuaciones de benchmark. Una licencia permisiva amplía el grupo de empresas y desarrolladores dispuestos a construir sobre un modelo, especialmente cuando la sensibilidad al costo ya es alta.

El hecho de que Deepseek haya mantenido la misma arquitectura central y aun así haya registrado grandes mejoras en benchmarks, según el informe, también envía una señal sobre dónde está rindiendo el esfuerzo de optimización. Las mejoras no siempre requieren una familia de modelos completamente nueva. En algunos casos, las actualizaciones de entrenamiento, los métodos de postentrenamiento y el trabajo de eficiencia pueden producir un salto suficiente como para reposicionar una línea existente frente a la competencia.

Qué significa esto para el mercado

La conclusión más importante no es que una tabla de clasificación de benchmarks haya cambiado por un punto. Es que el segmento económico de la IA se está volviendo más competitivo, más capaz y más importante estratégicamente. El mercado de modelos premium sigue siendo relevante, pero muchas implementaciones reales se deciden en la zona intermedia, donde la calidad es suficiente y los costos de escala dominan.

Si las afirmaciones de benchmark proporcionadas se traducen en un rendimiento real más amplio, Deepseek ha fortalecido su caso como un contendiente serio en ese segmento. La fuente describe explícitamente al modelo actualizado como líder en relación precio-rendimiento en el índice citado. Ese tipo de posicionamiento puede impulsar la adopción entre creadores sensibles al costo, especialmente aquellos que diseñan sistemas que dependen de inferencia repetida a gran volumen.

Para los competidores, incluido OpenAI, la implicación es directa: la presión sobre los precios no se está relajando, y alcanzar paridad en benchmarks a menor costo puede cambiar rápidamente la conversación sobre qué modelo es el predeterminado práctico. Para los compradores, el lanzamiento es otro recordatorio de que el centro de gravedad en la IA ya no es solo quién tiene el buque insignia más potente. Cada vez más, se trata de quién puede ofrecer inteligencia utilizable a un precio que escale.

Puntos clave

  • Se informa que Deepseek V4 Flash “0731” subió a 50 en el Artificial Analysis Intelligence Index, frente a 40.
  • La fuente dice que el modelo queda un punto por detrás de GPT-5.6 Luna de OpenAI, mientras cuesta aproximadamente 60 por ciento menos por tarea.
  • Las mejoras en tareas agentic, el menor uso de tokens y un descuento de caché del 98 por ciento refuerzan su atractivo en el mercado económico.

Este artículo se basa en el reportaje de The Decoder. Leer el artículo original.

Originally published on the-decoder.com