El precio de la inteligencia artificial acaba de imprimir un nuevo bajo. El V4-Flash de DeepSeek, lanzado oficialmente el viernes, cuesta aproximadamente tres centavos para correr a través de una batería estándar de pruebas de referencia, según la firma de investigación de San Francisco Análisis Artificial. Moonshot El Kimi K3 de AI cuesta 86 centavos; el GPT-5.6 Sol de OpenAI, $1.86; y Claude Fable 5 de Antrópico, el modelo de primera línea de la industria, $3.15. En términos realizados, el modelo chino es más de 100 veces más barato que el buque insignia estadounidense, según Reuters.
Sarah Rogers / MITTR ← Foto Getty
V4-Flash es el modelo más barato conocido del mundo, y por un amplio margen. La figura es aún más llamativa debido a un detalle enterrado en el escrito de la firma: V4-Flash es inusualmente verbosa. Consume tokens fuertemente y aún aterriza en tres centavos. El precio per-token está haciendo todo el trabajo.
La misma firma abastece a la caveat. V4-Flash marca 50 de 100 en el Índice de Inteligencia de Análisis Artificial, un compuesto de nueve puntos de referencia que abarcan tareas de codificación, razonamiento y trabajo. Eso vincula a Gemini 3.6 Flash de Google y lo pone un punto detrás de Muse Spark 1.1 de Meta y GLM-5.2 de Zhipu. El Kimi K3 de Moonshot cumple 57 años, mientras que Claude Opus 5 y Fable 5 de Anthropic, junto con el GPT-5.6 de OpenAI, marcan al menos nueve puntos más alto.
Dicho esto - V4-Flash patea el culo masivo en tareas rutinarias, pero los modelos fronterizos todavía poseen el levantamiento pesado. En trabajos difíciles, multi-pasos, pequeñas brechas de confiabilidad en cada paso compuesto en enormes diferencias de extremo a extremo. Esencialmente ese es el estado actual de juego para los precios fronterizos. Pero para el volumen de rutina que compone la mayor parte del tráfico de producción - resumen, código caldera, y automatización de back-office - V4-Flash es donde está.
China Knife Fight
La impresión de 3 centavos de V4-Flash es el cuarto tiro en una barraca de 18 días: los laboratorios de AI de China se están cortando para la cuota doméstica, y la caída está replanteando el mercado modelo en todas partes. El 16 de julio, Moonshot envió Kimi K3, un modelo de 2,8 millones de metros que rápidamente tomó la ranura número uno en el código Frontend de Arena de Fable 5 y GPT-5.6 Sol. El 19 de julio, Alibaba precipitó una vista previa de Qwen3.8-Max en el escenario en la Conferencia Mundial de AI en Shanghai. No había precios, ninguna tarjeta modelo, y su reclamación de ranking "segundo sólo a Fable 5" descansaba en las evaluaciones internas de Alibaba.
El 27 de julio, Moonshot respondió con pesos completos de código abierto K3, la mayor liberación de peso abierto en la historia. DeepSeek envió V4-Flash el 31 de julio. Luego el 3 de agosto - lunes, la misma mañana la historia de Reuters corrió - Alibaba tomó Qwen3.8-Max a disponibilidad general: 2.4 billones de parámetros totales, 95 mil millones de parámetros activos, una ventana de contexto de un millón de toneladas, y precios planos de $2 por millón de fichas de entrada y $6 por millón de fichas de salida, sin recargo de texto largo.
La liberación de Qwen aterrizó rápidamente en el No 4 en el Frontend Code Arena con 1,668 puntos - un punto detrás de Claude Opus 5 en alto esfuerzo, ocho detrás de Kimi K3, y por delante de ambos Fable 5 a 1,630 y GPT-5.6 Sol a 1,620. De los cinco modelos que Arena identifica en la frontera de Pareto de rentabilidad, cuatro son chinos: Kimi K3, Qwen3.8-Max, GLM-5.2 y V4-Flash. La única entrada americana, Opus 5, ocupa la punta cara, defendida por 37 puntos Elo.
Qwen3.8-Max de @Alibaba Qwen ha redefinido la frontera de Pareto de rentabilidad en Frontend Code Arena, con precios de $2 por entrada MToken y $6 por salida MToken.
Principales modelos en la frontera de Pareto:
- Claude-Opus-5
- Kimi-K3
- Qwen3.8-Max
- GLM-5.2
- DeepSeek-V4-Flash
Felicitaciones... https://t.co/3S4tW1KmlI pic.twitter.com/CiWU7Hh4BD
— Arena.ai (@arena) 3 de agosto de 2026
La propia tabla de referencia de Alibaba es más dulce. Qwen3.8-Max edges Fable 5 y Opus 4.8 en Terminal-Bench, 86.6 a 84.6, mientras que sigue mal en la ingeniería de repositorio duro: puntua 67.7 en SWE-bench Pro contra Fable 5's 80.0. Se ha ido la fosa de codificación juzgada por las preferencias. La fosa profunda permanece intacta, por ahora.
Todo esto plantea una pregunta más básica: ¿quién paga por inferencia de tres centavos?
Hasta esta primavera, DeepSeek nunca había tomado dinero exterior. El fundador Liang Wenfeng arrancó la compañía a través de su fondo de cuarentena, High-Flyer. A finales de mayo, DeepSeek cerró su primera ronda externa - más de 50 mil millones de yuanes, o aproximadamente 7,4 mil millones de dólares, en una valoración superior a 50 mil millones de dólares - como informó por primera vez La Información.
La estructura de la ronda es inusual. Los inversores comerciales, presuntamente dirigidos por Tencent y CATL, adquirieron una asociación limitada controlada por Liang, sin derechos de voto y un cierre de cinco años. Exactamente una parte recibió la equidad directa y un voto: el Fondo Nacional de Inversión de la Industria AI respaldado por el Estado de China. En pocas semanas, DeepSeek estaba en conversaciones para una ronda de seguimiento a aproximadamente $71 mil millones, con los ingresos asignados para centros de datos y chips.
Añada el 75% de descuento de API que la empresa hizo permanente a principios de este año, y el arreglo comienza a parecerse a la política industrial realizada a través de una API: capital privatizado estatal subescribir fichas de bajo costo para capturar cuota global. Está funcionando: en junio, DeepSeek representó casi el 23% de las decenas de trillones de fichas que fluyen por la puerta de IA empresarial de Vercel, en comparación con el 32% de Antrópico.
Mientras tanto...
Como hemos notado (y ahora Wall Street), el índice de gastos de Token - un promedio ponderado en el uso de lo que el mercado paga por millón de fichas, mezclado a través de APIs de frontera y plataformas de peso abierto - superó el 2.0 en mayo después de casi duplicar su lanzamiento de diciembre, y ahora se desliza más abajo.
El estratogista Andreas Steno Larsen lo llamó el que todo el mundo debería estar mirando, advirtiendo que la debilidad sostenida en los precios de token terminaría con los intercambios de memoria, hardware y centro de datos para este ciclo. El índice imprimió 1.3394, aproximadamente un tercio por debajo de su nivel de mayo. Bloomberg señaló la escalada a principios de julio como evidencia de que los proveedores de IA estaban perdiendo poder de precios con clientes cada vez más sensibles a los costos; el propio comentario de Silicon Data lo interpretó como el uso que se desvía hacia modelos de peso abierto.
También relevante - el retroceso a los centros de datos en medio de un boom capex que corre al norte de $700 mil millones. Como informamos el mes pasado, de las protestas del 18 de julio en todo el país organizadas por el veterano del Partido Tea Amy Kremer Humans First to the widening fracture inside the Republican coalition over land, water, and power - domestic politics has entered the chat, something Beijing does not have to deal with - so now they've got a three-cent benchmark funded on terms no Western lab can match. A través de liberaciones de peso abierto, también es portátil en el silicio americano, donde los proveedores de inferencia de EE.UU. servirán felizmente modelos chinos en los márgenes de productos básicos. Los controles de exportación no pueden contener un conjunto de pesos sobre el torrente.
El modelo para ver es V4-Pro, el sistema más pesado DeepSeek ha confirmado sin nombrar una fecha de liberación. Flash a tres centavos presiona los niveles de presupuesto en OpenAI y Google. Si Pro aterriza cerca de puntajes fronterizos a precios de DeepSeek, los últimos 37 puntos Elo - y la prima de frontera que OpenAI y Anthropic cobran para subescribir la construcción - estarán directamente en juego.
Tyler Durden
Mon, 08/03/2026 - 18:20