Volver al blog

DeepSeek V4.1 Flash: El Modelo Open Weights Que Cuesta 40x Menos y Empata con Opus 5

Hola HaWkers, el 10 de septiembre de 2026 DeepSeek publicó el V4.1-Flash con los pesos en Hugging Face bajo licencia MIT. No es un preview, no es una API cerrada con lista de espera: es el archivo entero, 552 mil millones de parámetros en el backbone, disponible para descargar y ejecutar en tu propia infraestructura. Y el precio de la API oficial empieza en US$ 0,003 por millón de tokens de entrada con cache hit.

¿Alguna vez te detuviste a calcular cuánto gasta tu agente por mes en tokens de salida? Si la respuesta te asustó, este artículo es para ti. Vamos a mirar la arquitectura real del modelo, la tabla de precios completa con las trampas del horario pico, los benchmarks que DeepSeek divulgó y —sobre todo— cómo decidir si vale la pena migrar tu caso de uso o quedarte donde estás.

Qué Lanzó Realmente DeepSeek

El V4.1-Flash es un Mixture-of-Experts disperso y multimodal. El número que aparece en los titulares es el backbone: 552 mil millones de parámetros. Pero lo que importa para el costo de inferencia es cuánto de eso se enciende en cada token, y ahí está la jugada de la arquitectura: el modelo activa 8 mil millones de parámetros en el procesamiento de entrada y 16 mil millones en la generación de salida.

Esa división asimétrica es deliberada. Cargar contexto es barato, generar texto es caro, así que DeepSeek dimensionó cada etapa en consecuencia. El resultado es un modelo que se comporta como un gigante en calidad y como un modelo pequeño en la cuenta de cómputo por token.

Las especificaciones de contexto acompañan la ambición:

  • Ventana de contexto: 1.048.576 tokens (1M exacto, no redondeado hacia arriba en el marketing)
  • Salida máxima: 131.072 tokens en una única respuesta
  • Cache KV comprimido: la memoria de cache cayó a cerca de un cuarto de la generación Flash anterior
  • Licencia: MIT, pesos publicados en Hugging Face
  • Nombre en la API: deepseek-flash, con límite de concurrencia de 2.500 peticiones

Ese cache KV comprimido es el detalle que más importa para quien ejecuta agentes. En un workload agéntico reenvías el mismo historial decenas de veces por tarea; si el cache ocupa un cuarto de la memoria, caben muchas más sesiones simultáneas en la misma GPU.

La Tabla de Precios y la Trampa del Horario Pico

Aquí es donde la conversación se pone interesante, y donde la mayoría de las comparaciones que circulan por ahí está equivocada. DeepSeek cobra dos precios distintos según la hora del día.

Fuera de pico (off-peak):

Ítem Precio por 1M de tokens
Entrada con cache hit US$ 0,003
Entrada sin cache US$ 0,15
Salida US$ 0,60

En horario pico: exactamente el doble de cada valor de arriba.

Las ventanas de pico van de 01:00 a 04:00 y de 06:00 a 10:00 UTC, solo en días hábiles. Todo el resto —incluyendo noches, fines de semana y feriados— cae en la franja barata. Para quien está en América Latina eso es excelente: el pico de DeepSeek cae de madrugada y a primera hora de la mañana en nuestro huso, así que buena parte del horario comercial de la región ya está fuera de pico.

Comparando con Quienes Están en la Cima

Para dimensionar, los precios públicos de los competidores directos:

Modelo Entrada Entrada en cache Salida
DeepSeek V4.1 Flash (off-peak) US$ 0,15 US$ 0,003 US$ 0,60
DeepSeek V4.1 Flash (pico) US$ 0,30 US$ 0,006 US$ 1,20
GPT-5.6 Sol US$ 4,00 US$ 0,40 US$ 20,00
Claude Opus 5 US$ 5,00 US$ 0,50 US$ 25,00

La salida en horario pico del V4.1-Flash es cerca de 20 veces más barata que la de Claude Opus 5. Fuera de pico, pasa de 40 veces. En la entrada en cache la diferencia es todavía más violenta: US$ 0,003 contra US$ 0,50.

Vale registrar la salvedad honesta: la comparación no es perfectamente simétrica, porque el menor precio de DeepSeek depende de que ejecutes fuera de la ventana de pico. Si tu tráfico es síncrono y acompaña el horario comercial europeo, una parte relevante de tus llamadas va a caer en el doble del precio. Aun así, incluso al doble, la distancia frente a los modelos de frontera sigue siendo de un orden de magnitud.

Los Benchmarks: Qué Dicen los Números

DeepSeek divulgó el V4.1-Flash con 74,2 puntos en DeepSWE v1.1, contra 74,0 de Claude Opus 5 y 73,0 de GPT-5.6 Sol. Es un empate técnico con la cima de la tabla en un benchmark de ingeniería de software agéntica.

OpenDesign publicó una evaluación independiente y llegó a un número que resume bien la propuesta: el V4.1-Flash alcanzó el 98% de la nota de calidad de GPT-6 Astra por el 1,4% del costo, en el conjunto de pedidos de diseño del día a día de la empresa.

Antes de que cambies todo tu stack, dos salvedades que valen más que cualquier titular:

  1. Los benchmarks de DeepSWE los ejecutó la propia DeepSeek. Eso no los invalida, pero pone la responsabilidad de la verificación en tu regazo. Ejecuta tu propio conjunto de evaluación antes de decidir.
  2. Empatar en un benchmark no es empatar en tu caso de uso. Una diferencia de 0,2 puntos en un agregado esconde variaciones enormes por tipo de tarea.

Si quieres un panorama más amplio de cómo se comportan los modelos en el día a día de quien escribe código, ya desmenucé eso en el comparativo de los mejores asistentes de IA para programación en 2026.

Llamando al Modelo en la Práctica

La API de DeepSeek sigue el formato de Chat Completions, así que cualquier cliente compatible funciona sin adaptación. El nombre del modelo es deepseek-flash:

// Llamada directa con fetch, sin ningún SDK.
// La API acepta el formato Chat Completions, así que el payload es el mismo
// que ya usas con otros proveedores.
const resposta = await fetch('https://api.deepseek.com/chat/completions', {
  method: 'POST',
  headers: {
    'Content-Type': 'application/json',
    Authorization: `Bearer ${process.env.DEEPSEEK_API_KEY}`
  },
  body: JSON.stringify({
    model: 'deepseek-flash',
    messages: [
      { role: 'system', content: 'Respondes en español, de forma objetiva.' },
      { role: 'user', content: 'Explica qué es un Mixture-of-Experts disperso.' }
    ],
    // Con 131.072 tokens de salida disponibles, limitar aquí es una
    // protección de costo, no una limitación del modelo.
    max_tokens: 2048
  })
})

const dados = await resposta.json()
console.log(dados.choices[0].message.content)

El punto de atención es el max_tokens. El modelo acepta generar hasta 131.072 tokens en una sola respuesta. Sin un techo explícito, un loop de agente mal calibrado consigue quemar presupuesto rápido incluso con el precio bajo.

DeepSeek también publicó el deepseek-recipe, un conjunto de bibliotecas en Rust con bindings para Python. Convierte peticiones en los formatos Messages, Chat Completions y Responses API al formato Conversation interno, codifica los prompts del V4 y del V4.1 en token IDs y hace el parse de la salida de vuelta, incluso en streaming. Si estás construyendo tu propio runtime sobre los pesos, por ahí se empieza.

Ejecutando en Local con los Pesos MIT

La licencia MIT es lo que separa este lanzamiento de un "modelo barato en la nube". Puedes descargar, servir, modificar y usar comercialmente sin pedirle licencia a nadie. El model card documenta cuatro caminos de deploy: Transformers, vLLM, SGLang y Docker.

# Sirviendo con vLLM. El modelo es grande: planifica el clúster de GPU
# antes de ejecutar esto en producción.
pip install vllm

vllm serve deepseek-ai/DeepSeek-V4.1-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --served-model-name deepseek-flash

# El endpoint levanta compatible con Chat Completions en
# http://localhost:8000/v1/chat/completions

Sé realista sobre el costo de ejecutar esto en tu casa. Un MoE de 552B en precisión reducida todavía pide varios aceleradores con mucha memoria. Para la mayoría de los equipos, la API oficial a US$ 0,60 por millón de tokens de salida sale más barata que mantener el clúster encendido. El valor práctico de los pesos abiertos, en el corto plazo, es otro: dejas de depender de un único proveedor, puedes auditar el modelo y tienes una salida lista por si el precio cambia mañana.

Calculando el Costo Real de Tu Agente

Antes de migrar, pon números sobre el papel. Esta función calcula el costo de una ejecución considerando el horario pico de DeepSeek:

// Precios en dólares por 1 millón de tokens (tabla off-peak).
const TABELA_OFF_PEAK = {
  entradaCache: 0.003,
  entradaSemCache: 0.15,
  saida: 0.6
}

// Pico: 01:00-04:00 y 06:00-10:00 UTC, solo en días hábiles.
function estaEmPico(data = new Date()) {
  const diaDaSemana = data.getUTCDay()
  const ehDiaUtil = diaDaSemana >= 1 && diaDaSemana <= 5
  if (!ehDiaUtil) return false

  const hora = data.getUTCHours()
  return (hora >= 1 && hora < 4) || (hora >= 6 && hora < 10)
}

function calcularCusto({ tokensCache, tokensEntrada, tokensSaida }, data = new Date()) {
  // En pico todos los valores se duplican.
  const multiplicador = estaEmPico(data) ? 2 : 1
  const porMilhao = (tokens, preco) => (tokens / 1_000_000) * preco * multiplicador

  return (
    porMilhao(tokensCache, TABELA_OFF_PEAK.entradaCache) +
    porMilhao(tokensEntrada, TABELA_OFF_PEAK.entradaSemCache) +
    porMilhao(tokensSaida, TABELA_OFF_PEAK.saida)
  )
}

// Un agente que reenvía 400 mil tokens de contexto cacheado,
// 20 mil tokens nuevos y genera 8 mil tokens de respuesta.
const custo = calcularCusto({
  tokensCache: 400_000,
  tokensEntrada: 20_000,
  tokensSaida: 8_000
})

console.log(`US$ ${custo.toFixed(5)} por ejecución`)
// Fuera de pico: cerca de US$ 0,00900 por ejecución.

Haz la misma cuenta con la tabla de Claude Opus 5 y compara. En escenarios con mucho contexto cacheado —que es exactamente el perfil de un agente de código— la diferencia explota, porque el cache hit de DeepSeek cuesta US$ 0,003 contra US$ 0,50.

Cuándo Migrar y Cuándo Quedarte Donde Estás

Migra si

  • Tu cuello de botella es el costo y no los últimos puntos porcentuales de calidad.
  • El workload es asíncrono: procesamiento por lotes, generación de contenido, clasificación, enriquecimiento de datos. Agendas fuera del pico y pagas la tabla con todo el descuento.
  • Necesitas contexto gigante. 1M de tokens por menos de un dólar el millón cambia qué arquitecturas son viables.
  • La independencia de proveedor es un requisito. Pesos MIT significan que nadie apaga tu funcionalidad.

Quédate donde estás si

  • Tu producto depende de latencia bajísima y predecible, y todavía no mediste la de DeepSeek en tu tráfico real.
  • Tienes exigencias de residencia de datos que la infraestructura de DeepSeek no atiende, y no tienes presupuesto para servir los pesos por tu cuenta.
  • Tu stack ya está profundamente amarrada a recursos específicos de otro proveedor.

El camino del medio

Lo más sensato para la mayoría de los equipos no es cambiarlo todo: es enrutar. Manda las tareas de alto volumen y bajo riesgo al Flash y guarda el modelo caro para lo que realmente lo exige. Con la API siendo compatible con Chat Completions, ese enrutamiento suele ser una docena de líneas:

// Enrutador simple: la tarea cara solo va al modelo caro.
const MODELO_BARATO = { url: 'https://api.deepseek.com', nome: 'deepseek-flash' }
const MODELO_PREMIUM = { url: 'https://api.provedor-caro.com', nome: 'modelo-premium' }

function escolherModelo(tarefa) {
  // Criterio de negocio, no de tecnología: ¿qué se rompe si sale mal?
  const exigeMaximaQualidade =
    tarefa.tipo === 'revisao-final' || tarefa.impactoNoCliente === 'alto'

  return exigeMaximaQualidade ? MODELO_PREMIUM : MODELO_BARATO
}

Qué Significa Esto Para el Mercado

El patrón que DeepSeek repite desde el V3 ahora se volvió difícil de ignorar: entregar calidad de frontera, publicar los pesos bajo licencia permisiva y cobrar una fracción del precio. Cuando un modelo con pesos MIT empata con Claude Opus 5 en DeepSWE y cuesta veinte veces menos en la salida, la pregunta deja de ser "cuál es el mejor modelo" y pasa a ser "cuánta calidad extra necesito, y cuánto cuesta".

Para quien construye producto, la lectura es directa: el costo por token dejó de ser la restricción principal del diseño. Arquitecturas que eran demasiado caras —reprocesar el repositorio entero en cada pull request, mantener un agente vigilando logs continuamente, generar cinco respuestas y elegir la mejor— vuelven a la mesa.

Para los laboratorios de frontera, la presión es evidente. No se puede sostener US$ 25 por millón de tokens de salida cuando existe un modelo abierto a US$ 0,60 empatando en un benchmark de ingeniería. O la diferencia de calidad se vuelve estridente en los casos que importan, o el precio baja.

Y para ti, hoy, la acción práctica es pequeña: agarra una tarea real de tu sistema, ejecútala en los dos modelos, mide calidad y costo. La respuesta correcta está en tu tráfico, no en el gráfico de nadie.

¡Vamos con todo! 🦅

📚 ¿Quieres Seguir lo Que Viene Por Delante?

Este artículo cubrió el lanzamiento de DeepSeek V4.1 Flash, pero el ecosistema cambia todas las semanas y no todo se convierte en artículo aquí.

En X comparto lo que estoy probando, los bastidores de los proyectos y las novedades que aparecen antes de volverse post.

Sígueme Allá

👉 Seguir a @jeffbruchado en X

💡 Contenido diario sobre desarrollo, carrera y las herramientas que realmente uso

Comentarios (0)

Este artículo aún no tiene comentarios 😢. ¡Sé el primero! 🚀🦅

Añadir comentarios