Voltar para o Blog

DeepSeek V4.1 Flash: O Modelo Open Weights Que Custa 40x Menos e Empata com o Opus 5

Olá HaWkers, no dia 10 de setembro de 2026 a DeepSeek publicou o V4.1-Flash com os pesos no Hugging Face sob licença MIT. Não é um preview, não é uma API fechada com lista de espera: é o arquivo inteiro, 552 bilhões de parâmetros no backbone, disponível para baixar e rodar na sua própria infraestrutura. E o preço da API oficial começa em US$ 0,003 por milhão de tokens de entrada em cache hit.

Você já parou para calcular quanto o seu agente gasta por mês em tokens de saída? Se a resposta te assustou, este artigo é para você. Vamos olhar a arquitetura real do modelo, a tabela de preços completa com as pegadinhas do horário de pico, os benchmarks que a DeepSeek divulgou e — principalmente — como decidir se vale a pena migrar o seu caso de uso ou ficar onde você está.

O Que a DeepSeek Realmente Lançou

O V4.1-Flash é um Mixture-of-Experts esparso e multimodal. O número que aparece nas manchetes é o backbone: 552 bilhões de parâmetros. Mas o que interessa para o custo de inferência é quanto disso acende a cada token, e aqui está a sacada da arquitetura: o modelo ativa 8 bilhões de parâmetros no processamento de entrada e 16 bilhões na geração de saída.

Essa divisão assimétrica é deliberada. Carregar contexto é barato, gerar texto é caro — então a DeepSeek dimensionou cada etapa de acordo. O resultado é um modelo que se comporta como um gigante na qualidade e como um modelo pequeno na conta de computação por token.

As especificações de contexto acompanham a ambição:

  • Janela de contexto: 1.048.576 tokens (1M exato, não arredondado para cima no marketing)
  • Saída máxima: 131.072 tokens em uma única resposta
  • Cache KV comprimido: a memória de cache caiu para cerca de um quarto da geração Flash anterior
  • Licença: MIT, pesos publicados no Hugging Face
  • Nome na API: deepseek-flash, com limite de concorrência de 2.500 requisições

Esse cache KV comprimido é o detalhe que mais importa para quem roda agente. Em workload agêntico você reenvia o mesmo histórico dezenas de vezes por tarefa; se o cache ocupa um quarto da memória, cabe muito mais sessão simultânea na mesma GPU.

A Tabela de Preços e a Pegadinha do Horário de Pico

Aqui é onde a conversa fica interessante — e onde a maioria das comparações que circulam por aí está errada. A DeepSeek cobra dois preços diferentes dependendo da hora do dia.

Fora de pico (off-peak):

Item Preço por 1M de tokens
Entrada com cache hit US$ 0,003
Entrada sem cache US$ 0,15
Saída US$ 0,60

Em horário de pico: exatamente o dobro de cada valor acima.

As janelas de pico vão de 01:00 às 04:00 e de 06:00 às 10:00 UTC, apenas em dias úteis. Todo o resto — incluindo noites, fins de semana e feriados — cai na faixa barata. Para quem está no Brasil isso é ótimo: o pico da DeepSeek cai de madrugada e no começo da manhã no nosso fuso, então boa parte do horário comercial brasileiro já está fora de pico.

Comparando com Quem Está no Topo

Para dimensionar, os preços públicos dos concorrentes diretos:

Modelo Entrada Entrada em cache Saída
DeepSeek V4.1 Flash (off-peak) US$ 0,15 US$ 0,003 US$ 0,60
DeepSeek V4.1 Flash (pico) US$ 0,30 US$ 0,006 US$ 1,20
GPT-5.6 Sol US$ 4,00 US$ 0,40 US$ 20,00
Claude Opus 5 US$ 5,00 US$ 0,50 US$ 25,00

A saída em horário de pico do V4.1-Flash é cerca de 20 vezes mais barata que a do Claude Opus 5. Fora de pico, passa de 40 vezes. Na entrada em cache a diferença é ainda mais violenta: US$ 0,003 contra US$ 0,50.

Vale registrar a ressalva honesta: a comparação não é perfeitamente simétrica, porque o menor preço da DeepSeek depende de você rodar fora da janela de pico. Se o seu tráfego é síncrono e acompanha o horário comercial europeu, uma parte relevante das suas chamadas vai cair no dobro do preço. Ainda assim, mesmo no dobro, a distância para os modelos de fronteira continua sendo de uma ordem de grandeza.

Os Benchmarks: O Que os Números Dizem

A DeepSeek divulgou o V4.1-Flash com 74,2 pontos no DeepSWE v1.1, contra 74,0 do Claude Opus 5 e 73,0 do GPT-5.6 Sol. É um empate técnico com o topo da tabela em um benchmark de engenharia de software agêntica.

A OpenDesign publicou uma avaliação independente e chegou a um número que resume bem a proposta: o V4.1-Flash alcançou 98% da nota de qualidade do GPT-6 Astra por 1,4% do custo, no conjunto de pedidos de design do dia a dia da empresa.

Antes de você trocar todo o seu stack, duas ressalvas que valem mais que qualquer manchete:

  1. Os benchmarks do DeepSWE foram rodados pela própria DeepSeek. Isso não os invalida, mas coloca a responsabilidade da verificação no seu colo. Rode o seu próprio conjunto de avaliação antes de decidir.
  2. Empatar em benchmark não é empatar no seu caso de uso. Uma diferença de 0,2 ponto em um agregado esconde variações enormes por tipo de tarefa.

Se você quer um panorama mais amplo de como os modelos se comportam no dia a dia de quem escreve código, eu já destrinchei isso no comparativo dos melhores assistentes de IA para programação em 2026.

Chamando o Modelo na Prática

A API da DeepSeek segue o formato de Chat Completions, então qualquer cliente compatível funciona sem adaptação. O nome do modelo é deepseek-flash:

// Chamada direta com fetch, sem SDK nenhum.
// A API aceita o formato Chat Completions, então o payload é o mesmo
// que você já usa com outros provedores.
const resposta = await fetch('https://api.deepseek.com/chat/completions', {
  method: 'POST',
  headers: {
    'Content-Type': 'application/json',
    Authorization: `Bearer ${process.env.DEEPSEEK_API_KEY}`
  },
  body: JSON.stringify({
    model: 'deepseek-flash',
    messages: [
      { role: 'system', content: 'Você responde em português, de forma objetiva.' },
      { role: 'user', content: 'Explique o que é um Mixture-of-Experts esparso.' }
    ],
    // Com 131.072 tokens de saída disponíveis, limitar aqui é uma
    // proteção de custo, não uma limitação do modelo.
    max_tokens: 2048
  })
})

const dados = await resposta.json()
console.log(dados.choices[0].message.content)

O ponto de atenção é o max_tokens. O modelo aceita gerar até 131.072 tokens em uma resposta só. Sem um teto explícito, um loop de agente mal calibrado consegue queimar orçamento rápido mesmo com o preço baixo.

A DeepSeek também publicou o deepseek-recipe, um conjunto de bibliotecas em Rust com bindings para Python. Ele converte requisições nos formatos Messages, Chat Completions e Responses API para o formato Conversation interno, codifica os prompts do V4 e do V4.1 em token IDs e faz o parse da saída de volta, inclusive em streaming. Se você está construindo o seu próprio runtime em cima dos pesos, é por ali que se começa.

Rodando Local com os Pesos MIT

A licença MIT é o que separa esse lançamento de um "modelo barato na nuvem". Você pode baixar, servir, modificar e usar comercialmente sem pedir licença a ninguém. O model card documenta quatro caminhos de deploy: Transformers, vLLM, SGLang e Docker.

# Servindo com vLLM. O modelo é grande: planeje o cluster de GPU
# antes de rodar isso em produção.
pip install vllm

vllm serve deepseek-ai/DeepSeek-V4.1-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --served-model-name deepseek-flash

# O endpoint sobe compatível com Chat Completions em
# http://localhost:8000/v1/chat/completions

Seja realista sobre o custo de rodar isso na sua casa. Um MoE de 552B em precisão reduzida ainda pede vários aceleradores com muita memória. Para a maioria das equipes, a API oficial a US$ 0,60 por milhão de tokens de saída sai mais barata que manter o cluster ligado. O valor prático dos pesos abertos, no curto prazo, é outro: você deixa de depender de um único fornecedor, pode auditar o modelo e tem uma saída pronta caso o preço mude amanhã.

Calculando o Custo Real do Seu Agente

Antes de migrar, coloque números no papel. Esta função calcula o custo de uma execução considerando o horário de pico da DeepSeek:

// Preços em dólares por 1 milhão de tokens (tabela off-peak).
const TABELA_OFF_PEAK = {
  entradaCache: 0.003,
  entradaSemCache: 0.15,
  saida: 0.6
}

// Pico: 01:00-04:00 e 06:00-10:00 UTC, apenas em dias úteis.
function estaEmPico(data = new Date()) {
  const diaDaSemana = data.getUTCDay()
  const ehDiaUtil = diaDaSemana >= 1 && diaDaSemana <= 5
  if (!ehDiaUtil) return false

  const hora = data.getUTCHours()
  return (hora >= 1 && hora < 4) || (hora >= 6 && hora < 10)
}

function calcularCusto({ tokensCache, tokensEntrada, tokensSaida }, data = new Date()) {
  // Em pico todos os valores dobram.
  const multiplicador = estaEmPico(data) ? 2 : 1
  const porMilhao = (tokens, preco) => (tokens / 1_000_000) * preco * multiplicador

  return (
    porMilhao(tokensCache, TABELA_OFF_PEAK.entradaCache) +
    porMilhao(tokensEntrada, TABELA_OFF_PEAK.entradaSemCache) +
    porMilhao(tokensSaida, TABELA_OFF_PEAK.saida)
  )
}

// Um agente que reenvia 400 mil tokens de contexto cacheado,
// 20 mil tokens novos e gera 8 mil tokens de resposta.
const custo = calcularCusto({
  tokensCache: 400_000,
  tokensEntrada: 20_000,
  tokensSaida: 8_000
})

console.log(`US$ ${custo.toFixed(5)} por execução`)
// Fora de pico: cerca de US$ 0,00900 por execução.

Rode a mesma conta com a tabela do Claude Opus 5 e compare. Em cenários com muito contexto cacheado — que é exatamente o perfil de agente de código — a diferença explode, porque o cache hit da DeepSeek custa US$ 0,003 contra US$ 0,50.

Quando Migrar e Quando Ficar Onde Está

Migre se

  • O seu gargalo é custo e não os últimos pontos percentuais de qualidade.
  • O workload é assíncrono: processamento em lote, geração de conteúdo, classificação, enriquecimento de dados. Você agenda fora do pico e paga a tabela cheia de desconto.
  • Você precisa de contexto gigante. 1M de tokens por menos de um dólar o milhão muda quais arquiteturas são viáveis.
  • Independência de fornecedor é requisito. Pesos MIT significam que ninguém desliga a sua feature.

Fique onde está se

  • O seu produto depende de latência baixíssima e previsível, e você ainda não mediu a da DeepSeek no seu tráfego real.
  • Você tem exigências de residência de dados que a infraestrutura da DeepSeek não atende — e não tem orçamento para servir os pesos por conta própria.
  • A sua stack já está profundamente amarrada a recursos específicos de outro provedor.

O caminho do meio

O mais sensato para a maioria dos times não é trocar tudo: é rotear. Mande as tarefas de alto volume e baixo risco para o Flash e guarde o modelo caro para o que realmente exige. Com a API sendo compatível com Chat Completions, esse roteamento costuma ser uma dúzia de linhas:

// Roteador simples: tarefa cara só vai para o modelo caro.
const MODELO_BARATO = { url: 'https://api.deepseek.com', nome: 'deepseek-flash' }
const MODELO_PREMIUM = { url: 'https://api.provedor-caro.com', nome: 'modelo-premium' }

function escolherModelo(tarefa) {
  // Critério de negócio, não de tecnologia: o que quebra se sair errado?
  const exigeMaximaQualidade =
    tarefa.tipo === 'revisao-final' || tarefa.impactoNoCliente === 'alto'

  return exigeMaximaQualidade ? MODELO_PREMIUM : MODELO_BARATO
}

O Que Isso Significa Para o Mercado

O padrão que a DeepSeek repete desde o V3 agora ficou difícil de ignorar: entregar qualidade de fronteira, publicar os pesos sob licença permissiva e cobrar uma fração do preço. Quando um modelo com pesos MIT empata com o Claude Opus 5 no DeepSWE e custa vinte vezes menos na saída, a pergunta deixa de ser "qual o melhor modelo" e passa a ser "quanta qualidade extra eu preciso, e quanto ela custa".

Para quem constrói produto, a leitura é direta: o custo por token deixou de ser a restrição principal do desenho. Arquiteturas que eram caras demais — reprocessar o repositório inteiro a cada pull request, manter um agente vigiando logs continuamente, gerar cinco respostas e escolher a melhor — voltam para a mesa.

Para os laboratórios de fronteira, a pressão é evidente. Não dá para sustentar US$ 25 por milhão de tokens de saída quando existe um modelo aberto a US$ 0,60 empatando em benchmark de engenharia. Ou a diferença de qualidade fica gritante nos casos que importam, ou o preço desce.

E para você, hoje, a ação prática é pequena: pegue uma tarefa real do seu sistema, rode nos dois modelos, meça qualidade e custo. A resposta certa está no seu tráfego, não no gráfico de ninguém.

Bora pra cima! 🦅

📚 Quer Acompanhar o Que Vem Por Aí?

Este artigo cobriu o lançamento do DeepSeek V4.1 Flash, mas o ecossistema muda toda semana e nem tudo vira artigo aqui.

No X eu compartilho o que estou testando, os bastidores dos projetos e as novidades que aparecem antes de virarem post.

Me Segue Lá

👉 Seguir @jeffbruchado no X

💡 Conteúdo diário sobre desenvolvimento, carreira e as ferramentas que eu realmente uso

Comentários (0)

Esse artigo ainda não possui comentários 😢. Seja o primeiro! 🚀🦅

Adicionar comentário