DeepSeek V4.1 Flash : Le Modèle Open Weights Qui Coûte 40x Moins et Égale l'Opus 5
Salut HaWkers, le 10 septembre 2026 DeepSeek a publié le V4.1-Flash avec les poids sur Hugging Face sous licence MIT. Ce n'est pas une préversion, ce n'est pas une API fermée avec liste d'attente : c'est le fichier entier, 552 milliards de paramètres dans le backbone, disponible au téléchargement pour tourner sur votre propre infrastructure. Et le prix de l'API officielle démarre à 0,003 $ par million de tokens d'entrée en cache hit.
Vous êtes-vous déjà arrêté pour calculer combien votre agent dépense chaque mois en tokens de sortie ? Si la réponse vous a fait peur, cet article est pour vous. On va regarder l'architecture réelle du modèle, la grille tarifaire complète avec ses pièges liés aux heures de pointe, les benchmarks publiés par DeepSeek et — surtout — comment décider s'il vaut la peine de migrer votre cas d'usage ou de rester où vous êtes.
Ce Que DeepSeek a Réellement Lancé
Le V4.1-Flash est un Mixture-of-Experts creux et multimodal. Le chiffre qui fait les gros titres, c'est le backbone : 552 milliards de paramètres. Mais ce qui compte pour le coût d'inférence, c'est la part qui s'allume à chaque token, et c'est là que l'architecture devient maligne : le modèle active 8 milliards de paramètres pour le traitement de l'entrée et 16 milliards pour la génération de la sortie.
Cette répartition asymétrique est délibérée. Charger du contexte coûte peu, générer du texte coûte cher — alors DeepSeek a dimensionné chaque étape en conséquence. Le résultat est un modèle qui se comporte comme un géant côté qualité et comme un petit modèle sur la facture de calcul par token.
Les spécifications de contexte suivent la même ambition :
- Fenêtre de contexte : 1 048 576 tokens (1M exact, pas arrondi vers le haut pour le marketing)
- Sortie maximale : 131 072 tokens dans une seule réponse
- Cache KV compressé : la mémoire de cache est tombée à environ un quart de la génération Flash précédente
- Licence : MIT, poids publiés sur Hugging Face
- Nom dans l'API :
deepseek-flash, avec une limite de concurrence de 2 500 requêtes
Ce cache KV compressé est le détail qui compte le plus pour ceux qui font tourner des agents. Dans une charge de travail agentique, vous renvoyez le même historique des dizaines de fois par tâche ; si le cache occupe un quart de la mémoire, beaucoup plus de sessions simultanées tiennent sur le même GPU.
La Grille Tarifaire et le Piège des Heures de Pointe
C'est ici que la conversation devient intéressante — et c'est là que la majorité des comparaisons qui circulent se trompent. DeepSeek facture deux prix différents selon l'heure de la journée.
Hors pointe (off-peak) :
| Élément | Prix par 1M de tokens |
|---|---|
| Entrée avec cache hit | 0,003 $ |
| Entrée sans cache | 0,15 $ |
| Sortie | 0,60 $ |
En heures de pointe : exactement le double de chaque valeur ci-dessus.
Les fenêtres de pointe vont de 01h00 à 04h00 et de 06h00 à 10h00 UTC, uniquement les jours ouvrés. Tout le reste — y compris les nuits, les week-ends et les jours fériés — tombe dans la tranche bon marché. Pour la France, c'est un compromis à connaître : une partie du créneau de pointe recouvre le tout début de matinée en heure locale, mais l'essentiel de la journée de travail française sort de la fenêtre chère.
Comparer avec Ceux Qui Sont en Tête
Pour donner l'échelle, les prix publics des concurrents directs :
| Modèle | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| DeepSeek V4.1 Flash (off-peak) | 0,15 $ | 0,003 $ | 0,60 $ |
| DeepSeek V4.1 Flash (pointe) | 0,30 $ | 0,006 $ | 1,20 $ |
| GPT-5.6 Sol | 4,00 $ | 0,40 $ | 20,00 $ |
| Claude Opus 5 | 5,00 $ | 0,50 $ | 25,00 $ |
La sortie du V4.1-Flash en heures de pointe est environ 20 fois moins chère que celle de Claude Opus 5. Hors pointe, on dépasse les 40 fois. Sur l'entrée en cache, l'écart est encore plus violent : 0,003 $ contre 0,50 $.
Il faut poser la réserve honnête : la comparaison n'est pas parfaitement symétrique, parce que le prix le plus bas de DeepSeek dépend de votre capacité à tourner hors de la fenêtre de pointe. Si votre trafic est synchrone et suit les horaires de bureau européens, une partie non négligeable de vos appels tombera au double du prix. Même ainsi, même au double, la distance avec les modèles de frontière reste d'un ordre de grandeur.
Les Benchmarks : Ce Que Disent les Chiffres
DeepSeek a annoncé le V4.1-Flash avec 74,2 points sur DeepSWE v1.1, contre 74,0 pour Claude Opus 5 et 73,0 pour GPT-5.6 Sol. C'est une égalité technique avec le haut du tableau sur un benchmark d'ingénierie logicielle agentique.
OpenDesign a publié une évaluation indépendante et est arrivée à un chiffre qui résume bien la proposition : le V4.1-Flash a atteint 98 % de la note de qualité de GPT-6 Astra pour 1,4 % du coût, sur l'ensemble des demandes de design du quotidien de l'entreprise.
Avant de remplacer toute votre stack, deux réserves qui valent plus que n'importe quel gros titre :
- Les benchmarks DeepSWE ont été exécutés par DeepSeek elle-même. Cela ne les invalide pas, mais cela met la responsabilité de la vérification sur vos genoux. Faites tourner votre propre jeu d'évaluation avant de décider.
- Égaler sur un benchmark n'est pas égaler sur votre cas d'usage. Un écart de 0,2 point sur un agrégat cache d'énormes variations selon le type de tâche.
Si vous voulez un panorama plus large de la façon dont ces modèles se comportent au quotidien pour ceux qui écrivent du code, j'ai déjà décortiqué le sujet dans le comparatif des assistants IA pour le code en 2026.
Appeler le Modèle en Pratique
L'API de DeepSeek suit le format Chat Completions, donc n'importe quel client compatible fonctionne sans adaptation. Le nom du modèle est deepseek-flash :
// Appel direct avec fetch, sans aucun SDK.
// L'API accepte le format Chat Completions, donc la charge utile est la même
// que celle que vous utilisez déjà avec d'autres fournisseurs.
const reponse = await fetch('https://api.deepseek.com/chat/completions', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
Authorization: `Bearer ${process.env.DEEPSEEK_API_KEY}`
},
body: JSON.stringify({
model: 'deepseek-flash',
messages: [
{ role: 'system', content: 'Tu réponds en français, de manière concise.' },
{ role: 'user', content: "Explique ce qu'est un Mixture-of-Experts creux." }
],
// Avec 131 072 tokens de sortie disponibles, limiter ici est une
// protection de coût, pas une limitation du modèle.
max_tokens: 2048
})
})
const donnees = await reponse.json()
console.log(donnees.choices[0].message.content)Le point de vigilance, c'est max_tokens. Le modèle accepte de générer jusqu'à 131 072 tokens dans une seule réponse. Sans plafond explicite, une boucle d'agent mal calibrée arrive à brûler le budget vite, même avec un prix bas.
DeepSeek a aussi publié deepseek-recipe, un ensemble de bibliothèques en Rust avec des bindings pour Python. Il convertit les requêtes aux formats Messages, Chat Completions et Responses API vers le format Conversation interne, encode les prompts du V4 et du V4.1 en token IDs et fait le parsing de la sortie en sens inverse, y compris en streaming. Si vous construisez votre propre runtime par-dessus les poids, c'est par là qu'on commence.
Faire Tourner en Local avec les Poids MIT
La licence MIT est ce qui sépare ce lancement d'un « modèle pas cher dans le cloud ». Vous pouvez télécharger, servir, modifier et utiliser commercialement sans demander de licence à personne. La model card documente quatre chemins de déploiement : Transformers, vLLM, SGLang et Docker.
# Service avec vLLM. Le modèle est gros : planifiez le cluster de GPU
# avant de lancer ça en production.
pip install vllm
vllm serve deepseek-ai/DeepSeek-V4.1-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--served-model-name deepseek-flash
# Le endpoint démarre compatible Chat Completions sur
# http://localhost:8000/v1/chat/completionsSoyez réaliste sur le coût de faire tourner ça chez vous. Un MoE de 552B en précision réduite demande encore plusieurs accélérateurs avec beaucoup de mémoire. Pour la plupart des équipes, l'API officielle à 0,60 $ par million de tokens de sortie revient moins cher que de maintenir le cluster allumé. La valeur pratique des poids ouverts, à court terme, est ailleurs : vous cessez de dépendre d'un fournisseur unique, vous pouvez auditer le modèle et vous avez une porte de sortie prête si le prix change demain.
Calculer le Coût Réel de Votre Agent
Avant de migrer, mettez des chiffres sur le papier. Cette fonction calcule le coût d'une exécution en tenant compte des heures de pointe de DeepSeek :
// Prix en dollars par 1 million de tokens (grille off-peak).
const TARIFS_OFF_PEAK = {
entreeCache: 0.003,
entreeSansCache: 0.15,
sortie: 0.6
}
// Pointe : 01h00-04h00 et 06h00-10h00 UTC, uniquement les jours ouvrés.
function estEnHeurePointe(date = new Date()) {
const jourDeLaSemaine = date.getUTCDay()
const estJourOuvre = jourDeLaSemaine >= 1 && jourDeLaSemaine <= 5
if (!estJourOuvre) return false
const heure = date.getUTCHours()
return (heure >= 1 && heure < 4) || (heure >= 6 && heure < 10)
}
function calculerCout({ tokensCache, tokensEntree, tokensSortie }, date = new Date()) {
// En heures de pointe, toutes les valeurs doublent.
const multiplicateur = estEnHeurePointe(date) ? 2 : 1
const parMillion = (tokens, prix) => (tokens / 1_000_000) * prix * multiplicateur
return (
parMillion(tokensCache, TARIFS_OFF_PEAK.entreeCache) +
parMillion(tokensEntree, TARIFS_OFF_PEAK.entreeSansCache) +
parMillion(tokensSortie, TARIFS_OFF_PEAK.sortie)
)
}
// Un agent qui renvoie 400 mille tokens de contexte mis en cache,
// 20 mille tokens nouveaux et génère 8 mille tokens de réponse.
const cout = calculerCout({
tokensCache: 400_000,
tokensEntree: 20_000,
tokensSortie: 8_000
})
console.log(`${cout.toFixed(5)} $ par exécution`)
// Hors pointe : environ 0,00900 $ par exécution.Faites le même calcul avec la grille de Claude Opus 5 et comparez. Dans les scénarios avec beaucoup de contexte mis en cache — qui est exactement le profil d'un agent de code — l'écart explose, parce que le cache hit de DeepSeek coûte 0,003 $ contre 0,50 $.
Quand Migrer et Quand Rester Où Vous Êtes
Migrez si
- Votre goulot d'étranglement est le coût et non les derniers points de pourcentage de qualité.
- La charge de travail est asynchrone : traitement par lots, génération de contenu, classification, enrichissement de données. Vous planifiez hors pointe et vous payez la grille avec toute la remise.
- Vous avez besoin d'un contexte gigantesque. 1M de tokens pour moins d'un dollar le million change les architectures qui deviennent viables.
- L'indépendance vis-à-vis du fournisseur est une exigence. Des poids MIT signifient que personne n'éteint votre fonctionnalité.
Restez où vous êtes si
- Votre produit dépend d'une latence très basse et prévisible, et vous n'avez pas encore mesuré celle de DeepSeek sur votre trafic réel.
- Vous avez des exigences de résidence des données que l'infrastructure de DeepSeek ne satisfait pas — et pas de budget pour servir les poids vous-même.
- Votre stack est déjà profondément attachée à des fonctionnalités spécifiques d'un autre fournisseur.
La voie du milieu
Le plus sensé pour la majorité des équipes n'est pas de tout remplacer : c'est de router. Envoyez les tâches à gros volume et à faible risque vers le Flash et gardez le modèle cher pour ce qui l'exige vraiment. Comme l'API est compatible Chat Completions, ce routage tient en général en une douzaine de lignes :
// Routeur simple : une tâche coûteuse part seulement vers le modèle cher.
const MODELE_ECONOMIQUE = { url: 'https://api.deepseek.com', nom: 'deepseek-flash' }
const MODELE_PREMIUM = { url: 'https://api.fournisseur-cher.com', nom: 'modele-premium' }
function choisirModele(tache) {
// Critère métier, pas technique : qu'est-ce qui casse si ça sort faux ?
const exigeQualiteMaximale =
tache.type === 'revision-finale' || tache.impactClient === 'eleve'
return exigeQualiteMaximale ? MODELE_PREMIUM : MODELE_ECONOMIQUE
}
Ce Que Cela Signifie Pour le Marché
Le schéma que DeepSeek répète depuis le V3 est devenu difficile à ignorer : livrer une qualité de frontière, publier les poids sous licence permissive et facturer une fraction du prix. Quand un modèle avec des poids MIT égale Claude Opus 5 sur DeepSWE et coûte vingt fois moins en sortie, la question cesse d'être « quel est le meilleur modèle » et devient « de combien de qualité supplémentaire ai-je besoin, et combien coûte-t-elle ».
Pour ceux qui construisent un produit, la lecture est directe : le coût par token a cessé d'être la contrainte principale de la conception. Des architectures qui étaient trop chères — retraiter le dépôt entier à chaque pull request, garder un agent qui surveille les logs en continu, générer cinq réponses et choisir la meilleure — reviennent sur la table.
Pour les laboratoires de frontière, la pression est évidente. Impossible de tenir 25 $ par million de tokens de sortie quand il existe un modèle ouvert à 0,60 $ qui fait jeu égal sur un benchmark d'ingénierie. Soit l'écart de qualité devient criant sur les cas qui comptent, soit le prix descend.
Et pour vous, aujourd'hui, l'action pratique est petite : prenez une tâche réelle de votre système, exécutez-la sur les deux modèles, mesurez la qualité et le coût. La bonne réponse est dans votre trafic, pas dans le graphique de quelqu'un d'autre.
Allez, on y va ! 🦅
📚 Vous Voulez Suivre Ce Qui Arrive ?
Cet article a couvert le lancement de DeepSeek V4.1 Flash, mais l'écosystème change toutes les semaines et tout ne devient pas un article ici.
Sur X, je partage ce que je teste, les coulisses des projets et les nouveautés qui apparaissent avant de devenir un post.
Suivez-Moi Là-Bas
💡 Du contenu quotidien sur le développement, la carrière et les outils que j'utilise vraiment

