Titre original : (DeepSeek V4 Pro version officielle mise en ligne)
Auteur original : Observateur Beating
La version officielle de DeepSeek V4 Pro est arrivée.
Le 12 août, dans la soirée, la documentation officielle de l’API de DeepSeek a mis à jour la version du modèle correspondant à deepseek-v4-pro vers DeepSeek-V4-Pro-0813. Désormais, les développeurs peuvent appeler directement la nouvelle version via l’API ; les tarifs sont de 3 yuans par million de tokens en entrée et 6 yuans par million de tokens en sortie, avec une entrée en cache qui ne coûte que 0,025 yuan par million de tokens.
V4 Pro-0813 continue de prendre en charge une fenêtre de contexte de 1 million de tokens, avec une sortie maximale pouvant atteindre 384 000 tokens. En outre, il prend en charge deux modes : réflexion et sans réflexion. Les fonctionnalités comme le JSON Output et les Tool Calls ont également été ouvertes.
Jusqu’au soir du 12 août, le journal des mises à jour officiel de DeepSeek n’avait pas encore publié séparément d’annonce pour la version officielle de V4 Pro. Cependant, lors de la mise à jour de la version officielle de V4 Flash précédente, DeepSeek avait clairement indiqué que la version officielle de V4 Pro serait lancée ensuite. Aujourd’hui, le nœud du modèle côté API est passé de la version précédente à DeepSeek-V4-Pro-0813.
Il s’est écoulé presque quatre mois depuis la première apparition de V4.
Le 24 avril de cette année, DeepSeek a publié V4 Preview, tout en lançant V4 Pro et V4 Flash. Dans cette gamme, V4 Pro est la version phare : le nombre total de paramètres atteint 1,6T, environ 49B paramètres activés par token, et la prise en charge d’un contexte de 1 million de tokens. Dès le départ, cette génération V4 renforce nettement le codage, l’appel d’outils et les tâches d’agents sur de longues durées.
Le 31 juillet, DeepSeek a sorti V4-Flash-0731. Officiellement, cette version conserve la même architecture et la même taille de modèle ; le principal changement concerne le post-entraînement. Les capacités des agents sont nettement renforcées, et l’API Responses est ajoutée nativement. Le modèle a aussi été adapté à Codex. À l’époque, DeepSeek a insisté sur le fait que cette mise à jour ne concerne que Flash : Pro et les modèles côté web ne changent pas. La version officielle de V4 Pro a ensuite été publiée.
Maintenant, la dernière pièce du puzzle pour Pro est enfin en place.

Les modèles de cette génération DeepSeek tournent de plus en plus autour des agents
Le calendrier de publication de la version officielle de V4 Pro tombe à point nommé : il coïncide avec le transfert du centre de gravité des produits dans l’industrie des grands modèles.
Lorsqu’une entreprise de modèles publie un nouveau produit cette année, la part consacrée à la simple comparaison des questions-réponses, des mathématiques et des Benchmark traditionnels diminue de plus en plus. Le taux de réussite dans l’accomplissement du codage, du Computer Use, du Tool Use et des tâches sur de longues durées, ainsi que le coût nécessaire pour accomplir une tâche, deviennent de nouveaux indicateurs essentiels.
En juillet, lors de la sortie de GPT-5.6, OpenAI a consacré beaucoup d’espace à présenter les capacités des agents et du codage. GPT-5.6 Sol prend en charge un nouvel “max reasoning effort”, puis propose davantage le mode ultra, permettant de réaliser des tâches complexes en parallèle via plusieurs agents. L’API Responses permet aussi au modèle d’écrire directement du code pour orchestrer des outils, de traiter les résultats intermédiaires, puis de décider de l’étape suivante. OpenAI a même fait de « la quantité de travail accomplie pour chaque dollar » l’un des arguments de vente principaux de cette génération.
La démarche d’Anthropic est aussi très proche.
Le Claude Sonnet 5, publié fin juin, améliore principalement des aspects concentrés sur le codage, les agents, le Computer Use et les tâches de longue durée. Anthropic propose différents niveaux d’effort, permettant aux développeurs de choisir l’intensité du raisonnement selon la tâche. Puis, le 10 août, Anthropic a aussi annoncé que le prix promotionnel de Sonnet 5 (à l’origine 2 dollars par million d’entrées et 10 dollars par million de sorties) serait conservé définitivement.
Désormais, les entreprises de modèles ne doivent plus seulement se demander qui est le plus intelligent.
Un agent peut fonctionner en continu pendant des dizaines de minutes, voire plusieurs heures : relire et réécrire du code, rechercher des informations, appeler le navigateur et des outils externes. Une fois qu’on entre réellement en environnement de production, le nombre d’appels au modèle augmente rapidement. Les capacités, la vitesse, la consommation de tokens et les coûts d’appel commencent à déterminer ensemble si un produit d’agent peut réellement fonctionner.
Le design de DeepSeek V4 s’inscrit aussi globalement dans cette direction.
Un contexte de 1 million de tokens permet au modèle de lire en une seule fois de plus grands dépôts de code, des bases de connaissances d’entreprise et l’historique des tâches. Les Tool Calls assurent l’interaction avec l’environnement externe. La compatibilité avec l’API d’Anthropic, ainsi que l’API Responses déjà prise en charge en premier par Flash, sert à abaisser les barrières pour que le modèle entre dans la chaîne d’outils existante des agents. Lors de la sortie de V4 en avril, DeepSeek a déjà ouvert simultanément les interfaces OpenAI ChatCompletions et Anthropic.
C’est aussi un point qui mérite davantage d’attention : la version officielle de V4 Pro est non seulement “une de plus”, mais correspond à un modèle DeepSeek encore plus grand. DeepSeek est en train de transformer les modèles en une infrastructure de base directement appelable par des agents.
Après la mise en ligne de la version officielle de V4 Pro, la “stratification” de cette génération de produits DeepSeek est devenue encore plus claire.
Pour le moment, le prix d’entrée (input) de V4 Flash est de 1 yuan / million de tokens, et celui de Pro de 3 yuan. Flash pour la sortie (output) : 2 yuan ; Pro : 6 yuan. Les prix des deux offres sont exactement trois fois différents. V4 Pro et Flash prennent tous deux en charge un contexte de 1 million de tokens ; en revanche, Pro utilise une échelle plus grande de paramètres d’activation, et vise davantage les tâches de raisonnement complexe, de codage et d’agents plus difficiles.
Flash prend en charge une grande quantité de tâches intensives, fréquentes et sensibles aux coûts ; Pro est plutôt réservé aux tâches plus lourdes.
En 2025, la concurrence entre grands modèles tourne encore souvent autour de « quel modèle phare obtient les meilleurs scores ». En 2026, les modèles ressemblent de plus en plus à de véritables infrastructures logicielles : ils doivent être intelligents, mais aussi offrir une API stable, de longs contextes, l’appel d’outils, une concurrence suffisamment élevée, et des prix qui permettent aux développeurs de calculer clairement leur rentabilité.
Après la mise en ligne de la version officielle de V4 Pro, le contour produit de cette génération DeepSeek V4 est enfin complet.
Lien de la source
