À sa capacité la plus élevée, le V4 de DeepSeek « redéfinit l'état de l'art pour les modèles ouverts », selon la société.
DeepSeek, le chouchou chinois de l'IA, a lancé en avant-première son très attendu modèle de langage étendu (LLM) V4, alors que les spéculations autour d'un éventuel premier cycle de financement tourbillonnent.
Le dernier lancement open source intervient plus d'un an après que la start-up a publié R1, dont la rentabilité et les performances ont mis les dirigeants de la Silicon Valley dans un état d'agitation, déclenchant des accusations de vol. R1 a été formé à l’aide de puces Nvidia de moindre capacité.
La série V4 est disponible en deux versions, une version « Pro » avec 49 milliards de paramètres activés et une version « Flash » avec 13 milliards de paramètres activés, toutes deux prenant en charge une longueur de contexte de 1 million de jetons.
À sa capacité maximale, le mode V4-Pro-Max « redéfinit l'état de l'art pour les modèles ouverts, surpassant ses prédécesseurs dans les tâches principales », a déclaré DeepSeek.
Ce mode a « considérablement réduit l'écart » avec Gemini 3.1-Pro de Google, le modèle leader en matière d'évaluations basées sur les connaissances, selon la société, tout en devançant GPT-5.2 et Gemini-3.0-Pro d'OpenAI sur les « benchmarks de raisonnement standard ».
Dans les tâches agentiques, le V4-Pro-Max de DeepSeek est à égalité avec les principaux modèles open source, tels que Kimi-K2.6 et GLM-5.1, mais légèrement pire que les modèles fermés aux frontières, note-t-il.
Ses évaluations internes ont révélé que la version Pro-Max surpasse Claude Sonnet 4.5 d'Anthropic et se rapproche du niveau d'Opus 4.5. Huawei a déclaré que son supernode Ascend basé sur les puces Ascend 950 AI prendrait en charge les versions V4.
OpenAI a fait de nouvelles allégations contre DeepSeek en février, qualifiant les techniques de distillation de l'entreprise de « efforts continus pour profiter des capacités développées par OpenAI et d'autres laboratoires frontaliers américains ».
Dans le même temps, l’administration américaine a déclaré hier (23 avril) qu’elle travaillerait en étroite collaboration avec les sociétés d’IA pour lutter contre les « campagnes à l’échelle industrielle » menées par des acteurs étrangers tentant de voler sa technologie.
Les géants chinois de la technologie Tencent et Alibaba seraient en pourparlers pour rejoindre le premier cycle de financement de DeepSeek. Une source a déclaré à Bloomberg que la référence pour une valorisation se situerait autour de 40 milliards de dollars. La publication rapporte en outre que Tencent a proposé une participation de 20 % dans la société.
Les contemporains chinois de DeepSeek ont lancé leurs propres modèles d'IA au cours des mois passés, souhaitant devancer la V4, qui était censée être le lancement le plus important de l'entreprise depuis la R1, et la V3 fin 2024.
Les derniers lancements incluent Qwen3.5 d'Alibaba ; Seedance 2.0 de ByteDance ; le GLM-5 de Zhipu, entièrement entraîné à l'aide de puces chinoises ; MiniMax, qui a sorti M2.5 ; et Moonshot AI, soutenu par Alibaba, qui est sorti avec Kimi K2.5.
