
DeepSeek-V4-Flash : un modèle ouvert de 284 milliards de paramètres qui n'en allume que 13 à la fois
Le 31 juillet 2026, DeepSeek publie la version officielle de V4-Flash, un modèle ouvert MoE de 284 milliards de paramètres sous licence MIT, contexte d'un million de tokens. Le petit passe devant le gros V4-Pro sur les tâches d'agent. Je l'ai fait tourner sur mon Mac, en streaming depuis le SSD.
Le 31 juillet 2026, DeepSeek publie la version officielle de son modèle ouvert V4-Flash. Il pèse 284 milliards de paramètres, mais c'est un mélange d'experts : à chaque mot qu'il produit, il n'en active que 13. Sous licence MIT, avec un contexte d'un million de tokens, ce petit passe devant le gros V4-Pro sur les tâches d'agent. Sur DeepSWE, il marque 54,4 là où le Pro-preview plafonne à 12,8. La structure n'a pas bougé depuis la préversion d'avril 2026 ; DeepSeek a seulement refait le post-entraînement.
Le vrai progrès est dans la mémoire. Le cache d'attention, ce que le modèle garde en tête de tout ce qu'il a déjà lu, sature vite les cartes graphiques quand on allonge le contexte. DeepSeek a compressé ce cache : à un million de tokens, il tombe autour d'un dixième de la génération précédente, environ 9,6 Go au lieu de 84. Le coût de calcul par token descend autour du quart. C'est cette efficacité qui décide si un modèle reste confiné dans un centre de calcul ou s'il peut descendre sur nos machines.
Je l'ai fait tourner sur mon Mac Studio M3 Ultra avec 96 Go de mémoire, en streaming depuis le SSD via le moteur ds4 signé Salvatore Sanfilippo. Le principe : garder les poids dont on n'a pas besoin sur le disque, aller chercher seulement les experts utiles au prochain token. J'utilise une version compressée à deux bits, moins précise que l'original mais utilisable, avec une rédaction d'une dizaine de mots à la seconde. C'est plus lent qu'une machine dédiée, mais c'est chez moi, sans demander la permission à personne.
Il faut rester prudent : les chiffres viennent des bancs d'essai de DeepSeek et ce n'est pas encore une vérité établie tant que des gens de l'extérieur ne les ont pas rejoués. Ce que je retiens, ce n'est pas la taille du modèle, mais l'orientation de l'effort vers l'efficacité mémoire et le coût par token. La question n'est plus de savoir qui a le plus gros modèle, mais qui pourra le faire tourner en local.
La version complète, avec ses sources, et le podcast sont réservés aux abonnés. Le compte est gratuit.