Le 26 août 2026, l'équipe Qwen d'Alibaba a publié en poids ouverts Qwen3.8-Flash-Next, un modèle multimodal présenté comme un avant-goût de l'architecture Qwen4. Le chiffre qui circule depuis est celui de SWE-bench Pro : 62,5 contre 53,4 pour Claude Opus 4.6 Max.
Le score est spectaculaire. Il est aussi entièrement auto-déclaré, et personne ne l'a encore reproduit. Ce qui mérite réellement votre attention se trouve ailleurs : ce modèle n'active que 6 milliards de paramètres pour produire une réponse, et sa licence contient une clause qui concerne directement toute entreprise qui vend de l'IA.
Ce qu'Alibaba a publié exactement
| Élément | Valeur |
|---|---|
| Date de publication | 26 août 2026 |
| Licence | Qwen Community License 1.0 (pas Apache 2.0) |
| Paramètres stockés | environ 180 milliards |
| Paramètres actifs par token | 6 milliards |
| Contexte natif | 262 144 tokens |
| Contexte étendu via YaRN | 1 million de tokens |
| Entrées | texte, image, vidéo |
| Sortie | texte |
| Poids téléchargeables | FP8 : 172,8 Gio · BF16 : 335,3 Gio |
Les 180 milliards de paramètres stockés se décomposent en trois blocs : 125 milliards pour le squelette principal, 51 milliards pour une table d'embeddings n-gram, et 4 milliards pour une tête de prédiction multi-token. C'est cette décomposition qui rend le modèle intéressant, bien plus que son classement du jour.
Alibaba annonce par ailleurs un coût d'entraînement d'environ un neuvième de celui de Qwen3.7-Plus, pour de meilleures performances en code et en tâches bureautiques.
Six milliards actifs : le vrai sujet
Qwen3.8-Flash-Next est un modèle Mixture of Experts. Ses 48 couches contiennent 512 experts, dont seulement 10 routés plus 1 partagé sont sollicités à chaque token. Autrement dit, le modèle est énorme sur le disque et minuscule à l'exécution.
La conséquence est directement financière. Le coût d'une réponse, en électricité comme en temps de calcul, suit les paramètres activés, pas les paramètres stockés. Un modèle dense de 125 milliards de paramètres mobiliserait la totalité de son réseau à chaque token. Celui-ci en réveille moins de 5 %.

Second effet, plus concret encore : la table d'embeddings n-gram de 51 milliards de paramètres a été conçue pour résider en mémoire vive système, avec préchargement asynchrone, plutôt qu'en mémoire graphique. En quantisation 4 bits, le modèle pèse environ 82 Go, dont 24 Go pour cette table qui peut sortir du GPU. Des configurations comme un Mac Studio 128 Go ou un DGX Spark suffisent alors à le faire tourner.
Ce n'est plus une question de datacenter. C'est une question de machine de bureau haut de gamme.
Les scores annoncés, et ce qu'ils valent aujourd'hui
Les chiffres publiés par Qwen sont les suivants.
| Benchmark | Qwen3.8-Flash-Next | Meilleur concurrent cité |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 (Claude Opus 4.6 Max) |
| GPQA Diamond | 91,7 | non communiqué |
| LiveCodeBench v6 | 91,9 | non communiqué |
| DeepSWE 1.1 | 58,7 | non communiqué |
| CoWorkBench | 73,9 | non communiqué |
| AndroidWorld | 84,5 | non communiqué |
Il faut lire aussi la colonne inverse, celle que les résumés omettent. Le modèle perd sur plusieurs terrains :
| Benchmark | Qwen3.8-Flash-Next | Concurrent devant |
|---|---|---|
| NL2Repo-Bench (code à l'échelle du dépôt) | 48,1 | 54,2 (DeepSeek-V4-Flash) |
| HLE (raisonnement de pointe) | 35,9 | 40,0 (Claude Opus 4.6) |
| OSWorld 2.0 (pilotage d'ordinateur) | 19,4 % de réussite | non communiqué |
Ce 19,4 % sur OSWorld mérite d'être retenu : sur des tâches de pilotage d'ordinateur, le modèle échoue quatre fois sur cinq. Nous sommes très loin d'un agent autonome fiable.
Surtout, aucun de ces chiffres n'a été reproduit par un tiers. Ils proviennent de la fiche modèle publiée par Qwen. Les plateformes de vérification indépendantes classent encore le modèle comme non vérifié. C'est normal pour un modèle publié il y a quelques jours, mais cela impose de traiter le classement comme une annonce commerciale, pas comme un résultat établi. Nous avions fait la même réserve pour GLM-5.1 et pour MiniMax M3.
Le prix de 0,16 dollar ne concerne pas le modèle que vous téléchargez
C'est la confusion la plus répandue depuis l'annonce, et elle change tout.
Deux produits distincts portent presque le même nom :
- Qwen3.8-Flash-Next est le modèle en poids ouverts. Vous le téléchargez, vous l'hébergez, il n'a aucun prix au token parce qu'il n'y a pas de facturation.
- Qwen3.8-Flash est la version de production, servie par l'API QwenCloud, ouverte le 28 août. C'est elle qui est facturée 0,16 dollar par million de tokens en entrée et 0,47 dollar en sortie.
Ces tarifs sont effectivement très agressifs. Mais les payer signifie repasser par une API propriétaire, hébergée par Alibaba, avec vos données qui sortent d'Europe. Vous retrouvez exactement l'arbitrage que le modèle ouvert était censé supprimer, et vous perdez le bénéfice de conformité que recherchent la plupart des entreprises françaises qui nous sollicitent sur le sujet de l'IA souveraine.
L'auto-hébergement ne coûte pas 0,16 dollar par million de tokens. Il coûte une machine, son amortissement et son exploitation.
Ce qu'il faut réellement pour l'héberger

| Précision | Empreinte | Matériel réaliste |
|---|---|---|
| BF16 | 335,3 Gio | plusieurs GPU de datacenter |
| FP8 | 172,8 Gio | minimum deux GPU récents haut de gamme |
| GGUF 4 bits | environ 82 Go, dont 24 Go déportables en RAM | station de travail 128 Go |
Le support est disponible dès le premier jour sur vLLM, SGLang et llama.cpp, et le fine-tuning sur Unsloth, Swift et LLaMA-Factory. Trois réserves techniques méritent d'être connues avant de s'engager :
- Le déport de la table n-gram en mémoire système ne fonctionne que sur matériel NVIDIA.
- Sur une configuration à huit GPU H200, le parallélisme tensoriel classique est incompatible avec les blocs de quantisation du checkpoint. Il faut basculer sur une autre stratégie de découpage.
- L'extension de contexte YaRN est statique et peut dégrader la qualité sur les textes courts. Si vos usages ne réclament pas un million de tokens, ne l'activez pas.
La licence, la clause que personne ne lit
Qwen3.8-Flash-Next n'est pas sous licence Apache 2.0. Il est publié sous Qwen Community License 1.0, et la nuance est loin d'être cosmétique.
L'usage commercial est autorisé, avec deux conditions. La première est anecdotique pour une PME française : au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 millions de dollars de revenu mensuel, vous devez afficher le nom du modèle. La seconde ne l'est pas du tout : exploiter une activité de Model-as-a-Service ou d'assistant de travail IA exige une licence séparée, négociée avec Qwen.

Traduisons. Héberger ce modèle pour vos propres équipes, sur votre propre infrastructure, ne pose pas de difficulté. Le revendre sous forme d'accès, l'intégrer au cœur d'un produit SaaS que vous facturez, ou en faire le moteur d'un assistant que vous commercialisez, vous fait entrer dans un périmètre qui demande un accord explicite.
C'est la différence de fond avec un modèle sous licence Apache 2.0, et c'est le premier point à vérifier avant d'écrire une ligne de code.
Notre avis chez RedArrow
La nouvelle n'est pas qu'un modèle chinois passe devant Anthropic sur un benchmark. Cela s'est déjà produit avec Kimi K3 et avec DeepSeek V4, et cela se reproduira au prochain trimestre dans l'autre sens. Courir après le classement du mois est le meilleur moyen de ne jamais rien livrer.
La nouvelle, c'est que le plancher de coût d'une assistance au code correcte continue de s'effondrer. Il y a dix-huit mois, il fallait une API propriétaire pour obtenir ce niveau. Aujourd'hui, une station de travail à 6 000 euros y arrive avec un modèle quantisé, sans qu'aucune donnée ne quitte vos locaux. Pour une PME ou une ETI soumise à des contraintes de confidentialité, c'est un changement de nature, pas de degré.
Ce que nous en tirons concrètement pour nos clients : le modèle ne doit jamais être une décision structurante. Nous construisons les agents IA et les logiciels métier de nos clients avec une couche d'abstraction qui rend le moteur interchangeable. Qwen aujourd'hui, Mistral demain, Claude après-demain, en fonction du coût, de la conformité et de la qualité réelle mesurée sur vos propres données, pas sur SWE-bench. La valeur durable est dans vos processus, vos données et l'intégration à votre système d'information. Elle n'a jamais été dans le nom du modèle.
Questions fréquentes
Qwen3.8-Flash-Next est-il vraiment meilleur que Claude Opus 4.6 ?
Sur SWE-bench Pro, Qwen annonce 62,5 contre 53,4, mais ce chiffre est auto-déclaré et n'a été reproduit par aucun tiers indépendant à ce jour. Sur d'autres épreuves, Claude Opus 4.6 reste devant, notamment en raisonnement de pointe avec 40,0 contre 35,9 sur HLE. Il n'y a pas de vainqueur général, seulement des profils différents.
Peut-on héberger Qwen3.8-Flash-Next dans son entreprise ?
Oui. En quantisation 4 bits, le modèle occupe environ 82 Go, dont 24 Go de table n-gram déportables en mémoire vive système. Une station de travail dotée de 128 Go de mémoire suffit. En FP8, il faut compter 172,8 Gio et donc plusieurs GPU de datacenter.
La licence Qwen permet-elle un usage commercial ?
Oui pour un usage interne, sous Qwen Community License 1.0 et non Apache 2.0. En revanche, exploiter une activité de Model-as-a-Service ou commercialiser un assistant de travail fondé sur ce modèle nécessite une licence séparée accordée par Qwen. Ce point doit être vérifié avant tout projet de revente.
En résumé
Qwen3.8-Flash-Next est une belle démonstration d'ingénierie : 180 milliards de paramètres stockés, 6 milliards activés, un million de tokens de contexte et un coût d'entraînement divisé par neuf. Les scores annoncés sont impressionnants et non vérifiés. Le tarif de 0,16 dollar ne s'applique pas au modèle ouvert. Et la licence n'est pas Apache.
Pour une entreprise française, la bonne question n'est pas de savoir si ce modèle bat Opus. C'est de savoir si votre architecture vous permettra d'en changer sans tout réécrire, le jour où le classement bougera de nouveau.
Parlons de votre architecture IA en 30 minutes →
Sources : llm-stats, fiche de lancement · MarkTechPost, analyse de l'architecture · CellCog, licence et déploiement · Local AI Zone, besoins matériels et limites