Agence IA Services Références Actualités Qui sommes-nous Contact
Logo Qwen violet flottant dans une allee de baies de serveurs sombre
News IA

Qwen3.8-Flash-Next : l'open-weight qui n'active que 6 milliards de paramètres

Alibaba publie un modèle multimodal de 180 milliards de paramètres qui n'en active que 6 par token. Les scores annoncés dépassent Claude Opus 4.6, mais aucun tiers ne les a vérifiés et la licence n'est pas Apache 2.0.

8 min de lecture Benoit Charlier
Guide complet : News IA

Le 26 août 2026, l'équipe Qwen d'Alibaba a publié en poids ouverts Qwen3.8-Flash-Next, un modèle multimodal présenté comme un avant-goût de l'architecture Qwen4. Le chiffre qui circule depuis est celui de SWE-bench Pro : 62,5 contre 53,4 pour Claude Opus 4.6 Max.

Le score est spectaculaire. Il est aussi entièrement auto-déclaré, et personne ne l'a encore reproduit. Ce qui mérite réellement votre attention se trouve ailleurs : ce modèle n'active que 6 milliards de paramètres pour produire une réponse, et sa licence contient une clause qui concerne directement toute entreprise qui vend de l'IA.

Ce qu'Alibaba a publié exactement

Élément Valeur
Date de publication 26 août 2026
Licence Qwen Community License 1.0 (pas Apache 2.0)
Paramètres stockés environ 180 milliards
Paramètres actifs par token 6 milliards
Contexte natif 262 144 tokens
Contexte étendu via YaRN 1 million de tokens
Entrées texte, image, vidéo
Sortie texte
Poids téléchargeables FP8 : 172,8 Gio · BF16 : 335,3 Gio

Les 180 milliards de paramètres stockés se décomposent en trois blocs : 125 milliards pour le squelette principal, 51 milliards pour une table d'embeddings n-gram, et 4 milliards pour une tête de prédiction multi-token. C'est cette décomposition qui rend le modèle intéressant, bien plus que son classement du jour.

Alibaba annonce par ailleurs un coût d'entraînement d'environ un neuvième de celui de Qwen3.7-Plus, pour de meilleures performances en code et en tâches bureautiques.

Six milliards actifs : le vrai sujet

Qwen3.8-Flash-Next est un modèle Mixture of Experts. Ses 48 couches contiennent 512 experts, dont seulement 10 routés plus 1 partagé sont sollicités à chaque token. Autrement dit, le modèle est énorme sur le disque et minuscule à l'exécution.

La conséquence est directement financière. Le coût d'une réponse, en électricité comme en temps de calcul, suit les paramètres activés, pas les paramètres stockés. Un modèle dense de 125 milliards de paramètres mobiliserait la totalité de son réseau à chaque token. Celui-ci en réveille moins de 5 %.

Une grille de centaines de cubes noirs dont seuls quelques-uns s'illuminent en violet, figurant l'activation clairsemee d'un modele Mixture of Experts

Second effet, plus concret encore : la table d'embeddings n-gram de 51 milliards de paramètres a été conçue pour résider en mémoire vive système, avec préchargement asynchrone, plutôt qu'en mémoire graphique. En quantisation 4 bits, le modèle pèse environ 82 Go, dont 24 Go pour cette table qui peut sortir du GPU. Des configurations comme un Mac Studio 128 Go ou un DGX Spark suffisent alors à le faire tourner.

Ce n'est plus une question de datacenter. C'est une question de machine de bureau haut de gamme.

Les scores annoncés, et ce qu'ils valent aujourd'hui

Les chiffres publiés par Qwen sont les suivants.

Benchmark Qwen3.8-Flash-Next Meilleur concurrent cité
SWE-bench Pro 62,5 53,4 (Claude Opus 4.6 Max)
GPQA Diamond 91,7 non communiqué
LiveCodeBench v6 91,9 non communiqué
DeepSWE 1.1 58,7 non communiqué
CoWorkBench 73,9 non communiqué
AndroidWorld 84,5 non communiqué

Il faut lire aussi la colonne inverse, celle que les résumés omettent. Le modèle perd sur plusieurs terrains :

Benchmark Qwen3.8-Flash-Next Concurrent devant
NL2Repo-Bench (code à l'échelle du dépôt) 48,1 54,2 (DeepSeek-V4-Flash)
HLE (raisonnement de pointe) 35,9 40,0 (Claude Opus 4.6)
OSWorld 2.0 (pilotage d'ordinateur) 19,4 % de réussite non communiqué

Ce 19,4 % sur OSWorld mérite d'être retenu : sur des tâches de pilotage d'ordinateur, le modèle échoue quatre fois sur cinq. Nous sommes très loin d'un agent autonome fiable.

Surtout, aucun de ces chiffres n'a été reproduit par un tiers. Ils proviennent de la fiche modèle publiée par Qwen. Les plateformes de vérification indépendantes classent encore le modèle comme non vérifié. C'est normal pour un modèle publié il y a quelques jours, mais cela impose de traiter le classement comme une annonce commerciale, pas comme un résultat établi. Nous avions fait la même réserve pour GLM-5.1 et pour MiniMax M3.

Le prix de 0,16 dollar ne concerne pas le modèle que vous téléchargez

C'est la confusion la plus répandue depuis l'annonce, et elle change tout.

Deux produits distincts portent presque le même nom :

  • Qwen3.8-Flash-Next est le modèle en poids ouverts. Vous le téléchargez, vous l'hébergez, il n'a aucun prix au token parce qu'il n'y a pas de facturation.
  • Qwen3.8-Flash est la version de production, servie par l'API QwenCloud, ouverte le 28 août. C'est elle qui est facturée 0,16 dollar par million de tokens en entrée et 0,47 dollar en sortie.

Ces tarifs sont effectivement très agressifs. Mais les payer signifie repasser par une API propriétaire, hébergée par Alibaba, avec vos données qui sortent d'Europe. Vous retrouvez exactement l'arbitrage que le modèle ouvert était censé supprimer, et vous perdez le bénéfice de conformité que recherchent la plupart des entreprises françaises qui nous sollicitent sur le sujet de l'IA souveraine.

L'auto-hébergement ne coûte pas 0,16 dollar par million de tokens. Il coûte une machine, son amortissement et son exploitation.

Ce qu'il faut réellement pour l'héberger

Une baie de serveurs GPU ouverte dans un local technique clair, avec quelques diodes violettes comme seule couleur saturee

Précision Empreinte Matériel réaliste
BF16 335,3 Gio plusieurs GPU de datacenter
FP8 172,8 Gio minimum deux GPU récents haut de gamme
GGUF 4 bits environ 82 Go, dont 24 Go déportables en RAM station de travail 128 Go

Le support est disponible dès le premier jour sur vLLM, SGLang et llama.cpp, et le fine-tuning sur Unsloth, Swift et LLaMA-Factory. Trois réserves techniques méritent d'être connues avant de s'engager :

  1. Le déport de la table n-gram en mémoire système ne fonctionne que sur matériel NVIDIA.
  2. Sur une configuration à huit GPU H200, le parallélisme tensoriel classique est incompatible avec les blocs de quantisation du checkpoint. Il faut basculer sur une autre stratégie de découpage.
  3. L'extension de contexte YaRN est statique et peut dégrader la qualité sur les textes courts. Si vos usages ne réclament pas un million de tokens, ne l'activez pas.

La licence, la clause que personne ne lit

Qwen3.8-Flash-Next n'est pas sous licence Apache 2.0. Il est publié sous Qwen Community License 1.0, et la nuance est loin d'être cosmétique.

L'usage commercial est autorisé, avec deux conditions. La première est anecdotique pour une PME française : au-delà de 100 millions d'utilisateurs actifs mensuels ou de 20 millions de dollars de revenu mensuel, vous devez afficher le nom du modèle. La seconde ne l'est pas du tout : exploiter une activité de Model-as-a-Service ou d'assistant de travail IA exige une licence séparée, négociée avec Qwen.

Un contrat imprime sur un bureau en bois sombre, une clause surlignee en violet, des lunettes et un stylo poses a cote

Traduisons. Héberger ce modèle pour vos propres équipes, sur votre propre infrastructure, ne pose pas de difficulté. Le revendre sous forme d'accès, l'intégrer au cœur d'un produit SaaS que vous facturez, ou en faire le moteur d'un assistant que vous commercialisez, vous fait entrer dans un périmètre qui demande un accord explicite.

C'est la différence de fond avec un modèle sous licence Apache 2.0, et c'est le premier point à vérifier avant d'écrire une ligne de code.

Notre avis chez RedArrow

La nouvelle n'est pas qu'un modèle chinois passe devant Anthropic sur un benchmark. Cela s'est déjà produit avec Kimi K3 et avec DeepSeek V4, et cela se reproduira au prochain trimestre dans l'autre sens. Courir après le classement du mois est le meilleur moyen de ne jamais rien livrer.

La nouvelle, c'est que le plancher de coût d'une assistance au code correcte continue de s'effondrer. Il y a dix-huit mois, il fallait une API propriétaire pour obtenir ce niveau. Aujourd'hui, une station de travail à 6 000 euros y arrive avec un modèle quantisé, sans qu'aucune donnée ne quitte vos locaux. Pour une PME ou une ETI soumise à des contraintes de confidentialité, c'est un changement de nature, pas de degré.

Ce que nous en tirons concrètement pour nos clients : le modèle ne doit jamais être une décision structurante. Nous construisons les agents IA et les logiciels métier de nos clients avec une couche d'abstraction qui rend le moteur interchangeable. Qwen aujourd'hui, Mistral demain, Claude après-demain, en fonction du coût, de la conformité et de la qualité réelle mesurée sur vos propres données, pas sur SWE-bench. La valeur durable est dans vos processus, vos données et l'intégration à votre système d'information. Elle n'a jamais été dans le nom du modèle.

Questions fréquentes

Qwen3.8-Flash-Next est-il vraiment meilleur que Claude Opus 4.6 ?

Sur SWE-bench Pro, Qwen annonce 62,5 contre 53,4, mais ce chiffre est auto-déclaré et n'a été reproduit par aucun tiers indépendant à ce jour. Sur d'autres épreuves, Claude Opus 4.6 reste devant, notamment en raisonnement de pointe avec 40,0 contre 35,9 sur HLE. Il n'y a pas de vainqueur général, seulement des profils différents.

Peut-on héberger Qwen3.8-Flash-Next dans son entreprise ?

Oui. En quantisation 4 bits, le modèle occupe environ 82 Go, dont 24 Go de table n-gram déportables en mémoire vive système. Une station de travail dotée de 128 Go de mémoire suffit. En FP8, il faut compter 172,8 Gio et donc plusieurs GPU de datacenter.

La licence Qwen permet-elle un usage commercial ?

Oui pour un usage interne, sous Qwen Community License 1.0 et non Apache 2.0. En revanche, exploiter une activité de Model-as-a-Service ou commercialiser un assistant de travail fondé sur ce modèle nécessite une licence séparée accordée par Qwen. Ce point doit être vérifié avant tout projet de revente.

En résumé

Qwen3.8-Flash-Next est une belle démonstration d'ingénierie : 180 milliards de paramètres stockés, 6 milliards activés, un million de tokens de contexte et un coût d'entraînement divisé par neuf. Les scores annoncés sont impressionnants et non vérifiés. Le tarif de 0,16 dollar ne s'applique pas au modèle ouvert. Et la licence n'est pas Apache.

Pour une entreprise française, la bonne question n'est pas de savoir si ce modèle bat Opus. C'est de savoir si votre architecture vous permettra d'en changer sans tout réécrire, le jour où le classement bougera de nouveau.

Parlons de votre architecture IA en 30 minutes →


Sources : llm-stats, fiche de lancement · MarkTechPost, analyse de l'architecture · CellCog, licence et déploiement · Local AI Zone, besoins matériels et limites

Agent commercial IAAgent IA entrepriseAutomatisation n8nChatbot IAE-commerce IAFormation IAGEOMulti-canaln8nQualification leadsRAGRGPDROISEO intelligentSite vitrineSite web IASupport client IAWhatsApp Business