Qwen3.8-27B : audit des protocoles derrière les scores agentiques annoncés dans sa fiche Qwen
La fiche Qwen de Qwen3.8-27B annonce des scores agentiques issus de jeux publics ou internes ; selon les lignes, les baselines ont été rejouées, tandis que métriques, budgets, harness, scaffolds et graders diffèrent, sans reproduction indépendante reproductible identifiée par TekBrut au moment de la vérification.
Artefacts vérifiés le 15 août 2026 à 11:41, heure de Paris (Europe/Paris, UTC+02:00).
Qwen3.8-27B est disponible depuis le 14 août 2026 dans un dépôt Hugging Face public et non soumis à validation d’accès. L’API de la plateforme recense 27 781 427 952 paramètres BF16, répartis dans 18 fichiers safetensors. Qwen fournit aussi un checkpoint FP8 officiel. Le dépôt et sa licence permettent d’examiner et de déployer les poids ; ils ne valident pas les performances annoncées dans la fiche du modèle.
Cette distinction traverse toute l’analyse. Les scores publiés proviennent de Qwen. Certains portent sur des benchmarks publics exécutés ou réévalués par l’équipe, d’autres sur des jeux internes. Les réglages, les environnements et les budgets ne sont pas uniformes. TekBrut n’a identifié aucune reproduction indépendante reproductible au moment de la vérification.
Un modèle dense, mais une attention hybride
L’appellation « 27B » arrondit un total de 27,8 milliards de paramètres. Qwen3.8-27B est dense : il ne reprend pas l’architecture en mélange d’experts du checkpoint Qwen3.8-2.4T-A95B. Le mot « hybride » décrit ici l’alternance des mécanismes d’attention.
La configuration contient 64 couches. Le motif répète trois couches d’attention linéaire, désignées comme GDN dans la documentation, puis une couche d’attention complète. On obtient 48 couches linéaires et 16 couches d’attention complète. Cette organisation vise à traiter de longues séquences sans appliquer l’attention complète à chaque étage. Les gains de débit, de mémoire ou de qualité qui en résultent dépendront toutefois de l’implémentation et de la charge ; aucun de ces effets n’a été mesuré par TekBrut.
Les chiffres du checkpoint
| Élément | Valeur vérifiée | Portée |
|---|---|---|
| Paramètres BF16 | 27 781 427 952 | Métadonnées Hugging Face du dépôt officiel |
| Couches | 64 | Configuration officielle |
| Attention linéaire / complète | 48 / 16 | Décompte du motif de configuration |
| Contexte natif | 262 144 tokens | Configuration et fiche officielles |
| Fichiers de poids BF16 | 18 shards safetensors | API Hugging Face |
| Stockage du dépôt BF16 | 55 575 816 096 octets | Métadonnée de stockage, distincte de la VRAM |
| Licence | Apache-2.0 | Tag et fichier de licence concordants |
| Formats officiels | BF16, FP8 | Dépôts Qwen |
| Formats tiers examinés | GGUF, NVFP4 | Dépôts Unsloth, sans validation Qwen ni TekBrut |
Le modèle est configuré pour un pipeline image-texte vers texte. Qwen annonce la compréhension des images et des vidéos, et la configuration inclut un encodeur visuel. Cela établit la présence d’une voie multimodale et l’intention fonctionnelle du modèle, sans renseigner sa fiabilité sur des interfaces graphiques, des documents ou des vidéos longues.
262K natifs, 1M sous conditions
La fenêtre native déclarée atteint 262 144 tokens. Qwen documente une extension jusqu’à un million de tokens avec YaRN et des réglages explicites dans les runtimes pris en charge. Ce million ne correspond donc pas à la fenêtre native. Il ne garantit pas non plus qu’une requête de cette taille puisse être exécutée sur une carte de 24 Go, ni que la qualité reste stable jusqu’à cette limite.
La fiche décrit aussi un mode de raisonnement activé par défaut, les contrôles reasoning_effort et preserve_thinking, ainsi que des interfaces d’appel d’outils. Les recettes vLLM et SGLang mentionnent notamment les parsers qwen3 et qwen3_coder. Ces éléments documentent une compatibilité logicielle. La qualité du raisonnement, le respect des schémas d’outils et la récupération après erreur devront être testés séparément.
Ne pas confondre 27B, 2.4T-A95B et Max
La famille Qwen3.8 réunit plusieurs objets aux propriétés différentes :
- Qwen3.8-27B, sujet de cet article, est le checkpoint dense et multimodal de 27,8 milliards de paramètres ;
- Qwen3.8-2.4T-A95B est un autre checkpoint, de type mélange d’experts, avec 2,4 billions de paramètres au total et 95 milliards actifs d’après son identification ;
- Qwen3.8-Max désigne le modèle mis en avant dans le billet de présentation de la famille.
Les démonstrations de tâches conduites pendant plusieurs jours, de reproduction de travaux scientifiques ou de participation à une compétition multimodale concernent Max. Elles ne documentent ni l’endurance ni les résultats du 27B. De même, l’architecture et les scores du 2.4T-A95B ne peuvent pas servir de raccourci pour caractériser le checkpoint présenté ici.
Des écarts agentiques élevés dans le tableau de Qwen
Le tableau suivant reprend les valeurs de la fiche officielle. Les écarts sont calculés en points entre Qwen3.8-27B et Qwen3.6-27B sur une même ligne. Ils ne représentent pas des pourcentages relatifs et ne rendent pas les échelles de benchmarks différentes comparables entre elles.
Résultats annoncés par Qwen, non reproduits par TekBrut.
| Benchmark et métrique | Qwen3.8-27B | Qwen3.6-27B | Écart | Nature de la mesure |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73,0 | 63,4 | +9,6 | Benchmark public, exécuté et rapporté par Qwen |
| SWE-bench Pro | 61,7 | 53,5 | +8,2 | Benchmark public corrigé et baselines réévaluées par Qwen |
| DeepSWE 1.1 | 42,2 | 13,3 | +28,9 | Benchmark public, exécuté par Qwen avec Claude Code |
| QwenSWEBench | 79,0 | 49,3 | +29,7 | Benchmark interne Qwen, moyenne avg@3 |
| CoWorkBench | 70,7 | 61,0 | +9,7 | Benchmark interne Qwen consacré au long horizon |
Agents’ Last Exam, pass@1 | 20,4 | 10,6 | +9,8 | Résultat constructeur ; protocole externe non établi dans le dossier |
| Agents’ Last Exam, score | 42,9 | 27,3 | +15,6 | Résultat constructeur ; métrique distincte du pass@1 |
| OSWorld-Verified | 84,3 | 63,9 | +20,4 | Benchmark public, exécuté par Qwen |
| WebArena-Verified | 64,8 | 48,8 | +16,0 | Benchmark public, exécuté par Qwen avec grader officiel et scaffold OSWorld |
Les écarts numériques les plus grands apparaissent sur QwenSWEBench (+29,7 points) et DeepSWE 1.1 (+28,9 points). Le premier est interne, tandis que le second est public mais exécuté par Qwen. Leur proximité arithmétique ne permet pas de les agréger : jeux, budgets et métriques diffèrent.
Les deux lignes d’Agents’ Last Exam exigent la même prudence. La fiche publie 20,4 pour la métrique pass@1 et 42,9 pour une métrique distincte appelée « score ». Présenter 42,9 comme un pass@1 doublerait presque artificiellement le résultat.
Le protocole compte autant que la valeur publiée
SWE-bench Pro : un jeu corrigé et des baselines rejouées
Pour SWE-bench Pro, Qwen indique avoir corrigé des tâches problématiques, raffiné le jeu et réévalué les baselines. Le run du 27B utilise Claude Code, une température de 1,0, un top_p de 0,95 et un contexte de 256K. La valeur de 53,5 attribuée à Qwen3.6-27B appartient au même tableau de réévaluation, ce qui rend l’écart de +8,2 points lisible dans ce cadre précis.
Cette méthode complique les comparaisons avec des résultats historiques issus d’une version antérieure du jeu ou d’un autre harness. La fiche affiche aussi un score officiel de 53,4 pour Opus 4.6 Max. Qwen précise qu’il ne provient pas nécessairement de son protocole de réévaluation. Un dixième de point d’écart ne peut donc pas établir un classement entre Qwen3.8-27B et cette baseline.
DeepSWE et QwenSWEBench : même harness, statuts différents
DeepSWE 1.1 est public. Qwen déclare l’avoir exécuté avec Claude Code, une température de 1,0, un top_p de 0,95 et 256K de contexte. Son 42,2 reste un run constructeur.
QwenSWEBench est un jeu interne. La fiche indique Claude Code, une moyenne avg@3, un délai maximal de huit heures, une sortie plafonnée à 32 768 tokens, une température de 1,0 et 256K de contexte. Ces ressources décrivent une évaluation d’agent au budget large. Le 79,0 ne peut pas être rapproché directement d’un pass@1, d’un timeout plus court ou d’un benchmark sans retries normalisés.
Environnements, scaffolds et graders
OSWorld-Verified et WebArena-Verified mesurent des agents dans des environnements interactifs. Pour WebArena, Qwen mentionne le grader officiel sous un scaffold OSWorld. La version de l’environnement, le scaffold, le nombre d’actions, les reprises après échec et le budget de génération peuvent déplacer le score sans changement du modèle lui-même.
Le suffixe « Verified » appartient au nom du benchmark ; il ne signifie pas que le résultat de Qwen a été audité par une équipe indépendante. D’autres lignes de la fiche du modèle recourent à des juges modèles ou à des corrections manuelles de vérité terrain. Une valeur issue de ce type de pipeline dépend aussi du juge et des règles de correction.
Terminal-Bench 2.1, CoWorkBench et Agents’ Last Exam sont moins documentés dans le dossier disponible. CoWorkBench est identifié comme interne. Pour Agents’ Last Exam, la provenance opérationnelle du run n’a pas été établie au-delà de la publication par Qwen. L’absence de détails homogènes interdit une lecture de l’ensemble comme un classement unique.
Encadré méthodologique — Comment lire ces scores
- Chaque ligne décrit un protocole propre ; les écarts n’ont de sens qu’à l’intérieur de cette ligne.
- « Benchmark public » signifie que le jeu ou l’évaluation est public, pas que le run de Qwen est indépendant.
- Une réévaluation après correction du jeu doit être comparée aux baselines rejouées avec la même méthode.
pass@1, score,avg@3, timeout de huit heures et budgets de sortie différents ne sont pas interchangeables.- Harness, scaffold, parser d’outils, grader, juge modèle, retries et longueur de contexte font partie du résultat.
- TekBrut n’a identifié aucune reproduction indépendante reproductible de Qwen3.8-27B au moment de la vérification.
Ce que ces résultats autorisent à envisager
Les données de Qwen justifient de tester Qwen3.8-27B sur quatre familles d’usage. Elles ne démontrent pas que le modèle soit prêt pour chacune d’elles.
Code agentique et appels d’outils
Les écarts publiés sur SWE-bench Pro, DeepSWE 1.1, QwenSWEBench et Terminal-Bench 2.1 indiquent une priorité donnée au code agentique. Les parsers documentés rendent possible une évaluation avec choix automatique d’outils. Un test utile devra dépasser la réussite finale : conformité du JSON, sélection du bon outil, gestion des erreurs, nombre de tours, coût en tokens et reproductibilité entre essais comptent aussi.
Tâches longues
Le contexte natif de 262K et le score interne CoWorkBench donnent des raisons d’examiner les travaux qui s’étendent sur plusieurs documents ou étapes. Ils ne renseignent pas encore le taux de dérive, la capacité à reprendre après une erreur, la consommation mémoire ou la qualité au-delà de la fenêtre native. L’extension YaRN jusqu’à 1M ajoute une configuration possible, pas un résultat expérimental.
Vision et contrôle d’interface
L’encodeur visuel, la prise en charge annoncée des images et vidéos, puis les scores OSWorld et WebArena placent l’usage multimodal parmi les fonctions à tester. Il faudra séparer perception, localisation des éléments, décision et exécution. Un bon score agrégé ne permet pas d’identifier laquelle de ces étapes échoue sur une machine locale.
Une carte de 24 Go impose une quantification
Les poids BF16 occupent environ 51,75 GiB à raison de deux octets par paramètre, avant cache, activations, buffers, encodeur visuel et surcoût du runtime. Le checkpoint officiel ne tient donc pas intégralement dans 24 Go de VRAM.
À un octet par paramètre, une estimation théorique du FP8 atteint déjà environ 25,87 GiB. Il faut encore ajouter les échelles de quantification, les métadonnées, les caches et le runtime. Le dépôt FP8 officiel répond à d’autres configurations matérielles ; il ne constitue pas une voie confortable documentée pour une carte de 24 Go.
Q4 et Q5 : des tailles de fichiers, pas des mesures de VRAM
Le dépôt GGUF tiers d’Unsloth proposait, lors de la vérification, des variantes Q4 d’environ 16,1 à 17,9 Go et des variantes Q5 autour de 19,3 à 20,2 Go. Certaines variantes Q6 atteignaient environ 22,9 à 25,9 Go. Ces nombres décrivent des fichiers. Ils ne comprennent pas nécessairement le cache, les buffers GPU, l’état des couches linéaires, le traitement visuel, la mémoire du processus ni les effets d’un éventuel offload CPU.
Unsloth avance également un total de 17 à 19 Go pour du 4-bit. Faute de mesure TekBrut sur RTX 4090, cette indication reste un claim tiers. Un Q4 laisse sur le papier davantage de marge qu’un Q5, mais la longueur de contexte et le runtime décideront si cette marge suffit. Le Q5 peut réduire encore l’espace disponible avant même de charger une requête longue.
La fenêtre de 262K accentue le problème. L’architecture hybride ne supprime ni l’état des couches linéaires/GDN ni le cache associé aux couches d’attention complète. Les recettes SGLang exposent d’ailleurs un réglage de mémoire propre aux couches de type Mamba/GDN. Le contexte réellement atteignable, la concurrence et les risques d’erreur mémoire doivent être mesurés pour chaque quantification.
Runtimes et parsers à figer
Qwen documente Transformers, vLLM et SGLang. Les GGUF tiers orientent aussi vers les runtimes compatibles avec ce format, mais la présence d’un fichier GGUF ne suffit pas à valider une version précise de llama.cpp pour le modèle, la vision et les appels d’outils.
Le parser fait partie de la configuration expérimentale. Un modèle capable d’émettre un appel d’outil peut échouer si le template de conversation, le parser qwen3 ou qwen3_coder, le mode de raisonnement et la grammaire de sortie ne correspondent pas. Une mesure locale devra donc publier les versions et les options exactes, plutôt que résumer l’essai par « tool calling pris en charge ».
NVFP4 ne se transpose pas à une RTX 4090
Le dépôt NVFP4 examiné est une publication tierce Unsloth, marquée comme preview. Les chemins NVFP4/FP4 documentés ciblent Blackwell. Une RTX 4090 repose sur Ada ; elle ne doit pas être présentée comme exécutant nativement ce format de la même manière. Un runtime pourrait employer un autre chemin de calcul ou un fallback, mais il faudrait alors le nommer et le mesurer comme tel.
Le prochain contrôle doit être reproductible
TekBrut préparera un protocole Lab distinct de cet article. Aucun test TekBrut de Qwen3.8-27B n’a encore été exécuté.
Le protocole devra enregistrer le commit exact du modèle, le fichier quantifié, le runtime, le pilote, le matériel, le template de conversation et le parser. Sur une RTX 4090 24 Go, il comparera au moins un Q4 et un Q5 avec les mêmes prompts, températures, limites de sortie, timeouts et règles de retry. Les mesures couvriront le chargement en VRAM et en RAM, le débit de préremplissage et de décodage, le contexte atteint avant erreur mémoire, ainsi que le comportement de l’encodeur visuel.
Les essais agentiques sépareront code, terminal, appels d’outils, tâches longues et contrôle d’interface. Prompts, sorties, logs, seeds lorsqu’ils sont disponibles et échecs seront conservés. Les scores de Qwen ne serviront de comparaison directe que si le même jeu, le même harness, le même scaffold et le même budget peuvent être reproduits.
D’ici là, le checkpoint public, la licence Apache-2.0 et les quants tiers rendent l’expérimentation locale envisageable. La qualité agentique, le débit, la mémoire réellement consommée, la stabilité multimodale et le contexte exploitable sur 24 Go restent à établir.
Sources primaires
- Qwen, fiche officielle de Qwen3.8-27B : https://huggingface.co/Qwen/Qwen3.8-27B
- Hugging Face, métadonnées API du dépôt officiel : https://huggingface.co/api/models/Qwen/Qwen3.8-27B
- Qwen, configuration officielle : https://huggingface.co/Qwen/Qwen3.8-27B/raw/main/config.json
- Qwen, licence du checkpoint : https://huggingface.co/Qwen/Qwen3.8-27B/raw/main/LICENSE
- Qwen, checkpoint FP8 officiel : https://huggingface.co/Qwen/Qwen3.8-27B-FP8
- Qwen, collection Qwen3.8 : https://huggingface.co/collections/Qwen/qwen38
- Qwen, annonce officielle du 14 août 2026 : https://x.com/Alibaba_Qwen/status/2088280182356611304
- Qwen, billet de présentation de Qwen3.8-Max, utilisé uniquement pour séparer Max du 27B : https://qwen.ai/blog?id=qwen3.8
Documentation technique et formats tiers
- Recette vLLM pour Qwen3.8-27B : https://recipes.vllm.ai/Qwen/Qwen3.8-27B
- Cookbook SGLang pour Qwen3.8-27B : https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B
- Documentation Unsloth sur Qwen3.8 : https://unsloth.ai/docs/models/qwen3.8
- GGUF tiers Unsloth : https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
- NVFP4 tiers Unsloth : https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4