Qwen3 est la génération de LLM à poids ouverts publiée par Alibaba Cloud en 2025. Le dépôt officiel couvre checkpoints dense/MoE de 0,6B à 235B, pensée hybride, outils, multilingue et auto-hébergement. Poids, model cards et licence Apache-2.0 donnent une cible reproductible plutôt qu'un alias API mouvant.
Mais ce GitHub n'est pas l'endpoint Qwen le plus récent en août 2026. Qwen3-2507 fut la dernière mise à jour originale ; la lignée ouverte actuelle est Qwen3.6 avec 27B et 35B-A3B. Model Studio sert séparément des IDs propriétaires tels que qwen3.8-max. Qwen3 historique, Qwen3.6 ouvert et service hébergé sont trois choix différents.
Ce que Qwen3 signifie en 2026
| Branche | Modèles | Position |
|---|---|---|
| Qwen3 original | 0,6B–235B ; final 2507 Instruct/Thinking | Stable, reproductible, plus la famille récente |
| Qwen3-Next / 3.5 | 80B-A3B et successeurs | Intermédiaires pour projets épinglés |
| Qwen3.6 ouvert | 27B et 35B-A3B | Branche ouverte actuelle général/code |
| Model Studio | qwen3.8-max, snapshots Plus/Flash | Service propriétaire, pas checkpoint GitHub |
N'attribuez pas à un modèle hébergé 2026 les benchmarks, le contexte d'entraînement 32K ou le switch /think du lancement 2025. Model card, Model Studio et Qwen Chat diffèrent en version, limites, données et prix.
Qwen3 original reste une large boîte à outils
La série comprend dense 0,6B, 1,7B, 4B, 8B, 14B, 32B et MoE 30B-A3B, 235B-A22B. A3B/A22B désignent les paramètres actifs par token, pas le stockage : 30B-A3B porte toujours environ 30B total. Le lancement couvrait 119 langues/dialectes et pensée hybride ; 2507 sépara Instruct/Thinking et ajouta des recettes long contexte.
Le dépôt annonce Apache-2.0 pour ses poids. La licence permet l'usage commercial et inclut un brevet, sous obligations de notices lors de redistribution. Elle ne donne aucun droit sur inputs, datasets tiers, marques ou outputs. Vérifiez quantisation, merge et fine-tune séparément.
| Contrainte | Départ | Pourquoi | Risque |
|---|---|---|---|
| Edge/petite mémoire | Qwen3 0,6B–4B ou quant vérifiée | Petit et compatible | Instruction, langues, hallucination |
| Assistant workstation | Qwen3 8B/14B ou Qwen3.6 | Équilibre | KV cache, contexte, concurrence |
| Débit MoE | 30B-A3B ou 35B-A3B | Peu de paramètres actifs | Poids total, routing, moteur |
| Agent vision/code | Qwen3.6 27B/35B-A3B | Post-training/vision actuels | Parser, pensée, sandbox |
| Sans GPU Ops | Snapshot daté Model Studio | Inférence gérée | Région, rétention, prix, alias |
Qwen3.6 change les hypothèses de déploiement
Qwen3.6-27B est dense vision-language ; 35B-A3B est MoE avec ~3B actifs. Les cartes indiquent 262 144 tokens natifs et extension ~1,01M. C'est une capacité de configuration, pas une garantie pour chaque GPU. La commande SGLang 27B de référence utilise tensor parallel 8 à 262K : référence, pas minimum universel.
Qwen3.6 pense par défaut mais ne prend plus officiellement /think//nothink. Self-host utilise souvent le chat template ; Model Studio enable_thinking. Conserver le raisonnement historique peut aider les agents seulement si modèle, template et serveur partagent le format.
Workflow de déploiement et d'évaluation
- Épingler dépôt, révision, tokenizer, licence, quant, template, moteur ou snapshot hébergé daté.
- Construire tâches privées en français/chinois/langues cibles avec retrieval, code, tools, long, refus et injection.
- Partir du contexte minimal accepté et mesurer poids, KV, prefill, decode, concurrence et OOM.
- Comparer pensée/non-pensée selon acceptation, latence, tokens et exactitude tools.
- Valider arguments, identité, droits, budget, sandbox, réseau et approbation côté serveur.
- Rejouer l'eval figée avant poids, alias, moteur, prompt, retrieval ou quant.
| Métrique | Définition | Détecte |
|---|---|---|
| Succès avec preuve | Sorties acceptées et justifiées/tâches | Fluidité non étayée |
| Succès outils | Tool/schema/droits/séquence/résultat corrects | Sécurité d'action |
| Rappel positionnel | Preuves début/milieu/fin | Au-delà longueur max |
| Coût accepté | GPU/API/reprises/revue par approuvé | Correction chère |
| Stabilité | OOM, répétition, parser, timeout | Échecs cachés |
Prix hébergé et taxe du long contexte
Au 20 août 2026, Model Studio affiche qwen3.8-max global jusqu'à 1M à CNY 12 par million d'entrée et CNY 36 de sortie. Max/Plus, régions, paliers, promotions et quotas diffèrent ; qwen3.6-plus augmente au-delà de 256K input. Un prix ne représente pas toute la famille.
Self-host remplace tokens par accélérateurs, VRAM, stockage, réseau, ingénierie et utilisation. Le long contexte augmente KV et prefill. La quantification économise la mémoire mais peut modifier qualité et kernels. Comparez snapshot hébergé et candidats locaux sur mêmes tâches et pic de concurrence.
Sécurité, confidentialité et limites
- Traiter web, dépôts, documents et sorties d'outils récupérés comme non fiables.
- Exécuter le code dans checkout/conteneur isolé, credentials limités, egress, tests et diff revu.
- 119 langues ne garantissent pas la même safety ; tester refus et toxicité par langue.
- Minimiser les métadonnées vision et tester les instructions cachées dans images/documents.
- Pour hosted, vérifier région, contrat, rétention, logs et contrôles de compte.
- L'opérateur self-host assume auth, isolation, monitoring, abus, patches, suppression et incidents.
Comparaison DeepSeek, Llama, Gemma et API
| Option | Atout | Compromis | Test |
|---|---|---|---|
| Qwen3/3.6 | Tailles, Apache-2.0, chinois/multilingue, dense/MoE, tools | Versions complexes ; vision/long exige matériel | Tâches privées sur hardware cible |
| DeepSeek V4 | Prix hosted bas, poids V4, efficacité 1M | Checkpoints énormes, frontière data différente | Coût accepté et empreinte Ops |
| Meta Llama | Large écosystème | Licence non Apache-2.0 | Portabilité, langue, licence |
| Google Gemma | Petits modèles et tooling Google | Autre licence/comportement | Qualité par GB/watt |
| API frontier gérée | Pas de serving, scale géré | Prix/alias, lock-in, gouvernance | Mêmes tâches, région, fallback, total |
Notre jugement : Qwen excelle par son optionnalité, du petit dense au MoE, aux poids vision/code actuels et au cloud Alibaba. Cette largeur rend ‘Qwen3’ insuffisant. Choisissez le plus petit checkpoint exact qui passe l'eval privée, épinglez un snapshot daté en production gouvernée et évaluez Qwen3.6 sans prétendre que le dépôt 2025 est le défaut actuel.
Questions fréquentes
Qwen3 est-il encore actuel ?
Utilisable, mais pas la branche la plus récente. L'original s'arrête à 2507 ; Qwen3.6 est le successeur ouvert et Model Studio a des IDs propriétaires plus nouveaux.
Qwen3 est-il open source ?
Le repo dit open-weight Apache-2.0. Open-weight est plus précis car données et pipeline complet ne sont pas nécessairement publiés.
Quel modèle local ?
Le plus petit checkpoint qui passe vos tâches. Qwen3 offre petits–32B dense ; Qwen3.6 ajoute vision/agents actuels.
Qwen3.6 local supporte-t-il 1M ?
La carte indique 262K natif et extension ~1,01M ; moteur, GPU, précision, concurrence et mémoire décident.
qwen3.8-max est-il téléchargeable ?
Non. C'est un ID Model Studio hébergé. Pour les poids, utilisez un dépôt Qwen3.6 publié.
Tools/MCP sont-ils possibles ?
Oui, avec validation schema, droits, sandbox, limites et approbation des actions importantes dans l'application.
Apache-2.0 autorise-t-il le commercial ?
Généralement oui sous conditions. Vérifiez modèle/dérivé, notices, données, output et marque ; pas un avis juridique.
Sources vérifiées
- Qwen3 official GitHub repository, release history and Apache-2.0 notice
- Qwen3 launch article: architectures, languages and hybrid thinking
- Qwen3 technical report
- Current Qwen3.5/Qwen3.6 open-model repository and release history
- Qwen3.6-27B official model card and deployment guidance
- Qwen3.6-35B-A3B official model card
- Alibaba Cloud Model Studio qwen3.6-plus capabilities and context limits
- Alibaba Cloud Model Studio live model and pricing table
- Model Studio thinking-mode documentation
Revue indépendante le 20 août 2026. Modèles, snapshots, prix, promotions, contexte, licences et régions évoluent ; vérifiez model card, Model Studio et compte actif.

