Qwen3 ist die 2025 veröffentlichte Open-Weight-Generation von Alibaba Cloud. Das offizielle Repository umfasst dichte und MoE-Checkpoints von 0,6B bis 235B Parametern, hybrides Thinking, Tool Use, mehrsprachige Arbeit und Self-Hosting. Gewichte, Model Cards und Apache-2.0-Lizenz ergeben ein reproduzierbares Ziel statt eines beweglichen API-Alias.
Die GitHub-Seite ist jedoch nicht der neueste Qwen-Endpunkt im August 2026. Qwen3-2507 war das letzte Original-Update. Die offene Nachfolgelinie heißt heute Qwen3.6, unter anderem Qwen3.6-27B und 35B-A3B. Model Studio bietet getrennt verwaltete, proprietäre IDs wie qwen3.8-max. Historisches Qwen3, aktuelles offenes Qwen3.6 und Hosted Service sind verschiedene Kauf- und Architekturentscheidungen.
Was Qwen3 im Jahr 2026 bezeichnet
| Zweig | Beispiele | Aktuelle Position |
|---|---|---|
| Original Qwen3 | 0,6B–235B, finale 2507 Instruct/Thinking | Stabil und reproduzierbar, aber nicht neueste Familie |
| Qwen3-Next / 3.5 | 80B-A3B und spätere dense/MoE | Zwischengeneration für explizit fixierte Projekte |
| Open Qwen3.6 | 27B und 35B-A3B | Aktueller offener General-/Coding-Zweig |
| Model Studio Hosted | qwen3.8-max, Plus/Flash-Snapshots | Proprietärer Dienst, nicht der GitHub-Checkpoint |
Übertragen Sie Launch-Benchmarks von 2025, 32K Trainingskontext oder den damaligen /think-Schalter nicht auf ein gehostetes Modell von 2026. Open Model Card, Model Studio und Qwen Chat unterscheiden sich in Version, Limit, Datenbedingungen und Preis.
Original Qwen3 bleibt ein breiter Open-Weight-Baukasten
Die Familie enthält dichte Modelle mit 0,6B, 1,7B, 4B, 8B, 14B und 32B sowie die MoE-Modelle 30B-A3B und 235B-A22B. A3B/A22B sind pro Token aktivierte Parameter, nicht die gespeicherte Modellgröße: 30B-A3B enthält weiterhin ungefähr 30B Gesamtparameter. Der Launch nannte 119 Sprachen und Dialekte sowie hybrides Thinking; 2507 trennte Instruct- und Thinking-Varianten und ergänzte Langkontext-Rezepte.
Das Repository lizenziert seine Open Weights unter Apache 2.0. Das ist kommerziell nutzbar und enthält eine Patentlizenz, verlangt aber unter anderem Lizenz-/Hinweiserhalt bei Weitergabe. Rechte an Eingaben, Drittdatensätzen, Marken oder Outputs entstehen dadurch nicht. Prüfen Sie Quantisierung, Merge und Fine-Tune einzeln.
| Constraint | Startpunkt | Grund | Zu testen |
|---|---|---|---|
| Edge/kleiner Speicher | Qwen3 0,6B–4B oder geprüfte Quantisierung | Klein und breit unterstützt | Instruction Quality, Sprachen, Halluzination |
| Workstation-Assistent | Qwen3 8B/14B oder Qwen3.6 | Balance aus Fähigkeit und Betrieb | KV Cache, Kontext, Parallelität |
| MoE-Durchsatz | 30B-A3B oder 35B-A3B | Weniger aktive Parameter | Gesamtgewichte, Routing, Engine-Reife |
| Vision-/Coding-Agent | Qwen3.6 27B/35B-A3B | Neueres Post-Training und Vision | Parser, Thinking State, Sandbox |
| Kein GPU-Betrieb | Datiertes Model-Studio-Snapshot | Managed Inference | Region, Aufbewahrung, Preis, Alias |
Qwen3.6 verändert die Deployment-Annahmen
Qwen3.6-27B ist ein dichtes Vision-Language-Modell; 35B-A3B ist ein MoE mit etwa drei Milliarden aktiven Parametern. Die offiziellen Karten nennen 262.144 Tokens nativ und Erweiterung auf rund 1,01M. Das ist eine Konfigurationsmöglichkeit, keine Garantie für jede GPU-Anordnung. Der SGLang-Referenzbefehl für 27B nutzt bei 262K achtfache Tensorparallelität; das ist ein Referenzaufbau, kein allgemeines Minimum.
Qwen3.6 denkt standardmäßig, unterstützt aber den Qwen3-Soft-Switch /think//nothink nicht offiziell. Self-Hosting nutzt typischerweise Chat-Template-Parameter, Model Studio enable_thinking. Historische Thinking-Traces können Agenten helfen, dürfen aber nur mit passendem Modell-, Template- und Serverformat erhalten bleiben.
Deployment- und Evaluationsablauf
- Repository, Revision, Tokenizer, Lizenz, Quantisierung, Chat Template, Engine oder datiertes Hosted Snapshot fixieren.
- Private Aufgaben mit Deutsch/Zielsprachen, Retrieval, Code, Tools, Langtext, Refusal und Prompt Injection aufbauen.
- Mit dem kürzesten erfolgreichen Kontext beginnen; Gewichtsspeicher, KV Cache, Prefill, Decode, Parallelität und OOM messen.
- Thinking und Non-Thinking nach akzeptiertem Ergebnis, Latenz, Tokens und Tool-Korrektheit vergleichen.
- Toolargumente, Identität, Berechtigung, Budget, Sandbox, Netzwerk und Freigabe serverseitig kontrollieren.
- Vor Änderungen an Gewichten, Alias, Engine, Prompt, Retrieval oder Quantisierung den festen Satz wiederholen.
| Metrik | Definition | Verdeckter Fehler |
|---|---|---|
| Belegter Task-Erfolg | Akzeptierte Antworten mit gültiger Evidenz/Tasks | Flüssige unbelegte Antworten |
| Tool-Erfolg | Tool, Schema, Rechte, Reihenfolge, Ergebnis korrekt | Trennt Reasoning und Aktionssicherheit |
| Positionsabruf | Belege vom Anfang, Mitte und Ende | Mehr als maximale Eingabelänge |
| Kosten je Annahme | GPU/API, Retries, Review / freigegeben | Billiges Modell mit teurer Korrektur |
| Stabilität | OOM, Wiederholung, Parser, Timeout | Serving-Probleme hinter Mittelwerten |
Hosted-Preis und Langkontext-Steuer
Die am 20. August 2026 geprüfte Model-Studio-Tabelle listet globales qwen3.8-max bis 1M Input mit CNY 12 pro Million Input-Tokens und CNY 36 pro Million Output-Tokens. Max/Plus, Regionen, Stufen, Aktionen und Gratisquoten unterscheiden sich; bei qwen3.6-plus steigt der Listenpreis jenseits 256K Input pro Request. Ein Preis gilt nicht für die ganze Qwen-Familie.
Self-Hosting ersetzt Tokenkosten durch Beschleuniger, VRAM, Storage, Netzwerk, Engineering und Auslastung. Langkontext vergrößert KV Cache und Prefill, auch wenn Gewichte passen. Quantisierung spart Speicher, kann aber Qualität, Durchsatz und Kernel-Support ändern. Vergleichen Sie Hosted Snapshot und lokale Kandidaten mit identischen Tasks bei Spitzenparallelität.
Sicherheit, Datenschutz und Grenzen
- Retrieval-Webseiten, Repositories, Dokumente und Tooloutput als nicht vertrauenswürdig behandeln.
- Code in isoliertem Checkout/Container mit begrenzten Credentials, Egress, Tests und Diff-Review ausführen.
- 119 Sprachen sind keine 119-fache Safety-Parität; Refusal und Toxizität pro Sprache testen.
- Vision-Uploads minimieren, scannen und auf versteckte Anweisungen prüfen.
- Für Hosted Use Region, Vertrag, Aufbewahrung, Logging und Kontokontrollen prüfen.
- Self-Host-Betreiber verantworten Auth, Isolation, Monitoring, Missbrauchsschutz, Patches, Löschung und Incident Response.
Vergleich mit DeepSeek, Llama, Gemma und APIs
| Option | Stärke | Trade-off | Entscheidungstest |
|---|---|---|---|
| Qwen3/Qwen3.6 | Viele Größen, Apache-2.0, Chinesisch/mehrsprachig, dense/MoE, Tools | Versionskomplexität; Vision/Langtext braucht Hardware | Private Sprach-, Coding- und Tooltasks auf Zielsystem |
| DeepSeek V4 | Niedrige Hosted-Preise, offene V4-Gewichte, 1M-Effizienz | Sehr große Vollmodelle, andere Datengrenze | Kosten akzeptierter Agentjobs und Ops-Footprint |
| Meta Llama | Breites Vendor-/Deployment-Ökosystem | Lizenz ist nicht Apache-2.0 | Portabilität, Sprache, Lizenz |
| Google Gemma | Kleinere Open Models, Google Tooling | Andere Lizenz, Größen und Sprache | Qualität pro GB/Watt |
| Managed Frontier API | Kein Serving, Skalierung, proprietäre Leistung | Preis/Alias, Lock-in, Governance | Gleiche Tasks, Region, Fallback, Gesamtkosten |
Unser Urteil: Qwens stärkster Vorteil ist Deployment-Optionalität – kleine dichte Modelle, effiziente MoE, aktuelle offene Vision/Coding-Gewichte und Alibaba-Hosted Services. Die Breite macht ‘Qwen3’ zugleich zu ungenau. Wählen Sie den kleinsten exakt benannten Checkpoint, der die private Evaluation besteht, pinnen Sie für regulierte Produktion ein Datumssnapshot und testen Sie Qwen3.6, statt das 2025-Repository als aktuellen Default zu behandeln.
Häufige Fragen
Ist Qwen3 noch aktuell?
Als offene Generation ja, als neueste Familie nein. Das Original endete mit 2507; Qwen3.6 ist der aktuelle offene Nachfolger, Model Studio hat neuere proprietäre IDs.
Ist Qwen3 Open Source?
Das Repository nennt es Open Weight unter Apache 2.0. Da Trainingsdaten und vollständige Pipeline nicht zwingend offen sind, ist Open Weight präziser.
Welches Modell lokal?
Mit dem kleinsten Checkpoint beginnen, der private Tasks besteht. Qwen3 bietet kleine bis 32B dense Modelle; Qwen3.6 aktuelle Vision-/Agentfunktionen.
Unterstützt Qwen3.6 lokal 1M Kontext?
Model Cards nennen 262K nativ und rund 1,01M Erweiterung. Engine, GPU, Präzision, Parallelität und Speicher bestimmen die Praxis.
Ist qwen3.8-max herunterladbar?
Nein. Es ist eine Model-Studio-ID, kein GitHub-Checkpoint. Für Gewichte ein veröffentlichtes Qwen3.6-Repository verwenden.
Sind Tools/MCP möglich?
Ja, aber Schema, Autorisierung, Sandbox, Limits und Freigabe konsequenter Aktionen bleiben Aufgabe der Anwendung.
Ist kommerzielle Nutzung erlaubt?
Apache 2.0 erlaubt sie üblicherweise unter Bedingungen. Exaktes Modell, Derivat, Notices sowie Daten-, Output- und Markenpflichten getrennt prüfen; keine Rechtsberatung.
Geprüfte Quellen
- Qwen3 official GitHub repository, release history and Apache-2.0 notice
- Qwen3 launch article: architectures, languages and hybrid thinking
- Qwen3 technical report
- Current Qwen3.5/Qwen3.6 open-model repository and release history
- Qwen3.6-27B official model card and deployment guidance
- Qwen3.6-35B-A3B official model card
- Alibaba Cloud Model Studio qwen3.6-plus capabilities and context limits
- Alibaba Cloud Model Studio live model and pricing table
- Model Studio thinking-mode documentation
Unabhängig geprüft am 20. August 2026. Modelle, Snapshots, Preise, Aktionen, Kontext, Lizenzen und Regionen ändern sich; vor Deployment exakte Model Card, Model Studio und Konto prüfen.

