Qwen3
Qwen3
Active

Qwen3

Qwen3 ist Alibabas Apache-2.0-Open-Weight-Modellfamilie von 2025. Diese unabhängige Analyse trennt Qwen3-2507 von aktuellen offenen Qwen3.6-Modellen und Model-Studio-APIs und bewertet Deployment, Kontext, Reasoning, Kosten, Lizenz, Sicherheit und Alternativen.

80

Views

0

Likes

Jan 2026

Added

github.com

Projektlink

Tags

Qwen3Qwen3.6QwenOpen WeightLarge Language Modellokales LLMModel StudioReasoning Modell

Product Preview

A quick visual look at Qwen3 before you visit the official site.

Published 1/21/2026
Qwen3 screenshot

Editorial Review

About Qwen3

Qwen3 ist die 2025 veröffentlichte Open-Weight-Generation von Alibaba Cloud. Das offizielle Repository umfasst dichte und MoE-Checkpoints von 0,6B bis 235B Parametern, hybrides Thinking, Tool Use, mehrsprachige Arbeit und Self-Hosting. Gewichte, Model Cards und Apache-2.0-Lizenz ergeben ein reproduzierbares Ziel statt eines beweglichen API-Alias.

Die GitHub-Seite ist jedoch nicht der neueste Qwen-Endpunkt im August 2026. Qwen3-2507 war das letzte Original-Update. Die offene Nachfolgelinie heißt heute Qwen3.6, unter anderem Qwen3.6-27B und 35B-A3B. Model Studio bietet getrennt verwaltete, proprietäre IDs wie qwen3.8-max. Historisches Qwen3, aktuelles offenes Qwen3.6 und Hosted Service sind verschiedene Kauf- und Architekturentscheidungen.

Qwen3 Modellfamilie mit ursprünglichen offenen Gewichten aktuellem Qwen3.6 und Model Studio sowie Deployment Entscheidung
Originale AIDreamHub-Grafik aus Qwen-Release-Historie, offiziellen Model Cards und Model-Studio-Dokumentation; keine UI-Aufnahme.

Was Qwen3 im Jahr 2026 bezeichnet

ZweigBeispieleAktuelle Position
Original Qwen30,6B–235B, finale 2507 Instruct/ThinkingStabil und reproduzierbar, aber nicht neueste Familie
Qwen3-Next / 3.580B-A3B und spätere dense/MoEZwischengeneration für explizit fixierte Projekte
Open Qwen3.627B und 35B-A3BAktueller offener General-/Coding-Zweig
Model Studio Hostedqwen3.8-max, Plus/Flash-SnapshotsProprietärer Dienst, nicht der GitHub-Checkpoint

Übertragen Sie Launch-Benchmarks von 2025, 32K Trainingskontext oder den damaligen /think-Schalter nicht auf ein gehostetes Modell von 2026. Open Model Card, Model Studio und Qwen Chat unterscheiden sich in Version, Limit, Datenbedingungen und Preis.

Original Qwen3 bleibt ein breiter Open-Weight-Baukasten

Die Familie enthält dichte Modelle mit 0,6B, 1,7B, 4B, 8B, 14B und 32B sowie die MoE-Modelle 30B-A3B und 235B-A22B. A3B/A22B sind pro Token aktivierte Parameter, nicht die gespeicherte Modellgröße: 30B-A3B enthält weiterhin ungefähr 30B Gesamtparameter. Der Launch nannte 119 Sprachen und Dialekte sowie hybrides Thinking; 2507 trennte Instruct- und Thinking-Varianten und ergänzte Langkontext-Rezepte.

Das Repository lizenziert seine Open Weights unter Apache 2.0. Das ist kommerziell nutzbar und enthält eine Patentlizenz, verlangt aber unter anderem Lizenz-/Hinweiserhalt bei Weitergabe. Rechte an Eingaben, Drittdatensätzen, Marken oder Outputs entstehen dadurch nicht. Prüfen Sie Quantisierung, Merge und Fine-Tune einzeln.

ConstraintStartpunktGrundZu testen
Edge/kleiner SpeicherQwen3 0,6B–4B oder geprüfte QuantisierungKlein und breit unterstütztInstruction Quality, Sprachen, Halluzination
Workstation-AssistentQwen3 8B/14B oder Qwen3.6Balance aus Fähigkeit und BetriebKV Cache, Kontext, Parallelität
MoE-Durchsatz30B-A3B oder 35B-A3BWeniger aktive ParameterGesamtgewichte, Routing, Engine-Reife
Vision-/Coding-AgentQwen3.6 27B/35B-A3BNeueres Post-Training und VisionParser, Thinking State, Sandbox
Kein GPU-BetriebDatiertes Model-Studio-SnapshotManaged InferenceRegion, Aufbewahrung, Preis, Alias

Qwen3.6 verändert die Deployment-Annahmen

Qwen3.6-27B ist ein dichtes Vision-Language-Modell; 35B-A3B ist ein MoE mit etwa drei Milliarden aktiven Parametern. Die offiziellen Karten nennen 262.144 Tokens nativ und Erweiterung auf rund 1,01M. Das ist eine Konfigurationsmöglichkeit, keine Garantie für jede GPU-Anordnung. Der SGLang-Referenzbefehl für 27B nutzt bei 262K achtfache Tensorparallelität; das ist ein Referenzaufbau, kein allgemeines Minimum.

Qwen3.6 denkt standardmäßig, unterstützt aber den Qwen3-Soft-Switch /think//nothink nicht offiziell. Self-Hosting nutzt typischerweise Chat-Template-Parameter, Model Studio enable_thinking. Historische Thinking-Traces können Agenten helfen, dürfen aber nur mit passendem Modell-, Template- und Serverformat erhalten bleiben.

Deployment- und Evaluationsablauf

  1. Repository, Revision, Tokenizer, Lizenz, Quantisierung, Chat Template, Engine oder datiertes Hosted Snapshot fixieren.
  2. Private Aufgaben mit Deutsch/Zielsprachen, Retrieval, Code, Tools, Langtext, Refusal und Prompt Injection aufbauen.
  3. Mit dem kürzesten erfolgreichen Kontext beginnen; Gewichtsspeicher, KV Cache, Prefill, Decode, Parallelität und OOM messen.
  4. Thinking und Non-Thinking nach akzeptiertem Ergebnis, Latenz, Tokens und Tool-Korrektheit vergleichen.
  5. Toolargumente, Identität, Berechtigung, Budget, Sandbox, Netzwerk und Freigabe serverseitig kontrollieren.
  6. Vor Änderungen an Gewichten, Alias, Engine, Prompt, Retrieval oder Quantisierung den festen Satz wiederholen.
MetrikDefinitionVerdeckter Fehler
Belegter Task-ErfolgAkzeptierte Antworten mit gültiger Evidenz/TasksFlüssige unbelegte Antworten
Tool-ErfolgTool, Schema, Rechte, Reihenfolge, Ergebnis korrektTrennt Reasoning und Aktionssicherheit
PositionsabrufBelege vom Anfang, Mitte und EndeMehr als maximale Eingabelänge
Kosten je AnnahmeGPU/API, Retries, Review / freigegebenBilliges Modell mit teurer Korrektur
StabilitätOOM, Wiederholung, Parser, TimeoutServing-Probleme hinter Mittelwerten

Hosted-Preis und Langkontext-Steuer

Die am 20. August 2026 geprüfte Model-Studio-Tabelle listet globales qwen3.8-max bis 1M Input mit CNY 12 pro Million Input-Tokens und CNY 36 pro Million Output-Tokens. Max/Plus, Regionen, Stufen, Aktionen und Gratisquoten unterscheiden sich; bei qwen3.6-plus steigt der Listenpreis jenseits 256K Input pro Request. Ein Preis gilt nicht für die ganze Qwen-Familie.

Self-Hosting ersetzt Tokenkosten durch Beschleuniger, VRAM, Storage, Netzwerk, Engineering und Auslastung. Langkontext vergrößert KV Cache und Prefill, auch wenn Gewichte passen. Quantisierung spart Speicher, kann aber Qualität, Durchsatz und Kernel-Support ändern. Vergleichen Sie Hosted Snapshot und lokale Kandidaten mit identischen Tasks bei Spitzenparallelität.

Sicherheit, Datenschutz und Grenzen

  • Retrieval-Webseiten, Repositories, Dokumente und Tooloutput als nicht vertrauenswürdig behandeln.
  • Code in isoliertem Checkout/Container mit begrenzten Credentials, Egress, Tests und Diff-Review ausführen.
  • 119 Sprachen sind keine 119-fache Safety-Parität; Refusal und Toxizität pro Sprache testen.
  • Vision-Uploads minimieren, scannen und auf versteckte Anweisungen prüfen.
  • Für Hosted Use Region, Vertrag, Aufbewahrung, Logging und Kontokontrollen prüfen.
  • Self-Host-Betreiber verantworten Auth, Isolation, Monitoring, Missbrauchsschutz, Patches, Löschung und Incident Response.

Vergleich mit DeepSeek, Llama, Gemma und APIs

OptionStärkeTrade-offEntscheidungstest
Qwen3/Qwen3.6Viele Größen, Apache-2.0, Chinesisch/mehrsprachig, dense/MoE, ToolsVersionskomplexität; Vision/Langtext braucht HardwarePrivate Sprach-, Coding- und Tooltasks auf Zielsystem
DeepSeek V4Niedrige Hosted-Preise, offene V4-Gewichte, 1M-EffizienzSehr große Vollmodelle, andere DatengrenzeKosten akzeptierter Agentjobs und Ops-Footprint
Meta LlamaBreites Vendor-/Deployment-ÖkosystemLizenz ist nicht Apache-2.0Portabilität, Sprache, Lizenz
Google GemmaKleinere Open Models, Google ToolingAndere Lizenz, Größen und SpracheQualität pro GB/Watt
Managed Frontier APIKein Serving, Skalierung, proprietäre LeistungPreis/Alias, Lock-in, GovernanceGleiche Tasks, Region, Fallback, Gesamtkosten

Unser Urteil: Qwens stärkster Vorteil ist Deployment-Optionalität – kleine dichte Modelle, effiziente MoE, aktuelle offene Vision/Coding-Gewichte und Alibaba-Hosted Services. Die Breite macht ‘Qwen3’ zugleich zu ungenau. Wählen Sie den kleinsten exakt benannten Checkpoint, der die private Evaluation besteht, pinnen Sie für regulierte Produktion ein Datumssnapshot und testen Sie Qwen3.6, statt das 2025-Repository als aktuellen Default zu behandeln.

Häufige Fragen

Ist Qwen3 noch aktuell?

Als offene Generation ja, als neueste Familie nein. Das Original endete mit 2507; Qwen3.6 ist der aktuelle offene Nachfolger, Model Studio hat neuere proprietäre IDs.

Ist Qwen3 Open Source?

Das Repository nennt es Open Weight unter Apache 2.0. Da Trainingsdaten und vollständige Pipeline nicht zwingend offen sind, ist Open Weight präziser.

Welches Modell lokal?

Mit dem kleinsten Checkpoint beginnen, der private Tasks besteht. Qwen3 bietet kleine bis 32B dense Modelle; Qwen3.6 aktuelle Vision-/Agentfunktionen.

Unterstützt Qwen3.6 lokal 1M Kontext?

Model Cards nennen 262K nativ und rund 1,01M Erweiterung. Engine, GPU, Präzision, Parallelität und Speicher bestimmen die Praxis.

Ist qwen3.8-max herunterladbar?

Nein. Es ist eine Model-Studio-ID, kein GitHub-Checkpoint. Für Gewichte ein veröffentlichtes Qwen3.6-Repository verwenden.

Sind Tools/MCP möglich?

Ja, aber Schema, Autorisierung, Sandbox, Limits und Freigabe konsequenter Aktionen bleiben Aufgabe der Anwendung.

Ist kommerzielle Nutzung erlaubt?

Apache 2.0 erlaubt sie üblicherweise unter Bedingungen. Exaktes Modell, Derivat, Notices sowie Daten-, Output- und Markenpflichten getrennt prüfen; keine Rechtsberatung.

Geprüfte Quellen

Unabhängig geprüft am 20. August 2026. Modelle, Snapshots, Preise, Aktionen, Kontext, Lizenzen und Regionen ändern sich; vor Deployment exakte Model Card, Model Studio und Konto prüfen.

Qwen3 an der offiziellen Quelle prüfen

Öffnet Repository, Dokumentation oder Modellressourcen.

Offizielle Quelle öffnen

Quick Info

Projektlink
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/9/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
860
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
820
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
850
Mixtral

Mixtral

Mixtral ist die Modellfamilie Apache-2.0 von Mistral AI mit einer spärlichen Expertenmischung, einschließlich Mixtral 8x7B und 8x22B Basis- und Befehlsvarianten. Dieser unabhängige Leitfaden erläutert Routing, aktive versus Gesamtparameter, Speicher- und Bereitstellungskosten, Quantisierung, Auswertung, Sicherheit und moderne Alternativen.

open-source-llmfree
840