Qwen3 是阿里云在 2025 年发布的开放权重大模型代际,官方仓库覆盖 0.6B 到 235B 的密集与 MoE checkpoint、混合思考、多语言、工具调用和自部署。它今天仍有价值,因为权重、模型卡和 Apache-2.0 许可构成可复现的目标,而不是会移动的托管别名。
但该详情页指向的 GitHub 仓库并不等于 2026 年 8 月的最新 Qwen API。原始 Qwen3 以 2507 版本收尾;开放后继已经演进到 Qwen3.6-27B 与 Qwen3.6-35B-A3B。Model Studio 另行提供 qwen3.8-max 等专有托管 ID。第一步必须分清:历史 Qwen3、当前开放 Qwen3.6,还是托管服务。
2026 年“Qwen3”到底指什么
| 分支 | 代表模型 | 当前定位 |
|---|---|---|
| Qwen3 | Qwen3 0.6B–235B;最终 2507 Instruct/Thinking | 稳定可复现,但不再是最新家族 |
| Qwen3-Next / 3.5 | 80B-A3B 及后续密集/MoE | 过渡代;仅在项目明确锁定时选择 |
| Qwen3.6 开放权重 | 27B、35B-A3B | 当前开放通用/编码分支 |
| Model Studio 托管 | qwen3.8-max、Plus/Flash 快照 | 专有托管服务,不是 GitHub checkpoint |
不要把 2025 首发评测、32K 训练上下文或 /think 软开关当成 2026 托管模型的规格,也不要认为托管 ID 一定可以下载。开放模型卡、Model Studio 与聊天产品是不同表面,版本、限制、数据条件和费用都不同。
原始 Qwen3 仍是宽广的开放权重工具箱
原始系列包含 0.6B、1.7B、4B、8B、14B、32B 密集模型,以及 30B-A3B 和 235B-A22B MoE。A3B/A22B 是每个 token 的激活参数,不是权重存储量;30B-A3B 仍要容纳约 30B 总参数。首发支持 119 种语言与方言,并允许思考/非思考切换。后续 2507 把 Instruct 与 Thinking 分离,并为部分大模型提供更长上下文方案。
Qwen3 仓库声明所有开放权重使用 Apache-2.0。该许可适合商业使用并含专利授权,但再分发要保留许可/声明;它不授予输入数据、第三方数据集、商标或生成内容的权利。量化、合并与微调模型必须逐一核查来源和许可。
| 约束 | 建议起点 | 为何 | 要测试的风险 |
|---|---|---|---|
| 边缘/小内存 | Qwen3 0.6B–4B 或核实过的量化 | 体积小、运行时广 | 指令质量、多语下降、幻觉 |
| 工作站助手 | Qwen3 8B/14B 或 Qwen3.6 | 能力/成本折中 | KV cache、上下文、并发 |
| 高吞吐 MoE | 30B-A3B 或 35B-A3B | 激活参数少可能提高解码效率 | 总权重、专家路由、框架成熟度 |
| 视觉/编码 Agent | Qwen3.6 27B/35B-A3B | 较新的后训练、视觉和 Agent 能力 | 工具 parser、思考状态、沙箱 |
| 不运维 GPU | Model Studio 日期快照 | 托管推理与配额 | 区域、留存、价格、别名移动 |
Qwen3.6 改变了部署假设
Qwen3.6-27B 是密集视觉语言模型,35B-A3B 是约 3B 激活参数的 MoE。官方模型卡给出原生 262,144 token,并可扩展到约 1.01M。扩展值是配置能力,不保证所有 GPU 或 serving 组合都能承载。27B 的 SGLang 参考命令在 262K 下使用 8 路张量并行;这是参考配置,不是绝对最低硬件。
Qwen3.6 默认思考,但不再正式支持 Qwen3 的 /think//nothink 软开关。自托管框架通常用 chat template 参数,Model Studio 用 enable_thinking。它还能保留历史思考以帮助 Agent 一致性;只有模型卡、模板和引擎格式一致时才启用,否则会膨胀上下文或破坏解析。
部署与评测工作流
- 冻结仓库、revision、tokenizer、许可、量化、chat template、引擎版本或托管日期快照。
- 建立含中文与目标语言、检索、代码、工具、长文、拒答、prompt injection 的私有任务集。
- 用最短可通过的上下文开始,测权重内存、KV cache、prefill、decode、并发与 OOM。
- 比较思考/非思考的合格率、延迟、token 与工具正确率,不奖励冗长推理。
- 服务端校验工具参数、身份、权限、预算、沙箱、网络和审批。
- 权重、别名、引擎、提示词、检索或量化变更前重跑冻结评测。
| 指标 | 定义 | 价值 |
|---|---|---|
| 有证据任务成功率 | 带有效依据的合格输出/任务 | 惩罚流畅但无依据的回答 |
| 工具调用成功 | 工具、schema、权限、顺序、结果均正确 | 分离推理能力与动作安全 |
| 位置召回 | 输入前中后的证据均能找回 | 不把最大可接收长度当质量 |
| 合格结果成本 | GPU/API、重试与审核/合格输出 | 识别便宜模型的昂贵返工 |
| 运行稳定性 | OOM、重复、解析失败、超时率 | 发现 benchmark 平均值遮蔽的问题 |
托管价格与长上下文税
2026 年 8 月 20 日复核的 Model Studio 价格页列出全球 qwen3.8-max:最高 1M 输入,每百万 token 输入 12 元、输出 36 元。不同 Max/Plus、地区、阶梯、促销和免费额度不同;qwen3.6-plus 的列表价还会在单次输入超过 256K 后提高。不要把一个 Qwen 价格复制到所有模型和区域。
自部署把 token 费换成加速器、显存、存储、网络、工程和利用率。长上下文即使权重装得下,也会扩大 KV cache 与 prefill。量化可以省内存,但可能改变质量、吞吐和 kernel 支持。必须在同一任务集比较托管快照与两种本地候选,并计入峰值并发。
安全、隐私和生产限制
- 检索网页、仓库、文档和工具输出都不可信;把数据与指令分离,并在模型外执行权限。
- 代码在隔离 checkout/container 中运行,限制凭证和出网,要求测试、diff 审核与受保护发布。
- 119 种语言覆盖不等于 119 种语言安全一致;逐语言测试拒答、毒性与政策。
- 视觉输入要去除无关元数据、扫描文件,并测试图像/文档内隐藏指令。
- 托管使用需核查所选区域、合同、留存、日志与账号控制;开放权重许可不描述托管数据处理。
- 自部署方承担认证、隔离、监控、防滥用、补丁、删除与事故响应。
与 DeepSeek、Llama、Gemma 和托管 API 对比
| 选项 | 优势 | 主要权衡 | 决策测试 |
|---|---|---|---|
| Qwen3/Qwen3.6 | 尺寸广、Apache-2.0、中英/多语、密集与 MoE、工具生态活跃 | 版本复杂;视觉和长文提高硬件要求 | 目标硬件的私有多语/编码/工具任务 |
| DeepSeek V4 | 低托管价、开放 V4 权重、百万上下文效率 | 完整 checkpoint 很大,数据边界不同 | 长 Agent 合格结果成本与运维规模 |
| Meta Llama | 部署生态和供应商多 | 许可不是 Apache-2.0,尺寸/能力不同 | 可迁移性、目标语言与许可 |
| Google Gemma | 较小开放模型与 Google 工具 | 许可、规模、多语行为不同 | 每 GB/瓦的真实任务质量 |
| 托管前沿 API | 无需 serving、弹性与专有能力 | 价格/别名变化、锁定、数据治理 | 同任务、区域、fallback 与总成本 |
我们的判断:Qwen 最强的是部署选择权,从小型密集、MoE、当前视觉/编码开放权重延伸到阿里云托管服务。弱点也来自这种宽度:只写“Qwen3”不足以支持架构与采购。应选通过私有评测的最小明确 checkpoint;受治理生产使用日期快照;需要新能力时升级 Qwen3.6,而不是假定 2025 仓库仍是当前默认。
常见问题
Qwen3 还是当前模型吗?
它仍是可用的开放权重代际,但不是最新分支。原始系列止于 2507;Qwen3.6 是当前开放后继,Model Studio 还有更新的专有 ID。
Qwen3 是开源吗?
官方称其为开放权重并采用 Apache-2.0。训练数据和完整训练流程未必开放,所以“开放权重”更准确;仍须核查具体衍生模型。
本地运行选哪个?
选择能通过私有任务的最小 checkpoint。Qwen3 提供很小到 32B 的密集选择;Qwen3.6 27B/35B-A3B 更当前但要求更现代的 serving。
Qwen3.6 本地支持 100 万上下文吗?
模型卡称原生 262K、可扩展约 1.01M;实际取决于引擎、GPU、精度、并发与显存,不应默认分配最大值。
qwen3.8-max 可以下载吗?
不可以,它是 Model Studio 托管 ID,不是 GitHub Qwen3 checkpoint。需要权重时选择正式发布的 Qwen3.6 或更早仓库。
Qwen 可以调用工具/MCP 吗?
可以,但模型参数仍需应用端 schema 校验、权限、沙箱、限额与关键动作审批。
Apache-2.0 可以商用吗?
通常允许商业使用,但要遵守声明等条款,并单独审查数据、输出、商标和应用责任;本文不是法律意见。
复核来源
- Qwen3 official GitHub repository, release history and Apache-2.0 notice
- Qwen3 launch article: architectures, languages and hybrid thinking
- Qwen3 technical report
- Current Qwen3.5/Qwen3.6 open-model repository and release history
- Qwen3.6-27B official model card and deployment guidance
- Qwen3.6-35B-A3B official model card
- Alibaba Cloud Model Studio qwen3.6-plus capabilities and context limits
- Alibaba Cloud Model Studio live model and pricing table
- Model Studio thinking-mode documentation
独立复核日期:2026 年 8 月 20 日。模型、快照、价格、促销、上下文、许可和区域会变化,部署前请核对准确模型卡、Model Studio 页面与实际账户。

