Qwen3
Qwen3
Active

Qwen3

Qwen3 是阿里云 2025 年发布、采用 Apache-2.0 许可的开放权重模型家族。本文厘清 Qwen3-2507、当前 Qwen3.6 开放模型与 Model Studio 托管 API 的边界,并评估部署、上下文、推理、成本、许可、安全和竞品。

113

Views

0

Likes

Jan 2026

Added

github.com

项目链接

Tags

Qwen3Qwen3.6通义千问开放权重模型大语言模型本地部署Model Studio推理模型

Product Preview

A quick visual look at Qwen3 before you visit the official site.

Published 1/21/2026
Qwen3 screenshot

Editorial Review

About Qwen3

Qwen3 是阿里云在 2025 年发布的开放权重大模型代际,官方仓库覆盖 0.6B 到 235B 的密集与 MoE checkpoint、混合思考、多语言、工具调用和自部署。它今天仍有价值,因为权重、模型卡和 Apache-2.0 许可构成可复现的目标,而不是会移动的托管别名。

但该详情页指向的 GitHub 仓库并不等于 2026 年 8 月的最新 Qwen API。原始 Qwen3 以 2507 版本收尾;开放后继已经演进到 Qwen3.6-27BQwen3.6-35B-A3B。Model Studio 另行提供 qwen3.8-max 等专有托管 ID。第一步必须分清:历史 Qwen3、当前开放 Qwen3.6,还是托管服务。

Qwen3 原始开放权重、当前 Qwen3.6 与 Model Studio 托管服务的模型边界和部署决策图
AIDreamHub 根据 Qwen 发布历史、官方模型卡和 Model Studio 文档制作的原创编辑图,不是产品界面截图。

2026 年“Qwen3”到底指什么

分支代表模型当前定位
Qwen3Qwen3 0.6B–235B;最终 2507 Instruct/Thinking稳定可复现,但不再是最新家族
Qwen3-Next / 3.580B-A3B 及后续密集/MoE过渡代;仅在项目明确锁定时选择
Qwen3.6 开放权重27B、35B-A3B当前开放通用/编码分支
Model Studio 托管qwen3.8-max、Plus/Flash 快照专有托管服务,不是 GitHub checkpoint

不要把 2025 首发评测、32K 训练上下文或 /think 软开关当成 2026 托管模型的规格,也不要认为托管 ID 一定可以下载。开放模型卡、Model Studio 与聊天产品是不同表面,版本、限制、数据条件和费用都不同。

原始 Qwen3 仍是宽广的开放权重工具箱

原始系列包含 0.6B、1.7B、4B、8B、14B、32B 密集模型,以及 30B-A3B 和 235B-A22B MoE。A3B/A22B 是每个 token 的激活参数,不是权重存储量;30B-A3B 仍要容纳约 30B 总参数。首发支持 119 种语言与方言,并允许思考/非思考切换。后续 2507 把 Instruct 与 Thinking 分离,并为部分大模型提供更长上下文方案。

Qwen3 仓库声明所有开放权重使用 Apache-2.0。该许可适合商业使用并含专利授权,但再分发要保留许可/声明;它不授予输入数据、第三方数据集、商标或生成内容的权利。量化、合并与微调模型必须逐一核查来源和许可。

约束建议起点为何要测试的风险
边缘/小内存Qwen3 0.6B–4B 或核实过的量化体积小、运行时广指令质量、多语下降、幻觉
工作站助手Qwen3 8B/14B 或 Qwen3.6能力/成本折中KV cache、上下文、并发
高吞吐 MoE30B-A3B 或 35B-A3B激活参数少可能提高解码效率总权重、专家路由、框架成熟度
视觉/编码 AgentQwen3.6 27B/35B-A3B较新的后训练、视觉和 Agent 能力工具 parser、思考状态、沙箱
不运维 GPUModel Studio 日期快照托管推理与配额区域、留存、价格、别名移动

Qwen3.6 改变了部署假设

Qwen3.6-27B 是密集视觉语言模型,35B-A3B 是约 3B 激活参数的 MoE。官方模型卡给出原生 262,144 token,并可扩展到约 1.01M。扩展值是配置能力,不保证所有 GPU 或 serving 组合都能承载。27B 的 SGLang 参考命令在 262K 下使用 8 路张量并行;这是参考配置,不是绝对最低硬件。

Qwen3.6 默认思考,但不再正式支持 Qwen3 的 /think//nothink 软开关。自托管框架通常用 chat template 参数,Model Studio 用 enable_thinking。它还能保留历史思考以帮助 Agent 一致性;只有模型卡、模板和引擎格式一致时才启用,否则会膨胀上下文或破坏解析。

部署与评测工作流

  1. 冻结仓库、revision、tokenizer、许可、量化、chat template、引擎版本或托管日期快照。
  2. 建立含中文与目标语言、检索、代码、工具、长文、拒答、prompt injection 的私有任务集。
  3. 用最短可通过的上下文开始,测权重内存、KV cache、prefill、decode、并发与 OOM。
  4. 比较思考/非思考的合格率、延迟、token 与工具正确率,不奖励冗长推理。
  5. 服务端校验工具参数、身份、权限、预算、沙箱、网络和审批。
  6. 权重、别名、引擎、提示词、检索或量化变更前重跑冻结评测。
指标定义价值
有证据任务成功率带有效依据的合格输出/任务惩罚流畅但无依据的回答
工具调用成功工具、schema、权限、顺序、结果均正确分离推理能力与动作安全
位置召回输入前中后的证据均能找回不把最大可接收长度当质量
合格结果成本GPU/API、重试与审核/合格输出识别便宜模型的昂贵返工
运行稳定性OOM、重复、解析失败、超时率发现 benchmark 平均值遮蔽的问题

托管价格与长上下文税

2026 年 8 月 20 日复核的 Model Studio 价格页列出全球 qwen3.8-max:最高 1M 输入,每百万 token 输入 12 元、输出 36 元。不同 Max/Plus、地区、阶梯、促销和免费额度不同;qwen3.6-plus 的列表价还会在单次输入超过 256K 后提高。不要把一个 Qwen 价格复制到所有模型和区域。

自部署把 token 费换成加速器、显存、存储、网络、工程和利用率。长上下文即使权重装得下,也会扩大 KV cache 与 prefill。量化可以省内存,但可能改变质量、吞吐和 kernel 支持。必须在同一任务集比较托管快照与两种本地候选,并计入峰值并发。

安全、隐私和生产限制

  • 检索网页、仓库、文档和工具输出都不可信;把数据与指令分离,并在模型外执行权限。
  • 代码在隔离 checkout/container 中运行,限制凭证和出网,要求测试、diff 审核与受保护发布。
  • 119 种语言覆盖不等于 119 种语言安全一致;逐语言测试拒答、毒性与政策。
  • 视觉输入要去除无关元数据、扫描文件,并测试图像/文档内隐藏指令。
  • 托管使用需核查所选区域、合同、留存、日志与账号控制;开放权重许可不描述托管数据处理。
  • 自部署方承担认证、隔离、监控、防滥用、补丁、删除与事故响应。

与 DeepSeek、Llama、Gemma 和托管 API 对比

选项优势主要权衡决策测试
Qwen3/Qwen3.6尺寸广、Apache-2.0、中英/多语、密集与 MoE、工具生态活跃版本复杂;视觉和长文提高硬件要求目标硬件的私有多语/编码/工具任务
DeepSeek V4低托管价、开放 V4 权重、百万上下文效率完整 checkpoint 很大,数据边界不同长 Agent 合格结果成本与运维规模
Meta Llama部署生态和供应商多许可不是 Apache-2.0,尺寸/能力不同可迁移性、目标语言与许可
Google Gemma较小开放模型与 Google 工具许可、规模、多语行为不同每 GB/瓦的真实任务质量
托管前沿 API无需 serving、弹性与专有能力价格/别名变化、锁定、数据治理同任务、区域、fallback 与总成本

我们的判断:Qwen 最强的是部署选择权,从小型密集、MoE、当前视觉/编码开放权重延伸到阿里云托管服务。弱点也来自这种宽度:只写“Qwen3”不足以支持架构与采购。应选通过私有评测的最小明确 checkpoint;受治理生产使用日期快照;需要新能力时升级 Qwen3.6,而不是假定 2025 仓库仍是当前默认。

常见问题

Qwen3 还是当前模型吗?

它仍是可用的开放权重代际,但不是最新分支。原始系列止于 2507;Qwen3.6 是当前开放后继,Model Studio 还有更新的专有 ID。

Qwen3 是开源吗?

官方称其为开放权重并采用 Apache-2.0。训练数据和完整训练流程未必开放,所以“开放权重”更准确;仍须核查具体衍生模型。

本地运行选哪个?

选择能通过私有任务的最小 checkpoint。Qwen3 提供很小到 32B 的密集选择;Qwen3.6 27B/35B-A3B 更当前但要求更现代的 serving。

Qwen3.6 本地支持 100 万上下文吗?

模型卡称原生 262K、可扩展约 1.01M;实际取决于引擎、GPU、精度、并发与显存,不应默认分配最大值。

qwen3.8-max 可以下载吗?

不可以,它是 Model Studio 托管 ID,不是 GitHub Qwen3 checkpoint。需要权重时选择正式发布的 Qwen3.6 或更早仓库。

Qwen 可以调用工具/MCP 吗?

可以,但模型参数仍需应用端 schema 校验、权限、沙箱、限额与关键动作审批。

Apache-2.0 可以商用吗?

通常允许商业使用,但要遵守声明等条款,并单独审查数据、输出、商标和应用责任;本文不是法律意见。

复核来源

独立复核日期:2026 年 8 月 20 日。模型、快照、价格、促销、上下文、许可和区域会变化,部署前请核对准确模型卡、Model Studio 页面与实际账户。

前往 Qwen3 官方来源核查

打开官方仓库、文档或模型资源。

查看官方来源

Quick Info

项目链接
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/10/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - 智能 AI 工具,助力您的工作效率。

open-source-llmfree
1230
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - 智能 AI 工具,助力您的工作效率。

open-source-llmfree
1170
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - 智能 AI 工具,助力您的工作效率。

open-source-llmfree
1140
Mixtral

Mixtral

Mixtral 是 Mistral AI 的 Apache-2.0 稀疏专家混合模型系列,包括 Mixtral 8x7B 和 8x22B 基础和指令变体。该独立指南解释了路由、主动参数与总参数、内存和服务成本、量化、评估、安全性和现代替代方案。

open-source-llmfree
1190