Qwen3 es la generación de LLM de pesos abiertos que Alibaba Cloud lanzó en 2025. El repositorio oficial cubre checkpoints dense y MoE de 0,6B a 235B, pensamiento híbrido, herramientas, idiomas y alojamiento propio. Los pesos, model cards y licencia Apache-2.0 ofrecen un objetivo reproducible, no un alias de API cambiante.
Pero ese GitHub no representa el endpoint Qwen más nuevo en agosto de 2026. Qwen3-2507 cerró la serie original; la sucesora abierta es Qwen3.6, con 27B y 35B-A3B. Model Studio ofrece aparte IDs administrados y propietarios como qwen3.8-max. Qwen3 histórico, Qwen3.6 abierto y servicio alojado son decisiones distintas.
Qué significa Qwen3 en 2026
| Rama | Modelos | Posición |
|---|---|---|
| Qwen3 original | 0,6B–235B; 2507 Instruct/Thinking | Generación estable, ya no la más nueva |
| Qwen3-Next / 3.5 | 80B-A3B y sucesores | Intermedios para proyectos fijados |
| Qwen3.6 abierto | 27B y 35B-A3B | Rama abierta actual general/código |
| Model Studio | qwen3.8-max, snapshots Plus/Flash | Servicio propietario; no checkpoint GitHub |
No atribuyas a un modelo alojado de 2026 los benchmarks de lanzamiento, contexto de entrenamiento 32K o el interruptor /think de 2025. Model card, Model Studio y Qwen Chat difieren en versión, límites, datos y precio.
Qwen3 original sigue siendo una caja abierta amplia
Incluye dense 0,6B, 1,7B, 4B, 8B, 14B y 32B, además de MoE 30B-A3B y 235B-A22B. A3B/A22B son parámetros activos por token, no tamaño almacenado: 30B-A3B conserva unos 30B totales. El lanzamiento cubrió 119 idiomas/dialectos y pensamiento híbrido; 2507 separó Instruct/Thinking y añadió recetas de contexto largo.
El repo declara Apache-2.0 para sus pesos. Permite uso comercial y aporta patente, con obligaciones de avisos al redistribuir. No concede derechos sobre entradas, datasets, marcas o salidas. Verifica por separado cuantizaciones, merges y fine-tunes.
| Restricción | Inicio | Motivo | Riesgo |
|---|---|---|---|
| Edge/memoria baja | Qwen3 0,6B–4B o quant verificada | Pequeño y compatible | Instrucción, idiomas, alucinación |
| Asistente local | Qwen3 8B/14B o Qwen3.6 | Equilibrio | KV cache, contexto, concurrencia |
| MoE de caudal | 30B-A3B o 35B-A3B | Pocos activos | Peso total, routing, engine |
| Agente visión/código | Qwen3.6 27B/35B-A3B | Post-training y visión actuales | Parser, thinking, sandbox |
| Sin operar GPU | Snapshot fechado Model Studio | Inferencia gestionada | Región, retención, precio, alias |
Qwen3.6 cambia el supuesto de despliegue
Qwen3.6-27B es vision-language dense; 35B-A3B es MoE con unos 3B activos. Las fichas indican 262.144 tokens nativos y extensión a ~1,01M. Es capacidad configurable, no garantía para cada GPU. El ejemplo SGLang 27B usa tensor parallel 8 para 262K: referencia, no mínimo universal.
Qwen3.6 piensa por defecto y ya no soporta oficialmente /think//nothink. Self-host suele usar argumentos del chat template; Model Studio usa enable_thinking. Preservar reasoning histórico puede ayudar a agentes solo si modelo, plantilla y servidor coinciden.
Flujo de despliegue y evaluación
- Fijar repo, revisión, tokenizer, licencia, quant, template, engine o snapshot alojado fechado.
- Crear tareas privadas en español/chino/idiomas objetivo con retrieval, código, tools, largo, rechazo e injection.
- Empezar con el contexto mínimo que aprueba y medir pesos, KV, prefill, decode, concurrencia y OOM.
- Comparar thinking/no-thinking por aceptación, latencia, tokens y exactitud de tools.
- Validar argumentos, identidad, permisos, presupuesto, sandbox, red y aprobación en servidor.
- Repetir eval congelada antes de cambiar pesos, alias, engine, prompt, retrieval o quant.
| Métrica | Definición | Detecta |
|---|---|---|
| Éxito con evidencia | Resultados aceptados con fuentes/tareas | Fluidez sin soporte |
| Éxito de tools | Tool/schema/auth/secuencia/resultado correctos | Seguridad de acción |
| Recuerdo posicional | Evidencia al inicio/centro/final | Más que longitud máxima |
| Coste aceptado | GPU/API/reintentos/revisión por aprobado | Corrección cara |
| Estabilidad | OOM, repetición, parser, timeout | Fallos ocultos |
Precio alojado e impuesto de contexto largo
El 20 de agosto de 2026, Model Studio lista qwen3.8-max global hasta 1M a CNY 12 por millón de entrada y CNY 36 de salida. Max/Plus, regiones, niveles, promociones y cuotas cambian; qwen3.6-plus sube al cruzar 256K de entrada. Un precio no representa toda la familia.
Self-host cambia tokens por aceleradores, VRAM, almacenamiento, red, ingeniería y uso. El contexto largo aumenta KV y prefill. La quantización ahorra memoria pero puede cambiar calidad y kernels. Compara snapshot alojado y candidatos locales con tareas iguales y concurrencia pico.
Seguridad, privacidad y límites
- Tratar web, repos, documentos y tool output recuperados como no confiables.
- Ejecutar código en checkout/contenedor aislado, credenciales limitadas, egress, tests y diff revisado.
- 119 idiomas no significan paridad de seguridad; probar rechazo y toxicidad por idioma.
- Minimizar metadatos visuales y probar instrucciones ocultas en imágenes/documentos.
- Para hosting revisar región, contrato, retención, logs y controles de cuenta.
- El operador local asume auth, aislamiento, monitorización, abuso, parches, borrado e incidentes.
Comparación con DeepSeek, Llama, Gemma y API
| Opción | Ventaja | Trade-off | Prueba |
|---|---|---|---|
| Qwen3/3.6 | Tamaños, Apache-2.0, chino/multilingüe, dense/MoE, tools | Versiones complejas; visión/largo exige hardware | Tareas privadas en hardware objetivo |
| DeepSeek V4 | Precio alojado bajo, pesos V4, eficiencia 1M | Checkpoints enormes, otra frontera de datos | Coste aceptado y operación |
| Meta Llama | Gran ecosistema | Licencia no Apache-2.0 | Portabilidad, idioma, licencia |
| Google Gemma | Modelos pequeños y tooling Google | Otra licencia y comportamiento | Calidad por GB/vatio |
| API frontier gestionada | Sin serving y escala gestionada | Precio/alias, lock-in, gobernanza | Mismas tareas, región, fallback, total |
Conclusión: la ventaja de Qwen es la opcionalidad, desde dense pequeños y MoE hasta pesos visión/código actuales y Alibaba Cloud. La amplitud hace que ‘Qwen3’ sea insuficiente. Elige el checkpoint exacto más pequeño que pase eval privada, fija snapshot fechado en producción gobernada y prueba Qwen3.6 cuando necesites actualidad sin fingir que el repo 2025 es el default.
Preguntas frecuentes
¿Qwen3 sigue actual?
Es utilizable, no la rama más nueva. El original terminó en 2507; Qwen3.6 es sucesor abierto y Model Studio tiene IDs propietarios más nuevos.
¿Qwen3 es open source?
El repo lo llama open-weight Apache-2.0. Open-weight es más preciso porque datos y pipeline completo no necesariamente se publican.
¿Qué modelo local?
El checkpoint más pequeño que pase tareas privadas. Qwen3 tiene dense pequeños–32B; Qwen3.6 añade visión/agentes actuales.
¿Qwen3.6 local tiene 1M?
La card dice 262K nativo y extensión ~1,01M; depende de engine, GPU, precisión, concurrencia y memoria.
¿Se descarga qwen3.8-max?
No. Es ID alojado Model Studio. Para pesos usa repos publicados Qwen3.6 u otros.
¿Puede usar tools/MCP?
Sí, pero la app debe validar schema, permisos, sandbox, límites y aprobar acciones importantes.
¿Apache-2.0 permite comercial?
Normalmente sí con condiciones. Revisa modelo/derivado, avisos, datos, output y marca; no es asesoría legal.
Fuentes revisadas
- Qwen3 official GitHub repository, release history and Apache-2.0 notice
- Qwen3 launch article: architectures, languages and hybrid thinking
- Qwen3 technical report
- Current Qwen3.5/Qwen3.6 open-model repository and release history
- Qwen3.6-27B official model card and deployment guidance
- Qwen3.6-35B-A3B official model card
- Alibaba Cloud Model Studio qwen3.6-plus capabilities and context limits
- Alibaba Cloud Model Studio live model and pricing table
- Model Studio thinking-mode documentation
Revisión independiente: 20 de agosto de 2026. Modelos, snapshots, precios, promociones, contexto, licencias y regiones cambian; verifica model card, Model Studio y cuenta activa.

