Mixtral es una familia de modelos de lenguaje de mezcla dispersa de expertos (MoE) de peso abierto lanzados por Mistral AI. Los puntos de control más conocidos son Mixtral 8x7B y Mixtral 8x22B, cada uno de ellos disponible como modelo base previamente entrenado y como variante ajustada con instrucciones. Su licencia Apache 2.0 permite un amplio uso comercial, modificación y redistribución sujeta a los términos de la licencia.
El nombre "8x" no significa que ocho modelos independientes respondan a cada ficha. En cada bloque transformador, un enrutador selecciona dos de los ocho expertos en retroalimentación para cada token. La atención y otros componentes siguen siendo compartidos. Esto crea una distinción importante: el modelo debe almacenar todos los pesos de los expertos, pero solo un subconjunto participa en el avance de un token. La computación puede parecerse a un modelo denso más pequeño, mientras que los requisitos de memoria y distribución permanecen mucho más cerca de la huella de parámetros completa.

Cómo funciona el enrutamiento experto disperso
representación simbólica
|
v
puntuaciones del enrutador
E1 E2 E3 E4 E5 E6 E7 E8
\ /
los 2 mejores expertos
/\
salida experta salida experta
\ /
fusión ponderada
|
atención compartida + siguiente capa
El enrutamiento ocurre de forma independiente en cada capa y token, por lo que un mensaje no elige permanentemente a dos expertos. El enrutador pondera las salidas seleccionadas. La activación dispersa reduce el cálculo de avance en relación con la ejecución de todos los expertos, pero la eficiencia del servicio depende del soporte del kernel, la ubicación de los expertos, el tamaño del lote y la comunicación. Un paralelismo deficiente entre expertos puede borrar los ahorros teóricos.
Mixtral variantes del modelo
| Punto de control | Parámetros totales | Aprox. activo/token | Contexto publicado | Propósito |
|---|---|---|---|---|
| Mixtral 8x7B v0.1 | Alrededor de 46,7 mil millones | Alrededor de 12,9 mil millones | 32K fichas | Base previamente entrenada para completar/afinar |
| Mixtral 8x7B Instrucción v0.1 | Alrededor de 46,7 mil millones | Alrededor de 12,9 mil millones | 32K fichas | Seguimiento de instrucciones y chat |
| Mixtral 8x22B v0.1 | Acerca de 141B | Acerca de 39B | fichas de 64K | Base previamente entrenada más grande |
| Mixtral 8x22B Instrucción v0.1 | Acerca de 141B | Acerca de 39B | fichas de 64K | Modelo más grande adaptado a las instrucciones |
Los valores son aproximados porque la contabilidad de parámetros puede diferir entre los componentes, el vocabulario y la implementación compartidos. Inspeccione siempre la configuración del repositorio elegido en lugar de derivar la capacidad del nombre comercial. El informe original del 8x7B enfatizó los sólidos resultados en comparación con los sistemas de la era Llama 2 70B y GPT-3.5; esas comparaciones son históricamente útiles pero no establecen competitividad con los modelos de 2026.
Base versus instrucción
| Variante | Úselo para | No asumas |
|---|---|---|
| bases | Investigación, formación previa continua, adaptación del dominio y finalización controlada | Formato de chat confiable, comportamiento de rechazo o jerarquía de instrucciones |
| Instruir | Tareas de asistente/chat usando la plantilla documentada | Seguridad de la producción, factibilidad o cumplimiento de políticas sin controles externos |
Las tarjetas modelo de Mistral advierten explícitamente que el punto de control 8x7B previamente entrenado no tiene mecanismos de moderación. El ajuste de instrucciones mejora la usabilidad, no garantiza la seguridad. Utilice el tokenizador y la plantilla de chat exactos para el modelo Instruct; un formato de aviso improvisado puede cambiar materialmente el comportamiento y comparar los resultados.
Memoria de peso: los parámetros activos no son requisitos de VRAM
Un límite inferior aproximado para el almacenamiento de peso es el total de parámetros multiplicado por bytes por parámetro. Excluye caché KV, activaciones, buffers de enrutamiento, metadatos de cuantificación, sobrecarga del marco y espacio de trabajo temporal. Tampoco garantiza que un formato cuantificado tenga núcleos optimizados en el acelerador seleccionado.
| modelo | Pesos BF16/FP16 | pesos de 8 bits | Pesos teóricos de 4 bits | Implicaciones prácticas |
|---|---|---|---|---|
| 8x7B (~46,7B) | ~93GB | ~47GB | ~23GB | A menudo, múltiples GPU con total precisión; El uso local cuantificado es posible con RAM/VRAM adecuada |
| 8x22B (~141B) | ~282GB | ~141GB | ~71GB | Diseñado para una importante infraestructura de múltiples aceleradores incluso cuando está cuantificado |
Se trata de estimaciones aritméticas, no de promesas de despliegue. Agregue espacio libre y mida el artefacto real. Algunos tiempos de ejecución descargan capas o expertos a la CPU, intercambiando capacidad por latencia. La memoria unificada puede hacer que un modelo se cargue mientras produce tokens inaceptables por segundo.
Caché KV y costo de contexto largo
La caché de KV crece con secuencias, capas y tokens almacenados en caché simultáneos. MoE la escasez no elimina el caché de atención compartida. Un contexto máximo de 32K o 64K es un límite de capacidad, no una instrucción para completar cada solicitud. Las indicaciones largas aumentan la latencia previa al llenado y reducen la capacidad del lote; la recuperación o el resumen pueden ser más económicos y precisos.
| factor de carga | Efecto | controlar |
|---|---|---|
| Longitud del mensaje | Mayor tiempo de precarga y memoria KV | Limitar el contexto por ruta; recuperar solo evidencia relevante |
| Secuencias concurrentes | Multiplica el caché en vivo | Control de admisión, dosificación continua y límites de colas |
| Longitud de salida | El tiempo de decodificación y el caché siguen creciendo | Tokens máximos explícitos y condiciones de parada |
| Tipo de precisión/caché | Cambia la memoria y potencialmente la calidad. | Cuantificación de caché compatible con pruebas comparativas en tareas de destino |
| Distribución experta | La comunicación entre dispositivos puede generar cuellos de botella | Utilice tensor compatible con MoE/diseño paralelo experto |
Opciones de servicio
El funcionario inferencia-mistral El repositorio proporciona herramientas de referencia para los modelos de la familia Mistral. Hugging Face Transformers admite arquitecturas Mixtral, mientras que vLLM y otros motores de inferencia ofrecen funciones de producción como procesamiento por lotes continuo y puntos finales compatibles con OpenAI. Los ecosistemas llama.cpp/GGUF son comunes para el uso local cuantificado de CPU/GPU, pero las conversiones de terceros deben rastrearse hasta el punto de control canónico y probarse.
| Tiempo de ejecución | Buen ajuste | Verificar antes de la adopción |
|---|---|---|
| inferencia-mistral | Comportamiento de referencia y Mistral-experimentación nativa | Programación de producción, observabilidad y versión de punto de control compatible. |
| Transformadores | Investigación, ajuste y flexibilidad del ecosistema | Mapa de dispositivos, backend de atención y rendimiento del kernel MoE |
| vLLM | Servicio de GPU con procesamiento por lotes y compatibilidad con API | Soporte, cuantificación y topología paralela de Mixtral específicos de la versión |
| TensorRT-LLM/TGI | Implementación administrada optimizada o con uso intensivo de NVIDIA | Genere complejidad, precisión soportada y paralelismo experto |
| llama.cpp / GGUF | Uso cuantificado local, de estación de trabajo o asistido por CPU | Procedencia del convertidor, ancho de banda de RAM y latencia de contexto prolongado |
Opciones de cuantificación
| Enfoque | Beneficio | Riesgo | prueba |
|---|---|---|---|
| BF16/FP16 | La calidad más cercana a la de referencia y los granos amplios | Memoria/costo muy alto | Línea base de referencia |
| 8 bits | Aproximadamente la mitad de la memoria de peso | Dependencia del kernel/tiempo de ejecución | Latencia, rendimiento y calidad exacta de las tareas |
| AWQ/GPTQ 4 bits | Gran reducción de memoria GPU | Calibración y sensibilidad de capa MoE | Degradación por idioma y de respuesta larga |
| GGUF cuantificación | Descarga flexible de CPU/GPU | Variantes de conversión y cuellos de botella en el ancho de banda | Velocidad de indicación/decodificación en la descarga prevista |
Nunca seleccione la cuantificación únicamente por perplejidad. Evalúe la llamada a la herramienta JSON, la compilación de códigos, las instrucciones multilingües, la clasificación de seguridad, la conexión a tierra de recuperación y el comportamiento de contexto largo. El enrutamiento experto puede amplificar los errores de manera diferente según las entradas, así que use suficientes ejemplos y ejecuciones repetidas.
Punto de referencia Mixtral para la carga de trabajo, no para la nostalgia
Mixtral fue influyente porque combinaba licencias abiertas, sólida calidad para 2023-2024 y computación escasa. Para julio de 2026, muchos puntos de control densos y MoE más nuevos ofrecen mejor calidad por memoria, contexto más prolongado o uso de herramientas nativas. La pregunta correcta es si Mixtral gana bajo sus limitaciones: hardware que ya posee, licencia, reproducibilidad, ajustes finos, combinación de idiomas y latencia aceptable.
- Cree entre 100 y 500 mensajes representativos con criterios de oro y fallas prohibidas.
- Revisión de puntos de control de pines, tokenizador, plantilla de chat, tiempo de ejecución, cuantificación y muestreo.
- Compare en el mismo contexto y límites de salida, no en los valores predeterminados del proveedor.
- Mida la latencia del primer token, los tokens de decodificación por segundo, el rendimiento simultáneo, la memoria de la GPU y el costo total de energía/nube.
- Califique por separado el apoyo factual, el cumplimiento de las instrucciones, el resultado estructurado, la seguridad y la abstención.
- Repetir con una concurrencia realista; El rendimiento de MoE puede cambiar drásticamente según el lote y la topología.
| Métrica | Por qué es importante | Atajos engañosos comunes |
|---|---|---|
| Éxito de la tarea | Mide directamente el resultado del usuario | Usar una tabla de clasificación general como proxy |
| p95 tiempo hasta el primer token | Capacidad de respuesta interactiva | Informar solo la velocidad de decodificación promedio |
| Tokens/seg en concurrencia | Capacidad de servicio | Rendimiento del laboratorio de flujo único |
| Costo total/éxito | Combina hardware y calidad | Comparación de recuentos de parámetros activos |
| Memoria máxima | Determina la topología viable. | Contando sólo bytes de peso cuantificados |
| Gravedad del fallo | Distingue los errores cosméticos de los inseguros | Una puntuación de precisión agregada |
Controles de seguridad y producción.
Los pesos abiertos hacen que el comportamiento sea inspeccionable y desplegable en infraestructura privada, pero no proporcionan moderación. Los puntos de control de la base pueden emitir contenido inseguro; Los puntos de control de instrucciones pueden tener jailbreak, alucinar y seguir texto recuperado malicioso. Construya un sistema en capas:
- Clasifique solicitudes y resultados utilizando una política apropiada para el dominio.
- Keep retrieved documents untrusted and separate data from system instructions.
- Restrinja las herramientas con listas permitidas, esquemas, tiempos de espera, cuotas y confirmación humana.
- Validar el código generado y la salida estructurada fuera del modelo.
- Registre las versiones del modelo/punto de control/plantilla y conserve los rastros de evaluación sin almacenar datos personales innecesarios.
- Ataques multilingües y de contexto prolongado del equipo rojo; Las afirmaciones en el lenguaje histórico del modelo no son garantías de cobertura.
Licencia y procedencia
Los repositorios canónicos Mistral AI Mixtral identifican los puntos de control como Apache 2.0. Esto es permisivo, pero los ajustes finales, las cuantificaciones, los conjuntos de datos y los servicios de servicio pueden introducir términos diferentes. Registre la revisión exacta del modelo y los hashes, lea la tarjeta del modelo, conserve avisos, escanee artefactos serializados y documente las obligaciones de datos de terceros. El “LLM de código abierto” es impreciso: los pesos y el código de inferencia se pueden licenciar abiertamente sin que estén disponibles todos los datos de capacitación y el proceso de capacitación.
Cuando Mixtral todavía tiene sentido
| Situación | Encajar | Razón |
|---|---|---|
| Ajuste fino Mixtral validado existente | fuerte | El riesgo de migración puede superar los nuevos avances en los índices de referencia |
| Apache-2.0 requisito | fuerte | Licencia clara y permisiva de punto de control |
| Investigación sobre enrutamiento MoE disperso | fuerte | Arquitectura y ecosistema conocidos |
| GPU pequeña y única | Débil | Las ponderaciones totales de los expertos siguen siendo elevadas; Los modelos densos más pequeños son más simples. |
| La mejor calidad fronteriza de 2026 | Débil | Mixtral es ahora una generación histórica, no la frontera de Mistral |
| Servicio de alta concurrencia sin experiencia en MoE | Condicional | La topología y los núcleos determinan si la computación dispersa se convierte en un ahorro real |
Alternativas
Compare Mixtral con los modelos abiertos Mistral actuales, las familias Qwen y Llama actuales, los puntos de control DeepSeek MoE, DBRX y modelos de instrucción densa más pequeños. No congele una lista de las “mejores” alternativas porque los lanzamientos avanzan rápidamente. Cree un conjunto de candidatos a partir de puntos de control que cumplan con los requisitos de licencia, idioma, contexto, hardware y seguridad, luego ejecute la misma evaluación de carga de trabajo.
| Tipo de candidato | Elígelo cuando | Compensación |
|---|---|---|
| 7B-32B denso más nuevo | La simplicidad de un solo nodo y la eficiencia de la memoria son importantes | Puede ofrecer menos capacidad pero a menudo un mejor uso de herramientas/ajuste moderno |
| Más reciente y escaso MoE | Puede explotar el paralelismo experto y necesita escalamiento de calidad/cómputo | Misma clase de complejidad con diferentes licencias y ecosistemas. |
| Propietario alojado API | Las operaciones y la calidad de frontera importan más que el control de peso | Límite de datos, costo recurrente y dependencia de proveedores |
| Modelo pequeño ajustado al dominio | La tarea es limitada y los datos de evaluación son sólidos | Menor costo pero generalidad limitada |
Preguntas frecuentes
¿Es Mixtral 8x7B un modelo de ocho mil millones de parámetros?
No. Tiene aproximadamente 46,7 mil millones de parámetros totales y activa alrededor de 12,9 mil millones por token. Los pesos totales impulsan el almacenamiento y gran parte de los requisitos de memoria.
¿Utiliza los ocho expertos para cada token?
No. El enrutador selecciona dos expertos por token en cada capa MoE y combina sus salidas.
¿Puede Mixtral 8x7B caber en una GPU de 24 GB?
Las pesas de máxima precisión no pueden. Algunas conversiones agresivas de 4 bits se acercan a ese presupuesto de peso bruto, pero la sobrecarga y el caché KV generalmente requieren RAM/descarga adicional o más VRAM. Pruebe el tiempo de ejecución exacto.
¿Mixtral es gratuito para uso comercial?
Los puntos de control canónicos se publican en Apache 2.0. Verifique el artefacto exacto y cualquier ajuste, conjunto de datos o términos de alojamiento con un abogado.
¿El modelo Instruct incluye moderación de seguridad?
No trate el ajuste de instrucciones como una capa de seguridad. Agregue política de entrada/salida, restricciones de herramientas y evaluación específica del dominio.
¿Mixtral sigue siendo un buen valor predeterminado en 2026?
No automáticamente. Sigue siendo valioso para licencias permisivas, implementaciones establecidas e investigación MoE, pero debe compararse con los modelos actuales en cuanto a hardware y carga de trabajo reales.
Fuentes y verificación
- Mistral AI: Mixtral de la versión de Expertos
- Mistral AI: Mixtral Versión 8x22B
- Mixtral del documento técnico de expertos
- Tarjeta modelo base Canonical Mixtral 8x7B
- Canonical Mixtral 8x7B Tarjeta de modelo de instrucción
- Tarjeta modelo base Canonical Mixtral 8x22B
- Canonical Mixtral 8x22B Tarjeta de modelo de instrucciones
- Repositorio oficial de inferencias Mistral
- vLLM documentación del modelo compatible
Última revisión el 26 de julio de 2026. Soporte de tiempo de ejecución, disponibilidad de modelos y cambios de calidad comparativos. Fije cada artefacto y vuelva a ejecutar la evaluación de la carga de trabajo antes de la implementación.