Mixtral
Mixtral
Active

Mixtral

Mixtral es la familia de modelos de mezcla escasa de expertos Mistral AI de Mistral AI, que incluye variantes básicas y de instrucciones de Mixtral 8x7B y 8x22B. Esta guía independiente explica el enrutamiento, los parámetros activos frente a los totales, los costos de memoria y servicio, la cuantificación, la evaluación, la seguridad y las alternativas modernas.

64

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

open-source-llmfree

Editorial Review

About Mixtral

Mixtral es una familia de modelos de lenguaje de mezcla dispersa de expertos (MoE) de peso abierto lanzados por Mistral AI. Los puntos de control más conocidos son Mixtral 8x7B y Mixtral 8x22B, cada uno de ellos disponible como modelo base previamente entrenado y como variante ajustada con instrucciones. Su licencia Apache 2.0 permite un amplio uso comercial, modificación y redistribución sujeta a los términos de la licencia.

El nombre "8x" no significa que ocho modelos independientes respondan a cada ficha. En cada bloque transformador, un enrutador selecciona dos de los ocho expertos en retroalimentación para cada token. La atención y otros componentes siguen siendo compartidos. Esto crea una distinción importante: el modelo debe almacenar todos los pesos de los expertos, pero solo un subconjunto participa en el avance de un token. La computación puede parecerse a un modelo denso más pequeño, mientras que los requisitos de memoria y distribución permanecen mucho más cerca de la huella de parámetros completa.

Mixtral sparse mixture-of-experts model listing image
Los pesos abiertos de Mixtral siguen siendo útiles para el autohospedaje y la investigación de MoE. Las decisiones de hardware deben utilizar la memoria de peso total, no sólo los parámetros activos.

Cómo funciona el enrutamiento experto disperso

 representación simbólica
        |
        v
     puntuaciones del enrutador
  E1 E2 E3 E4 E5 E6 E7 E8
       \ /
        los 2 mejores expertos
       /\
 salida experta salida experta
       \ /
      fusión ponderada
           |
 atención compartida + siguiente capa

El enrutamiento ocurre de forma independiente en cada capa y token, por lo que un mensaje no elige permanentemente a dos expertos. El enrutador pondera las salidas seleccionadas. La activación dispersa reduce el cálculo de avance en relación con la ejecución de todos los expertos, pero la eficiencia del servicio depende del soporte del kernel, la ubicación de los expertos, el tamaño del lote y la comunicación. Un paralelismo deficiente entre expertos puede borrar los ahorros teóricos.

Mixtral variantes del modelo

Punto de controlParámetros totalesAprox. activo/tokenContexto publicadoPropósito
Mixtral 8x7B v0.1Alrededor de 46,7 mil millonesAlrededor de 12,9 mil millones32K fichasBase previamente entrenada para completar/afinar
Mixtral 8x7B Instrucción v0.1Alrededor de 46,7 mil millonesAlrededor de 12,9 mil millones32K fichasSeguimiento de instrucciones y chat
Mixtral 8x22B v0.1Acerca de 141BAcerca de 39Bfichas de 64KBase previamente entrenada más grande
Mixtral 8x22B Instrucción v0.1Acerca de 141BAcerca de 39Bfichas de 64KModelo más grande adaptado a las instrucciones

Los valores son aproximados porque la contabilidad de parámetros puede diferir entre los componentes, el vocabulario y la implementación compartidos. Inspeccione siempre la configuración del repositorio elegido en lugar de derivar la capacidad del nombre comercial. El informe original del 8x7B enfatizó los sólidos resultados en comparación con los sistemas de la era Llama 2 70B y GPT-3.5; esas comparaciones son históricamente útiles pero no establecen competitividad con los modelos de 2026.

Base versus instrucción

VarianteÚselo paraNo asumas
basesInvestigación, formación previa continua, adaptación del dominio y finalización controladaFormato de chat confiable, comportamiento de rechazo o jerarquía de instrucciones
InstruirTareas de asistente/chat usando la plantilla documentadaSeguridad de la producción, factibilidad o cumplimiento de políticas sin controles externos

Las tarjetas modelo de Mistral advierten explícitamente que el punto de control 8x7B previamente entrenado no tiene mecanismos de moderación. El ajuste de instrucciones mejora la usabilidad, no garantiza la seguridad. Utilice el tokenizador y la plantilla de chat exactos para el modelo Instruct; un formato de aviso improvisado puede cambiar materialmente el comportamiento y comparar los resultados.

Memoria de peso: los parámetros activos no son requisitos de VRAM

Un límite inferior aproximado para el almacenamiento de peso es el total de parámetros multiplicado por bytes por parámetro. Excluye caché KV, activaciones, buffers de enrutamiento, metadatos de cuantificación, sobrecarga del marco y espacio de trabajo temporal. Tampoco garantiza que un formato cuantificado tenga núcleos optimizados en el acelerador seleccionado.

modeloPesos BF16/FP16pesos de 8 bitsPesos teóricos de 4 bitsImplicaciones prácticas
8x7B (~46,7B)~93GB~47GB~23GBA menudo, múltiples GPU con total precisión; El uso local cuantificado es posible con RAM/VRAM adecuada
8x22B (~141B)~282GB~141GB~71GBDiseñado para una importante infraestructura de múltiples aceleradores incluso cuando está cuantificado

Se trata de estimaciones aritméticas, no de promesas de despliegue. Agregue espacio libre y mida el artefacto real. Algunos tiempos de ejecución descargan capas o expertos a la CPU, intercambiando capacidad por latencia. La memoria unificada puede hacer que un modelo se cargue mientras produce tokens inaceptables por segundo.

Caché KV y costo de contexto largo

La caché de KV crece con secuencias, capas y tokens almacenados en caché simultáneos. MoE la escasez no elimina el caché de atención compartida. Un contexto máximo de 32K o 64K es un límite de capacidad, no una instrucción para completar cada solicitud. Las indicaciones largas aumentan la latencia previa al llenado y reducen la capacidad del lote; la recuperación o el resumen pueden ser más económicos y precisos.

factor de cargaEfectocontrolar
Longitud del mensajeMayor tiempo de precarga y memoria KVLimitar el contexto por ruta; recuperar solo evidencia relevante
Secuencias concurrentesMultiplica el caché en vivoControl de admisión, dosificación continua y límites de colas
Longitud de salidaEl tiempo de decodificación y el caché siguen creciendoTokens máximos explícitos y condiciones de parada
Tipo de precisión/cachéCambia la memoria y potencialmente la calidad.Cuantificación de caché compatible con pruebas comparativas en tareas de destino
Distribución expertaLa comunicación entre dispositivos puede generar cuellos de botellaUtilice tensor compatible con MoE/diseño paralelo experto

Opciones de servicio

El funcionario inferencia-mistral El repositorio proporciona herramientas de referencia para los modelos de la familia Mistral. Hugging Face Transformers admite arquitecturas Mixtral, mientras que vLLM y otros motores de inferencia ofrecen funciones de producción como procesamiento por lotes continuo y puntos finales compatibles con OpenAI. Los ecosistemas llama.cpp/GGUF son comunes para el uso local cuantificado de CPU/GPU, pero las conversiones de terceros deben rastrearse hasta el punto de control canónico y probarse.

Tiempo de ejecuciónBuen ajusteVerificar antes de la adopción
inferencia-mistralComportamiento de referencia y Mistral-experimentación nativaProgramación de producción, observabilidad y versión de punto de control compatible.
TransformadoresInvestigación, ajuste y flexibilidad del ecosistemaMapa de dispositivos, backend de atención y rendimiento del kernel MoE
vLLMServicio de GPU con procesamiento por lotes y compatibilidad con APISoporte, cuantificación y topología paralela de Mixtral específicos de la versión
TensorRT-LLM/TGIImplementación administrada optimizada o con uso intensivo de NVIDIAGenere complejidad, precisión soportada y paralelismo experto
llama.cpp / GGUFUso cuantificado local, de estación de trabajo o asistido por CPUProcedencia del convertidor, ancho de banda de RAM y latencia de contexto prolongado

Opciones de cuantificación

EnfoqueBeneficioRiesgoprueba
BF16/FP16La calidad más cercana a la de referencia y los granos ampliosMemoria/costo muy altoLínea base de referencia
8 bitsAproximadamente la mitad de la memoria de pesoDependencia del kernel/tiempo de ejecuciónLatencia, rendimiento y calidad exacta de las tareas
AWQ/GPTQ 4 bitsGran reducción de memoria GPUCalibración y sensibilidad de capa MoEDegradación por idioma y de respuesta larga
GGUF cuantificaciónDescarga flexible de CPU/GPUVariantes de conversión y cuellos de botella en el ancho de bandaVelocidad de indicación/decodificación en la descarga prevista

Nunca seleccione la cuantificación únicamente por perplejidad. Evalúe la llamada a la herramienta JSON, la compilación de códigos, las instrucciones multilingües, la clasificación de seguridad, la conexión a tierra de recuperación y el comportamiento de contexto largo. El enrutamiento experto puede amplificar los errores de manera diferente según las entradas, así que use suficientes ejemplos y ejecuciones repetidas.

Punto de referencia Mixtral para la carga de trabajo, no para la nostalgia

Mixtral fue influyente porque combinaba licencias abiertas, sólida calidad para 2023-2024 y computación escasa. Para julio de 2026, muchos puntos de control densos y MoE más nuevos ofrecen mejor calidad por memoria, contexto más prolongado o uso de herramientas nativas. La pregunta correcta es si Mixtral gana bajo sus limitaciones: hardware que ya posee, licencia, reproducibilidad, ajustes finos, combinación de idiomas y latencia aceptable.

  1. Cree entre 100 y 500 mensajes representativos con criterios de oro y fallas prohibidas.
  2. Revisión de puntos de control de pines, tokenizador, plantilla de chat, tiempo de ejecución, cuantificación y muestreo.
  3. Compare en el mismo contexto y límites de salida, no en los valores predeterminados del proveedor.
  4. Mida la latencia del primer token, los tokens de decodificación por segundo, el rendimiento simultáneo, la memoria de la GPU y el costo total de energía/nube.
  5. Califique por separado el apoyo factual, el cumplimiento de las instrucciones, el resultado estructurado, la seguridad y la abstención.
  6. Repetir con una concurrencia realista; El rendimiento de MoE puede cambiar drásticamente según el lote y la topología.
MétricaPor qué es importanteAtajos engañosos comunes
Éxito de la tareaMide directamente el resultado del usuarioUsar una tabla de clasificación general como proxy
p95 tiempo hasta el primer tokenCapacidad de respuesta interactivaInformar solo la velocidad de decodificación promedio
Tokens/seg en concurrenciaCapacidad de servicioRendimiento del laboratorio de flujo único
Costo total/éxitoCombina hardware y calidadComparación de recuentos de parámetros activos
Memoria máximaDetermina la topología viable.Contando sólo bytes de peso cuantificados
Gravedad del falloDistingue los errores cosméticos de los insegurosUna puntuación de precisión agregada

Controles de seguridad y producción.

Los pesos abiertos hacen que el comportamiento sea inspeccionable y desplegable en infraestructura privada, pero no proporcionan moderación. Los puntos de control de la base pueden emitir contenido inseguro; Los puntos de control de instrucciones pueden tener jailbreak, alucinar y seguir texto recuperado malicioso. Construya un sistema en capas:

  • Clasifique solicitudes y resultados utilizando una política apropiada para el dominio.
  • Keep retrieved documents untrusted and separate data from system instructions.
  • Restrinja las herramientas con listas permitidas, esquemas, tiempos de espera, cuotas y confirmación humana.
  • Validar el código generado y la salida estructurada fuera del modelo.
  • Registre las versiones del modelo/punto de control/plantilla y conserve los rastros de evaluación sin almacenar datos personales innecesarios.
  • Ataques multilingües y de contexto prolongado del equipo rojo; Las afirmaciones en el lenguaje histórico del modelo no son garantías de cobertura.

Licencia y procedencia

Los repositorios canónicos Mistral AI Mixtral identifican los puntos de control como Apache 2.0. Esto es permisivo, pero los ajustes finales, las cuantificaciones, los conjuntos de datos y los servicios de servicio pueden introducir términos diferentes. Registre la revisión exacta del modelo y los hashes, lea la tarjeta del modelo, conserve avisos, escanee artefactos serializados y documente las obligaciones de datos de terceros. El “LLM de código abierto” es impreciso: los pesos y el código de inferencia se pueden licenciar abiertamente sin que estén disponibles todos los datos de capacitación y el proceso de capacitación.

Cuando Mixtral todavía tiene sentido

SituaciónEncajarRazón
Ajuste fino Mixtral validado existentefuerteEl riesgo de migración puede superar los nuevos avances en los índices de referencia
Apache-2.0 requisitofuerteLicencia clara y permisiva de punto de control
Investigación sobre enrutamiento MoE dispersofuerteArquitectura y ecosistema conocidos
GPU pequeña y únicaDébilLas ponderaciones totales de los expertos siguen siendo elevadas; Los modelos densos más pequeños son más simples.
La mejor calidad fronteriza de 2026DébilMixtral es ahora una generación histórica, no la frontera de Mistral
Servicio de alta concurrencia sin experiencia en MoECondicionalLa topología y los núcleos determinan si la computación dispersa se convierte en un ahorro real

Alternativas

Compare Mixtral con los modelos abiertos Mistral actuales, las familias Qwen y Llama actuales, los puntos de control DeepSeek MoE, DBRX y modelos de instrucción densa más pequeños. No congele una lista de las “mejores” alternativas porque los lanzamientos avanzan rápidamente. Cree un conjunto de candidatos a partir de puntos de control que cumplan con los requisitos de licencia, idioma, contexto, hardware y seguridad, luego ejecute la misma evaluación de carga de trabajo.

Tipo de candidatoElígelo cuandoCompensación
7B-32B denso más nuevoLa simplicidad de un solo nodo y la eficiencia de la memoria son importantesPuede ofrecer menos capacidad pero a menudo un mejor uso de herramientas/ajuste moderno
Más reciente y escaso MoEPuede explotar el paralelismo experto y necesita escalamiento de calidad/cómputoMisma clase de complejidad con diferentes licencias y ecosistemas.
Propietario alojado APILas operaciones y la calidad de frontera importan más que el control de pesoLímite de datos, costo recurrente y dependencia de proveedores
Modelo pequeño ajustado al dominioLa tarea es limitada y los datos de evaluación son sólidosMenor costo pero generalidad limitada

Preguntas frecuentes

¿Es Mixtral 8x7B un modelo de ocho mil millones de parámetros?

No. Tiene aproximadamente 46,7 mil millones de parámetros totales y activa alrededor de 12,9 mil millones por token. Los pesos totales impulsan el almacenamiento y gran parte de los requisitos de memoria.

¿Utiliza los ocho expertos para cada token?

No. El enrutador selecciona dos expertos por token en cada capa MoE y combina sus salidas.

¿Puede Mixtral 8x7B caber en una GPU de 24 GB?

Las pesas de máxima precisión no pueden. Algunas conversiones agresivas de 4 bits se acercan a ese presupuesto de peso bruto, pero la sobrecarga y el caché KV generalmente requieren RAM/descarga adicional o más VRAM. Pruebe el tiempo de ejecución exacto.

¿Mixtral es gratuito para uso comercial?

Los puntos de control canónicos se publican en Apache 2.0. Verifique el artefacto exacto y cualquier ajuste, conjunto de datos o términos de alojamiento con un abogado.

¿El modelo Instruct incluye moderación de seguridad?

No trate el ajuste de instrucciones como una capa de seguridad. Agregue política de entrada/salida, restricciones de herramientas y evaluación específica del dominio.

¿Mixtral sigue siendo un buen valor predeterminado en 2026?

No automáticamente. Sigue siendo valioso para licencias permisivas, implementaciones establecidas e investigación MoE, pero debe compararse con los modelos actuales en cuanto a hardware y carga de trabajo reales.

Fuentes y verificación

Última revisión el 26 de julio de 2026. Soporte de tiempo de ejecución, disponibilidad de modelos y cambios de calidad comparativos. Fije cada artefacto y vuelva a ejecutar la evaluación de la carga de trabajo antes de la implementación.

Ready to try Mixtral?

Visit the official website to get started

Visit Mixtral

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
7/25/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - Herramienta de IA inteligente para mejorar tu productividad.

open-source-llmfree
640
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - Herramienta de IA inteligente para mejorar tu productividad.

open-source-llmfree
610
Qwen3

Qwen3

Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud. - Herramienta de IA inteligente para mejorar tu productividad.

open-source-llmfree
660
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - Herramienta de IA inteligente para mejorar tu productividad.

open-source-llmfree
630