Mixtral est une famille de modèles de langage ouverts à mélange d'experts (MoE) publiés par Mistral AI. Les points de contrôle les plus connus sont Mixtral 8x7B et Mixtral 8x22B, chacun disponible sous forme de modèle de base pré-entraîné et de variante optimisée pour les instructions. Leur licence Apache 2.0 autorise une large utilisation commerciale, la modification et la redistribution sous réserve des termes de la licence.
Le nom « 8x » ne signifie pas que huit modèles indépendants répondent à chaque jeton. Dans chaque bloc de transformateur, un routeur sélectionne deux des huit experts en anticipation pour chaque jeton. L’attention et les autres composantes restent partagées. Cela crée une distinction importante : le modèle doit stocker tous les poids experts, mais seul un sous-ensemble participe au passage direct d'un jeton. Le calcul peut ressembler à un modèle dense plus petit, tandis que les exigences en matière de mémoire et de distribution restent beaucoup plus proches de l'empreinte complète des paramètres.

Comment fonctionne le routage expert clairsemé
représentation symbolique
|
v
scores du routeur
E1 E2 E3 E4 E5 E6 E7 E8
\/
les 2 meilleurs experts
/\
sortie d'expert sortie d'expert
\/
fusion pondérée
|
attention partagée + couche suivante
Le routage s'effectue indépendamment au niveau de chaque couche et jeton, de sorte qu'une invite ne choisit pas en permanence deux experts. Le routeur pondère les sorties sélectionnées. L'activation éparse réduit le calcul anticipé par rapport à l'exécution de tous les experts, mais l'efficacité du service dépend de la prise en charge du noyau, du placement des experts, de la taille des lots et de la communication. Un mauvais parallélisme expert peut effacer les économies théoriques.
variantes du modèle Mixtral
| Point de contrôle | Paramètres totaux | Env. actif/jeton | Contexte publié | Objectif |
|---|---|---|---|---|
| Mixtral 8x7B v0.1 | Environ 46,7 milliards | Environ 12,9 milliards | 32 000 jetons | Base pré-entraînée pour la finalisation/la mise au point |
| Mixtral 8x7B Instruction v0.1 | Environ 46,7 milliards | Environ 12,9 milliards | 32 000 jetons | Suivi des instructions et chat |
| Mixtral 8x22B v0.1 | À propos de 141B | Environ 39B | 64 000 jetons | Base pré-entraînée plus grande |
| Mixtral 8x22B Instruction v0.1 | À propos de 141B | Environ 39B | 64 000 jetons | Modèle plus grand adapté aux instructions |
Les valeurs sont approximatives car la comptabilisation des paramètres peut différer selon les composants partagés, le vocabulaire et la mise en œuvre. Inspectez toujours la configuration du référentiel choisi plutôt que de déduire la capacité du nom marketing. Le rapport 8x7B original mettait l'accent sur de bons résultats par rapport aux systèmes de l'ère Llama 2 70B et GPT-3.5 ; ces comparaisons sont historiquement utiles mais n’établissent pas de compétitivité avec les modèles 2026.
Base contre Instruire
| Variante | Utilisez-le pour | Ne présumez pas |
|---|---|---|
| Socle | Recherche, préformation continue, adaptation du domaine et achèvement contrôlé | Formatage de chat fiable, comportement de refus ou hiérarchie d'instructions |
| Instruire | Tâches d'assistant/chat utilisant le modèle documenté | Sécurité de la production, factualité ou conformité aux politiques sans contrôles externes |
Les cartes modèles de Mistral avertissent explicitement que le point de contrôle 8x7B pré-entraîné n'a aucun mécanisme de modération. Le réglage des instructions améliore la convivialité, mais ne garantit pas la sécurité. Utilisez le tokenizer et le modèle de discussion exacts pour le modèle Instruct ; un format d'invite improvisé peut modifier sensiblement le comportement et les résultats de référence.
Mémoire de poids : les paramètres actifs ne sont pas des exigences VRAM
Une limite inférieure approximative pour le stockage du poids est le nombre total de paramètres multiplié par les octets par paramètre. Il exclut le cache KV, les activations, les tampons de routage, les métadonnées de quantification, la surcharge du framework et l'espace de travail temporaire. Cela ne garantit pas non plus qu'un format quantifié possède des noyaux optimisés sur l'accélérateur sélectionné.
| Modèle | Poids BF16/FP16 | poids 8 bits | poids théoriques 4 bits | Implication pratique |
|---|---|---|---|---|
| 8x7B (~46,7B) | ~93 Go | ~47 Go | ~23 Go | Souvent multi-GPU en pleine précision ; une utilisation locale quantifiée est possible avec une RAM/VRAM adéquate |
| 8x22B (~141B) | ~282 Go | ~141 Go | ~71 Go | Conçu pour une infrastructure multi-accélérateurs importante, même lorsqu'elle est quantifiée |
Il s’agit d’estimations arithmétiques et non de promesses de déploiement. Ajoutez de la marge et mesurez l'artefact réel. Certains environnements d'exécution déchargent des couches ou des experts sur le processeur, échangeant ainsi leur capacité contre de la latence. La mémoire unifiée peut charger un modèle tout en produisant des jetons inacceptables par seconde.
Cache KV et coût du contexte long
Le cache KV s'agrandit avec des séquences, des couches et des jetons mis en cache simultanés. La rareté MoE ne supprime pas le cache d’attention partagée. Un contexte maximum de 32 000 ou 64 000 est un plafond de capacité, et non une instruction pour répondre à chaque demande. Les invites longues augmentent la latence de pré-remplissage et réduisent la capacité des lots ; la récupération ou le résumé peut être moins coûteux et plus précis.
| Facteur de charge | Effet | Contrôle |
|---|---|---|
| Longueur de l'invite | Temps de pré-remplissage plus élevé et mémoire KV | Cap contexte par itinéraire ; récupérer uniquement les preuves pertinentes |
| Séquences simultanées | Multiplie le cache dynamique | Contrôle d'admission, traitement par lots continu et limites de file d'attente |
| Longueur de sortie | Le temps de décodage et le cache continuent d'augmenter | Jetons maximum explicites et conditions d'arrêt |
| Type de précision/cache | Modifie la mémoire et potentiellement la qualité | Benchmark pris en charge la quantification du cache sur les tâches cibles |
| Distribution experte | La communication entre appareils peut constituer un goulot d'étranglement | Utiliser la disposition parallèle tenseur/expert compatible MoE |
Options de service
Le fonctionnaire mistral-inférence Le référentiel fournit des outils de référence pour les modèles de la famille Mistral. Hugging Face Transformers prend en charge les architectures Mixtral, tandis que vLLM et d'autres moteurs d'inférence offrent des fonctionnalités de production telles que le traitement par lots continu et les points de terminaison compatibles OpenAI. Les écosystèmes llama.cpp/GGUF sont courants pour une utilisation locale quantifiée du CPU/GPU, mais les conversions tierces doivent être tracées jusqu'au point de contrôle canonique et testées.
| Durée d'exécution | Bon ajustement | Vérifier avant l'adoption |
|---|---|---|
| mistral-inférence | Comportement de référence et expérimentation native Mistral | Planification de la production, observabilité et version de point de contrôle prise en charge |
| Transformateurs | Recherche, mise au point et flexibilité des écosystèmes | Carte des périphériques, attention au backend et performances du noyau MoE |
| vLLM | Service GPU avec traitement par lots et compatibilité API | Prise en charge de Mixtral spécifique à la version, quantification et topologie parallèle |
| TensorRT-LLM/TGI | Déploiement géré optimisé ou lourd NVIDIA | Développez la complexité, la précision prise en charge et le parallélisme expert |
| llama.cpp / GGUF | Utilisation quantifiée locale, sur poste de travail ou assistée par CPU | Provenance du convertisseur, bande passante RAM et latence de contexte long |
Choix de quantification
| Approche | Avantage | Risque | Tester |
|---|---|---|---|
| BF16/FP16 | Qualité la plus proche de la référence et noyaux larges | Mémoire/coût très élevé | Base de référence |
| 8 bits | Réduit environ la moitié de la mémoire de poids | Dépendance noyau/environnement d'exécution | Latence, débit et qualité exacte des tâches |
| AWQ/GPTQ 4 bits | Grande réduction de la mémoire GPU | Calibrage et sensibilité de la couche MoE | Dégradation par langue et réponse longue |
| GGUF quantification | Déchargement flexible du CPU/GPU | Variantes de conversion et goulots d'étranglement de bande passante | Vitesse d'invite/décodage au déchargement prévu |
Ne sélectionnez jamais la quantification par simple perplexité. Évaluez l'appel d'outil JSON, la compilation de code, les instructions multilingues, la classification de sécurité, la mise à la terre de récupération et le comportement dans un contexte long. Le routage expert peut amplifier les erreurs différemment selon les entrées, utilisez donc suffisamment d'exemples et d'exécutions répétées.
Repère Mixtral pour la charge de travail, pas pour la nostalgie
Mixtral a été influent car il combinait licence ouverte, forte qualité 2023-2024 et calcul clairsemé. D’ici juillet 2026, de nombreux nouveaux points de contrôle denses et MoE offrent une meilleure qualité par mémoire, un contexte plus long ou une utilisation d’outils natifs. La bonne question est de savoir si Mixtral gagne sous vos contraintes : matériel déjà possédé, licence, reproductibilité, réglages fins, mélange de langues et latence acceptable.
- Créez 100 à 500 invites représentatives avec des critères or et des échecs interdits.
- Révision du point de contrôle des broches, tokeniseur, modèle de discussion, runtime, quantification et échantillonnage.
- Comparez dans le même contexte et dans les mêmes limites de sortie, et non dans les valeurs par défaut du fournisseur.
- Mesurez la latence du premier jeton, décodez les jetons/seconde, le débit simultané, la mémoire GPU et le coût total de l'énergie/du cloud.
- Notez séparément le soutien factuel, le respect des instructions, la production structurée, la sécurité et l’abstention.
- Répétez avec une concurrence réaliste ; Les performances de MoE peuvent changer fortement en fonction du lot et de la topologie.
| Métrique | Pourquoi c'est important | Raccourci trompeur courant |
|---|---|---|
| Succès de la tâche | Mesure directement les résultats des utilisateurs | Utiliser un classement général comme proxy |
| p95 délai d'obtention du premier jeton | Réactivité interactive | Signaler uniquement la vitesse de décodage moyenne |
| Jetons/s en simultanéité | Capacité de service | Débit de laboratoire à flux unique |
| Coût total/succès | Combine matériel et qualité | Comparaison du nombre de paramètres actifs |
| Mémoire maximale | Détermine la topologie viable | Compter uniquement les octets de poids quantifiés |
| Gravité de l'échec | Distingue les erreurs cosmétiques des erreurs dangereuses | Un score de précision global |
Contrôles de sécurité et de production
Les pondérations ouvertes rendent le comportement inspectable et déployable sur une infrastructure privée, mais n'assurent pas de modération. Les points de contrôle de base peuvent émettre du contenu dangereux ; les points de contrôle d'instructions peuvent être jailbreakés, halluciner et suivre un texte récupéré malveillant. Construisez un système en couches :
- Classez les demandes et les sorties à l’aide d’une politique appropriée au domaine.
- Keep retrieved documents untrusted and separate data from system instructions.
- Limitez les outils avec des listes autorisées, des schémas, des délais d'attente, des quotas et une confirmation humaine.
- Validez le code généré et la sortie structurée en dehors du modèle.
- Enregistrez les versions de modèle/point de contrôle/modèle et conservez les traces d’évaluation sans stocker de données personnelles inutiles.
- Attaques multilingues et à contexte long par équipe rouge ; les revendications linguistiques historiques du modèle ne constituent pas des garanties de couverture.
Licence et provenance
Les référentiels canoniques Mistral AI Mixtral identifient les points de contrôle comme Apache 2.0. C'est permissif, mais les réglages fins, les quantifications, les ensembles de données et les services de service en aval peuvent introduire des termes différents. Enregistrez la révision et les hachages exacts du modèle, lisez la carte du modèle, conservez les avis, numérisez les artefacts sérialisés et documentez les obligations en matière de données tierces. Le « LLM open source » est imprécis : les poids et le code d'inférence peuvent faire l'objet d'une licence ouverte sans que les données de formation complètes et le pipeline de formation ne soient disponibles.
Quand Mixtral a encore du sens
| Situation | Ajustement | Raison |
|---|---|---|
| Ajustement précis Mixtral existant et validé | Fort | Le risque migratoire peut contrebalancer les nouveaux gains de référence |
| Exigence Apache-2.0 | Fort | Effacer la licence de point de contrôle permissive |
| Recherche sur le routage clairsemé MoE | Fort | Architecture et écosystème reconnus |
| Un seul petit GPU | Faible | La pondération totale des experts reste importante ; les modèles denses plus petits sont plus simples |
| Meilleure qualité frontière 2026 | Faible | Mixtral est désormais une génération historique, et non la frontière de Mistral |
| Service à haute concurrence sans expertise MoE | Conditionnel | La topologie et les noyaux déterminent si le calcul clairsemé génère de réelles économies |
Alternatives
Comparez Mixtral avec les modèles ouverts Mistral actuels, les familles Qwen et Llama actuelles, les points de contrôle DeepSeek MoE, DBRX et les modèles d'instructions denses plus petits. Ne figez pas une liste des « meilleures » alternatives, car les versions évoluent rapidement. Créez un ensemble de candidats à partir de points de contrôle qui répondent aux exigences en matière de licence, de langue, de contexte, de matériel et de sécurité, puis exécutez la même évaluation de charge de travail.
| Type de candidat | Choisissez-le quand | Compromis |
|---|---|---|
| Plus récent, dense 7B – 32B | La simplicité d'un nœud unique et l'efficacité de la mémoire sont importantes | Peut offrir moins de capacité mais souvent une meilleure utilisation des réglages/outils modernes |
| Plus récent, clairsemé MoE | Vous pouvez exploiter le parallélisme expert et avez besoin d'une mise à l'échelle de la qualité/du calcul | Même classe de complexité avec des licences et un écosystème différents |
| Hébergé propriétaire API | Les opérations et la qualité aux frontières comptent plus que le contrôle du poids | Limite des données, coûts récurrents et dépendance aux fournisseurs |
| Petit modèle optimisé pour le domaine | La tâche est restreinte et les données d’évaluation sont solides | Coût inférieur mais généralité limitée |
FAQ
Mixtral 8x7B est-il un modèle à huit milliards de paramètres ?
Non, il contient environ 46,7 milliards de paramètres au total et en active environ 12,9 milliards par jeton. Les poids totaux déterminent le stockage et une grande partie des besoins en mémoire.
Utilise-t-il les huit experts pour chaque jeton ?
Non. Le routeur sélectionne deux experts par jeton dans chaque couche MoE et combine leurs sorties.
Mixtral 8x7B peut-il s'adapter à un GPU de 24 Go ?
Les poids de pleine précision ne le peuvent pas. Certaines conversions 4 bits agressives s'approchent de ce budget de poids brut, mais les frais généraux et le cache KV nécessitent généralement de la RAM/déchargement supplémentaire ou plus de VRAM. Testez le temps d'exécution exact.
Mixtral est-il gratuit pour un usage commercial ?
Les points de contrôle canoniques sont publiés sous Apache 2.0. Vérifiez l’artefact exact et tout réglage fin, ensemble de données ou conditions d’hébergement avec un avocat.
Le modèle Instruct inclut-il une modération de sécurité ?
Ne considérez pas le réglage des instructions comme une couche de sécurité. Ajoutez une politique d’entrée/sortie, des contraintes d’outils et une évaluation spécifique au domaine.
Mixtral est-il toujours un bon défaut en 2026 ?
Pas automatiquement. Il reste utile pour les licences permissives, les déploiements établis et la recherche MoE, mais doit être comparé aux modèles actuels sur le matériel et la charge de travail réels.
Sources et vérification
- Mistral AI : Mixtral de libération des experts
- Mistral AI : Mixtral version 8x22B
- Mixtral de la note technique des Experts
- Carte modèle de base Canonical Mixtral 8x7B
- Canonical Mixtral 8x7B Instruire la carte de modèle
- Carte modèle de base Canonical Mixtral 8x22B
- Carte modèle d'instruction Canonical Mixtral 8x22B
- Dépôt d'inférence officiel Mistral
- Documentation du modèle pris en charge vLLM
Dernière révision le 26 juillet 2026. Prise en charge de l'exécution, disponibilité du modèle et changement de qualité comparatif. Épinglez chaque artefact et réexécutez l’évaluation de la charge de travail avant le déploiement.