Mixtral ist eine Familie von Open-Weight-Spärse-Experten-Sprachmodellen (MoE), die von Mistral AI veröffentlicht wurden. Die bekanntesten Prüfpunkte sind Mixtral 8x7B und Mixtral 8x22B, jeweils als vorab trainiertes Basismodell und als anweisungsoptimierte Variante erhältlich. Ihre Apache 2.0-Lizenz erlaubt eine umfassende kommerzielle Nutzung, Änderung und Weiterverbreitung vorbehaltlich der Lizenzbedingungen.
Der Name „8x“ bedeutet nicht, dass auf jeden Token acht unabhängige Modelle antworten. In jedem Transformatorblock wählt ein Router zwei von acht Feed-Forward-Experten für jeden Token aus. Aufmerksamkeit und andere Komponenten bleiben geteilt. Dadurch entsteht ein wichtiger Unterschied: Das Modell muss alle Expertengewichte speichern, aber nur eine Teilmenge nimmt am Vorwärtsdurchlauf eines Tokens teil. Die Berechnung kann einem kleineren, dichten Modell ähneln, während die Speicher- und Verteilungsanforderungen viel näher am gesamten Parameter-Footprint bleiben.

Wie Sparse-Expert-Routing funktioniert
Token-Darstellung
|
v
Router-Scores
E1 E2 E3 E4 E5 E6 E7 E8
\ /
Top-2-Experten
/ \
Expertenausgabe Expertenausgabe
\ /
gewichtete Zusammenführung
|
geteilte Aufmerksamkeit + nächste Ebene
Das Routing erfolgt unabhängig auf jeder Ebene und jedem Token, sodass eine Eingabeaufforderung nicht dauerhaft zwei Experten auswählt. Der Router gewichtet die ausgewählten Ausgänge. Die Sparse-Aktivierung reduziert die Feed-Forward-Berechnung im Vergleich zur Ausführung aller Experten, die Bereitstellungseffizienz hängt jedoch von der Kernel-Unterstützung, der Platzierung der Experten, der Batch-Größe und der Kommunikation ab. Eine schlechte Expertenparallelität kann theoretische Einsparungen zunichte machen.
Mixtral Modellvarianten
| Kontrollpunkt | Gesamtparameter | Ca. aktiv/Token | Veröffentlichter Kontext | Zweck |
|---|---|---|---|---|
| Mixtral 8x7B v0.1 | Ungefähr 46,7 Milliarden | Ungefähr 12,9 Milliarden | 32.000 Token | Vortrainierte Basis zur Vervollständigung/Feinabstimmung |
| Mixtral 8x7B Instruct v0.1 | Ungefähr 46,7 Milliarden | Ungefähr 12,9 Milliarden | 32.000 Token | Anweisungen folgen und chatten |
| Mixtral 8x22B v0.1 | Ungefähr 141B | Ungefähr 39B | 64.000 Token | Größere vortrainierte Basis |
| Mixtral 8x22B Instruct v0.1 | Ungefähr 141B | Ungefähr 39B | 64.000 Token | Größeres, auf Anweisungen abgestimmtes Modell |
Bei den Werten handelt es sich um Näherungswerte, da die Parameterabrechnung je nach gemeinsam genutzten Komponenten, Vokabular und Implementierung unterschiedlich sein kann. Überprüfen Sie immer die Konfiguration des gewählten Repositorys, anstatt die Kapazität aus dem Marketingnamen abzuleiten. Der ursprüngliche 8x7B-Bericht betonte starke Ergebnisse im Vergleich zu Llama 2 70B- und GPT-3.5-Systemen; Diese Vergleiche sind historisch nützlich, belegen jedoch nicht die Wettbewerbsfähigkeit mit 2026-Modellen.
Basis versus Unterweisung
| Variante | Benutze es für | Gehen Sie nicht davon aus |
|---|---|---|
| Basis | Recherche, fortlaufende Vorschulung, Domänenanpassung und kontrollierte Vervollständigung | Zuverlässige Chatformatierung, Verweigerungsverhalten oder Anweisungshierarchie |
| Unterweisen | Assistenten-/Chat-Aufgaben mithilfe der dokumentierten Vorlage | Produktionssicherheit, Sachlichkeit oder Richtlinieneinhaltung ohne externe Kontrollen |
Die Modellkarten von Mistral warnen ausdrücklich, dass der vorab trainierte 8x7B-Kontrollpunkt über keine Moderationsmechanismen verfügt. Die Optimierung der Anweisungen verbessert die Benutzerfreundlichkeit, garantiert jedoch nicht die Sicherheit. Verwenden Sie den genauen Tokenizer und die Chat-Vorlage für das Instruct-Modell. Ein improvisiertes Eingabeaufforderungsformat kann das Verhalten erheblich verändern und Ergebnisse vergleichen.
Gewichtsspeicher: Aktive Parameter sind keine VRAM-Anforderungen
Eine grobe Untergrenze für die Gewichtsspeicherung ist die Gesamtzahl der Parameter multipliziert mit Bytes pro Parameter. Ausgenommen sind KV-Cache, Aktivierungen, Routing-Puffer, Quantisierungsmetadaten, Framework-Overhead und temporärer Arbeitsbereich. Es garantiert auch nicht, dass ein quantisiertes Format optimierte Kernel auf dem ausgewählten Beschleuniger hat.
| Modell | BF16/FP16-Gewichte | 8-Bit-Gewichte | Theoretische 4-Bit-Gewichte | Praktische Implikation |
|---|---|---|---|---|
| 8x7B (~46,7B) | ~93 GB | ~47 GB | ~23 GB | Oftmals Multi-GPU mit voller Präzision; Bei ausreichend RAM/VRAM ist eine quantisierte lokale Nutzung möglich |
| 8x22B (~141B) | ~282 GB | ~141 GB | ~71 GB | Entwickelt für umfangreiche Multi-Beschleuniger-Infrastruktur, auch bei Quantisierung |
Dabei handelt es sich um arithmetische Schätzungen, nicht um Einsatzversprechen. Fügen Sie Spielraum hinzu und messen Sie das tatsächliche Artefakt. Einige Laufzeiten verlagern Schichten oder Experten auf die CPU und tauschen Kapazität gegen Latenz ein. Ein einheitlicher Speicher kann dazu führen, dass ein Modell geladen wird und gleichzeitig inakzeptable Token pro Sekunde erzeugt werden.
KV-Cache und Long-Context-Kosten
Der KV-Cache wächst mit gleichzeitigen Sequenzen, Ebenen und zwischengespeicherten Token. MoE Sparsity entfernt den Shared-Attention-Cache nicht. Bei einem maximalen Kontext von 32 KB oder 64 KB handelt es sich um eine Leistungsobergrenze und nicht um eine Anweisung, jede Anforderung zu erfüllen. Lange Eingabeaufforderungen erhöhen die Vorfülllatenz und verringern die Batch-Kapazität. Das Abrufen oder Zusammenfassen kann kostengünstiger und genauer sein.
| Belastungsfaktor | Wirkung | Kontrolle |
|---|---|---|
| Prompte Länge | Höhere Vorfüllzeit und KV-Speicher | Cap-Kontext nach Route; nur relevante Beweise abrufen |
| Gleichzeitige Sequenzen | Vervielfacht den Live-Cache | Einlasskontrolle, kontinuierliche Stapelung und Warteschlangenbegrenzungen |
| Ausgabelänge | Die Dekodierungszeit und der Cache nehmen weiter zu | Explizite maximale Token und Stoppbedingungen |
| Präzision/Cache-Dtyp | Ändert den Speicher und möglicherweise die Qualität | Benchmark-unterstützte Cache-Quantisierung für Zielaufgaben |
| Expertenvertrieb | Bei der geräteübergreifenden Kommunikation kann es zu Engpässen kommen | Verwenden Sie das MoE-fähige Tensor-/Experten-Parallellayout |
Serviermöglichkeiten
Der Beamte Mistral-Schlussfolgerung Das Repository stellt Referenztools für Modelle der Mistral-Familie bereit. Hugging Face Transformers unterstützt Mixtral-Architekturen, während vLLM und andere Inferenz-Engines Produktionsfunktionen wie kontinuierliches Batching und OpenAI-kompatible Endpunkte bieten. llama.cpp/GGUF Ökosysteme sind für die quantisierte lokale CPU/GPU-Nutzung üblich, Konvertierungen von Drittanbietern müssen jedoch bis zum kanonischen Prüfpunkt zurückverfolgt und getestet werden.
| Laufzeit | Gute Passform | Vor der Adoption prüfen |
|---|---|---|
| Mistral-Schlussfolgerung | Referenzverhalten und Mistral-natives Experimentieren | Produktionsplanung, Beobachtbarkeit und unterstützte Checkpoint-Version |
| Transformatoren | Forschung, Feinabstimmung und Ökosystemflexibilität | Gerätekarte, Aufmerksamkeits-Backend und MoE Kernel-Leistung |
| vLLM | GPU-Bereitstellung mit Batch- und API-Kompatibilität | Versionsspezifische Mixtral-Unterstützung, Quantisierung und parallele Topologie |
| TensorRT-LLM/TGI | Optimierte verwaltete oder NVIDIA-lastige Bereitstellung | Bauen Sie Komplexität, unterstützte Präzision und Expertenparallelität auf |
| llama.cpp / GGUF | Quantisierte lokale, Workstation- oder CPU-gestützte Nutzung | Herkunft des Konverters, RAM-Bandbreite und lange Kontextlatenz |
Quantisierungsoptionen
| Ansatz | Profitieren | Risiko | Testen |
|---|---|---|---|
| BF16/FP16 | Am nächsten an Referenzqualität und breiten Kerneln | Sehr hoher Speicher/Kosten | Referenzbasislinie |
| 8-Bit | Gewichtsgedächtnis wird ungefähr halbiert | Kernel-/Laufzeitabhängigkeit | Latenz, Durchsatz und exakte Aufgabenqualität |
| AWQ/GPTQ 4-Bit | Große Reduzierung des GPU-Speichers | Kalibrierung und MoE Schichtempfindlichkeit | Verschlechterung pro Sprache und bei langen Antworten |
| GGUF Quantisierung | Flexible CPU/GPU-Auslagerung | Konvertierungsvarianten und Bandbreitenengpässe | Eingabeaufforderungs-/Dekodierungsgeschwindigkeit bei beabsichtigtem Offload |
Wählen Sie die Quantisierung niemals allein aus Ratlosigkeit. Bewerten Sie den Tool-Aufruf JSON, die Codekompilierung, mehrsprachige Anweisungen, die Sicherheitsklassifizierung, die Abruferdung und das Verhalten bei langen Kontexten. Expertenrouting kann Fehler bei verschiedenen Eingaben unterschiedlich verstärken. Verwenden Sie daher genügend Beispiele und wiederholte Durchläufe.
Benchmark Mixtral für die Arbeitsbelastung, nicht für Nostalgie
Mixtral war einflussreich, weil es offene Lizenzierung, starke Qualität für 2023–2024 und spärliche Rechenleistung kombinierte. Bis Juli 2026 bieten viele neuere dichte und MoE-Prüfpunkte eine bessere Qualität pro Speicher, längeren Kontext oder native Tool-Nutzung. Die richtige Frage ist, ob Mixtral unter Ihren Einschränkungen gewinnt: bereits vorhandene Hardware, Lizenz, Reproduzierbarkeit, Feinabstimmungen, Sprachmix und akzeptable Latenz.
- Erstellen Sie 100–500 repräsentative Eingabeaufforderungen mit Goldkriterien und verbotenen Fehlern.
- Pin-Checkpoint-Revision, Tokenizer, Chat-Vorlage, Laufzeit, Quantisierung und Sampling.
- Vergleichen Sie den gleichen Kontext und die gleichen Ausgabegrenzen, nicht die Herstellerstandards.
- Messen Sie die Latenz des ersten Tokens, die Dekodierung von Tokens/Sekunde, den gleichzeitigen Durchsatz, den GPU-Speicher und die gesamten Energie-/Cloud-Kosten.
- Bewerten Sie die sachliche Unterstützung, die Einhaltung von Anweisungen, die strukturierte Ausgabe, die Sicherheit und die Enthaltung separat.
- Wiederholen Sie dies bei realistischer Parallelität. Die Leistung von MoE kann sich je nach Batch und Topologie stark ändern.
| Metrisch | Warum es wichtig ist | Häufige irreführende Abkürzung |
|---|---|---|
| Aufgabenerfolg | Misst direkt das Benutzerergebnis | Verwendung einer allgemeinen Bestenliste als Stellvertreter |
| p95 Zeit bis zum ersten Token | Interaktive Reaktionsfähigkeit | Es wird nur die durchschnittliche Dekodierungsgeschwindigkeit gemeldet |
| Tokens/Sek. bei Parallelität | Servierkapazität | Single-Stream-Labordurchsatz |
| Gesamtkosten/Erfolg | Kombiniert Hardware und Qualität | Vergleich der Anzahl aktiver Parameter |
| Spitzengedächtnis | Bestimmt die realisierbare Topologie | Es werden nur quantisierte Gewichtsbytes gezählt |
| Schweregrad des Fehlers | Unterscheidet zwischen kosmetischen und unsicheren Fehlern | Eine Gesamtgenauigkeitsbewertung |
Sicherheits- und Produktionskontrollen
Offene Gewichtungen machen das Verhalten in der privaten Infrastruktur überprüfbar und einsetzbar, bieten jedoch keine Moderation. Basiskontrollpunkte können unsichere Inhalte ausgeben; Anweisungskontrollpunkte können einen Jailbreak haben, halluzinieren und böswillig abgerufenem Text folgen. Erstellen Sie ein Schichtsystem:
- Klassifizieren Sie Anfragen und Ausgaben mithilfe einer für die Domäne geeigneten Richtlinie.
- Keep retrieved documents untrusted and separate data from system instructions.
- Beschränken Sie Tools mit Zulassungslisten, Schemata, Zeitüberschreitungen, Kontingenten und menschlicher Bestätigung.
- Validieren Sie generierten Code und strukturierte Ausgaben außerhalb des Modells.
- Protokollieren Sie Modell-/Prüfpunkt-/Vorlagenversionen und bewahren Sie Auswertungsspuren auf, ohne unnötige persönliche Daten zu speichern.
- Red-Team-Angriffe mit mehreren Sprachen und langen Kontexten; Die historischen Sprachansprüche des Modells stellen keine Abdeckungsgarantien dar.
Lizenzierung und Herkunft
Die kanonischen Mistral AI Mixtral-Repositorys identifizieren die Prüfpunkte als Apache 2.0. Das ist zwar zulässig, aber nachgelagerte Feinabstimmungen, Quantisierungen, Datensätze und Bereitstellungsdienste können zu unterschiedlichen Begriffen führen. Erfassen Sie die genaue Modellrevision und Hashes, lesen Sie die Modellkarte, bewahren Sie Hinweise auf, scannen Sie serialisierte Artefakte und dokumentieren Sie Datenverpflichtungen Dritter. „Open Source LLM“ ist ungenau: Die Gewichte und der Inferenzcode können offen lizenziert werden, ohne dass die vollständigen Trainingsdaten und die Trainingspipeline verfügbar sind.
Wenn Mixtral immer noch Sinn macht
| Situation | Passt | Grund |
|---|---|---|
| Vorhandene validierte Mixtral Feinabstimmung | Stark | Das Migrationsrisiko kann die neueren Benchmark-Gewinne überwiegen |
| Apache-2.0 Anforderung | Stark | Freizügige Checkpoint-Lizenz löschen |
| Forschung zum spärlichen MoE-Routing | Stark | Bekannte Architektur und Ökosystem |
| Einzelne kleine GPU | Schwach | Die Gesamtgewichtung der Experten bleibt groß; Kleinere dichte Modelle sind einfacher |
| Beste Grenzqualität 2026 | Schwach | Mixtral ist nun eine historische Generation, nicht die Grenze von Mistral |
| Hochparallele Bereitstellung ohne MoE Fachwissen | Bedingt | Topologie und Kernel bestimmen, ob spärliche Rechenleistung zu echten Einsparungen führt |
Alternativen
Vergleichen Sie Mixtral mit aktuellen Mistral offenen Modellen, aktuellen Qwen- und Llama-Familien, DeepSeek MoE Checkpoints, DBRX und kleineren dichten Befehlsmodellen. Frieren Sie eine Liste der „besten“ Alternativen nicht ein, da Veröffentlichungen schnell erfolgen. Erstellen Sie einen Kandidatensatz aus Prüfpunkten, die Lizenz-, Sprach-, Kontext-, Hardware- und Sicherheitsanforderungen erfüllen, und führen Sie dann dieselbe Workload-Bewertung durch.
| Kandidatentyp | Wählen Sie es wann | Kompromiss |
|---|---|---|
| Neuere dichte 7B–32B | Die Einfachheit eines einzelnen Knotens und die Speichereffizienz sind wichtig | Bietet möglicherweise weniger Kapazität, aber oft eine bessere moderne Abstimmung/Werkzeugnutzung |
| Neuere Sparse MoE | Sie können Expertenparallelität nutzen und benötigen eine Qualitäts-/Rechenskalierung | Gleiche Komplexitätsklasse mit unterschiedlicher Lizenzierung und unterschiedlichem Ökosystem |
| Gehostetes proprietäres API | Operationen und Grenzqualität sind wichtiger als Gewichtskontrolle | Datengrenze, wiederkehrende Kosten und Anbieterabhängigkeit |
| Domänenfein abgestimmtes kleines Modell | Die Aufgabe ist eng gefasst und die Bewertungsdaten sind aussagekräftig | Geringere Kosten, aber begrenzte Allgemeingültigkeit |
FAQ
Ist Mixtral 8x7B ein Acht-Milliarden-Parameter-Modell?
Nein. Es verfügt über insgesamt etwa 46,7 Milliarden Parameter und aktiviert etwa 12,9 Milliarden pro Token. Die Gesamtgewichte gewichten den Laufwerksspeicher und einen Großteil des Speicherbedarfs.
Werden alle acht Experten für jeden Token verwendet?
Nein. Der Router wählt pro Token in jeder MoE-Schicht zwei Experten aus und kombiniert deren Ausgaben.
Passt Mixtral 8x7B auf eine 24-GB-GPU?
Bei Gewichten mit voller Präzision ist dies nicht möglich. Einige aggressive 4-Bit-Konvertierungen erreichen dieses Rohgewichtsbudget, aber Overhead und KV-Cache erfordern normalerweise zusätzlichen RAM/Offload oder mehr VRAM. Testen Sie die genaue Laufzeit.
Ist Mixtral für die kommerzielle Nutzung kostenlos?
Die kanonischen Prüfpunkte werden unter Apache 2.0 veröffentlicht. Überprüfen Sie mit Ihrem Berater das genaue Artefakt und alle Feinabstimmungs-, Datensatz- oder Hosting-Bedingungen.
Beinhaltet das Instruct-Modell Sicherheitsmoderation?
Betrachten Sie die Abstimmung von Anweisungen nicht als Sicherheitsebene. Fügen Sie Eingabe-/Ausgaberichtlinien, Tool-Einschränkungen und domänenspezifische Auswertungen hinzu.
Ist Mixtral im Jahr 2026 noch ein guter Standardwert?
Nicht automatisch. Es bleibt wertvoll für freizügige Lizenzen, etablierte Bereitstellungen und MoE-Forschung, sollte aber mit aktuellen Modellen auf der realen Hardware und Arbeitslast verglichen werden.
Quellen und Überprüfung
- Mistral AI: Mixtral der Expertenfreigabe
- Mistral AI: Mixtral 8x22B-Version
- Mixtral des technischen Papiers von Experten
- Canonical Mixtral 8x7B Basismodellkarte
- Canonical Mixtral 8x7B Instruct-Modellkarte
- Canonical Mixtral 8x22B Basismodellkarte
- Canonical Mixtral 8x22B Instruct-Modellkarte
- Offizielles Mistral-Inferenz-Repository
- vLLM Dokumentation zum unterstützten Modell
Zuletzt überprüft am 26. Juli 2026. Laufzeitunterstützung, Modellverfügbarkeit und vergleichende Qualitätsänderung. Fixieren Sie jedes Artefakt und führen Sie die Workload-Bewertung vor der Bereitstellung erneut durch.