Mixtral
Mixtral
Active

Mixtral

Mixtral ist die Modellfamilie Apache-2.0 von Mistral AI mit einer spärlichen Expertenmischung, einschließlich Mixtral 8x7B und 8x22B Basis- und Befehlsvarianten. Dieser unabhängige Leitfaden erläutert Routing, aktive versus Gesamtparameter, Speicher- und Bereitstellungskosten, Quantisierung, Auswertung, Sicherheit und moderne Alternativen.

52

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

open-source-llmfree

Editorial Review

About Mixtral

Mixtral ist eine Familie von Open-Weight-Spärse-Experten-Sprachmodellen (MoE), die von Mistral AI veröffentlicht wurden. Die bekanntesten Prüfpunkte sind Mixtral 8x7B und Mixtral 8x22B, jeweils als vorab trainiertes Basismodell und als anweisungsoptimierte Variante erhältlich. Ihre Apache 2.0-Lizenz erlaubt eine umfassende kommerzielle Nutzung, Änderung und Weiterverbreitung vorbehaltlich der Lizenzbedingungen.

Der Name „8x“ bedeutet nicht, dass auf jeden Token acht unabhängige Modelle antworten. In jedem Transformatorblock wählt ein Router zwei von acht Feed-Forward-Experten für jeden Token aus. Aufmerksamkeit und andere Komponenten bleiben geteilt. Dadurch entsteht ein wichtiger Unterschied: Das Modell muss alle Expertengewichte speichern, aber nur eine Teilmenge nimmt am Vorwärtsdurchlauf eines Tokens teil. Die Berechnung kann einem kleineren, dichten Modell ähneln, während die Speicher- und Verteilungsanforderungen viel näher am gesamten Parameter-Footprint bleiben.

Mixtral sparse mixture-of-experts model listing image
Die offenen Gewichte von Mixtral bleiben für Selbst-Hosting und MoE-Forschung nützlich. Hardware-Entscheidungen müssen den gesamten Gewichtsspeicher nutzen, nicht nur aktive Parameter.

Wie Sparse-Expert-Routing funktioniert

 Token-Darstellung
        |
        v
     Router-Scores
  E1 E2 E3 E4 E5 E6 E7 E8
       \ /
        Top-2-Experten
       / \
 Expertenausgabe Expertenausgabe
       \ /
      gewichtete Zusammenführung
           |
 geteilte Aufmerksamkeit + nächste Ebene

Das Routing erfolgt unabhängig auf jeder Ebene und jedem Token, sodass eine Eingabeaufforderung nicht dauerhaft zwei Experten auswählt. Der Router gewichtet die ausgewählten Ausgänge. Die Sparse-Aktivierung reduziert die Feed-Forward-Berechnung im Vergleich zur Ausführung aller Experten, die Bereitstellungseffizienz hängt jedoch von der Kernel-Unterstützung, der Platzierung der Experten, der Batch-Größe und der Kommunikation ab. Eine schlechte Expertenparallelität kann theoretische Einsparungen zunichte machen.

Mixtral Modellvarianten

KontrollpunktGesamtparameterCa. aktiv/TokenVeröffentlichter KontextZweck
Mixtral 8x7B v0.1Ungefähr 46,7 MilliardenUngefähr 12,9 Milliarden32.000 TokenVortrainierte Basis zur Vervollständigung/Feinabstimmung
Mixtral 8x7B Instruct v0.1Ungefähr 46,7 MilliardenUngefähr 12,9 Milliarden32.000 TokenAnweisungen folgen und chatten
Mixtral 8x22B v0.1Ungefähr 141BUngefähr 39B64.000 TokenGrößere vortrainierte Basis
Mixtral 8x22B Instruct v0.1Ungefähr 141BUngefähr 39B64.000 TokenGrößeres, auf Anweisungen abgestimmtes Modell

Bei den Werten handelt es sich um Näherungswerte, da die Parameterabrechnung je nach gemeinsam genutzten Komponenten, Vokabular und Implementierung unterschiedlich sein kann. Überprüfen Sie immer die Konfiguration des gewählten Repositorys, anstatt die Kapazität aus dem Marketingnamen abzuleiten. Der ursprüngliche 8x7B-Bericht betonte starke Ergebnisse im Vergleich zu Llama 2 70B- und GPT-3.5-Systemen; Diese Vergleiche sind historisch nützlich, belegen jedoch nicht die Wettbewerbsfähigkeit mit 2026-Modellen.

Basis versus Unterweisung

VarianteBenutze es fürGehen Sie nicht davon aus
BasisRecherche, fortlaufende Vorschulung, Domänenanpassung und kontrollierte VervollständigungZuverlässige Chatformatierung, Verweigerungsverhalten oder Anweisungshierarchie
UnterweisenAssistenten-/Chat-Aufgaben mithilfe der dokumentierten VorlageProduktionssicherheit, Sachlichkeit oder Richtlinieneinhaltung ohne externe Kontrollen

Die Modellkarten von Mistral warnen ausdrücklich, dass der vorab trainierte 8x7B-Kontrollpunkt über keine Moderationsmechanismen verfügt. Die Optimierung der Anweisungen verbessert die Benutzerfreundlichkeit, garantiert jedoch nicht die Sicherheit. Verwenden Sie den genauen Tokenizer und die Chat-Vorlage für das Instruct-Modell. Ein improvisiertes Eingabeaufforderungsformat kann das Verhalten erheblich verändern und Ergebnisse vergleichen.

Gewichtsspeicher: Aktive Parameter sind keine VRAM-Anforderungen

Eine grobe Untergrenze für die Gewichtsspeicherung ist die Gesamtzahl der Parameter multipliziert mit Bytes pro Parameter. Ausgenommen sind KV-Cache, Aktivierungen, Routing-Puffer, Quantisierungsmetadaten, Framework-Overhead und temporärer Arbeitsbereich. Es garantiert auch nicht, dass ein quantisiertes Format optimierte Kernel auf dem ausgewählten Beschleuniger hat.

ModellBF16/FP16-Gewichte8-Bit-GewichteTheoretische 4-Bit-GewichtePraktische Implikation
8x7B (~46,7B)~93 GB~47 GB~23 GBOftmals Multi-GPU mit voller Präzision; Bei ausreichend RAM/VRAM ist eine quantisierte lokale Nutzung möglich
8x22B (~141B)~282 GB~141 GB~71 GBEntwickelt für umfangreiche Multi-Beschleuniger-Infrastruktur, auch bei Quantisierung

Dabei handelt es sich um arithmetische Schätzungen, nicht um Einsatzversprechen. Fügen Sie Spielraum hinzu und messen Sie das tatsächliche Artefakt. Einige Laufzeiten verlagern Schichten oder Experten auf die CPU und tauschen Kapazität gegen Latenz ein. Ein einheitlicher Speicher kann dazu führen, dass ein Modell geladen wird und gleichzeitig inakzeptable Token pro Sekunde erzeugt werden.

KV-Cache und Long-Context-Kosten

Der KV-Cache wächst mit gleichzeitigen Sequenzen, Ebenen und zwischengespeicherten Token. MoE Sparsity entfernt den Shared-Attention-Cache nicht. Bei einem maximalen Kontext von 32 KB oder 64 KB handelt es sich um eine Leistungsobergrenze und nicht um eine Anweisung, jede Anforderung zu erfüllen. Lange Eingabeaufforderungen erhöhen die Vorfülllatenz und verringern die Batch-Kapazität. Das Abrufen oder Zusammenfassen kann kostengünstiger und genauer sein.

BelastungsfaktorWirkungKontrolle
Prompte LängeHöhere Vorfüllzeit und KV-SpeicherCap-Kontext nach Route; nur relevante Beweise abrufen
Gleichzeitige SequenzenVervielfacht den Live-CacheEinlasskontrolle, kontinuierliche Stapelung und Warteschlangenbegrenzungen
AusgabelängeDie Dekodierungszeit und der Cache nehmen weiter zuExplizite maximale Token und Stoppbedingungen
Präzision/Cache-DtypÄndert den Speicher und möglicherweise die QualitätBenchmark-unterstützte Cache-Quantisierung für Zielaufgaben
ExpertenvertriebBei der geräteübergreifenden Kommunikation kann es zu Engpässen kommenVerwenden Sie das MoE-fähige Tensor-/Experten-Parallellayout

Serviermöglichkeiten

Der Beamte Mistral-Schlussfolgerung Das Repository stellt Referenztools für Modelle der Mistral-Familie bereit. Hugging Face Transformers unterstützt Mixtral-Architekturen, während vLLM und andere Inferenz-Engines Produktionsfunktionen wie kontinuierliches Batching und OpenAI-kompatible Endpunkte bieten. llama.cpp/GGUF Ökosysteme sind für die quantisierte lokale CPU/GPU-Nutzung üblich, Konvertierungen von Drittanbietern müssen jedoch bis zum kanonischen Prüfpunkt zurückverfolgt und getestet werden.

LaufzeitGute PassformVor der Adoption prüfen
Mistral-SchlussfolgerungReferenzverhalten und Mistral-natives ExperimentierenProduktionsplanung, Beobachtbarkeit und unterstützte Checkpoint-Version
TransformatorenForschung, Feinabstimmung und ÖkosystemflexibilitätGerätekarte, Aufmerksamkeits-Backend und MoE Kernel-Leistung
vLLMGPU-Bereitstellung mit Batch- und API-KompatibilitätVersionsspezifische Mixtral-Unterstützung, Quantisierung und parallele Topologie
TensorRT-LLM/TGIOptimierte verwaltete oder NVIDIA-lastige BereitstellungBauen Sie Komplexität, unterstützte Präzision und Expertenparallelität auf
llama.cpp / GGUFQuantisierte lokale, Workstation- oder CPU-gestützte NutzungHerkunft des Konverters, RAM-Bandbreite und lange Kontextlatenz

Quantisierungsoptionen

AnsatzProfitierenRisikoTesten
BF16/FP16Am nächsten an Referenzqualität und breiten KernelnSehr hoher Speicher/KostenReferenzbasislinie
8-BitGewichtsgedächtnis wird ungefähr halbiertKernel-/LaufzeitabhängigkeitLatenz, Durchsatz und exakte Aufgabenqualität
AWQ/GPTQ 4-BitGroße Reduzierung des GPU-SpeichersKalibrierung und MoE SchichtempfindlichkeitVerschlechterung pro Sprache und bei langen Antworten
GGUF QuantisierungFlexible CPU/GPU-AuslagerungKonvertierungsvarianten und BandbreitenengpässeEingabeaufforderungs-/Dekodierungsgeschwindigkeit bei beabsichtigtem Offload

Wählen Sie die Quantisierung niemals allein aus Ratlosigkeit. Bewerten Sie den Tool-Aufruf JSON, die Codekompilierung, mehrsprachige Anweisungen, die Sicherheitsklassifizierung, die Abruferdung und das Verhalten bei langen Kontexten. Expertenrouting kann Fehler bei verschiedenen Eingaben unterschiedlich verstärken. Verwenden Sie daher genügend Beispiele und wiederholte Durchläufe.

Benchmark Mixtral für die Arbeitsbelastung, nicht für Nostalgie

Mixtral war einflussreich, weil es offene Lizenzierung, starke Qualität für 2023–2024 und spärliche Rechenleistung kombinierte. Bis Juli 2026 bieten viele neuere dichte und MoE-Prüfpunkte eine bessere Qualität pro Speicher, längeren Kontext oder native Tool-Nutzung. Die richtige Frage ist, ob Mixtral unter Ihren Einschränkungen gewinnt: bereits vorhandene Hardware, Lizenz, Reproduzierbarkeit, Feinabstimmungen, Sprachmix und akzeptable Latenz.

  1. Erstellen Sie 100–500 repräsentative Eingabeaufforderungen mit Goldkriterien und verbotenen Fehlern.
  2. Pin-Checkpoint-Revision, Tokenizer, Chat-Vorlage, Laufzeit, Quantisierung und Sampling.
  3. Vergleichen Sie den gleichen Kontext und die gleichen Ausgabegrenzen, nicht die Herstellerstandards.
  4. Messen Sie die Latenz des ersten Tokens, die Dekodierung von Tokens/Sekunde, den gleichzeitigen Durchsatz, den GPU-Speicher und die gesamten Energie-/Cloud-Kosten.
  5. Bewerten Sie die sachliche Unterstützung, die Einhaltung von Anweisungen, die strukturierte Ausgabe, die Sicherheit und die Enthaltung separat.
  6. Wiederholen Sie dies bei realistischer Parallelität. Die Leistung von MoE kann sich je nach Batch und Topologie stark ändern.
MetrischWarum es wichtig istHäufige irreführende Abkürzung
AufgabenerfolgMisst direkt das BenutzerergebnisVerwendung einer allgemeinen Bestenliste als Stellvertreter
p95 Zeit bis zum ersten TokenInteraktive ReaktionsfähigkeitEs wird nur die durchschnittliche Dekodierungsgeschwindigkeit gemeldet
Tokens/Sek. bei ParallelitätServierkapazitätSingle-Stream-Labordurchsatz
Gesamtkosten/ErfolgKombiniert Hardware und QualitätVergleich der Anzahl aktiver Parameter
SpitzengedächtnisBestimmt die realisierbare TopologieEs werden nur quantisierte Gewichtsbytes gezählt
Schweregrad des FehlersUnterscheidet zwischen kosmetischen und unsicheren FehlernEine Gesamtgenauigkeitsbewertung

Sicherheits- und Produktionskontrollen

Offene Gewichtungen machen das Verhalten in der privaten Infrastruktur überprüfbar und einsetzbar, bieten jedoch keine Moderation. Basiskontrollpunkte können unsichere Inhalte ausgeben; Anweisungskontrollpunkte können einen Jailbreak haben, halluzinieren und böswillig abgerufenem Text folgen. Erstellen Sie ein Schichtsystem:

  • Klassifizieren Sie Anfragen und Ausgaben mithilfe einer für die Domäne geeigneten Richtlinie.
  • Keep retrieved documents untrusted and separate data from system instructions.
  • Beschränken Sie Tools mit Zulassungslisten, Schemata, Zeitüberschreitungen, Kontingenten und menschlicher Bestätigung.
  • Validieren Sie generierten Code und strukturierte Ausgaben außerhalb des Modells.
  • Protokollieren Sie Modell-/Prüfpunkt-/Vorlagenversionen und bewahren Sie Auswertungsspuren auf, ohne unnötige persönliche Daten zu speichern.
  • Red-Team-Angriffe mit mehreren Sprachen und langen Kontexten; Die historischen Sprachansprüche des Modells stellen keine Abdeckungsgarantien dar.

Lizenzierung und Herkunft

Die kanonischen Mistral AI Mixtral-Repositorys identifizieren die Prüfpunkte als Apache 2.0. Das ist zwar zulässig, aber nachgelagerte Feinabstimmungen, Quantisierungen, Datensätze und Bereitstellungsdienste können zu unterschiedlichen Begriffen führen. Erfassen Sie die genaue Modellrevision und Hashes, lesen Sie die Modellkarte, bewahren Sie Hinweise auf, scannen Sie serialisierte Artefakte und dokumentieren Sie Datenverpflichtungen Dritter. „Open Source LLM“ ist ungenau: Die Gewichte und der Inferenzcode können offen lizenziert werden, ohne dass die vollständigen Trainingsdaten und die Trainingspipeline verfügbar sind.

Wenn Mixtral immer noch Sinn macht

SituationPasstGrund
Vorhandene validierte Mixtral FeinabstimmungStarkDas Migrationsrisiko kann die neueren Benchmark-Gewinne überwiegen
Apache-2.0 AnforderungStarkFreizügige Checkpoint-Lizenz löschen
Forschung zum spärlichen MoE-RoutingStarkBekannte Architektur und Ökosystem
Einzelne kleine GPUSchwachDie Gesamtgewichtung der Experten bleibt groß; Kleinere dichte Modelle sind einfacher
Beste Grenzqualität 2026SchwachMixtral ist nun eine historische Generation, nicht die Grenze von Mistral
Hochparallele Bereitstellung ohne MoE FachwissenBedingtTopologie und Kernel bestimmen, ob spärliche Rechenleistung zu echten Einsparungen führt

Alternativen

Vergleichen Sie Mixtral mit aktuellen Mistral offenen Modellen, aktuellen Qwen- und Llama-Familien, DeepSeek MoE Checkpoints, DBRX und kleineren dichten Befehlsmodellen. Frieren Sie eine Liste der „besten“ Alternativen nicht ein, da Veröffentlichungen schnell erfolgen. Erstellen Sie einen Kandidatensatz aus Prüfpunkten, die Lizenz-, Sprach-, Kontext-, Hardware- und Sicherheitsanforderungen erfüllen, und führen Sie dann dieselbe Workload-Bewertung durch.

KandidatentypWählen Sie es wannKompromiss
Neuere dichte 7B–32BDie Einfachheit eines einzelnen Knotens und die Speichereffizienz sind wichtigBietet möglicherweise weniger Kapazität, aber oft eine bessere moderne Abstimmung/Werkzeugnutzung
Neuere Sparse MoESie können Expertenparallelität nutzen und benötigen eine Qualitäts-/RechenskalierungGleiche Komplexitätsklasse mit unterschiedlicher Lizenzierung und unterschiedlichem Ökosystem
Gehostetes proprietäres APIOperationen und Grenzqualität sind wichtiger als GewichtskontrolleDatengrenze, wiederkehrende Kosten und Anbieterabhängigkeit
Domänenfein abgestimmtes kleines ModellDie Aufgabe ist eng gefasst und die Bewertungsdaten sind aussagekräftigGeringere Kosten, aber begrenzte Allgemeingültigkeit

FAQ

Ist Mixtral 8x7B ein Acht-Milliarden-Parameter-Modell?

Nein. Es verfügt über insgesamt etwa 46,7 Milliarden Parameter und aktiviert etwa 12,9 Milliarden pro Token. Die Gesamtgewichte gewichten den Laufwerksspeicher und einen Großteil des Speicherbedarfs.

Werden alle acht Experten für jeden Token verwendet?

Nein. Der Router wählt pro Token in jeder MoE-Schicht zwei Experten aus und kombiniert deren Ausgaben.

Passt Mixtral 8x7B auf eine 24-GB-GPU?

Bei Gewichten mit voller Präzision ist dies nicht möglich. Einige aggressive 4-Bit-Konvertierungen erreichen dieses Rohgewichtsbudget, aber Overhead und KV-Cache erfordern normalerweise zusätzlichen RAM/Offload oder mehr VRAM. Testen Sie die genaue Laufzeit.

Ist Mixtral für die kommerzielle Nutzung kostenlos?

Die kanonischen Prüfpunkte werden unter Apache 2.0 veröffentlicht. Überprüfen Sie mit Ihrem Berater das genaue Artefakt und alle Feinabstimmungs-, Datensatz- oder Hosting-Bedingungen.

Beinhaltet das Instruct-Modell Sicherheitsmoderation?

Betrachten Sie die Abstimmung von Anweisungen nicht als Sicherheitsebene. Fügen Sie Eingabe-/Ausgaberichtlinien, Tool-Einschränkungen und domänenspezifische Auswertungen hinzu.

Ist Mixtral im Jahr 2026 noch ein guter Standardwert?

Nicht automatisch. Es bleibt wertvoll für freizügige Lizenzen, etablierte Bereitstellungen und MoE-Forschung, sollte aber mit aktuellen Modellen auf der realen Hardware und Arbeitslast verglichen werden.

Quellen und Überprüfung

Zuletzt überprüft am 26. Juli 2026. Laufzeitunterstützung, Modellverfügbarkeit und vergleichende Qualitätsänderung. Fixieren Sie jedes Artefakt und führen Sie die Workload-Bewertung vor der Bereitstellung erneut durch.

Ready to try Mixtral?

Visit the official website to get started

Visit Mixtral

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
7/27/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
590
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
540
Qwen3

Qwen3

Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
520
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - Intelligentes KI-Tool für mehr Produktivität.

open-source-llmfree
570