Mixtral Mistral AI によってリリースされた、オープンウェイトの疎専門家混合 (MoE) 言語モデルのファミリーです。最もよく知られているチェックポイントは Mixtral 8x7B と Mixtral 8x22B で、それぞれ事前トレーニングされた基本モデルと命令調整されたバリアントとして利用できます。 Apache 2.0 ライセンスでは、ライセンス条項に従って広範な商業利用、変更、再配布が許可されています。
「8x」という名前は、8 つの独立したモデルがすべてのトークンに応答するという意味ではありません。各トランスブロックでは、ルーターはトークンごとに 8 人のフィードフォワード エキスパートのうち 2 人を選択します。注意およびその他のコンポーネントは共有されたままになります。これにより重要な違いが生まれます。モデルはすべてのエキスパートの重みを保存する必要がありますが、トークンのフォワード パスにはサブセットのみが参加します。コンピューティングはより小規模な高密度モデルに似ている可能性がありますが、メモリと分散の要件は依然として完全なパラメーター フットプリントにかなり近いままです。

スパースエキスパートルーティングの仕組み
トークン表現
|
v
ルータースコア
E1 E2 E3 E4 E5 E6 E7 E8
\/
トップ 2 の専門家
/\
エキスパートの出力 エキスパートの出力
\/
加重マージ
|
注意を共有 + 次の層
ルーティングは各レイヤーとトークンで独立して行われるため、プロンプトによって 2 人のエキスパートが永続的に選択されるわけではありません。ルーターは、選択された出力に重み付けを行います。スパース アクティベーションにより、すべてのエキスパートを実行する場合に比べてフィードフォワード計算が削減されますが、サービスの効率はカーネル サポート、エキスパートの配置、バッチ サイズ、および通信に依存します。エキスパート並列処理が不十分だと、理論上の節約が失われる可能性があります。
Mixtral モデルのバリアント
| チェックポイント | 合計パラメータ | 約アクティブ/トークン | 公開されたコンテキスト | 目的 |
|---|---|---|---|---|
| Mixtral 8x7B v0.1 | 約467億円 | 約129億円 | 32,000 トークン | 完成/微調整のための事前トレーニングされたベース |
| Mixtral 8x7B 命令 v0.1 | 約467億円 | 約129億円 | 32,000 トークン | 指示に従い、チャットする |
| Mixtral 8x22B v0.1 | 約141B | 約39B | 64Kトークン | より大きな事前トレーニング済みベース |
| Mixtral 8x22B 命令 v0.1 | 約141B | 約39B | 64Kトークン | より大型の命令調整済みモデル |
パラメーターの計算は共有コンポーネント、語彙、実装によって異なる可能性があるため、値はおおよそのものです。マーケティング名から容量を導き出すのではなく、選択したリポジトリの構成を常に検査してください。オリジナルの 8x7B レポートでは、Llama 2 70B および GPT-3.5 時代のシステムと比較した強力な結果が強調されていました。これらの比較は歴史的には役に立ちますが、2026 年モデルとの競争力を確立するものではありません。
ベースと指示
| バリアント | 用途: | 仮定しないでください |
|---|---|---|
| ベース | 研究、継続的な事前トレーニング、ドメインの適応、および制御された完了 | 信頼性の高いチャット形式、拒否動作、または指示階層 |
| 指示する | 文書化されたテンプレートを使用したアシスタント/チャット タスク | 外部制御なしでの生産の安全性、事実またはポリシーの遵守 |
Mistral のモデル カードは、事前トレーニングされた 8x7B チェックポイントにはモデレーション メカニズムがないことを明示的に警告します。命令のチューニングは使いやすさを向上させますが、安全性は保証されません。 Instruct モデルには正確なトークナイザーとチャット テンプレートを使用します。即席のプロンプト形式は、動作やベンチマーク結果を大きく変える可能性があります。
ウェイト メモリ: アクティブなパラメータは VRAM 要件ではありません
重みストレージの大まかな下限は、合計パラメータにパラメータごとのバイトを乗算したものです。これには、KV キャッシュ、アクティベーション、ルーティング バッファ、量子化メタデータ、フレームワーク オーバーヘッド、および一時ワークスペースは含まれません。また、量子化フォーマットが選択したアクセラレータ上でカーネルを最適化していることも保証しません。
| モデル | BF16/FP16 ウェイト | 8ビットの重み | 4 ビットの理論上の重み | 実用的な意味 |
|---|---|---|---|---|
| 8x7B (~46.7B) | ~93GB | ~47GB | ~23GB | 多くの場合、フル精度のマルチ GPU。適切な RAM/VRAM があれば量子化されたローカル使用が可能 |
| 8x22B (~141B) | ~282GB | ~141GB | ~71GB | 量子化された場合でも、実質的なマルチ アクセラレータ インフラストラクチャ向けに設計されています |
これらは算術推定値であり、展開の約束ではありません。ヘッドルームを追加して、実際のアーティファクトを測定します。一部のランタイムは、レイヤーまたはエキスパートを CPU にオフロードし、レイテンシーと容量をトレードします。ユニファイド メモリでは、1 秒あたり許容できないトークンが生成されながらモデルが読み込まれる可能性があります。
KV キャッシュとロングコンテキストのコスト
KV キャッシュは、同時シーケンス、レイヤー、キャッシュされたトークンとともに増加します。 MoE スパース性は共有アテンション キャッシュを削除しません。 32K または 64K の最大コンテキストは機能の上限であり、すべてのリクエストを満たすように指示するものではありません。プロンプトが長いと、プレフィルのレイテンシーが増加し、バッチ容量が減少します。検索や要約は、より安価でより正確になる可能性があります。
| 負荷率 | 効果 | 制御 |
|---|---|---|
| プロンプトの長さ | プレフィル時間と KV メモリの増加 | ルートごとにコンテキストをキャップします。関連する証拠のみを取得する |
| 同時シーケンス | ライブキャッシュを増やす | アドミッションコントロール、連続バッチ処理、およびキュー制限 |
| 出力長さ | デコード時間とキャッシュは増大し続ける | 明示的な最大トークンと停止条件 |
| 精度/キャッシュ dtype | 記憶と潜在的に品質を変える | ターゲットタスクでのキャッシュ量子化をサポートするベンチマーク |
| 専門家による配布 | クロスデバイス通信がボトルネックになる可能性がある | MoE 対応のテンソル/エキスパート並列レイアウトを使用する |
提供オプション
役人 ミストラル推論 リポジトリは、Mistral ファミリ モデルのリファレンス ツールを提供します。 Hugging Face Transformers は Mixtral アーキテクチャをサポートし、vLLM およびその他の推論エンジンは連続バッチ処理や OpenAI 互換エンドポイントなどの運用機能を提供します。 llama.cpp/GGUF エコシステムは量子化された CPU/GPU のローカル使用に一般的ですが、サードパーティの変換は正規チェックポイントまで追跡してテストする必要があります。
| ランタイム | フィット感が良い | 導入前にチェック |
|---|---|---|
| ミストラル推論 | 参照動作と Mistral ネイティブの実験 | 実稼働のスケジューリング、可観測性、およびサポートされているチェックポイントのバージョン |
| トランスフォーマー | 研究、微調整、エコシステムの柔軟性 | デバイス マップ、アテンション バックエンド、および MoE カーネル パフォーマンス |
| vLLM | バッチ処理と API 互換性を備えた GPU サービス | バージョン固有の Mixtral サポート、量子化、並列トポロジ |
| TensorRT-LLM/TGI | 最適化されたマネージド展開または NVIDIA を多用した展開 | 構築の複雑さ、サポートされる精度、専門的な並列処理 |
| llama.cpp / GGUF | 量子化されたローカル、ワークステーション、または CPU 支援による使用 | コンバーターの来歴、RAM 帯域幅、および長いコンテキストのレイテンシ |
量子化の選択肢
| アプローチ | メリット | リスク | テスト |
|---|---|---|---|
| BF16/FP16 | リファレンス品質に最も近い品質と幅広いカーネル | 非常に高いメモリ/コスト | 基準ベースライン |
| 8ビット | 重量メモリが約半分に | カーネル/ランタイムの依存性 | レイテンシー、スループット、正確なタスク品質 |
| AWQ/GPTQ 4 ビット | GPU メモリの大幅な削減 | キャリブレーションと MoE 層の感度 | 言語ごとおよび長文回答の劣化 |
| GGUF 量子化 | 柔軟な CPU/GPU オフロード | 変換のバリエーションと帯域幅のボトルネック | 意図したオフロードでのプロンプト/デコード速度 |
複雑さだけから量子化を選択しないでください。ツール呼び出し JSON、コードのコンパイル、多言語命令、安全性分類、検索グラウンディング、およびロングコンテキストの動作を評価します。エキスパート ルーティングでは、入力ごとにエラーが異なる方法で増幅される可能性があるため、十分な例を使用して実行を繰り返してください。
ノスタルジーではなく、ワークロードのベンチマーク Mixtral
Mixtral は、オープン ライセンス、2023 ~ 2024 年の強力な品質、およびスパース コンピューティングを組み合わせていたため、影響力がありました。 2026 年 7 月までに、多くの新しい高密度チェックポイントと MoE チェックポイントにより、メモリあたりの品質が向上し、コンテキストが長くなり、ネイティブ ツールが使用できるようになります。正しい質問は、既に所有しているハードウェア、ライセンス、再現性、微調整、言語の組み合わせ、許容可能な遅延などの制約の下で Mixtral が勝つかどうかです。
- ゴールド基準と禁止されている失敗を含む代表的なプロンプトを 100 ~ 500 個作成します。
- ピンチェックポイントのリビジョン、トークナイザー、チャットテンプレート、ランタイム、量子化、サンプリング。
- ベンダーのデフォルトではなく、同じコンテキストと出力制限で比較します。
- 最初のトークンのレイテンシ、デコードトークン/秒、同時スループット、GPU メモリ、総エネルギー/クラウド コストを測定します。
- 事実の裏付け、指示の順守、構造化された成果、安全性、棄権を個別に採点します。
- 現実的な同時並行性で繰り返します。 MoE のパフォーマンスは、バッチとトポロジによって大幅に変化する可能性があります。
| メトリック | なぜそれが重要なのか | よくある誤解を招くショートカット |
|---|---|---|
| タスクの成功 | ユーザーの成果を直接測定 | 一般的なリーダーボードをプロキシとして使用する |
| p95 最初のトークンまでの時間 | インタラクティブな応答性 | 平均デコード速度のみをレポートする |
| 同時実行時のトークン/秒 | 供給能力 | シングルストリームの実験室スループット |
| 総コスト/成功率 | ハードウェアと品質を組み合わせる | アクティブなパラメータ数の比較 |
| ピークメモリ | 実行可能なトポロジを決定する | 量子化された重みバイトのみをカウントする |
| 障害の重大度 | 表面上のエラーと安全でないエラーを区別する | 1 つの集計精度スコア |
安全性と生産管理
オープンウェイトを使用すると、動作を検査してプライベート インフラストラクチャに展開できるようになりますが、モデレーションは提供されません。基本チェックポイントは安全でないコンテンツを出力する可能性があります。命令チェックポイントはジェイルブレイクされ、幻覚を起こし、悪意のある取得テキストを追跡する可能性があります。階層化されたシステムを構築します。
- ドメインに適切なポリシーを使用してリクエストと出力を分類します。
- Keep retrieved documents untrusted and separate data from system instructions.
- ホワイトリスト、スキーマ、タイムアウト、クォータ、人間による確認を使用してツールを制限します。
- 生成されたコードと構造化された出力をモデルの外部で検証します。
- モデル/チェックポイント/テンプレートのバージョンをログに記録し、不必要な個人データを保存せずに評価トレースを保存します。
- レッドチームによる多言語およびロングコンテキスト攻撃。モデルの歴史的な文言の主張は、適用範囲を保証するものではありません。
ライセンスと出所
正規の Mistral AI Mixtral リポジトリは、チェックポイントを Apache 2.0 として識別します。これは許容範囲内ですが、ダウンストリームの微調整、量子化、データセット、およびサービス提供では、異なる条件が導入される可能性があります。正確なモデル リビジョンとハッシュを記録し、モデル カードを読み取り、通知を保持し、シリアル化されたアーティファクトをスキャンし、サードパーティのデータ義務を文書化します。 「オープンソース LLM」は不正確です。完全なトレーニング データとトレーニング パイプラインが利用可能でなくても、重みと推論コードはオープンにライセンスを取得できます。
Mixtral がまだ意味をなす場合
| 状況 | フィット | 理由 |
|---|---|---|
| 既存の検証済み Mixtral の微調整 | 強い | 移行リスクが新しいベンチマークの利益を上回る可能性がある |
| Apache-2.0 要件 | 強い | 寛容なチェックポイント ライセンスをクリアする |
| スパース MoE ルーティングの研究 | 強い | 有名なアーキテクチャとエコシステム |
| 単一の小型 GPU | 弱い | 専門家の合計の重みは依然として大きい。より小さい高密度モデルはより単純です |
| 2026 年のフロンティアにおける最高の品質 | 弱い | Mixtral は今や歴史的な世代であり、Mistral のフロンティアではありません |
| MoE の専門知識を必要としない高同時実行サービス | 条件付き | スパース コンピューティングが実際の節約になるかどうかは、トポロジとカーネルによって決まります |
代替案
Mixtral を現在の Mistral オープン モデル、現在の Qwen および Llama ファミリ、DeepSeek MoE チェックポイント、DBRX および小規模な高密度命令モデルと比較します。リリースは急速に進むため、「最適な」代替案のリストを凍結しないでください。ライセンス、言語、コンテキスト、ハードウェア、安全性の要件を満たすチェックポイントから候補セットを作成し、同じワークロード評価を実行します。
| 候補の種類 | こんなときに選んでください | トレードオフ |
|---|---|---|
| 新しい高密度 7B ~ 32B | 単一ノードのシンプルさとメモリ効率が重要 | 容量は少なくなりますが、多くの場合、最新のチューニング/ツールの使用が向上します。 |
| 新しいスパース MoE | 専門的な並列処理を活用でき、品質/コンピューティングのスケーリングが必要 | ライセンスとエコシステムが異なる同じ複雑さのクラス |
| ホストされた独自の API | 体重管理よりもオペレーションとフロンティアの品質が重要 | データ境界、経常コスト、ベンダーへの依存 |
| ドメインの微調整された小規模モデル | タスクは狭く、評価データは強力です | コストは低いが汎用性は限られている |
よくある質問
Mixtral 8x7B は 80 億パラメータ モデルですか?
いいえ。合計で約 467 億のパラメーターがあり、トークンごとに約 129 億をアクティブにします。合計の重みによって、ストレージとメモリ要件の大部分が決まります。
各トークンに対して 8 人の専門家全員を使用しますか?
いいえ。ルーターは、各 MoE レイヤーのトークンごとに 2 人のエキスパートを選択し、その出力を結合します。
Mixtral 8x7B は 24 GB GPU に適合しますか?
完全精度の重みではそれができません。一部の積極的な 4 ビット変換では、生の重みバジェットに近づきますが、オーバーヘッドと KV キャッシュには通常、追加の RAM/オフロード、またはさらに多くの VRAM が必要です。正確なランタイムをテストします。
Mixtral は商用利用が無料ですか?
正規チェックポイントは、Apache 2.0 で公開されます。正確なアーティファクトと微調整、データセット、またはホスティング条件を弁護士と確認してください。
指示モデルには安全モデレーションが含まれていますか?
命令チューニングを安全層として扱わないでください。入出力ポリシー、ツール制約、ドメイン固有の評価を追加します。
Mixtral は 2026 年でも適切なデフォルトでしょうか?
自動的ではありません。これは、寛容なライセンス、確立された展開、MoE 研究にとって依然として価値がありますが、実際のハードウェアとワークロードで現在のモデルに対してベンチマークを行う必要があります。
出典と検証
- Mistral AI: エキスパート リリースの Mixtral
- Mistral AI: Mixtral 8x22B リリース
- エキスパートの技術文書の Mixtral
- Canonical Mixtral 8x7B 基本モデル カード
- Canonical Mixtral 8x7B 指示モデル カード
- Canonical Mixtral 8x22B 基本モデル カード
- Canonical Mixtral 8x22B 指示モデル カード
- 公式 Mistral 推論リポジトリ
- vLLM サポートされているモデルのドキュメント
最終レビュー日は 2026 年 7 月 26 日です。ランタイム サポート、モデルの可用性、比較品質の変更。すべてのアーティファクトを固定し、展開前にワークロード評価を再実行します。