Mixtral
Mixtral
Active

Mixtral

Mixtral は、Mistral AI の Apache-2.0 の疎な専門家混合モデル ファミリであり、Mixtral 8x7B および 8x22B ベースおよび命令バリアントが含まれます。この独立したガイドでは、ルーティング、アクティブ パラメーターと合計パラメーター、メモリとサービスのコスト、量子化、評価、安全性、最新の代替手段について説明します。

54

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

open-source-llmfree

Editorial Review

About Mixtral

Mixtral Mistral AI によってリリースされた、オープンウェイトの疎専門家混合 (MoE) 言語モデルのファミリーです。最もよく知られているチェックポイントは Mixtral 8x7B と Mixtral 8x22B で、それぞれ事前トレーニングされた基本モデルと命令調整されたバリアントとして利用できます。 Apache 2.0 ライセンスでは、ライセンス条項に従って広範な商業利用、変更、再配布が許可されています。

「8x」という名前は、8 つの独立したモデルがすべてのトークンに応答するという意味ではありません。各トランスブロックでは、ルーターはトークンごとに 8 人のフィードフォワード エキスパートのうち 2 人を選択します。注意およびその他のコンポーネントは共有されたままになります。これにより重要な違いが生まれます。モデルはすべてのエキスパートの重みを保存する必要がありますが、トークンのフォワード パスにはサブセットのみが参加します。コンピューティングはより小規模な高密度モデルに似ている可能性がありますが、メモリと分散の要件は依然として完全なパラメーター フットプリントにかなり近いままです。

Mixtral sparse mixture-of-experts model listing image
Mixtral のオープン ウェイトは、引き続きセルフホスティングや MoE の研究に役立ちます。ハードウェアの決定には、アクティブなパラメータだけでなく、総重量メモリを使用する必要があります。

スパースエキスパートルーティングの仕組み

 トークン表現
        |
        v
     ルータースコア
  E1 E2 E3 E4 E5 E6 E7 E8
       \/
        トップ 2 の専門家
       /\
 エキスパートの出力 エキスパートの出力
       \/
      加重マージ
           |
 注意を共有 + 次の層

ルーティングは各レイヤーとトークンで独立して行われるため、プロンプトによって 2 人のエキスパートが永続的に選択されるわけではありません。ルーターは、選択された出力に重み付けを行います。スパース アクティベーションにより、すべてのエキスパートを実行する場合に比べてフィードフォワード計算が削減されますが、サービスの効率はカーネル サポート、エキスパートの配置、バッチ サイズ、および通信に依存します。エキスパート並列処理が不十分だと、理論上の節約が失われる可能性があります。

Mixtral モデルのバリアント

チェックポイント合計パラメータ約アクティブ/トークン公開されたコンテキスト目的
Mixtral 8x7B v0.1約467億円約129億円32,000 トークン完成/微調整のための事前トレーニングされたベース
Mixtral 8x7B 命令 v0.1約467億円約129億円32,000 トークン指示に従い、チャットする
Mixtral 8x22B v0.1約141B約39B64Kトークンより大きな事前トレーニング済みベース
Mixtral 8x22B 命令 v0.1約141B約39B64Kトークンより大型の命令調整済みモデル

パラメーターの計算は共有コンポーネント、語彙、実装によって異なる可能性があるため、値はおおよそのものです。マーケティング名から容量を導き出すのではなく、選択したリポジトリの構成を常に検査してください。オリジナルの 8x7B レポートでは、Llama 2 70B および GPT-3.5 時代のシステムと比較した強力な結果が強調されていました。これらの比較は歴史的には役に立ちますが、2026 年モデルとの競争力を確立するものではありません。

ベースと指示

バリアント用途:仮定しないでください
ベース研究、継続的な事前トレーニング、ドメインの適応、および制御された完了信頼性の高いチャット形式、拒否動作、または指示階層
指示する文書化されたテンプレートを使用したアシスタント/チャット タスク外部制御なしでの生産の安全性、事実またはポリシーの遵守

Mistral のモデル カードは、事前トレーニングされた 8x7B チェックポイントにはモデレーション メカニズムがないことを明示的に警告します。命令のチューニングは使いやすさを向上させますが、安全性は保証されません。 Instruct モデルには正確なトークナイザーとチャット テンプレートを使用します。即席のプロンプト形式は、動作やベンチマーク結果を大きく変える可能性があります。

ウェイト メモリ: アクティブなパラメータは VRAM 要件ではありません

重みストレージの大まかな下限は、合計パラメータにパラメータごとのバイトを乗算したものです。これには、KV キャッシュ、アクティベーション、ルーティング バッファ、量子化メタデータ、フレームワーク オーバーヘッド、および一時ワークスペースは含まれません。また、量子化フォーマットが選択したアクセラレータ上でカーネルを最適化していることも保証しません。

モデルBF16/FP16 ウェイト8ビットの重み4 ビットの理論上の重み実用的な意味
8x7B (~46.7B)~93GB~47GB~23GB多くの場合、フル精度のマルチ GPU。適切な RAM/VRAM があれば量子化されたローカル使用が可能
8x22B (~141B)~282GB~141GB~71GB量子化された場合でも、実質的なマルチ アクセラレータ インフラストラクチャ向けに設計されています

これらは算術推定値であり、展開の約束ではありません。ヘッドルームを追加して、実際のアーティファクトを測定します。一部のランタイムは、レイヤーまたはエキスパートを CPU にオフロードし、レイテンシーと容量をトレードします。ユニファイド メモリでは、1 秒あたり許容できないトークンが生成されながらモデルが読み込まれる可能性があります。

KV キャッシュとロングコンテキストのコスト

KV キャッシュは、同時シーケンス、レイヤー、キャッシュされたトークンとともに増加します。 MoE スパース性は共有アテンション キャッシュを削除しません。 32K または 64K の最大コンテキストは機能の上限であり、すべてのリクエストを満たすように指示するものではありません。プロンプトが長いと、プレフィルのレイテンシーが増加し、バッチ容量が減少します。検索や要約は、より安価でより正確になる可能性があります。

負荷率効果制御
プロンプトの長さプレフィル時間と KV メモリの増加ルートごとにコンテキストをキャップします。関連する証拠のみを取得する
同時シーケンスライブキャッシュを増やすアドミッションコントロール、連続バッチ処理、およびキュー制限
出力長さデコード時間とキャッシュは増大し続ける明示的な最大トークンと停止条件
精度/キャッシュ dtype記憶と潜在的に品質を変えるターゲットタスクでのキャッシュ量子化をサポートするベンチマーク
専門家による配布クロスデバイス通信がボトルネックになる可能性があるMoE 対応のテンソル/エキスパート並列レイアウトを使用する

提供オプション

役人 ミストラル推論 リポジトリは、Mistral ファミリ モデルのリファレンス ツールを提供します。 Hugging Face Transformers は Mixtral アーキテクチャをサポートし、vLLM およびその他の推論エンジンは連続バッチ処理や OpenAI 互換エンドポイントなどの運用機能を提供します。 llama.cpp/GGUF エコシステムは量子化された CPU/GPU のローカル使用に一般的ですが、サードパーティの変換は正規チェックポイントまで追跡してテストする必要があります。

ランタイムフィット感が良い導入前にチェック
ミストラル推論参照動作と Mistral ネイティブの実験実稼働のスケジューリング、可観測性、およびサポートされているチェックポイントのバージョン
トランスフォーマー研究、微調整、エコシステムの柔軟性デバイス マップ、アテンション バックエンド、および MoE カーネル パフォーマンス
vLLMバッチ処理と API 互換性を備えた GPU サービスバージョン固有の Mixtral サポート、量子化、並列トポロジ
TensorRT-LLM/TGI最適化されたマネージド展開または NVIDIA を多用した展開構築の複雑さ、サポートされる精度、専門的な並列処理
llama.cpp / GGUF量子化されたローカル、ワークステーション、または CPU 支援による使用コンバーターの来歴、RAM 帯域幅、および長いコンテキストのレイテンシ

量子化の選択肢

アプローチメリットリスクテスト
BF16/FP16リファレンス品質に最も近い品質と幅広いカーネル非常に高いメモリ/コスト基準ベースライン
8ビット重量メモリが約半分にカーネル/ランタイムの依存性レイテンシー、スループット、正確なタスク品質
AWQ/GPTQ 4 ビットGPU メモリの大幅な削減キャリブレーションと MoE 層の感度言語ごとおよび長文回答の劣化
GGUF 量子化柔軟な CPU/GPU オフロード変換のバリエーションと帯域幅のボトルネック意図したオフロードでのプロンプト/デコード速度

複雑さだけから量子化を選択しないでください。ツール呼び出し JSON、コードのコンパイル、多言語命令、安全性分類、検索グラウンディング、およびロングコンテキストの動作を評価します。エキスパート ルーティングでは、入力ごとにエラーが異なる方法で増幅される可能性があるため、十分な例を使用して実行を繰り返してください。

ノスタルジーではなく、ワークロードのベンチマーク Mixtral

Mixtral は、オープン ライセンス、2023 ~ 2024 年の強力な品質、およびスパース コンピューティングを組み合わせていたため、影響力がありました。 2026 年 7 月までに、多くの新しい高密度チェックポイントと MoE チェックポイントにより、メモリあたりの品質が向上し、コンテキストが長くなり、ネイティブ ツールが使用できるようになります。正しい質問は、既に所有しているハードウェア、ライセンス、再現性、微調整、言語の組み合わせ、許容可能な遅延などの制約の下で Mixtral が勝つかどうかです。

  1. ゴールド基準と禁止されている失敗を含む代表的なプロンプトを 100 ~ 500 個作成します。
  2. ピンチェックポイントのリビジョン、トークナイザー、チャットテンプレート、ランタイム、量子化、サンプリング。
  3. ベンダーのデフォルトではなく、同じコンテキストと出力制限で比較します。
  4. 最初のトークンのレイテンシ、デコードトークン/秒、同時スループット、GPU メモリ、総エネルギー/クラウド コストを測定します。
  5. 事実の裏付け、指示の順守、構造化された成果、安全性、棄権を個別に採点します。
  6. 現実的な同時並行性で繰り返します。 MoE のパフォーマンスは、バッチとトポロジによって大幅に変化する可能性があります。
メトリックなぜそれが重要なのかよくある誤解を招くショートカット
タスクの成功ユーザーの成果を直接測定一般的なリーダーボードをプロキシとして使用する
p95 最初のトークンまでの時間インタラクティブな応答性平均デコード速度のみをレポートする
同時実行時のトークン/秒供給能力シングルストリームの実験室スループット
総コスト/成功率ハードウェアと品質を組み合わせるアクティブなパラメータ数の比較
ピークメモリ実行可能なトポロジを決定する量子化された重みバイトのみをカウントする
障害の重大度表面上のエラーと安全でないエラーを区別する1 つの集計精度スコア

安全性と生産管理

オープンウェイトを使用すると、動作を検査してプライベート インフラストラクチャに展開できるようになりますが、モデレーションは提供されません。基本チェックポイントは安全でないコンテンツを出力する可能性があります。命令チェックポイントはジェイルブレイクされ、幻覚を起こし、悪意のある取得テキストを追跡する可能性があります。階層化されたシステムを構築します。

  • ドメインに適切なポリシーを使用してリクエストと出力を分類します。
  • Keep retrieved documents untrusted and separate data from system instructions.
  • ホワイトリスト、スキーマ、タイムアウト、クォータ、人間による確認を使用してツールを制限します。
  • 生成されたコードと構造化された出力をモデルの外部で検証します。
  • モデル/チェックポイント/テンプレートのバージョンをログに記録し、不必要な個人データを保存せずに評価トレースを保存します。
  • レッドチームによる多言語およびロングコンテキスト攻撃。モデルの歴史的な文言の主張は、適用範囲を保証するものではありません。

ライセンスと出所

正規の Mistral AI Mixtral リポジトリは、チェックポイントを Apache 2.0 として識別します。これは許容範囲内ですが、ダウンストリームの微調整、量子化、データセット、およびサービス提供では、異なる条件が導入される可能性があります。正確なモデル リビジョンとハッシュを記録し、モデル カードを読み取り、通知を保持し、シリアル化されたアーティファクトをスキャンし、サードパーティのデータ義務を文書化します。 「オープンソース LLM」は不正確です。完全なトレーニング データとトレーニング パイプラインが利用可能でなくても、重みと推論コードはオープンにライセンスを取得できます。

Mixtral がまだ意味をなす場合

状況フィット理由
既存の検証済み Mixtral の微調整強い移行リスクが新しいベンチマークの利益を上回る可能性がある
Apache-2.0 要件強い寛容なチェックポイント ライセンスをクリアする
スパース MoE ルーティングの研究強い有名なアーキテクチャとエコシステム
単一の小型 GPU弱い専門家の合計の重みは依然として大きい。より小さい高密度モデルはより単純です
2026 年のフロンティアにおける最高の品質弱いMixtral は今や歴史的な世代であり、Mistral のフロンティアではありません
MoE の専門知識を必要としない高同時実行サービス条件付きスパース コンピューティングが実際の節約になるかどうかは、トポロジとカーネルによって決まります

代替案

Mixtral を現在の Mistral オープン モデル、現在の Qwen および Llama ファミリ、DeepSeek MoE チェックポイント、DBRX および小規模な高密度命令モデルと比較します。リリースは急速に進むため、「最適な」代替案のリストを凍結しないでください。ライセンス、言語、コンテキスト、ハードウェア、安全性の要件を満たすチェックポイントから候補セットを作成し、同じワークロード評価を実行します。

候補の種類こんなときに選んでくださいトレードオフ
新しい高密度 7B ~ 32B単一ノードのシンプルさとメモリ効率が重要容量は少なくなりますが、多くの場合、最新のチューニング/ツールの使用が向上します。
新しいスパース MoE専門的な並列処理を活用でき、品質/コンピューティングのスケーリングが必要ライセンスとエコシステムが異なる同じ複雑さのクラス
ホストされた独自の API体重管理よりもオペレーションとフロンティアの品質が重要データ境界、経常コスト、ベンダーへの依存
ドメインの微調整された小規模モデルタスクは狭く、評価データは強力ですコストは低いが汎用性は限られている

よくある質問

Mixtral 8x7B は 80 億パラメータ モデルですか?

いいえ。合計で約 467 億のパラメーターがあり、トークンごとに約 129 億をアクティブにします。合計の重みによって、ストレージとメモリ要件の大部分が決まります。

各トークンに対して 8 人の専門家全員を使用しますか?

いいえ。ルーターは、各 MoE レイヤーのトークンごとに 2 人のエキスパートを選択し、その出力を結合します。

Mixtral 8x7B は 24 GB GPU に適合しますか?

完全精度の重みではそれができません。一部の積極的な 4 ビット変換では、生の重みバジェットに近づきますが、オーバーヘッドと KV キャッシュには通常、追加の RAM/オフロード、またはさらに多くの VRAM が必要です。正確なランタイムをテストします。

Mixtral は商用利用が無料ですか?

正規チェックポイントは、Apache 2.0 で公開されます。正確なアーティファクトと微調整、データセット、またはホスティング条件を弁護士と確認してください。

指示モデルには安全モデレーションが含まれていますか?

命令チューニングを安全層として扱わないでください。入出力ポリシー、ツール制約、ドメイン固有の評価を追加します。

Mixtral は 2026 年でも適切なデフォルトでしょうか?

自動的ではありません。これは、寛容なライセンス、確立された展開、MoE 研究にとって依然として価値がありますが、実際のハードウェアとワークロードで現在のモデルに対してベンチマークを行う必要があります。

出典と検証

最終レビュー日は 2026 年 7 月 26 日です。ランタイム サポート、モデルの可用性、比較品質の変更。すべてのアーティファクトを固定し、展開前にワークロード評価を再実行します。

Ready to try Mixtral?

Visit the official website to get started

Visit Mixtral

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
7/25/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - スマートな AI ツールで生産性を向上。

open-source-llmfree
570
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - スマートな AI ツールで生産性を向上。

open-source-llmfree
580
Qwen3

Qwen3

Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud. - スマートな AI ツールで生産性を向上。

open-source-llmfree
620
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - スマートな AI ツールで生産性を向上。

open-source-llmfree
590