Mixtral
Mixtral
Active

Mixtral

Mixtral은 Mixtral 8x7B 및 8x22B 기본 및 명령어 변형을 포함하는 Mistral AI의 Apache-2.0 전문가 혼합 모델 제품군입니다. 이 독립 가이드에서는 라우팅, 활성 매개변수와 전체 매개변수, 메모리 및 서비스 비용, 양자화, 평가, 안전 및 최신 대안에 대해 설명합니다.

61

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

open-source-llmfree

Editorial Review

About Mixtral

Mixtral Mistral AI에서 출시한 개방형 희소 전문가 혼합(MoE) 언어 모델 제품군입니다. 가장 잘 알려진 체크포인트는 Mixtral 8x7B 및 Mixtral 8x22B이며, 각각은 사전 훈련된 기본 모델과 명령 조정 변형으로 제공됩니다. Apache 2.0 라이센스는 라이센스 조건에 따라 광범위한 상업적 사용, 수정 및 재배포를 허용합니다.

"8x"라는 이름은 8개의 독립적인 모델이 모든 토큰에 응답한다는 의미는 아닙니다. 각 변환기 블록에서 라우터는 각 토큰에 대해 8명의 피드포워드 전문가 중 2명을 선택합니다. 주의 및 기타 구성 요소는 공유된 상태로 유지됩니다. 이는 중요한 차이점을 만듭니다. 모델은 모든 전문가 가중치를 저장해야 하지만 하위 집합만 토큰의 순방향 전달에 참여합니다. 컴퓨팅은 더 작고 밀도가 높은 모델과 유사할 수 있지만 메모리 및 배포 요구 사항은 전체 매개 변수 공간에 훨씬 더 가깝습니다.

Mixtral sparse mixture-of-experts model listing image
Mixtral의 공개 가중치는 자체 호스팅 및 MoE 연구에 여전히 유용합니다. 하드웨어 결정은 활성 매개변수뿐만 아니라 총 중량 메모리를 사용해야 합니다.

희소 전문가 라우팅 작동 방식

 토큰 표현
        |
        v
     라우터 점수
  E1 E2 E3 E4 E5 E6 E7 E8
       \ /
        상위 2명의 전문가
       / \
 전문가 출력 전문가 출력
       \ /
      가중 병합
           |
 공유된 관심 + 다음 레이어

라우팅은 각 레이어와 토큰에서 독립적으로 발생하므로 프롬프트에서 두 명의 전문가를 영구적으로 선택하지 않습니다. 라우터는 선택된 출력에 가중치를 부여합니다. 희소 활성화는 모든 전문가를 실행하는 것에 비해 피드포워드 계산을 줄이지만 서비스 효율성은 커널 지원, 전문가 배치, 배치 크기 및 통신에 따라 달라집니다. 전문가의 병렬성이 부족하면 이론적 비용 절감 효과가 사라질 수 있습니다.

Mixtral 모델 변형

체크포인트총 매개변수대략. 활성/토큰게시된 컨텍스트목적
Mixtral 8x7B v0.1약 46.7B약 12.9B32K 토큰완성/미세 조정을 위한 사전 훈련된 기반
Mixtral 8x7B 지침 v0.1약 46.7B약 12.9B32K 토큰지시사항 따르기 및 채팅
Mixtral 8x22B v0.1141B에 대하여약 39B64K 토큰더 큰 사전 학습된 베이스
Mixtral 8x22B 지침 v0.1141B에 대하여약 39B64K 토큰더 큰 명령 조정 모델

매개변수 계산은 공유 구성요소, 어휘 및 구현에 따라 다를 수 있으므로 값은 대략적인 것입니다. 마케팅 이름에서 용량을 도출하기보다는 항상 선택한 저장소의 구성을 검사하십시오. 원본 8x7B 보고서는 Llama 2 70B 및 GPT-3.5 시대 시스템에 비해 강력한 결과를 강조했습니다. 이러한 비교는 역사적으로 유용하지만 2026년 모델과의 경쟁력을 확립하지 못합니다.

기본 대 지시

변형다음 용도로 사용하세요.가정하지 마십시오
베이스연구, 지속적인 사전 훈련, 도메인 적응 및 제어된 완료안정적인 채팅 형식, 거부 행동 또는 지침 계층 구조
지시하다문서화된 템플릿을 사용한 어시스턴트/채팅 작업외부 통제 없이 생산 안전, 사실성 또는 정책 준수

Mistral의 모델 카드는 사전 학습된 8x7B 체크포인트에 조정 메커니즘이 없음을 명시적으로 경고합니다. 명령어 튜닝은 유용성을 향상시키지만 안전성은 보장되지 않습니다. Instruct 모델에 대해 정확한 토크나이저 및 채팅 템플릿을 사용하십시오. 즉흥적으로 프롬프트 형식을 사용하면 동작과 벤치마크 결과가 크게 바뀔 수 있습니다.

무게 메모리: 활성 매개변수는 VRAM 요구 사항이 아닙니다.

가중치 저장의 대략적인 하한은 총 매개변수에 매개변수당 바이트를 곱한 값입니다. KV 캐시, 활성화, 라우팅 버퍼, 양자화 메타데이터, 프레임워크 오버헤드 및 임시 작업 공간은 제외됩니다. 또한 양자화된 형식이 선택한 가속기에서 커널을 최적화했음을 보장하지 않습니다.

모델BF16/FP16 무게8비트 가중치4비트 이론적 가중치실용적인 의미
8x7B(~46.7B)~93GB~47GB~23GB종종 최대 정밀도로 다중 GPU를 사용합니다. 적절한 RAM/VRAM이 있으면 양자화된 로컬 사용이 가능합니다.
8x22B(~141B)~282GB~141GB~71GB양자화된 경우에도 상당한 다중 가속기 인프라를 위해 설계되었습니다.

이는 배포 약속이 아닌 산술적 추정치입니다. 헤드룸을 추가하고 실제 아티팩트를 측정합니다. 일부 런타임은 레이어나 전문가를 CPU에 오프로드하여 지연 시간에 맞춰 용량을 교환합니다. 통합 메모리는 초당 허용되지 않는 토큰을 생성하면서 모델을 로드할 수 있습니다.

KV 캐시 및 장기 컨텍스트 비용

KV 캐시는 동시 시퀀스, 레이어 및 캐시된 토큰을 통해 증가합니다. MoE 희소성은 공유 주의 캐시를 제거하지 않습니다. 32K 또는 64K 최대 컨텍스트는 모든 요청을 충족하라는 명령이 아니라 용량 한도입니다. 프롬프트가 길면 사전 채우기 대기 시간이 늘어나고 배치 용량이 줄어듭니다. 검색이나 요약은 더 저렴하고 정확할 수 있습니다.

부하율효과제어
프롬프트 길이더 높은 사전 충전 시간 및 KV 메모리경로별로 컨텍스트를 제한합니다. 관련 증거만 검색
동시 시퀀스라이브 캐시 증가승인 제어, 연속 일괄 처리 및 대기열 제한
출력 길이디코딩 시간과 캐시가 계속 증가함명시적인 최대 토큰 및 중지 조건
정밀도/캐시 dtype메모리와 잠재적인 품질을 변경합니다.대상 작업에 대한 벤치마크 지원 캐시 양자화
전문가 분포장치 간 통신에 병목 현상이 발생할 수 있음MoE 인식 텐서/전문가 병렬 레이아웃 사용

제공 옵션

공식 잘못된 추론 저장소는 Mistral 계열 모델에 대한 참조 도구를 제공합니다. Hugging Face Transformers는 Mixtral 아키텍처를 지원하는 반면, vLLM 및 기타 추론 엔진은 연속 일괄 처리 및 OpenAI 호환 엔드포인트와 같은 프로덕션 기능을 제공합니다. llama.cpp/GGUF 생태계는 양자화된 CPU/GPU 로컬 사용에 일반적이지만 타사 변환은 표준 체크포인트를 추적하고 테스트해야 합니다.

런타임핏이 좋음입양 전 확인하세요
잘못된 추론참조 동작 및 Mistral-기본 실험생산 일정, 관찰 가능성 및 지원되는 체크포인트 버전
트랜스포머연구, 미세 조정 및 생태계 유연성장치 맵, Attention 백엔드 및 MoE 커널 성능
vLLM일괄 처리 및 API 호환성을 제공하는 GPU버전별 Mixtral 지원, 양자화 및 병렬 토폴로지
TensorRT-LLM/TGI최적화된 관리형 또는 NVIDIA를 많이 사용하는 배포복잡성 구축, 정밀도 지원 및 전문적인 병렬 처리
llama.cpp / GGUF양자화된 로컬, 워크스테이션 또는 CPU 지원 사용변환기 출처, RAM 대역폭 및 긴 컨텍스트 대기 시간

양자화 선택

접근혜택위험테스트
BF16/FP16기준 품질 및 광범위한 커널에 가장 가깝습니다.매우 높은 메모리/비용참조 기준선
8비트체중 기억력이 대략 절반으로 줄어듭니다.커널/런타임 종속성지연 시간, 처리량 및 정확한 작업 품질
AWQ/GPTQ 4비트대규모 GPU 메모리 감소교정 및 MoE 레이어 감도언어별 및 긴 답변 성능 저하
GGUF 양자화유연한 CPU/GPU 오프로드변환 변형 및 대역폭 병목 현상의도된 오프로드 시 프롬프트/디코딩 속도

난처함만으로 양자화를 선택하지 마십시오. 도구 호출 JSON, 코드 컴파일, 다국어 지침, 안전 분류, 검색 접지 및 긴 컨텍스트 동작을 평가합니다. 전문가 라우팅은 입력에 따라 오류를 다르게 증폭시킬 수 있으므로 충분한 예시를 사용하고 반복 실행하세요.

향수가 아닌 워크로드에 대한 벤치마크 Mixtral

Mixtral은 개방형 라이선스, 강력한 2023~2024년 품질 및 희소 컴퓨팅을 결합했기 때문에 영향력이 있었습니다. 2026년 7월까지 많은 최신 밀도 및 MoE 체크포인트가 메모리당 더 나은 품질, 더 긴 컨텍스트 또는 기본 도구 사용을 제공합니다. 올바른 질문은 Mixtral이 이미 소유한 하드웨어, 라이센스, 재현성, 미세 조정, 언어 혼합 및 허용 가능한 대기 시간 등의 제약 조건 하에서 승리하는지 여부입니다.

  1. 골드 기준과 금지된 실패를 포함하여 100~500개의 대표 프롬프트를 만듭니다.
  2. 체크포인트 개정, 토크나이저, 채팅 템플릿, 런타임, 양자화 및 샘플링을 고정합니다.
  3. 공급업체 기본값이 아닌 동일한 컨텍스트 및 출력 제한에서 비교하세요.
  4. 첫 번째 토큰 대기 시간, 초당 토큰 디코딩, 동시 처리량, GPU 메모리 및 총 에너지/클라우드 비용을 측정합니다.
  5. 사실적 지원, 교육 준수, 구조화된 결과, 안전 및 기권을 별도로 점수화합니다.
  6. 현실적인 동시성으로 반복합니다. MoE 성능은 배치 및 토폴로지에 따라 크게 바뀔 수 있습니다.
미터법왜 중요한가요?오해의 소지가 있는 일반적인 단축키
작업 성공사용자 결과를 직접 측정일반 리더보드를 프록시로 사용
p95 첫 번째 토큰까지의 시간대화형 반응성평균 디코드 속도만 보고
동시 실행 시 토큰/초서빙 용량단일 스트림 실험실 처리량
총 비용/성공하드웨어와 품질의 결합활성 매개변수 수 비교
최대 메모리실행 가능한 토폴로지 결정양자화된 가중치 바이트만 계산
실패 심각도외관상 오류와 안전하지 않은 오류를 구별합니다.하나의 집계 정확도 점수

안전 및 생산 관리

개방형 가중치를 사용하면 개인 인프라에서 동작을 검사하고 배포할 수 있지만 조정 기능은 제공되지 않습니다. 기본 체크포인트는 안전하지 않은 콘텐츠를 방출할 수 있습니다. 명령 체크포인트는 탈옥되고, 환각을 느끼고, 악의적으로 검색된 텍스트를 따를 수 있습니다. 계층화된 시스템 구축:

  • 도메인에 적합한 정책을 사용하여 요청과 출력을 분류합니다.
  • Keep retrieved documents untrusted and separate data from system instructions.
  • 허용 목록, 스키마, 시간 초과, 할당량 및 사람의 확인을 통해 도구를 제한합니다.
  • 생성된 코드와 모델 외부의 구조화된 출력을 검증합니다.
  • 불필요한 개인 데이터를 저장하지 않고 모델/체크포인트/템플릿 버전을 기록하고 평가 추적을 보존합니다.
  • 레드팀 다국어 및 장기 컨텍스트 공격 모델의 역사적 언어 주장은 적용 범위를 보장하지 않습니다.

라이선스 및 출처

정식 Mistral AI Mixtral 리포지토리는 검사점을 Apache 2.0으로 식별합니다. 이는 허용적이지만 다운스트림 미세 조정, 양자화, 데이터 세트 및 서비스 제공으로 인해 다른 용어가 도입될 수 있습니다. 정확한 모델 개정판과 해시를 기록하고, 모델 카드를 읽고, 공지 사항을 유지하고, 직렬화된 아티팩트를 스캔하고, 제3자 데이터 의무를 문서화하세요. "오픈 소스 LLM"은 부정확합니다. 전체 훈련 데이터와 훈련 파이프라인을 사용하지 않고도 가중치와 추론 코드를 공개적으로 라이센스할 수 있습니다.

Mixtral이 여전히 의미가 있는 경우

상황이유
기존에 검증된 Mixtral 미세 조정강한마이그레이션 위험은 새로운 벤치마크 이익보다 클 수 있습니다.
Apache-2.0 요구 사항강한허용되는 체크포인트 라이센스 지우기
희소 MoE 라우팅에 대한 연구강한잘 알려진 아키텍처와 생태계
단일 소형 GPU약함총 전문가 가중치는 여전히 크다. 더 작고 밀도가 높은 모델이 더 간단합니다.
2026년 최고의 프론티어 품질약함Mixtral은(는) 이제 Mistral의 국경이 아닌 역사적인 세대입니다.
MoE 전문 지식 없이도 높은 동시 제공조건부토폴로지와 커널은 희소 컴퓨팅이 실질적인 비용 절감이 되는지 여부를 결정합니다.

대안

Mixtral을 현재 Mistral 개방형 모델, 현재 Qwen 및 Llama 제품군, DeepSeek MoE 체크포인트, DBRX 및 더 작은 밀도의 명령어 모델과 비교하세요. 릴리스가 빠르게 진행되므로 "최고의" 대안 목록을 동결하지 마십시오. 라이선스, 언어, 컨텍스트, 하드웨어 및 안전 요구 사항을 충족하는 체크포인트에서 후보 세트를 만든 다음 동일한 워크로드 평가를 실행합니다.

후보자 유형이럴 때 선택하세요절충안
최신 밀도 7B–32B단일 노드 단순성과 메모리 효율성이 중요합니다.더 적은 용량을 제공할 수 있지만 종종 더 나은 최신 튜닝/도구 사용을 제공할 수 있습니다.
최신 희소 MoE전문적인 병렬 처리를 활용할 수 있으며 품질/컴퓨팅 확장이 필요합니다.라이선스와 생태계가 다르지만 복잡도는 동일합니다.
호스팅된 독점 API중량 관리보다 운영 및 최전선 품질이 더 중요합니다.데이터 경계, 반복 비용 및 공급업체 종속성
도메인 미세 조정 소형 모델과제는 좁고 평가 데이터는 강력하다비용은 저렴하지만 일반성이 제한됨

FAQ

Mixtral 8x7B는 80억 매개변수 모델인가요?

아니요. 총 매개변수는 대략 467억 개이며 토큰당 약 129억 개를 활성화합니다. 총 무게는 스토리지와 많은 메모리 요구 사항을 결정합니다.

각 토큰에 대해 8명의 전문가를 모두 사용합니까?

아니요. 라우터는 각 MoE 레이어에서 토큰당 두 명의 전문가를 선택하고 그들의 출력을 결합합니다.

Mixtral 8x7B가 24GB GPU에 맞습니까?

완전 정밀도 가중치는 불가능합니다. 일부 공격적인 4비트 변환은 원시 중량 예산에 접근하지만 오버헤드 및 KV 캐시는 일반적으로 추가 RAM/오프로드 또는 더 많은 VRAM이 필요합니다. 정확한 런타임을 테스트하십시오.

Mixtral은 상업적 용도로 무료인가요?

정식 체크포인트는 Apache 2.0에 게시됩니다. 변호사와 함께 정확한 아티팩트와 미세 조정, 데이터세트 또는 호스팅 용어를 확인하세요.

교육 모델에 안전 조정이 포함되어 있나요?

명령어 튜닝을 안전 계층으로 취급하지 마십시오. 입력/출력 정책, 도구 제약 조건 및 도메인별 평가를 추가합니다.

Mixtral은 2026년에도 여전히 좋은 기본값인가요?

자동으로 아닙니다. 이는 허용적 라이센싱, 확립된 배포 및 MoE 연구에 여전히 유용하지만 실제 하드웨어 및 워크로드에 대한 현재 모델을 벤치마킹해야 합니다.

출처 및 검증

최종 검토일: 2026년 7월 26일. 런타임 지원, 모델 가용성 및 비교 품질 변경. 모든 아티팩트를 고정하고 배포 전에 워크로드 평가를 다시 실행하세요.

Ready to try Mixtral?

Visit the official website to get started

Visit Mixtral

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
7/27/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

DeepSeek-R1

DeepSeek-R1

DeepSeek's first-generation reasoning models. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning without supervised fine-tuning, demonstrated remarkable performance on reasoning. - 스마트 AI 도구로 생산성 향상.

open-source-llmfree
610
DeepSeek-V3

DeepSeek-V3

A strong Mixture-of-Experts (MoE) language model with 671B total parameters with 37B activated for each token. - 스마트 AI 도구로 생산성 향상.

open-source-llmfree
610
Qwen3

Qwen3

Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud. - 스마트 AI 도구로 생산성 향상.

open-source-llmfree
700
Llama 3

Llama 3

Llama3 is a large language model developed by Meta AI. It is the successor to Meta's Llama2 language model. - 스마트 AI 도구로 생산성 향상.

open-source-llmfree
650