whichllm 믿을 수 없을 정도로 어려운 로컬 AI 질문에 답합니다. 어떤 모델과 양자화가 이 특정 컴퓨터에서 가장 유용한 품질을 제공할 가능성이 높습니까? GPU, CPU, RAM 및 스토리지를 감지하고 현재 Hugging Face 후보를 수집하고 런타임 적합성과 생성 속도를 추정한 다음 이러한 제약 조건을 벤치마크 증거와 결합합니다. 결과는 순위가 매겨진 출발점입니다. 첫 번째 모델이 모든 프롬프트에 가장 적합할 것이라는 약속은 아닙니다.
whichllm의 차이점
기본 모델 선택기는 VRAM에 맞는 매개변수 수를 묻습니다. whichllm은 이를 하나의 제약 조건으로만 처리합니다. 해당 문서에서는 Hugging Face에서 인기 있고 최근 수정되었으며 선별된 모델을 가져오는 파이프라인에 대해 설명합니다. 관련 저장소를 모델 계열로 그룹화합니다. 사용 가능한 양자화를 평가합니다. 가중치, KV 캐시, 활성화 및 프레임워크 오버헤드를 추정합니다. 전체 GPU, 부분 오프로드 또는 CPU 적합성을 확인합니다. 그런 다음 정규화된 벤치마크 증거를 사용하여 후보자의 순위를 매깁니다.
실행 가능한 가장 큰 파일이 자동으로 최선의 선택이 아니기 때문에 이는 중요합니다. 최신 27B 모델은 이전 32B 모델보다 성능이 뛰어나고, 전문가 혼합 모델은 전체 매개변수 수가 제안하는 것보다 더 빠르게 생성할 수 있으며, 기술적으로 적합한 모델은 데스크톱, 컨텍스트 캐시 또는 런타임을 위한 헤드룸이 너무 적을 수 있습니다. whichllm은 하나의 "권장" 배지 뒤에 숨기는 대신 이러한 장단점에 대한 제어 기능을 노출합니다.
빠른 시작과 더 안전한 첫 번째 명령
uvx whichllm@최신
# 보수적인 첫 번째 통과: 완전한 GPU 적합성, 사용 가능한 속도, 1GB 헤드룸
uvx whichllm@latest --gpu-only --사용 가능한 속도 --vram-headroom 1GB
# 하드웨어를 구입하기 전에 시뮬레이션
uvx whichllm@latest --gpu "RTX 4090"
# 업그레이드 후보 비교
uvx whichllm@최신 업그레이드 "RTX 4090" "RTX 5090" "H100"
기본 순위는 의도적으로 야심찬 것입니다. 여기에는 가장자리에 가까운 VRAM 적합 및 부분적인 RAM 오프로드가 포함될 수 있습니다. 프로젝트의 safer-pick 명령은 예측 가능한 응답성을 중시하는 사용자에게 더 나은 초기 필터입니다. 다른 런타임에서 여전히 메모리 부족을 보고하는 경우 추정기가 잘못되었다고 가정하는 대신 헤드룸을 높이고, 요청된 컨텍스트를 줄이거나, 더 작은 양자화를 선택하거나, 백그라운드 VRAM 사용을 검사하세요.
추천 파이프라인 작동 방식
| 무대 | whichllm이 평가하는 것 | 답변이 바뀌는 이유 |
|---|---|---|
| 하드웨어 감지 | NVIDIA, AMD, Intel, Apple Silicon, CPU 기능, RAM 및 여유 디스크 | 백엔드, 통합 메모리 및 대역폭은 유사한 광고 메모리 크기에서도 다릅니다. |
| 모델 발견 | 인기 있고 최신 텍스트 생성/GGUF 저장소, 선별된 프론티어 ID 및 요청 시 비전 후보 | 정적 목록은 빠르게 오래되고 사용 가능한 변환이 누락될 수 있습니다. |
| 가족 그룹화 | 기본 모델 메타데이터 및 정규화된 저장소 이름 | 한 계열의 여러 재포장으로 인해 결과 테이블이 혼잡해지는 것을 방지합니다. |
| 메모리 추정 | 가중치, KV 캐시, 활성화 메모리 및 프레임워크 오버헤드 | 디스크에 맞거나 VRAM과 거의 일치하는 파일은 런타임 시 여전히 실패할 수 있습니다. |
| 속도 추정 | 메모리 대역폭, 양자화, 백엔드, 맞춤 유형 및 활성 MoE 매개변수 | "실행 가능"은 레이어가 시스템 RAM으로 유출될 때 사용할 수 없을 정도로 느려질 수 있음을 의미할 수 있습니다. |
| 증거 순위 | 벤치마크 점수, 신선도, 일치 품질, 양자화, 적합성, 소스 신뢰도 및 인기도 | 상속된 주장 또는 업로더가 보고한 주장과 직접적인 증거를 분리합니다. |
증거 라벨 읽기
whichllm은 LiveBench, Artificial Analysis 및 Aider와 같은 현재 소스를 Open LLM Leaderboard v2 및 Chatbot Arena 적용 범위와 같은 이전 고정 소스와 병합합니다. 점수는 정규화되고 오래된 증거는 모델 계보에 따라 강등되므로 오래된 점수가 자동으로 새로운 세대를 능가해서는 안 됩니다. 이는 유용하지만 병합된 벤치마크는 여전히 다른 사람의 작업 혼합을 나타냅니다.
| 증거 | 의미 | 사용방법 |
|---|---|---|
| 직접 | 정확한 독립 모델 일치 | 이용 가능한 최고의 순위 증거를 제공하면서도 여전히 워크로드를 검증합니다. |
| 변형 | 접미사 제거 또는 명령어 변형 일치 | 합리적인 대리 튜닝이나 양자화 후에는 동작이 달라질 수 있습니다. |
| 베이스_모델 | 모델 카드 기반 메타데이터를 통해 상속된 증거 | 특히 강력하게 미세 조정된 포크의 경우 방향성으로 취급합니다. |
| line_interp | 모델 패밀리 내 크기 인식 보간 | 발견에는 유용하지만 긴밀한 구매 또는 배포 결정에는 약함 |
| 자기보고 | 업로더 제공 평가 | 대폭 할인됨; 독립적인 재생산을 추구하다 |
| 없음 | 사용 가능한 벤치마크 일치 없음 | 숫자로 된 순위를 측정된 작업 품질로 읽지 마세요. |
또한 프로젝트는 후보의 매개변수 수가 계열 참조에서 너무 멀리 벗어날 경우 일부 의심스러운 상속을 거부합니다. 이는 훨씬 더 큰 기반의 벤치마크를 차용하는 작은 초안 헤드와 같은 오류를 줄이지만, 자동화된 이름 지정 및 메타데이터 파이프라인은 모든 비정상적인 포크를 식별할 수 없습니다.
맞춤, 컨텍스트 및 양자화가 결합됩니다.
모델 가중치는 메모리 사용의 시작일뿐입니다. 컨텍스트가 길어질수록 KV 캐시 수요가 늘어납니다. 동시 요청은 런타임 상태를 증가시킵니다. 비전 입력과 대규모 배치로 인해 부담이 가중됩니다. 데스크탑 디스플레이 워크로드는 VRAM을 소비합니다. 프레임워크 할당은 메모리를 조각화할 수 있습니다. 4K 컨텍스트에 대해 생성된 권장 사항은 동일한 양자화가 64K 컨텍스트 또는 여러 사용자에게 제공된다는 증거가 아닙니다.
양자화는 두 번째 절충안을 도입합니다. 비트 수가 적으면 일반적으로 메모리 무게가 줄어들고 처리량이 증가할 수 있지만 품질 손실은 아키텍처, 작업 또는 양자화기 전반에 걸쳐 균일하지 않습니다. whichllm은 순위 지정의 일부로 양자화 페널티를 적용하지만 사용자는 실행하려는 프롬프트에서 최소한 두 개의 인접한 변형(보통 보수적인 중간 양자화 및 더 작은 대체)을 비교해야 합니다.
실용적인 로컬 모델 선택 워크플로우
- 먼저 직업을 쓰세요. 채팅, 코딩, 추출, 비전, 다국어 작업 또는 수학을 지정합니다. 대상 컨텍스트; 허용 가능한 대기 시간; 데이터가 오프라인 상태를 유지해야 하는지 여부.
- 기계를 기록하십시오. 정확한 GPU 및 메모리, 사용 가능한 RAM, 운영 체제, 드라이버/백엔드, 여유 디스크 및 백그라운드 GPU 사용량을 캡처합니다.
- 보수적인 후보 목록을 생성합니다. 다음으로 시작
--gpu 전용 --사용 가능한 속도 --vram-headroom 1GB. 사용--프로필,--컨텍스트 길이그리고--퀀트실제 작업량에 맞게. - 자신감을 점검해보세요. 점수가 가까울 때는 직접적 증거나 변형 증거를 선호합니다. 스냅샷 날짜, 예상 속도 표시 및 부분 오프로드 경고를 확인하세요.
- 세 명의 후보를 출마하세요. 최고 권장 사항, 인접 모델 또는 양자화, 더 작은 빠른 기준을 테스트합니다. 하나의 결과로는 비용-품질 경계를 밝힐 수 없습니다.
- 비공개 평가 세트를 사용하세요. 대표적인 프롬프트, 엣지 케이스, 거부 기대치, 필수 언어, 구조화된 출력 스키마 및 긴 컨텍스트 검색을 포함합니다.
- 교정 후 측정합니다. 성공적인 답변, 사람의 수정 시간, 초당 토큰, 첫 번째 토큰 대기 시간, 최대 메모리, 로드 시간 및 관련 에너지를 추적합니다.
- 배포를 동결합니다. 정확한 저장소, 개정판, 파일 이름, 양자화, 런타임, 컨텍스트 설정 및 프롬프트 템플릿을 저장합니다. 모델명만으로는 재현이 불가능합니다.
기본 순위 이상의 유용한 명령
| 목표 | 명령 패턴 | 지원하는 결정 |
|---|---|---|
| 현재 하드웨어 검사 | whichllm 하드웨어 | 적합성 추정치를 신뢰하기 전에 감지 확인 |
| 완전한 GPU 거주 요구 | whichllm --gpu 전용 | 느린 PCIe/시스템 RAM 오프로드 후보 방지 |
| 속도 하한선 설정 | whichllm --사용 가능한 속도 또는 --최소 속도 20 | 기술적으로 실행 가능하지만 운영상 느린 옵션을 제거합니다. |
| 하나의 모델에 대한 계획 | whichllm 계획 "모델명" | 대상에 필요한 하드웨어 및 양자화 예측 |
| 기계 비교 | whichllm "GPU A" "GPU B" 업그레이드 | 구매가 후보 경계선을 어떻게 변경하는지 확인하세요. |
| 선택 자동화 | whichllm --top 1 --json | 모델 ID를 피드하고 메타데이터를 스크립트에 맞춥니다. |
| 로컬 채팅 시작 | whichllm 실행 | 격리된 환경에서 선택한 형식을 다운로드하고 테스트하세요. |
whichllm이 오해를 불러일으킬 수 있는 부분
- 예상 속도는 컴퓨터의 벤치마크가 아닙니다. 백엔드 버전, 클럭, 열 제한, 신속한 처리 및 오프로드 구성이 성능을 향상시킬 수 있습니다.
- 종합적인 품질은 작업 실패를 숨깁니다. 높은 일반 점수는 귀하의 언어, 코드베이스, 검색 자료, JSON 신뢰성 또는 안전 정책을 예측하지 못할 수도 있습니다.
- 리포지토리 메타데이터가 불완전할 수 있습니다. 매개변수 수, 기본 모델 링크, 라이센스 및 변환 품질은 Hugging Face에 균일하게 문서화되어 있지 않습니다.
- 라이브 소스는 실패하거나 모양이 바뀔 수 있습니다. 이 도구는 데이터를 캐시하고 선별된 스냅샷으로 대체할 수 있습니다. 항상 표시된 신선함과 자신감을 읽으십시오.
- 다운로드는 공급망 활동입니다. 모델이나 Python 아티팩트를 실행하기 전에 저장소 소유권, 파일, 원격 코드 요구 사항, 라이선스 및 해시를 검토하세요.
- 1인용 적합성은 용량을 제공하지 않습니다. 동시성, 일괄 처리, 컨텍스트 증가 및 가동 시간 요구 사항에는 실제 부하 테스트가 필요합니다.
대안과 더 나은 경우
| 옵션 | 최적의 핏 | whichllm과의 절충 |
|---|---|---|
| LM Studio | GUI 우선 검색, 다운로드 및 데스크톱 채팅 | 더 쉬운 상호작용; 투명하고 스크립트 가능한 순위 파이프라인에는 적합하지 않음 |
| Ollama | 간단한 로컬 모델 패키징, 제공 및 애플리케이션 통합 | 뛰어난 런타임 워크플로이지만 모델 선택이 수동으로 유지되는 경우가 많습니다. |
| llama.cpp | 세분화된 GGUF 런타임 제어 및 직접 성능 테스트 | 더 많은 운영 제어; 모델을 최종 후보로 선정하려면 더 많은 지식이 필요합니다. |
| Artificial Analysis | 호스팅/개방형 모델 인텔리전스, 속도 및 품질 증거 비교 | 더 광범위한 벤치마크 분석 기계별 국소 적합성 추정을 대체하지 않습니다. |
| LMArena | 인간 선호 신호 및 병렬 모델 발견 | 유용한 선호 증거 VRAM, 양자화 또는 로컬 속도 플래너가 아님 |
| 수동 벤치마크 매트릭스 | 안정적인 프라이빗 워크로드를 보유한 고위험 팀 | 가장 관련성이 높은 증거이지만 구축하고 새로 고치는 데 비용이 많이 듭니다. |
의사결정 스코어카드
각 후보자에 대해 작업 통과율, 수정 시간(분), 첫 번째 토큰 대기 시간, 초당 토큰 생성, 최대 VRAM/RAM, 로드 시간, 사용된 컨텍스트, 구조화된 출력 유효성, 라이센스, 모델 출처 및 증거 등급을 기록합니다. 테스트하기 전에 측정항목에 가중치를 부여하세요. 코딩 팀은 개인 저장소 정확성과 JSON/도구 신뢰성을 우선시할 수 있는 반면, 노트북 보조원은 메모리 여유 공간, 배터리 및 대화형 속도를 우선시할 수 있습니다.
자주 묻는 질문
추천을 요청하면 whichllm에서 모델을 다운로드하나요?
순위 흐름은 모든 후보자를 다운로드하는 대신 모델 메타데이터를 가져오고 캐시합니다. 는 달리다 워크플로우는 선택한 모델을 다운로드하고 시작할 수 있으므로 사용하기 전에 디스크 공간, 저장소 신뢰 및 런타임 종속성을 검토하십시오.
1위 결과가 적합하다고 보장되나요?
어떤 추정기도 모든 런타임 구성을 보장할 수 없습니다. 헤드룸을 남겨두고 감지된 하드웨어와 컨텍스트를 확인한 다음 정확한 파일과 백엔드를 테스트하세요. 예측 가능성이 중요한 경우 전체 GPU 및 속도 필터를 사용하세요.
GPU를 선택하는 데 도움이 될 수 있나요?
그렇습니다. GPU 시뮬레이션, 계획 그리고 업그레이드 후보 하드웨어를 비교할 수 있습니다. 출력을 계획 증거로 취급하고 가격, 전력, 섀시, 드라이버 및 실제 벤치마크 제약 조건을 별도로 확인합니다.
Apple Silicon 및 CPU 전용 시스템을 지원합니까?
프로젝트 문서에는 Apple Silicon, NVIDIA, AMD, Intel 및 CPU 감지가 포함됩니다. Apple Silicon 및 CPU 전용 순위는 런타임 안정성을 위해 GGUF로 제한됩니다. 실제 성능은 여전히 칩, 메모리 대역폭 및 백엔드 빌드에 따라 다릅니다.
결과를 자동화에 사용할 수 있나요?
그렇습니다. JSON 출력에는 모델 ID, 적합성, 예상 메모리 및 속도 메타데이터가 포함됩니다. 실시간 모델 인벤토리 및 벤치마크 데이터가 상위 결과를 변경할 수 있으므로 버전을 고정하고 유효성 검사를 추가하세요.
whichllm 자체가 모델 러너인가요?
그 주요 가치는 선택과 계획입니다. 는 달리다 명령은 격리된 환경을 생성하고 지원되는 런타임을 호출할 수 있는 반면, Ollama, llama.cpp과 같은 전용 도구 또는 제공 스택은 지속적인 배포에 더 나을 수 있습니다.
공식 출처
- whichllm 공식 GitHub 저장소 및 README
- 공식 아키텍처 및 데이터 파이프라인 문서
- 공식 채점 문서
- 공식 하드웨어 감지 및 시뮬레이션 문서
- 공식 실행 및 코드 조각 워크플로
- 공식 저장소의 MIT 라이센스
- Hugging Face 실시간 후보 검색에 사용되는 모델 카탈로그
2026년 7월 25일에 마지막으로 검토되었습니다. 모델 인벤토리, 벤치마크 스냅샷, 런타임 호환성 및 하드웨어 가격이 변경되었습니다. 결정하기 전에 현재 CLI를 다시 실행하고 정확한 모델 아티팩트를 검증하십시오.




