whichllm
whichllm
Active

whichllm

whichllm は、ローカル ハードウェアを検出し、メモリと速度を推定し、ベンチマークの鮮度と証拠の信頼度を使用して実行可能な Hugging Face モデルをランク付けするオープンソース CLI です。このガイドでは、スコアリング、セーフフィット設定、検証ワークフロー、および代替案について説明します。

148

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

ローカル LLM 選定ハードウェア対応 AIベンチマーク順位オフラインモデル

Product Preview

A quick visual look at whichllm before you visit the official site.

Published 6/10/2026
whichllm screenshot

Editorial Review

About whichllm

whichllm 一見難しいローカル AI の質問に答えます。どのモデルと量子化が、この特定のコンピューターで最高の有用な品質を提供する可能性がありますか? GPU、CPU、RAM、ストレージを検出し、現在の Hugging Face 候補を収集し、ランタイムの適合性と生成速度を推定し、それらの制約をベンチマークの証拠と組み合わせます。結果はランク付けされた開始点であり、最初のモデルがすべてのプロンプトに対して最適であることを保証するものではありません。

Official whichllm terminal demonstration showing hardware-aware local model recommendations
公式 whichllm デモンストレーション。有用な出力は単なるモデル名ではありません。適合タイプ、メモリ、推定速度、スコア、および推奨事項の説明に役立つ証拠のコンテキストが含まれます。画像ソース: プロジェクト リポジトリ。

whichllm の違い

基本的なモデル ピッカーは、VRAM に収まるパラメータの数を尋ねます。 whichllm は、これを 1 つの制約のみとして扱います。そのドキュメントでは、人気のある、最近変更され、厳選されたモデルを Hugging Face から取得するパイプラインについて説明しています。関連するリポジトリをモデル ファミリーにグループ化します。利用可能な量子化を評価します。重み、KV キャッシュ、アクティベーション、フレームワークのオーバーヘッドを推定します。フル GPU、部分オフロード、または CPU の適合性をチェックします。次に、正規化されたベンチマーク証拠を使用して候補をランク付けします。

実行可能な最大のファイルが自動的に最適な選択になるわけではないため、これは重要です。新しい 27B モデルは古い 32B モデルよりも優れたパフォーマンスを発揮する可能性があり、専門家が混在したモデルは総パラメーター数が示すよりも速く生成でき、技術的に適合するモデルでもデスクトップ、コンテキスト キャッシュ、またはランタイムのヘッドルームが少なすぎる可能性があります。 whichllm は、これらのトレードオフを 1 つの「推奨」バッジで隠すのではなく、コントロールを公開します。

クイックスタートとより安全な最初のコマンド

uvx whichllm@最新

# 保守的な最初のパス: 完全な GPU 適合、使用可能な速度、1 GB のヘッドルーム
uvx whichllm@latest --gpu-only --speed used --vram-headroom 1GB

# 購入前にハードウェアをシミュレートする
uvx whichllm@最新 --gpu "RTX 4090"

# アップグレード候補を比較する
uvx whichllm@最新アップグレード「RTX 4090」「RTX 5090」「H100」

デフォルトのランキングは意図的に野心的であり、ニアエッジ VRAM フィットや部分的な RAM オフロードが含まれる場合があります。プロジェクトのセーファーピック コマンドは、予測可能な応答性を重視するユーザーにとって、より優れた初期フィルターです。別のランタイムがまだメモリ不足を報告している場合は、推定値が間違っていると仮定するのではなく、ヘッドルームを増やす、要求されたコンテキストを短くする、より小さい量子化を選択する、またはバックグラウンドの VRAM の使用状況を検査してください。

レコメンデーションパイプラインの仕組み

ステージwhichllm が評価するものなぜ答えが変わるのか
ハードウェアの検出NVIDIA、AMD、Intel、Apple Silicon、CPU 機能、RAM、空きディスクバックエンド、ユニファイド メモリ、帯域幅は、アドバタイズされた同様のメモリ サイズでも異なります
モデルの発見人気および最近のテキスト生成/GGUF リポジトリ、厳選されたフロンティア ID、リクエストに応じたビジョン候補静的リストはすぐに古くなり、使用可能な変換が失われる可能性があります
家族のグループ化ベースモデルのメタデータと正規化されたリポジトリ名1 つのファミリーの多数の再パックによって結果テーブルが混雑するのを防ぎます
メモリの推定値重み、KV キャッシュ、アクティベーション メモリ、フレームワークのオーバーヘッドディスクに収まるファイル、または VRAM にほぼ一致するファイルでも、実行時に失敗する可能性がある
速度の推定メモリ帯域幅、量子化、バックエンド、フィット タイプ、アクティブ MoE パラメータ「実行可能」とは、レイヤーがシステム RAM に溢れたときに使用できないほど遅いことを意味する場合があります
証拠ランキングベンチマーク スコア、鮮度、一致の品質、量子化、適合性、ソースの信頼性と人気継承された申し立てまたはアップロード者が報告した申し立てから直接証拠を分離します。

証拠ラベルを読む

whichllm は、LiveBench、Artificial Analysis、Aider などの現在のソースを、Open LLM Leaderboard v2 や Chatbot Arena カバレッジなどの古い凍結ソースとマージします。スコアは正規化され、古い証拠はモデルの系統によって降格されるため、古いスコアが黙って新しい世代を上回ることはありません。これは便利ですが、マージされたベンチマークは依然として他の人のタスクの組み合わせを表します。

証拠意味使い方
直接独立したモデルの正確な一致利用可能な最良のランキング証拠でありながら、ワークロードを検証します
異形サフィックス除去または命令バリアントの一致合理的な代理人。チューニングまたはクオンタイズ後は動作が異なる場合があります
ベースモデルモデルカードのベースメタデータを通じて継承された証拠特に強く微調整されたフォークの場合、方向性があるものとして扱います
line_interpモデル ファミリ内のサイズを考慮した補間発見には役立ちますが、購入や展開の決定には弱い
自己申告アップローダー提供の評価大幅な割引。独立した生殖を求める
なし使用可能なベンチマーク一致がありません数値ランクをタスクの品質の測定値として解釈しないでください

また、候補者のパラメータ数がそのファミリー参照から大きく乖離している場合、プロジェクトは一部の疑わしい継承を拒否します。これにより、小さなドラフト ヘッドがはるかに大きなベースのベンチマークを借用するなどのエラーが軽減されますが、自動化された命名およびメタデータ パイプラインではすべての異常なフォークを識別することはできません。

フィット、コンテキスト、量子化は結合されています

モデルの重みはメモリ使用の始まりにすぎません。コンテキストが長くなると、KV キャッシュの需要が増加します。同時リクエストは実行時の状態を倍増します。ビジョン入力と大規模なバッチによりプレッシャーが加わります。デスクトップ ディスプレイのワークロードは VRAM を消費します。また、フレームワークの割り当てによりメモリが断片化される可能性があります。 4K コンテキストに対して生成された推奨事項は、同じ量子化が 64K コンテキストまたは複数のユーザーにサービスを提供するという証拠ではありません。

量子化により 2 番目のトレードオフが生じます。通常、ビット数が少ないと重みメモリが減り、スループットが向上する可能性がありますが、品質の低下はアーキテクチャ、タスク、量子化器間で均一ではありません。 whichllm はランキングの一部として量子化ペナルティを適用しますが、ユーザーは、実行する予定のプロンプトに対して、少なくとも 2 つの隣接するバリアント (多くの場合、保守的な中程度の量子化と小規模なフォールバック) を比較する必要があります。

実践的なローカルモデル選択ワークフロー

  1. まず仕事を書きます。 チャット、コーディング、抽出、ビジョン、多言語作業または数学を指定します。ターゲットコンテキスト。許容可能な遅延。データをオフラインにしておく必要があるかどうか。
  2. マシンを記録します。 正確な GPU とメモリ、利用可能な RAM、オペレーティング システム、ドライバー/バックエンド、空きディスク、バックグラウンド GPU の使用状況をキャプチャします。
  3. 保守的な候補リストを作成します。 から始める --GPU のみ --速度は使用可能 --vram-headroom 1GB。使用する --プロフィール, --コンテキストの長さ そして --quant 実際のワークロードに合わせて。
  4. 自信を検査します。 スコアが近い場合は、直接証拠または変形証拠を優先します。スナップショットの日付、推定速度マーカー、部分オフロードの警告に注意してください。
  5. 3人の候補者を立てます。 最上位の推奨事項、隣接するモデルまたは量子化、およびより小さい高速ベースラインをテストします。 1 つの結果だけでは、コストと品質のフロンティアを明らかにすることはできません。
  6. プライベート評価セットを使用します。 代表的なプロンプト、特殊なケース、拒否の予想、必要な言語、構造化された出力スキーマ、および長いコンテキストの取得を含めます。
  7. 補正後に計測します。 成功した回答、人による修正時間、1 秒あたりのトークン、最初のトークンの待ち時間、ピーク メモリ、ロード時間、関連するエネルギーを追跡します。
  8. デプロイメントを凍結します。 正確なリポジトリ、リビジョン、ファイル名、量子化、ランタイム、コンテキスト設定、およびプロンプト テンプレートを保存します。モデル名だけでは再現できません。

デフォルトランキングを超えた便利なコマンド

目標コマンドパターン支持する決定
現在のハードウェアを検査するwhichllm ハードウェア適合推定値を信頼する前に検出を検証する
フル GPU レジデンスを要求するwhichllm --GPU のみ低速の PCIe/システム RAM オフロード候補を回避する
速度の下限を設定するwhichllm -- 使用可能な速度 または --min-speed 20技術的には実行可能だが動作が遅いオプションを削除する
1 つのモデルを計画するwhichllm プラン「モデル名」ターゲットに必要なハードウェアと量子化を見積もる
マシンを比較するwhichllm 「GPU A」「GPU B」をアップグレードします購入によって候補者のフロンティアがどのように変化するかを確認する
選択を自動化するwhichllm --トップ 1 --jsonモデル ID をフィードし、メタデータをスクリプトに適合させる
ローカルチャットを開始するwhichllm 実行選択した形式をダウンロードして隔離された環境でテストする

whichllm が誤解を招く可能性がある箇所

  • 推定速度はマシンのベンチマークではありません。 バックエンドのバージョン、クロック、温度制限、プロンプト処理、オフロード構成によってパフォーマンスが変化する可能性があります。
  • 総合的な品質により、タスクの失敗が隠されます。 一般スコアが高いからといって、言語、コードベース、検索コーパス、JSON の信頼性や安全性ポリシーを予測できない場合があります。
  • リポジトリのメタデータは不完全である可能性があります。 パラメーター数、基本モデルのリンク、ライセンス、変換品質は、Hugging Face に統一的に文書化されていません。
  • ライブソースは失敗したり形状が変化したりする可能性があります。 このツールはデータをキャッシュし、厳選されたスナップショットにフォールバックできます。表示される新鮮さと自信を常に読んでください。
  • ダウンロードはサプライチェーンのアクションです。 モデルまたは Python アーティファクトを実行する前に、リポジトリの所有権、ファイル、リモート コードの要件、ライセンス、ハッシュを確認してください。
  • 1 ユーザーの適合性は処理能力ではありません。 同時実行、バッチ処理、コンテキストの増大、稼働時間の要件には、実際の負荷テストが必要です。

代替案とその方が優れている場合

オプションベストフィットトレードオフと whichllm
LM StudioGUI ファーストの検出、ダウンロード、デスクトップ チャットインタラクションが容易になります。透明でスクリプト可能なランキング パイプラインにはあまり適していない
Ollamaシンプルなローカル モデルのパッケージ化、提供、アプリケーションの統合優れた実行時のワークフローですが、モデルの選択は手動のままであることがよくあります
llama.cpp詳細な GGUF ランタイム制御と直接パフォーマンス テスト運用管理の強化。モデルを最終候補に挙げるためにはより多くの知識が必要です
Artificial Analysisホスト型/オープンモデルのインテリジェンス、スピード、品質の証拠を比較より広範なベンチマーク分析。マシン固有のローカル フィット推定を置き換えるものではありません
LMArena人間の好みの信号と並列モデルの発見有益な好みの証拠。 VRAM、量子化、またはローカル速度プランナーではありません
手動ベンチマーク マトリックス安定したプライベートワークロードを持つ一か八かのチーム最も関連性の高い証拠だが、構築と更新にコストがかかる

決定スコアカード

候補ごとに、タスクの合格率、修正分、最初のトークンのレイテンシー、1 秒あたりの生成トークン、ピーク VRAM/RAM、ロード時間、使用されたコンテキスト、構造化出力の有効性、ライセンス、モデルの出所、および証拠のグレードを記録します。テスト前にメトリクスに重みを付けます。コーディング チームはプライベート リポジトリの精度と JSON/ツールの信頼性を優先する場合がありますが、ラップトップ アシスタントはメモリのヘッドルーム、バッテリー、対話速度を優先する場合があります。

よくある質問

whichllm は、推奨事項をリクエストしたときにモデルをダウンロードしますか?

ランキング フローでは、すべての候補をダウンロードするのではなく、モデルのメタデータをフェッチしてキャッシュします。の 走る ワークフローは選択したモデルをダウンロードして起動できるため、使用する前にディスク容量、リポジトリの信頼性、実行時の依存関係を確認してください。

1 位の結果は適合することが保証されていますか?

すべての実行時構成を保証できる推定ツールはありません。余裕を残し、検出されたハードウェアとコンテキストを確認してから、正確なファイルとバックエンドをテストします。予測可能性が重要な場合は、フル GPU と速度フィルターを使用します。

GPUの選択に役立ちますか?

はい。 GPUシミュレーション、 計画 そして アップグレード 候補のハードウェアを比較できます。出力を計画の証拠として扱い、価格、電力、シャーシ、ドライバー、実際のベンチマークの制約を個別に確認します。

Apple Silicon および CPU のみのシステムをサポートしますか?

このプロジェクトでは、Apple Silicon、NVIDIA、AMD、Intel、および CPU の検出について文書化しています。 Apple Silicon および CPU のみのランキングは、実行時の安定性のために GGUF に制限されています。実際のパフォーマンスは、チップ、メモリ帯域幅、バックエンドのビルドによって異なります。

結果を自動化に使用できますか?

はい。 JSON 出力には、モデル ID、適合、推定メモリ、速度のメタデータが含まれます。ライブモデルインベントリとベンチマークデータによって上位の結果が変わる可能性があるため、バージョンを固定し、検証を追加します。

whichllm 自体がモデルランナーですか?

その主な価値は選択と計画です。の 走る コマンドは分離環境を作成し、サポートされているランタイムを呼び出すことができますが、進行中のデプロイには Ollama、llama.cpp、またはサービング スタックなどの専用ツールの方が適している場合があります。

公式情報源

最終レビュー日は 2026 年 7 月 25 日です。モデル インベントリ、ベンチマーク スナップショット、ランタイム互換性、およびハードウェア価格が変更されます。決定する前に、現在の CLI を再実行し、正確なモデル アーティファクトを検証してください。

Ready to try whichllm?

Visit the official website to get started

Visit whichllm

Quick Info

Added
6/10/2026
Published
6/10/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

LMArena

LMArena

LMArenaは、LMSYS Chatbot Arena / Chatbot Arenaとして知られてきた、人間の好みに基づくAIモデル比較リーダーボードです。モデル評価の重要な公開シグナルですが、独自評価と組み合わせて使うべきです。

LMArenaChatbot ArenaLMSYS
1590
Artificial Analysis

Artificial Analysis

Artificial Analysis は LLM、画像モデル、AIプロバイダーを比較する独立ベンチマークサイトです。知能、速度、価格、コンテキスト、遅延、品質、提供状況を確認し、導入前のモデル選定に使えます。

Artificial AnalysisAIモデル比較LLMランキング
760
LiveCodeBench

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark of LLMs for code that continuously collects new problems over time. - スマートな AI ツールで生産性を向上。

llm-leaderboardfree
770
Price Per Token

Price Per Token

Compare LLM API pricing across 200+ models from OpenAI, Anthropic, Google, and more. Includes token counters, cost calculators, and benchmark comparisons. - スマートな AI ツールで生産性を向上。

llm-leaderboardfree
760