whichllm
whichllm
Active

whichllm

whichllm ist eine Open-Source-CLI, die lokale Hardware erkennt, Speicher und Geschwindigkeit schätzt und ausführbare Hugging Face-Modelle anhand von Benchmark-Aktivität und Beweissicherheit bewertet. In diesem Leitfaden werden die Bewertung, die Safe-Fit-Einstellungen, der Validierungsworkflow und Alternativen erläutert.

36

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

lokaler LLM-Finderhardwarebewusste AIBenchmark-RankingOffline-Modelle

Product Preview

A quick visual look at whichllm before you visit the official site.

Published 6/10/2026
whichllm screenshot

Editorial Review

About whichllm

whichllm beantwortet eine trügerisch schwierige Frage der lokalen KI: Welches Modell und welche Quantisierung liefern wahrscheinlich die beste nützliche Qualität auf diesem bestimmten Computer? Es erkennt GPU, CPU, RAM und Speicher, sammelt aktuelle Hugging Face-Kandidaten, schätzt die Laufzeitanpassung und die Generierungsgeschwindigkeit und kombiniert diese Einschränkungen dann mit Benchmark-Beweisen. Das Ergebnis ist ein geordneter Ausgangspunkt – kein Versprechen, dass das erste Modell für jede Eingabeaufforderung das Beste ist.

Official whichllm terminal demonstration showing hardware-aware local model recommendations
Offizielle whichllm-Demonstration. Die nützliche Ausgabe ist nicht nur ein Modellname: Passformtyp, Gedächtnis, geschätzte Geschwindigkeit, Punktzahl und Evidenzkontext helfen bei der Erläuterung der Empfehlung. Bildquelle: Projekt-Repository.

Was whichllm anders macht

Ein einfacher Modellwähler fragt, wie viele Parameter in den VRAM passen. whichllm behandelt dies als nur eine Einschränkung. Die Dokumentation beschreibt eine Pipeline, die beliebte, kürzlich geänderte und kuratierte Modelle von Hugging Face abruft; gruppiert verwandte Repositories in Modellfamilien; wertet verfügbare Quantisierungen aus; schätzt Gewichte, KV-Cache, Aktivierungen und Framework-Overhead; prüft die Voll-GPU-, Teil-Offload- oder CPU-Passform; Anschließend werden die Kandidaten anhand normalisierter Benchmark-Beweise eingestuft.

Dies ist wichtig, da die größte ausführbare Datei nicht automatisch die beste Wahl ist. Ein neueres 27B-Modell kann ein älteres 32B-Modell übertreffen, ein Mix-of-Experts-Modell kann schneller generieren, als seine Gesamtparameterzahl vermuten lässt, und ein Modell, das technisch passt, lässt möglicherweise zu wenig Spielraum für einen Desktop, einen Kontext-Cache oder eine Laufzeit. whichllm legt Kontrollen für diese Kompromisse offen, anstatt sie hinter einem „empfohlenen“ Abzeichen zu verstecken.

Schneller Start und der sicherere erste Befehl

uvx whichllm@latest

# Konservativer erster Durchgang: volle GPU-Ausstattung, nutzbare Geschwindigkeit, 1 GB Headroom
uvx whichllm@latest --gpu-only --speed nutzbar --vram-headroom 1 GB

# Hardware vor dem Kauf simulieren
uvx whichllm@latest --gpu "RTX 4090"

# Upgrade-Kandidaten vergleichen
uvx whichllm@neuestes Upgrade „RTX 4090“ „RTX 5090“ „H100“

Die Standardeinstufung ist absichtlich ehrgeizig: Sie umfasst möglicherweise Near-Edge-VRAM-Anpassungen und teilweise RAM-Offload. Der Safer-Pick-Befehl des Projekts ist ein besserer Anfangsfilter für Benutzer, die Wert auf vorhersehbare Reaktionsfähigkeit legen. Wenn eine andere Laufzeit immer noch nicht genügend Speicher meldet, erhöhen Sie den Headroom, verkürzen Sie den angeforderten Kontext, wählen Sie eine kleinere Quantisierung oder überprüfen Sie die VRAM-Nutzung im Hintergrund, anstatt davon auszugehen, dass der Schätzer falsch ist.

So funktioniert die Empfehlungspipeline

BühneWas whichllm auswertetWarum es die Antwort ändert
HardwareerkennungNVIDIA, AMD, Intel, Apple Silicon, CPU-Funktionen, RAM und freie FestplatteBackend, einheitlicher Speicher und Bandbreite unterscheiden sich selbst bei ähnlich beworbenen Speichergrößen
ModellentdeckungBeliebte und aktuelle Textgenerierungs-/GGUF-Repositories, kuratierte Frontier-IDs und Vision-Kandidaten auf AnfrageEine statische Liste veraltet schnell und kann dazu führen, dass brauchbare Konvertierungen fehlen
FamiliengruppierungMetadaten des Basismodells und normalisierte Repository-NamenVerhindert, dass viele Umpackungen einer Familie die Ergebnistabelle überfüllen
SpeicherschätzungGewichte, KV-Cache, Aktivierungsspeicher und Framework-OverheadEine Datei, die auf die Festplatte passt oder fast mit dem VRAM übereinstimmt, kann zur Laufzeit dennoch fehlschlagen
GeschwindigkeitsschätzungSpeicherbandbreite, Quantisierung, Backend, Anpassungstyp und aktive MoE-Parameter„Ausführbar“ kann unbrauchbar langsam bedeuten, wenn Schichten in den System-RAM gelangen
EvidenzrankingBenchmark-Score, Aktualität, Übereinstimmungsqualität, Quantisierung, Passform, Quellenvertrauen und BeliebtheitTrennt direkte Beweise von übernommenen oder vom Uploader gemeldeten Ansprüchen

Lesen der Beweisetiketten

whichllm führt aktuelle Quellen wie LiveBench, Artificial Analysis und Aider mit älteren eingefrorenen Quellen wie Open LLM Leaderboard v2 und Chatbot Arena zusammen. Die Bewertungen werden normalisiert und ältere Beweise werden durch die Modelllinie herabgestuft, sodass eine veraltete Bewertung nicht stillschweigend eine neuere Generation schlagen sollte. Das ist nützlich, aber zusammengeführte Benchmarks stellen immer noch den Aufgabenmix einer anderen Person dar.

BeweiseBedeutungWie man es benutzt
direktExakte unabhängige ModellübereinstimmungBeste verfügbare Ranking-Beweise, aber dennoch Validierung Ihrer Arbeitsbelastung
VarianteSuffix-entfernte oder AnweisungsvariantenübereinstimmungAngemessener Stellvertreter; Das Verhalten kann nach der Abstimmung oder Quantisierung unterschiedlich sein
base_modelBeweise, die durch Metadaten der Modellkartenbasis übernommen werdenAls richtungsgebunden behandeln, insbesondere bei stark fein abgestimmten Gabeln
line_interpGrößenbewusste Interpolation innerhalb einer ModellfamilieNützlich für die Entdeckung, schwach für abschließende Kauf- oder Bereitstellungsentscheidungen
selbst_berichtetVom Uploader bereitgestellte BewertungStark reduziert; Suche nach unabhängiger Reproduktion
keineKeine brauchbare Benchmark-ÜbereinstimmungLesen Sie den numerischen Rang nicht als gemessene Aufgabenqualität

Das Projekt weist auch einige verdächtige Vererbungen zurück, wenn die Parameteranzahl eines Kandidaten zu weit von seiner Familienreferenz abweicht. Dadurch werden Fehler reduziert, etwa wenn ein kleiner Entwurfskopf den Benchmark einer viel größeren Basis übernimmt, aber keine automatisierte Benennungs- und Metadaten-Pipeline kann jeden ungewöhnlichen Fork identifizieren.

Passform, Kontext und Quantisierung sind gekoppelt

Modellgewichte sind nur der Anfang der Speichernutzung. Ein längerer Kontext erhöht den KV-Cache-Bedarf; gleichzeitige Anforderungen vervielfachen den Laufzeitstatus; Vision-Eingaben und große Chargen erhöhen den Druck; Desktop-Anzeige-Workloads verbrauchen VRAM; und die Framework-Zuweisung kann den Speicher fragmentieren. Eine für einen 4K-Kontext erstellte Empfehlung ist kein Beweis dafür, dass dieselbe Quantisierung für einen 64K-Kontext oder mehrere Benutzer geeignet ist.

Die Quantisierung führt zu einem zweiten Kompromiss. Weniger Bits verringern in der Regel die Speicherkapazität und können den Durchsatz erhöhen, der Qualitätsverlust ist jedoch nicht einheitlich bei allen Architekturen, Aufgaben oder Quantisierern. whichllm wendet einen Quantisierungsnachteil als Teil der Rangfolge an, dennoch sollten Benutzer mindestens zwei benachbarte Varianten – häufig eine konservative mittlere Quantisierung und einen kleineren Fallback – genau an den Eingabeaufforderungen vergleichen, die sie ausführen möchten.

Ein praktischer Workflow für die Auswahl lokaler Modelle

  1. Schreiben Sie zuerst den Job. Geben Sie Chat, Codierung, Extraktion, Vision, mehrsprachige Arbeit oder Mathematik an; Zielkontext; akzeptable Latenz; und ob Daten offline bleiben müssen.
  2. Nehmen Sie die Maschine auf. Erfassen Sie die genaue GPU und den Speicher, den verfügbaren RAM, das Betriebssystem, den Treiber/Backend, die freie Festplatte und die GPU-Nutzung im Hintergrund.
  3. Erstellen Sie eine konservative Auswahlliste. Beginnen Sie mit --gpu-only --speed nutzbar --vram-headroom 1 GB. Benutzen --profile, --context-length und --quant um der tatsächlichen Arbeitsbelastung gerecht zu werden.
  4. Überprüfen Sie das Vertrauen. Bevorzugen Sie direkte oder abweichende Beweise, wenn die Ergebnisse nahe beieinander liegen. Beachten Sie Schnappschussdaten, geschätzte Geschwindigkeitsmarkierungen und Warnungen vor teilweiser Entladung.
  5. Führen Sie drei Kandidaten aus. Testen Sie die oberste Empfehlung, ein angrenzendes Modell oder eine angrenzende Quantisierung und eine kleinere schnelle Basislinie. Ein einziges Ergebnis kann die Kosten-Qualitäts-Grenze nicht aufzeigen.
  6. Verwenden Sie einen privaten Evaluierungssatz. Beziehen Sie repräsentative Eingabeaufforderungen, Randfälle, Ablehnungserwartungen, erforderliche Sprachen, strukturierte Ausgabeschemata und den Abruf langer Kontexte ein.
  7. Messung nach Korrektur. Verfolgen Sie erfolgreiche Antworten, menschliche Korrekturzeit, Token pro Sekunde, Latenz beim ersten Token, Spitzenspeicher, Ladezeit und Energie, sofern relevant.
  8. Frieren Sie die Bereitstellung ein. Speichern Sie das genaue Repository, die Revision, den Dateinamen, die Quantisierung, die Laufzeit, die Kontexteinstellungen und die Eingabeaufforderungsvorlage. Ein Modellname allein ist nicht reproduzierbar.

Nützliche Befehle, die über das Standardranking hinausgehen

ZielBefehlsmusterEntscheidung, die es unterstützt
Überprüfen Sie die aktuelle Hardwarewhichllm HardwareÜberprüfen Sie die Erkennung, bevor Sie den Eignungsschätzungen vertrauen
Fordern Sie eine vollständige GPU-Residenzwhichllm --gpu-onlyVermeiden Sie langsame PCIe-/System-RAM-Offload-Kandidaten
Legen Sie eine Geschwindigkeitsuntergrenze festwhichllm – Geschwindigkeit nutzbar oder --min-speed 20Entfernen Sie technisch lauffähige, aber betrieblich langsame Optionen
Planen Sie ein Modell einwhichllm Plan „Modellname“Schätzen Sie, welche Hardware und Quantisierung das Ziel benötigt
Maschinen vergleichenwhichllm Upgrade „GPU A“ „GPU B“Sehen Sie, wie ein Kauf die Kandidatengrenze verändert
Auswahl automatisierenwhichllm --top 1 --jsonGeben Sie Modell-IDs ein und passen Sie Metadaten in Skripte ein
Starten Sie einen lokalen Chatwhichllm ausgeführtLaden Sie ein ausgewähltes Format herunter und testen Sie es in einer isolierten Umgebung

Wobei whichllm irreführend sein kann

  • Die geschätzte Geschwindigkeit ist kein Maßstab für Ihre Maschine. Backend-Versionen, Uhren, thermische Grenzwerte, schnelle Verarbeitung und Offload-Konfiguration können die Leistung beeinträchtigen.
  • Die Gesamtqualität verbirgt Aufgabenfehler. Eine hohe allgemeine Bewertung kann möglicherweise nicht Ihre Sprache, Codebasis, Retrieval-Korpus, JSON Zuverlässigkeit oder Sicherheitsrichtlinie vorhersagen.
  • Repository-Metadaten können unvollständig sein. Parameteranzahl, Basismodell-Links, Lizenzen und Konvertierungsqualität werden auf Hugging Face nicht einheitlich dokumentiert.
  • Live-Quellen können ausfallen oder ihre Form ändern. Das Tool speichert Daten zwischen und kann auf kuratierte Snapshots zurückgreifen; Lesen Sie immer die gezeigte Frische und Zuversicht.
  • Das Herunterladen ist eine Supply-Chain-Aktion. Überprüfen Sie den Repository-Eigentum, die Dateien, die Remote-Code-Anforderungen, die Lizenz und die Hashes, bevor Sie Modell- oder Python-Artefakte ausführen.
  • Die Kapazität für einen einzelnen Benutzer reicht nicht aus. Parallelität, Stapelverarbeitung, Kontextwachstum und Verfügbarkeitsanforderungen erfordern einen echten Lasttest.

Alternativen und wann sie besser sind

OptionBeste PassformKompromiss versus whichllm
LM StudioGUI-First-Erkennung, Download und Desktop-ChatEinfachere Interaktion; weniger geeignet für transparente, skriptfähige Ranking-Pipelines
OllamaEinfache lokale Modellpaketierung, Bereitstellung und AnwendungsintegrationHervorragender Laufzeit-Workflow, die Modellauswahl bleibt jedoch oft manuell
llama.cppFeinkörnige GGUF-Laufzeitsteuerung und direkte LeistungstestsMehr operative Kontrolle; Es sind mehr Kenntnisse erforderlich, um Modelle in die engere Auswahl zu nehmen
Artificial AnalysisVergleich der Intelligenz, Geschwindigkeit und Qualitätsnachweise gehosteter/offener ModelleUmfassendere Benchmark-Analyse; ersetzt nicht die maschinenspezifische lokale Anpassungsschätzung
LMArenaMenschliche Präferenzsignale und parallele ModellentdeckungNützliche Präferenznachweise; kein VRAM, keine Quantisierung oder kein lokaler Geschwindigkeitsplaner
Manuelle Benchmark-MatrixHochkarätige Teams mit einer stabilen privaten ArbeitsbelastungRelevanteste Beweise, aber teuer in der Erstellung und Aktualisierung

Entscheidungs-Scorecard

Notieren Sie für jeden Kandidaten die Erfolgsquote der Aufgabe, die Korrekturminuten, die Latenz beim ersten Token, die Generierung von Tokens pro Sekunde, den VRAM/RAM-Spitzenwert, die Ladezeit, den verwendeten Kontext, die Gültigkeit der strukturierten Ausgabe, die Lizenz, die Modellherkunft und den Evidenzgrad. Gewichten Sie die Metriken vor dem Testen. Ein Programmierteam priorisiert möglicherweise die Genauigkeit des privaten Repositorys und die Zuverlässigkeit des JSON/Tools, während ein Laptop-Assistent möglicherweise den Speicherbedarf, den Akku und die interaktive Geschwindigkeit priorisiert.

Häufig gestellte Fragen

Lädt whichllm ein Modell herunter, wenn ich Empfehlungen anfordere?

Der Ranking-Flow ruft Modellmetadaten ab und speichert sie zwischen, anstatt jeden Kandidaten herunterzuladen. Die laufen Der Workflow kann ein ausgewähltes Modell herunterladen und starten. Überprüfen Sie daher den Speicherplatz, die Repository-Vertrauenswürdigkeit und die Laufzeitabhängigkeiten, bevor Sie es verwenden.

Passt das Ergebnis Nummer eins garantiert?

Kein Schätzer kann jede Laufzeitkonfiguration garantieren. Lassen Sie Spielraum, überprüfen Sie die erkannte Hardware und den erkannten Kontext und testen Sie dann die genaue Datei und das Backend. Verwenden Sie Voll-GPU- und Geschwindigkeitsfilter, wenn es auf Vorhersagbarkeit ankommt.

Kann es bei der Auswahl einer GPU hilfreich sein?

Ja. GPU-Simulation, planen und Upgrade kann Kandidaten-Hardware vergleichen. Behandeln Sie die Ausgabe als Planungsbeweis und bestätigen Sie Preis, Leistung, Fahrwerk, Fahrer und tatsächliche Benchmark-Einschränkungen separat.

Unterstützt es Apple Silicon und reine CPU-Systeme?

Das Projekt dokumentiert die Erkennung von Apple Silicon, NVIDIA, AMD, Intel und CPU. Apple Silicon und die reine CPU-Rangliste sind zur Laufzeitstabilität auf GGUF beschränkt. Die tatsächliche Leistung variiert immer noch je nach Chip, Speicherbandbreite und Backend-Build.

Kann ich das Ergebnis in der Automatisierung verwenden?

Ja. Die Ausgabe von JSON umfasst Modellidentität, Anpassung, geschätzten Speicher und Geschwindigkeitsmetadaten. Pin-Versionen und Validierung hinzufügen, da Live-Modellinventare und Benchmark-Daten das Top-Ergebnis verändern können.

Ist whichllm selbst ein Modellläufer?

Sein Hauptwert ist Auswahl und Planung. Die laufen Der Befehl kann eine isolierte Umgebung erstellen und unterstützte Laufzeiten aufrufen, während dedizierte Tools wie Ollama, llama.cpp oder ein Serving-Stack für die laufende Bereitstellung möglicherweise besser geeignet sind.

Offizielle Quellen

Zuletzt überprüft am 25. Juli 2026. Modellbestände, Benchmark-Snapshots, Laufzeitkompatibilität und Hardwarepreise ändern sich; Führen Sie die aktuelle CLI erneut aus und validieren Sie das genaue Modellartefakt, bevor Sie eine Entscheidung treffen.

Ready to try whichllm?

Visit the official website to get started

Visit whichllm

Quick Info

Added
6/10/2026
Published
6/10/2026
Updated
7/25/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

LMArena

LMArena

LMArena, früher oft als LMSYS Chatbot Arena/Chatbot Arena bezeichnet, ist ein Human-Preference-Leaderboard zum Vergleich von AI-Modellen. Es ist wertvoll für Modellreputation, sollte aber mit privaten Evaluierungen kombiniert werden.

LMArenaChatbot ArenaLMSYS
520
Artificial Analysis

Artificial Analysis

Artificial Analysis ist eine unabhängige Benchmark- und Vergleichsplattform für KI-Modelle und Anbieter. Sie verfolgt Intelligenz, Geschwindigkeit, Preis, Kontext, Latenz, Qualität und Verfügbarkeit für bessere Modellentscheidungen.

Artificial AnalysisAI Model BenchmarkLLM Leaderboard
500
LiveCodeBench

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark of LLMs for code that continuously collects new problems over time. - Intelligentes KI-Tool für mehr Produktivität.

llm-leaderboardfree
460
Price Per Token

Price Per Token

Compare LLM API pricing across 200+ models from OpenAI, Anthropic, Google, and more. Includes token counters, cost calculators, and benchmark comparisons. - Intelligentes KI-Tool für mehr Produktivität.

llm-leaderboardfree
590