whichllm
whichllm
Active

whichllm

whichllm est une CLI open source qui détecte le matériel local, estime la mémoire et la vitesse, et classe les modèles Hugging Face exécutables à l'aide de la fraîcheur des références et de la fiabilité des preuves. Ce guide explique sa notation, ses paramètres d'ajustement sécurisé, son flux de travail de validation et ses alternatives.

33

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

selection LLM localAI adaptee au materielclassement benchmarkmodeles hors ligne

Product Preview

A quick visual look at whichllm before you visit the official site.

Published 6/10/2026
whichllm screenshot

Editorial Review

About whichllm

whichllm répond à une question d’IA locale trompeusement difficile : quel modèle et quelle quantification sont susceptibles de fournir la meilleure qualité utile sur cet ordinateur spécifique ? Il détecte le GPU, le CPU, la RAM et le stockage, collecte les candidats Hugging Face actuels, estime l'adéquation de l'exécution et la vitesse de génération, puis combine ces contraintes avec des preuves de référence. Le résultat est un point de départ classé, et non une promesse que le premier modèle sera le meilleur pour chaque invite.

Official whichllm terminal demonstration showing hardware-aware local model recommendations
Démonstration officielle whichllm. Le résultat utile n’est pas simplement un nom de modèle : le type d’ajustement, la mémoire, la vitesse estimée, le score et le contexte des preuves aident à expliquer la recommandation. Source de l'image : référentiel du projet.

Ce que whichllm fait différemment

Un sélecteur de modèle de base demande combien de paramètres tiennent dans la VRAM. whichllm traite cela comme une seule contrainte. Sa documentation décrit un pipeline qui récupère des modèles populaires, récemment modifiés et organisés à partir de Hugging Face ; regroupe les référentiels associés en familles modèles ; évalue les quantifications disponibles ; estime les poids, le cache KV, les activations et la surcharge du framework ; vérifie l'adéquation du GPU complet, du déchargement partiel ou du CPU ; puis classe les candidats à l'aide de preuves de référence normalisées.

Ceci est important car le fichier exécutable le plus volumineux n’est pas automatiquement le meilleur choix. Un modèle 27B plus récent peut surpasser un modèle 32B plus ancien, un modèle mixte d'experts peut générer plus rapidement que son nombre total de paramètres ne le suggère, et un modèle techniquement adapté peut laisser trop peu de marge pour un bureau, un cache contextuel ou un environnement d'exécution. whichllm expose les contrôles de ces compromis au lieu de les cacher derrière un badge « recommandé ».

Démarrage rapide et première commande plus sûre

uvx whichllm@dernier

# Premier passage conservateur : ajustement complet du GPU, vitesse utilisable, marge de 1 Go
uvx whichllm@latest --gpu-only --speed utilisable --vram-headroom 1 Go

# Simulez le matériel avant de l'acheter
uvx whichllm@latest --gpu "RTX 4090"

# Comparez les candidats à la mise à niveau
uvx whichllm@dernière mise à niveau "RTX 4090" "RTX 5090" "H100"

Le classement par défaut est intentionnellement ambitieux : il peut inclure des ajustements VRAM proches et un déchargement partiel de la RAM. La commande Safer-pick du projet constitue un meilleur filtre initial pour les utilisateurs qui apprécient une réactivité prévisible. Si un autre moteur d'exécution signale toujours une mémoire insuffisante, augmentez la marge, raccourcissez le contexte demandé, choisissez une quantification plus petite ou inspectez l'utilisation de la VRAM en arrière-plan au lieu de supposer que l'estimateur est erroné.

Comment fonctionne le pipeline de recommandations

ScèneCe que whichllm évaluePourquoi ça change la réponse
Détection du matérielNVIDIA, AMD, Intel, Apple Silicon, fonctionnalités du processeur, RAM et disque libreLe backend, la mémoire unifiée et la bande passante diffèrent même à des tailles de mémoire annoncées similaires
Découverte du modèleRéférentiels de génération de texte/GGUF populaires et récents, identifiants de frontière organisés et candidats à la vision sur demandeUne liste statique devient rapidement obsolète et peut manquer des conversions utilisables
Regroupement familialMétadonnées du modèle de base et noms de référentiels normalisésEmpêche de nombreux reconditionnements d'une famille d'encombrer la table des résultats
Estimation de la mémoirePoids, cache KV, mémoire d'activation et surcharge du frameworkUn fichier qui tient sur le disque ou correspond presque à la VRAM peut toujours échouer au moment de l'exécution
Estimation de la vitesseBande passante mémoire, quantification, backend, type d'ajustement et paramètres MoE actifs« Exécutable » peut signifier une lenteur inutilisable lorsque les couches débordent dans la RAM du système
Classement des preuvesScore de référence, fraîcheur, qualité de correspondance, quantification, ajustement, confiance dans la source et popularitéSépare les preuves directes des réclamations héritées ou signalées par le téléchargeur

Lire les étiquettes des preuves

whichllm fusionne les sources actuelles telles que LiveBench, Artificial Analysis et Aider avec des sources gelées plus anciennes telles que la couverture Open LLM Leaderboard v2 et Chatbot Arena. Les scores sont normalisés et les preuves plus anciennes sont rétrogradées par la lignée du modèle, de sorte qu'un score obsolète ne devrait pas silencieusement battre une génération plus récente. C'est utile, mais les références fusionnées représentent toujours la combinaison de tâches de quelqu'un d'autre.

PreuveSignificationComment l'utiliser
directCorrespondance exacte du modèle indépendantMeilleure preuve de classement disponible, tout en validant votre charge de travail
varianteCorrespondance avec un suffixe supprimé ou une variante d'instructionProcuration raisonnable ; le comportement peut différer après le réglage ou la quantification
modèle_de basePreuve héritée des métadonnées de base de la carte modèleTraitez comme directionnel, en particulier pour les fourches fortement réglées
interligne_ligneInterpolation sensible à la taille au sein d'une famille de modèlesUtile pour la découverte, faible pour les décisions d'achat ou de déploiement
auto_rapportéÉvaluation fournie par le téléchargeurFortement réduit; rechercher une reproduction indépendante
aucunAucune correspondance de référence utilisableNe lisez pas le classement numérique comme une qualité de tâche mesurée

Le projet rejette également certains héritages suspects lorsque le nombre de paramètres d'un candidat s'écarte trop de sa référence familiale. Cela réduit les erreurs telles qu'une petite tête de projet empruntant le benchmark d'une base beaucoup plus grande, mais aucun pipeline automatisé de dénomination et de métadonnées ne peut identifier chaque fork inhabituel.

L'ajustement, le contexte et la quantification sont couplés

Les poids des modèles ne sont que le début de l’utilisation de la mémoire. Un contexte plus long augmente la demande de cache KV ; les requêtes simultanées multiplient l'état d'exécution ; les apports de vision et les lots importants ajoutent de la pression ; les charges de travail d'affichage du bureau consomment de la VRAM ; et l'allocation de framework peut fragmenter la mémoire. Une recommandation produite pour un contexte 4K ne constitue pas une preuve que la même quantification servira un contexte 64K ou plusieurs utilisateurs.

La quantification introduit un deuxième compromis. Moins de bits réduit généralement le poids de la mémoire et peut augmenter le débit, mais la perte de qualité n'est pas uniforme selon les architectures, les tâches ou les quantificateurs. whichllm applique une pénalité de quantification dans le cadre du classement, mais les utilisateurs doivent comparer au moins deux variantes adjacentes (souvent une quantification moyenne conservatrice et une solution de repli plus petite) exactement sur les invites qu'ils ont l'intention d'exécuter.

Un workflow pratique de sélection de modèle local

  1. Écrivez d'abord le travail. Spécifiez le chat, le codage, l'extraction, la vision, le travail multilingue ou les mathématiques ; contexte cible ; latence acceptable ; et si les données doivent rester hors ligne.
  2. Enregistrez la machine. Capturez exactement le GPU et la mémoire, la RAM disponible, le système d'exploitation, le pilote/backend, le disque libre et l'utilisation du GPU en arrière-plan.
  3. Générez une liste restreinte conservatrice. Commencez par --gpu-only --speed utilisable --vram-headroom 1 Go. Utiliser --profil, --longueur-contexte et --quant pour correspondre à la charge de travail réelle.
  4. Inspectez la confiance. Préférez les preuves directes ou variantes lorsque les scores sont proches. Notez les dates des instantanés, les marqueurs de vitesse estimée et les avertissements de déchargement partiel.
  5. Présentez trois candidats. Testez la recommandation supérieure, un modèle ou une quantification adjacente et une ligne de base rapide plus petite. Un seul résultat ne peut révéler la frontière coût-qualité.
  6. Utilisez un ensemble d’évaluation privé. Incluez des invites représentatives, des cas extrêmes, des attentes de refus, des langues requises, des schémas de sortie structurés et une récupération de contexte long.
  7. Mesurer après correction. Suivez les réponses réussies, le temps de correction humaine, les jetons par seconde, la latence du premier jeton, la mémoire maximale, le temps de chargement et l'énergie, le cas échéant.
  8. Gelez le déploiement. Enregistrez le référentiel exact, la révision, le nom de fichier, la quantification, le runtime, les paramètres de contexte et le modèle d'invite. Un nom de modèle seul n’est pas reproductible.

Commandes utiles au-delà du classement par défaut

ObjectifModèle de commandeDécision qu’il soutient
Inspecter le matériel actuelMatériel whichllmVérifiez la détection avant de faire confiance aux estimations d'ajustement
Exigez une résidence GPU complètewhichllm --gpu uniquementÉvitez les candidats lents au déchargement PCIe/RAM système
Définir un plancher de vitessewhichllm --vitesse utilisable ou --vitesse min 20Supprimer les options techniquement exécutables mais opérationnellement lentes
Prévoyez un modèlewhichllm plan "nom du modèle"Estimer le matériel et la quantification dont la cible a besoin
Comparez les machineswhichllm mise à niveau "GPU A" "GPU B"Découvrez comment un achat modifie la frontière des candidats
Sélection automatiquewhichllm --top 1 --jsonAlimentez les ID de modèle et intégrez les métadonnées dans les scripts
Démarrer une discussion localewhichllm exécutionTéléchargez et testez un format sélectionné dans un environnement isolé

Où whichllm peut induire en erreur

  • La vitesse estimée n'est pas une référence sur votre machine. Les versions back-end, les horloges, les limites thermiques, le traitement rapide et la configuration du déchargement peuvent faire évoluer les performances.
  • La qualité globale cache les échecs des tâches. Un score général élevé peut ne pas prédire votre langage, votre base de code, votre corpus de récupération, votre fiabilité JSON ou votre politique de sécurité.
  • Les métadonnées du référentiel peuvent être incomplètes. Le nombre de paramètres, les liens vers le modèle de base, les licences et la qualité de conversion ne sont pas uniformément documentés sur Hugging Face.
  • Les sources actives peuvent échouer ou changer de forme. L'outil met en cache les données et peut recourir à des instantanés organisés ; lisez toujours la fraîcheur et la confiance affichées.
  • Le téléchargement est une action de la chaîne d’approvisionnement. Vérifiez la propriété du référentiel, les fichiers, les exigences du code distant, la licence et les hachages avant d'exécuter le modèle ou les artefacts Python.
  • L’adaptation à un seul utilisateur ne correspond pas à la capacité de service. Les exigences de concurrence, de traitement par lots, de croissance du contexte et de disponibilité exigent un véritable test de charge.

Alternatives et quand elles sont meilleures

OptionsMeilleur ajustementCompromis par rapport à whichllm
LM StudioDécouverte, téléchargement et chat sur ordinateur basés sur l'interface graphiqueInteraction plus facile ; moins adapté aux pipelines de classement transparents et scriptables
OllamaPackaging, service et intégration d'applications de modèles locaux simplesExcellent flux de travail d'exécution, mais la sélection du modèle reste souvent manuelle
llama.cppContrôle d'exécution GGUF à granularité fine et tests de performances directsPlus de contrôle opérationnel ; plus de connaissances requises pour présélectionner les modèles
Artificial AnalysisComparaison des données probantes sur l'intelligence, la rapidité et la qualité des modèles hébergés/ouvertsAnalyse de référence plus large ; ne remplace pas l'estimation d'ajustement local spécifique à la machine
LMArenaSignaux de préférence humaine et découverte de modèles côte à côtePreuve de préférence utile ; pas de VRAM, de quantification ou de planificateur de vitesse locale
Matrice de référence manuelleDes équipes à enjeux élevés avec une charge de travail privée stablePreuves les plus pertinentes, mais coûteuses à construire et à actualiser

Tableau de bord des décisions

Pour chaque candidat, enregistrez le taux de réussite des tâches, les minutes de correction, la latence du premier jeton, les jetons de génération par seconde, le pic de VRAM/RAM, le temps de chargement, le contexte utilisé, la validité de la sortie structurée, la licence, la provenance du modèle et la qualité des preuves. Pondérez les métriques avant de tester. Une équipe de codage peut donner la priorité à la précision du référentiel privé et à la fiabilité de JSON/outil, tandis qu'un assistant portable peut donner la priorité à la marge de mémoire, à la batterie et à la vitesse interactive.

Questions fréquemment posées

whichllm télécharge-t-il un modèle lorsque je demande des recommandations ?

Le flux de classement récupère et met en cache les métadonnées du modèle plutôt que de télécharger chaque candidat. Le courir Le workflow peut télécharger et lancer un modèle sélectionné, donc vérifiez l'espace disque, la confiance du référentiel et les dépendances d'exécution avant de l'utiliser.

Le résultat numéro un est-il garanti ?

Aucun estimateur ne peut garantir chaque configuration d’exécution. Laissez une marge, vérifiez le matériel et le contexte détectés, puis testez le fichier et le backend exacts. Utilisez le GPU complet et les filtres de vitesse lorsque la prévisibilité est importante.

Cela peut-il aider à choisir un GPU ?

Oui. Simulation GPU, planifier et mise à niveau peut comparer le matériel candidat. Traitez le résultat comme une preuve de planification et confirmez séparément les contraintes de prix, de puissance, de châssis, de pilote et de référence réelle.

Prend-il en charge les systèmes Apple Silicon et CPU uniquement ?

Le projet documente la détection Apple Silicon, NVIDIA, AMD, Intel et CPU. Le classement Apple Silicon et CPU uniquement est limité à GGUF pour la stabilité de l'exécution. Les performances réelles varient toujours selon la puce, la bande passante mémoire et la version backend.

Puis-je utiliser le résultat en automatisation ?

Oui. La sortie JSON inclut l’identité du modèle, l’ajustement, la mémoire estimée et les métadonnées de vitesse. Épinglez les versions et ajoutez une validation, car les inventaires de modèles vivants et les données de référence peuvent modifier le meilleur résultat.

whichllm est-il lui-même un coureur modèle ?

Sa valeur première est la sélection et la planification. Le courir La commande peut créer un environnement isolé et appeler des environnements d'exécution pris en charge, tandis que des outils dédiés tels que Ollama, llama.cpp ou une pile de service peuvent être meilleurs pour un déploiement en cours.

Sources officielles

Dernière révision le 25 juillet 2026. Les inventaires de modèles, les instantanés de référence, la compatibilité d'exécution et les prix du matériel changent ; réexécutez la CLI actuelle et validez l'artefact de modèle exact avant de prendre une décision.

Ready to try whichllm?

Visit the official website to get started

Visit whichllm

Quick Info

Added
6/10/2026
Published
6/10/2026
Updated
7/25/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

LMArena

LMArena

LMArena, auparavant connu via LMSYS Chatbot Arena/Chatbot Arena, est un leaderboard de préférence humaine pour comparer des modèles IA. Il est utile pour suivre la réputation des modèles, mais doit être combiné à des évaluations privées.

LMArenaChatbot ArenaLMSYS
660
Artificial Analysis

Artificial Analysis

Artificial Analysis est une plateforme indépendante de benchmarks pour comparer LLMs, modèles d’image et fournisseurs IA. Elle suit intelligence, vitesse, prix, contexte, latence, qualité et disponibilité pour choisir un modèle avant intégration.

Artificial Analysisbenchmark IAclassement LLM
600
LiveCodeBench

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark of LLMs for code that continuously collects new problems over time. - Outil IA intelligent pour améliorer votre productivité.

llm-leaderboardfree
520
Price Per Token

Price Per Token

Compare LLM API pricing across 200+ models from OpenAI, Anthropic, Google, and more. Includes token counters, cost calculators, and benchmark comparisons. - Outil IA intelligent pour améliorer votre productivité.

llm-leaderboardfree
460