whichllm répond à une question d’IA locale trompeusement difficile : quel modèle et quelle quantification sont susceptibles de fournir la meilleure qualité utile sur cet ordinateur spécifique ? Il détecte le GPU, le CPU, la RAM et le stockage, collecte les candidats Hugging Face actuels, estime l'adéquation de l'exécution et la vitesse de génération, puis combine ces contraintes avec des preuves de référence. Le résultat est un point de départ classé, et non une promesse que le premier modèle sera le meilleur pour chaque invite.
Ce que whichllm fait différemment
Un sélecteur de modèle de base demande combien de paramètres tiennent dans la VRAM. whichllm traite cela comme une seule contrainte. Sa documentation décrit un pipeline qui récupère des modèles populaires, récemment modifiés et organisés à partir de Hugging Face ; regroupe les référentiels associés en familles modèles ; évalue les quantifications disponibles ; estime les poids, le cache KV, les activations et la surcharge du framework ; vérifie l'adéquation du GPU complet, du déchargement partiel ou du CPU ; puis classe les candidats à l'aide de preuves de référence normalisées.
Ceci est important car le fichier exécutable le plus volumineux n’est pas automatiquement le meilleur choix. Un modèle 27B plus récent peut surpasser un modèle 32B plus ancien, un modèle mixte d'experts peut générer plus rapidement que son nombre total de paramètres ne le suggère, et un modèle techniquement adapté peut laisser trop peu de marge pour un bureau, un cache contextuel ou un environnement d'exécution. whichllm expose les contrôles de ces compromis au lieu de les cacher derrière un badge « recommandé ».
Démarrage rapide et première commande plus sûre
uvx whichllm@dernier
# Premier passage conservateur : ajustement complet du GPU, vitesse utilisable, marge de 1 Go
uvx whichllm@latest --gpu-only --speed utilisable --vram-headroom 1 Go
# Simulez le matériel avant de l'acheter
uvx whichllm@latest --gpu "RTX 4090"
# Comparez les candidats à la mise à niveau
uvx whichllm@dernière mise à niveau "RTX 4090" "RTX 5090" "H100"
Le classement par défaut est intentionnellement ambitieux : il peut inclure des ajustements VRAM proches et un déchargement partiel de la RAM. La commande Safer-pick du projet constitue un meilleur filtre initial pour les utilisateurs qui apprécient une réactivité prévisible. Si un autre moteur d'exécution signale toujours une mémoire insuffisante, augmentez la marge, raccourcissez le contexte demandé, choisissez une quantification plus petite ou inspectez l'utilisation de la VRAM en arrière-plan au lieu de supposer que l'estimateur est erroné.
Comment fonctionne le pipeline de recommandations
| Scène | Ce que whichllm évalue | Pourquoi ça change la réponse |
|---|---|---|
| Détection du matériel | NVIDIA, AMD, Intel, Apple Silicon, fonctionnalités du processeur, RAM et disque libre | Le backend, la mémoire unifiée et la bande passante diffèrent même à des tailles de mémoire annoncées similaires |
| Découverte du modèle | Référentiels de génération de texte/GGUF populaires et récents, identifiants de frontière organisés et candidats à la vision sur demande | Une liste statique devient rapidement obsolète et peut manquer des conversions utilisables |
| Regroupement familial | Métadonnées du modèle de base et noms de référentiels normalisés | Empêche de nombreux reconditionnements d'une famille d'encombrer la table des résultats |
| Estimation de la mémoire | Poids, cache KV, mémoire d'activation et surcharge du framework | Un fichier qui tient sur le disque ou correspond presque à la VRAM peut toujours échouer au moment de l'exécution |
| Estimation de la vitesse | Bande passante mémoire, quantification, backend, type d'ajustement et paramètres MoE actifs | « Exécutable » peut signifier une lenteur inutilisable lorsque les couches débordent dans la RAM du système |
| Classement des preuves | Score de référence, fraîcheur, qualité de correspondance, quantification, ajustement, confiance dans la source et popularité | Sépare les preuves directes des réclamations héritées ou signalées par le téléchargeur |
Lire les étiquettes des preuves
whichllm fusionne les sources actuelles telles que LiveBench, Artificial Analysis et Aider avec des sources gelées plus anciennes telles que la couverture Open LLM Leaderboard v2 et Chatbot Arena. Les scores sont normalisés et les preuves plus anciennes sont rétrogradées par la lignée du modèle, de sorte qu'un score obsolète ne devrait pas silencieusement battre une génération plus récente. C'est utile, mais les références fusionnées représentent toujours la combinaison de tâches de quelqu'un d'autre.
| Preuve | Signification | Comment l'utiliser |
|---|---|---|
| direct | Correspondance exacte du modèle indépendant | Meilleure preuve de classement disponible, tout en validant votre charge de travail |
| variante | Correspondance avec un suffixe supprimé ou une variante d'instruction | Procuration raisonnable ; le comportement peut différer après le réglage ou la quantification |
| modèle_de base | Preuve héritée des métadonnées de base de la carte modèle | Traitez comme directionnel, en particulier pour les fourches fortement réglées |
| interligne_ligne | Interpolation sensible à la taille au sein d'une famille de modèles | Utile pour la découverte, faible pour les décisions d'achat ou de déploiement |
| auto_rapporté | Évaluation fournie par le téléchargeur | Fortement réduit; rechercher une reproduction indépendante |
| aucun | Aucune correspondance de référence utilisable | Ne lisez pas le classement numérique comme une qualité de tâche mesurée |
Le projet rejette également certains héritages suspects lorsque le nombre de paramètres d'un candidat s'écarte trop de sa référence familiale. Cela réduit les erreurs telles qu'une petite tête de projet empruntant le benchmark d'une base beaucoup plus grande, mais aucun pipeline automatisé de dénomination et de métadonnées ne peut identifier chaque fork inhabituel.
L'ajustement, le contexte et la quantification sont couplés
Les poids des modèles ne sont que le début de l’utilisation de la mémoire. Un contexte plus long augmente la demande de cache KV ; les requêtes simultanées multiplient l'état d'exécution ; les apports de vision et les lots importants ajoutent de la pression ; les charges de travail d'affichage du bureau consomment de la VRAM ; et l'allocation de framework peut fragmenter la mémoire. Une recommandation produite pour un contexte 4K ne constitue pas une preuve que la même quantification servira un contexte 64K ou plusieurs utilisateurs.
La quantification introduit un deuxième compromis. Moins de bits réduit généralement le poids de la mémoire et peut augmenter le débit, mais la perte de qualité n'est pas uniforme selon les architectures, les tâches ou les quantificateurs. whichllm applique une pénalité de quantification dans le cadre du classement, mais les utilisateurs doivent comparer au moins deux variantes adjacentes (souvent une quantification moyenne conservatrice et une solution de repli plus petite) exactement sur les invites qu'ils ont l'intention d'exécuter.
Un workflow pratique de sélection de modèle local
- Écrivez d'abord le travail. Spécifiez le chat, le codage, l'extraction, la vision, le travail multilingue ou les mathématiques ; contexte cible ; latence acceptable ; et si les données doivent rester hors ligne.
- Enregistrez la machine. Capturez exactement le GPU et la mémoire, la RAM disponible, le système d'exploitation, le pilote/backend, le disque libre et l'utilisation du GPU en arrière-plan.
- Générez une liste restreinte conservatrice. Commencez par
--gpu-only --speed utilisable --vram-headroom 1 Go. Utiliser--profil,--longueur-contexteet--quantpour correspondre à la charge de travail réelle. - Inspectez la confiance. Préférez les preuves directes ou variantes lorsque les scores sont proches. Notez les dates des instantanés, les marqueurs de vitesse estimée et les avertissements de déchargement partiel.
- Présentez trois candidats. Testez la recommandation supérieure, un modèle ou une quantification adjacente et une ligne de base rapide plus petite. Un seul résultat ne peut révéler la frontière coût-qualité.
- Utilisez un ensemble d’évaluation privé. Incluez des invites représentatives, des cas extrêmes, des attentes de refus, des langues requises, des schémas de sortie structurés et une récupération de contexte long.
- Mesurer après correction. Suivez les réponses réussies, le temps de correction humaine, les jetons par seconde, la latence du premier jeton, la mémoire maximale, le temps de chargement et l'énergie, le cas échéant.
- Gelez le déploiement. Enregistrez le référentiel exact, la révision, le nom de fichier, la quantification, le runtime, les paramètres de contexte et le modèle d'invite. Un nom de modèle seul n’est pas reproductible.
Commandes utiles au-delà du classement par défaut
| Objectif | Modèle de commande | Décision qu’il soutient |
|---|---|---|
| Inspecter le matériel actuel | Matériel whichllm | Vérifiez la détection avant de faire confiance aux estimations d'ajustement |
| Exigez une résidence GPU complète | whichllm --gpu uniquement | Évitez les candidats lents au déchargement PCIe/RAM système |
| Définir un plancher de vitesse | whichllm --vitesse utilisable ou --vitesse min 20 | Supprimer les options techniquement exécutables mais opérationnellement lentes |
| Prévoyez un modèle | whichllm plan "nom du modèle" | Estimer le matériel et la quantification dont la cible a besoin |
| Comparez les machines | whichllm mise à niveau "GPU A" "GPU B" | Découvrez comment un achat modifie la frontière des candidats |
| Sélection automatique | whichllm --top 1 --json | Alimentez les ID de modèle et intégrez les métadonnées dans les scripts |
| Démarrer une discussion locale | whichllm exécution | Téléchargez et testez un format sélectionné dans un environnement isolé |
Où whichllm peut induire en erreur
- La vitesse estimée n'est pas une référence sur votre machine. Les versions back-end, les horloges, les limites thermiques, le traitement rapide et la configuration du déchargement peuvent faire évoluer les performances.
- La qualité globale cache les échecs des tâches. Un score général élevé peut ne pas prédire votre langage, votre base de code, votre corpus de récupération, votre fiabilité JSON ou votre politique de sécurité.
- Les métadonnées du référentiel peuvent être incomplètes. Le nombre de paramètres, les liens vers le modèle de base, les licences et la qualité de conversion ne sont pas uniformément documentés sur Hugging Face.
- Les sources actives peuvent échouer ou changer de forme. L'outil met en cache les données et peut recourir à des instantanés organisés ; lisez toujours la fraîcheur et la confiance affichées.
- Le téléchargement est une action de la chaîne d’approvisionnement. Vérifiez la propriété du référentiel, les fichiers, les exigences du code distant, la licence et les hachages avant d'exécuter le modèle ou les artefacts Python.
- L’adaptation à un seul utilisateur ne correspond pas à la capacité de service. Les exigences de concurrence, de traitement par lots, de croissance du contexte et de disponibilité exigent un véritable test de charge.
Alternatives et quand elles sont meilleures
| Options | Meilleur ajustement | Compromis par rapport à whichllm |
|---|---|---|
| LM Studio | Découverte, téléchargement et chat sur ordinateur basés sur l'interface graphique | Interaction plus facile ; moins adapté aux pipelines de classement transparents et scriptables |
| Ollama | Packaging, service et intégration d'applications de modèles locaux simples | Excellent flux de travail d'exécution, mais la sélection du modèle reste souvent manuelle |
| llama.cpp | Contrôle d'exécution GGUF à granularité fine et tests de performances directs | Plus de contrôle opérationnel ; plus de connaissances requises pour présélectionner les modèles |
| Artificial Analysis | Comparaison des données probantes sur l'intelligence, la rapidité et la qualité des modèles hébergés/ouverts | Analyse de référence plus large ; ne remplace pas l'estimation d'ajustement local spécifique à la machine |
| LMArena | Signaux de préférence humaine et découverte de modèles côte à côte | Preuve de préférence utile ; pas de VRAM, de quantification ou de planificateur de vitesse locale |
| Matrice de référence manuelle | Des équipes à enjeux élevés avec une charge de travail privée stable | Preuves les plus pertinentes, mais coûteuses à construire et à actualiser |
Tableau de bord des décisions
Pour chaque candidat, enregistrez le taux de réussite des tâches, les minutes de correction, la latence du premier jeton, les jetons de génération par seconde, le pic de VRAM/RAM, le temps de chargement, le contexte utilisé, la validité de la sortie structurée, la licence, la provenance du modèle et la qualité des preuves. Pondérez les métriques avant de tester. Une équipe de codage peut donner la priorité à la précision du référentiel privé et à la fiabilité de JSON/outil, tandis qu'un assistant portable peut donner la priorité à la marge de mémoire, à la batterie et à la vitesse interactive.
Questions fréquemment posées
whichllm télécharge-t-il un modèle lorsque je demande des recommandations ?
Le flux de classement récupère et met en cache les métadonnées du modèle plutôt que de télécharger chaque candidat. Le courir Le workflow peut télécharger et lancer un modèle sélectionné, donc vérifiez l'espace disque, la confiance du référentiel et les dépendances d'exécution avant de l'utiliser.
Le résultat numéro un est-il garanti ?
Aucun estimateur ne peut garantir chaque configuration d’exécution. Laissez une marge, vérifiez le matériel et le contexte détectés, puis testez le fichier et le backend exacts. Utilisez le GPU complet et les filtres de vitesse lorsque la prévisibilité est importante.
Cela peut-il aider à choisir un GPU ?
Oui. Simulation GPU, planifier et mise à niveau peut comparer le matériel candidat. Traitez le résultat comme une preuve de planification et confirmez séparément les contraintes de prix, de puissance, de châssis, de pilote et de référence réelle.
Prend-il en charge les systèmes Apple Silicon et CPU uniquement ?
Le projet documente la détection Apple Silicon, NVIDIA, AMD, Intel et CPU. Le classement Apple Silicon et CPU uniquement est limité à GGUF pour la stabilité de l'exécution. Les performances réelles varient toujours selon la puce, la bande passante mémoire et la version backend.
Puis-je utiliser le résultat en automatisation ?
Oui. La sortie JSON inclut l’identité du modèle, l’ajustement, la mémoire estimée et les métadonnées de vitesse. Épinglez les versions et ajoutez une validation, car les inventaires de modèles vivants et les données de référence peuvent modifier le meilleur résultat.
whichllm est-il lui-même un coureur modèle ?
Sa valeur première est la sélection et la planification. Le courir La commande peut créer un environnement isolé et appeler des environnements d'exécution pris en charge, tandis que des outils dédiés tels que Ollama, llama.cpp ou une pile de service peuvent être meilleurs pour un déploiement en cours.
Sources officielles
- whichllm dépôt GitHub officiel et README
- Architecture officielle et documentation du pipeline de données
- Documentation officielle de notation
- Documentation officielle de détection et de simulation de matériel
- Flux de travail officiel d'exécution et d'extrait de code
- Licence MIT dans le dépôt officiel
- Catalogue de modèles Hugging Face utilisé pour la découverte de candidats en direct
Dernière révision le 25 juillet 2026. Les inventaires de modèles, les instantanés de référence, la compatibilité d'exécution et les prix du matériel changent ; réexécutez la CLI actuelle et validez l'artefact de modèle exact avant de prendre une décision.




