whichllm
whichllm
Active

whichllm

whichllm es una CLI de código abierto que detecta hardware local, estima la memoria y la velocidad y clasifica los modelos Hugging Face ejecutables utilizando la frescura de las pruebas comparativas y la confianza de la evidencia. Esta guía explica su puntuación, configuración de ajuste seguro, flujo de trabajo de validación y alternativas.

81

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

selector de LLM localAI segun hardwareranking por benchmarksmodelos offline

Product Preview

A quick visual look at whichllm before you visit the official site.

Published 6/10/2026
whichllm screenshot

Editorial Review

About whichllm

whichllm responde a una pregunta engañosamente difícil sobre la IA local: ¿qué modelo y cuantificación pueden ofrecer la mejor calidad útil en esta computadora específica? Detecta GPU, CPU, RAM y almacenamiento, recopila candidatos Hugging Face actuales, estima el ajuste del tiempo de ejecución y la velocidad de generación y luego combina esas limitaciones con evidencia comparativa. El resultado es un punto de partida clasificado, no una promesa de que el primer modelo será el mejor para cada solicitud.

Official whichllm terminal demonstration showing hardware-aware local model recommendations
Demostración oficial whichllm. El resultado útil no es simplemente el nombre del modelo: el tipo de ajuste, la memoria, la velocidad estimada, la puntuación y el contexto de la evidencia ayudan a explicar la recomendación. Fuente de la imagen: repositorio de proyectos.

Qué hace whichllm de manera diferente

Un selector de modelo básico pregunta cuántos parámetros caben en la VRAM. whichllm lo trata como una sola restricción. Su documentación describe una canalización que recupera modelos populares, recientemente modificados y seleccionados de Hugging Face; agrupa repositorios relacionados en familias modelo; evalúa las cuantificaciones disponibles; estima pesos, caché KV, activaciones y sobrecarga del marco; comprueba la GPU completa, la descarga parcial o el ajuste de la CPU; y luego clasifica a los candidatos utilizando evidencia de referencia normalizada.

Esto es importante porque el archivo ejecutable más grande no es automáticamente la mejor opción. Un modelo 27B más nuevo puede superar a un modelo 32B más antiguo, un modelo mixto de expertos puede generar más rápido de lo que sugiere su recuento total de parámetros, y un modelo que técnicamente se ajusta puede dejar muy poco espacio para un escritorio, caché de contexto o tiempo de ejecución. whichllm expone controles para estas compensaciones en lugar de ocultarlas detrás de una insignia de "recomendado".

Inicio rápido y el primer comando más seguro

uvx whichllm@latest

# Primer paso conservador: ajuste completo de GPU, velocidad utilizable, 1 GB de espacio libre
uvx whichllm@latest --sólo gpu --velocidad utilizable --vram-headroom 1GB

# Simular hardware antes de comprarlo
uvx whichllm@latest --gpu "RTX 4090"

# Comparar candidatos a actualización
uvx whichllm@última actualización "RTX 4090" "RTX 5090" "H100"

La clasificación predeterminada es intencionalmente ambiciosa: puede incluir ajustes de VRAM cercanos al borde y descarga parcial de RAM. El comando de selección más segura del proyecto es un mejor filtro inicial para los usuarios que valoran la capacidad de respuesta predecible. Si otro tiempo de ejecución aún informa memoria insuficiente, aumente el margen, acorte el contexto solicitado, elija una cuantificación más pequeña o inspeccione el uso de VRAM en segundo plano en lugar de asumir que el estimador es incorrecto.

Cómo funciona el canal de recomendaciones

etapaQué evalúa whichllm¿Por qué cambia la respuesta?
Detección de hardwareNVIDIA, AMD, Intel, Apple Silicon, características de CPU, RAM y disco libreEl backend, la memoria unificada y el ancho de banda difieren incluso en tamaños de memoria anunciados similares
Descubrimiento de modelosRepositorios populares y recientes de generación de texto/GGUF, identificaciones de frontera seleccionadas y candidatos de visión cuando se solicitenUna lista estática se vuelve obsoleta rápidamente y puede perder conversiones utilizables.
Agrupación familiarMetadatos del modelo base y nombres de repositorios normalizadosEvita que muchos reempaquetados de una familia abarroten la tabla de resultados.
Estimación de memoriaPesos, caché KV, memoria de activación y sobrecarga del marcoUn archivo que cabe en el disco o que casi coincide con la VRAM aún puede fallar en tiempo de ejecución
Estimación de velocidadAncho de banda de memoria, cuantificación, backend, tipo de ajuste y parámetros MoE activos"Ejecutable" puede significar inutilizablemente lento cuando las capas se derraman en la RAM del sistema
Clasificación de evidenciaPuntuación de referencia, frescura, calidad de coincidencia, cuantificación, ajuste, confianza en la fuente y popularidadSepara la evidencia directa de los reclamos heredados o reportados por quienes los subieron

Leer las etiquetas de evidencia

whichllm fusiona fuentes actuales como LiveBench, Artificial Analysis y Aider con fuentes congeladas más antiguas como la cobertura Open LLM Leaderboard v2 y Chatbot Arena. Las puntuaciones se normalizan y la evidencia más antigua se degrada según el linaje del modelo, por lo que una puntuación obsoleta no debería vencer silenciosamente a una generación más nueva. Esto es útil, pero los puntos de referencia fusionados aún representan la combinación de tareas de otra persona.

evidenciaSignificadocomo usarlo
directoCoincidencia exacta del modelo independienteLa mejor evidencia de clasificación disponible, pero aun así valida tu carga de trabajo
varianteCoincidencia de variante de instrucción o sin sufijoRepresentante razonable; El comportamiento puede diferir después de la afinación o la cuantización.
modelo_baseEvidencia heredada a través de metadatos base de tarjetas modeloTrátelo como direccional, especialmente para horquillas muy afinadas.
interp_lineaInterpolación basada en el tamaño dentro de una familia de modelosÚtil para el descubrimiento, débil para decisiones cercanas de compra o implementación.
auto_reportadoEvaluación proporcionada por el cargadorGrandes descuentos; buscar reproducción independiente
ningunoNo hay coincidencia de referencia utilizableNo lea el rango numérico como calidad de tarea medida

El proyecto también rechaza algunas herencias sospechosas cuando el recuento de parámetros de un candidato difiere demasiado de su referencia familiar. Eso reduce errores como que un pequeño borrador tome prestado el punto de referencia de una base mucho más grande, pero ningún canal automatizado de nombres y metadatos puede identificar cada bifurcación inusual.

El ajuste, el contexto y la cuantificación están acoplados

Los pesos de los modelos son sólo el comienzo del uso de la memoria. Un contexto más prolongado aumenta la demanda de caché KV; las solicitudes simultáneas multiplican el estado de ejecución; las entradas de visión y los lotes grandes añaden presión; las cargas de trabajo de pantallas de escritorio consumen VRAM; y la asignación del marco puede fragmentar la memoria. Una recomendación elaborada para un contexto de 4K no es evidencia de que la misma cuantificación sirva para un contexto de 64K o para múltiples usuarios.

La cuantificación introduce una segunda compensación. Menos bits suelen reducir el peso de la memoria y pueden aumentar el rendimiento, pero la pérdida de calidad no es uniforme entre arquitecturas, tareas o cuantificadores. whichllm aplica una penalización de cuantificación como parte de la clasificación; sin embargo, los usuarios deben comparar al menos dos variantes adyacentes (a menudo una cuantificación media conservadora y un retroceso más pequeño) exactamente en las indicaciones que desean ejecutar.

Un flujo de trabajo práctico de selección de modelos locales

  1. Escribe el trabajo primero. Especifique chat, codificación, extracción, visión, trabajo multilingüe o matemáticas; contexto objetivo; latencia aceptable; y si los datos deben permanecer fuera de línea.
  2. Graba la máquina. Capture GPU y memoria exactas, RAM disponible, sistema operativo, controlador/backend, disco libre y uso de GPU en segundo plano.
  3. Genere una lista corta conservadora. Empezar con --sólo gpu --velocidad utilizable --vram-headroom 1GB. uso --perfil, --longitud-contexto y --cuantitativo para adaptarse a la carga de trabajo real.
  4. Inspeccionar la confianza. Prefiera evidencia directa o variante cuando las puntuaciones estén cercanas. Tenga en cuenta las fechas de las instantáneas, los marcadores de velocidad estimada y las advertencias de descarga parcial.
  5. Presenta tres candidatos. Pruebe la recomendación principal, un modelo o cuantificación adyacente y una línea de base rápida más pequeña. Un resultado no puede revelar la frontera costo-calidad.
  6. Utilice un conjunto de evaluación privado. Incluya indicaciones representativas, casos extremos, expectativas de rechazo, lenguajes requeridos, esquemas de salida estructurados y recuperación de contexto prolongado.
  7. Medida después de la corrección. Realice un seguimiento de las respuestas exitosas, el tiempo de corrección humana, los tokens por segundo, la latencia del primer token, la memoria máxima, el tiempo de carga y la energía, cuando sea relevante.
  8. Congele la implementación. Guarde el repositorio exacto, la revisión, el nombre de archivo, la cuantificación, el tiempo de ejecución, la configuración de contexto y la plantilla de aviso. El nombre de un modelo por sí solo no es reproducible.

Comandos útiles más allá de la clasificación predeterminada

ObjetivoPatrón de comandoDecisión que apoya
Inspeccionar el hardware actualwhichllm hardwareVerifique la detección antes de confiar en las estimaciones de ajuste
Exija residencia completa de GPUwhichllm --solo gpuEvite los candidatos de descarga lenta de PCIe/RAM del sistema
Establecer un piso de velocidadwhichllm --velocidad utilizable o --velocidad mínima 20Eliminar opciones técnicamente ejecutables pero operativamente lentas
Plan para un modelowhichllm plan "nombre del modelo"Estimar qué hardware y cuantificación necesita el objetivo.
Comparar máquinaswhichllm actualización "GPU A" "GPU B"Vea cómo una compra cambia la frontera del candidato
Automatizar la selecciónwhichllm --top 1 --jsonAlimente los ID de los modelos y ajuste los metadatos en los scripts
Iniciar un chat localwhichllm ejecutarDescargue y pruebe un formato seleccionado en un entorno aislado

Donde whichllm puede inducir a error

  • La velocidad estimada no es un punto de referencia en su máquina. Las versiones de backend, los relojes, los límites térmicos, el procesamiento rápido y la configuración de descarga pueden alterar el rendimiento.
  • La calidad agregada oculta los fallos de las tareas. Es posible que una puntuación general alta no prediga su idioma, base de código, corpus de recuperación, JSON confiabilidad o política de seguridad.
  • Los metadatos del repositorio pueden estar incompletos. Los recuentos de parámetros, los enlaces del modelo base, las licencias y la calidad de la conversión no están documentados de manera uniforme en Hugging Face.
  • Las fuentes en vivo pueden fallar o cambiar de forma. La herramienta almacena datos en caché y puede recurrir a instantáneas seleccionadas; Lea siempre la frescura y confianza mostradas.
  • La descarga es una acción de la cadena de suministro. Revise la propiedad del repositorio, los archivos, los requisitos del código remoto, la licencia y los hash antes de ejecutar el modelo o los artefactos de Python.
  • La adaptación de un solo usuario no equivale a capacidad de servicio. Los requisitos de simultaneidad, procesamiento por lotes, crecimiento del contexto y tiempo de actividad exigen una prueba de carga real.

Alternativas y cuándo son mejores

OpciónMejor ajusteCompensación versus whichllm
LM StudioDescubrimiento, descarga y chat de escritorio con GUI primeroInteracción más fácil; menos adecuado para canalizaciones de clasificación transparentes y programables
OllamaIntegración de aplicaciones, servicio y empaquetado de modelos locales simplesExcelente flujo de trabajo en tiempo de ejecución, pero la selección del modelo a menudo sigue siendo manual
llama.cppControl de tiempo de ejecución detallado GGUF y pruebas directas de rendimientoMás control operativo; Se requieren más conocimientos para preseleccionar modelos.
Artificial AnalysisComparación de inteligencia, velocidad y evidencia de calidad de modelos alojados/abiertosAnálisis de referencia más amplio; no reemplaza la estimación de ajuste local específica de la máquina
LMArenaSeñales de preferencia humana y descubrimiento de modelos en paraleloEvidencia de preferencia útil; no es una VRAM, cuantificación o planificador de velocidad local
Matriz de referencia manualEquipos de alto riesgo con una carga de trabajo privada estableEvidencia más relevante, pero costosa de construir y actualizar

Cuadro de mando de decisiones

Para cada candidato, registre la tasa de aprobación de tareas, los minutos de corrección, la latencia del primer token, los tokens de generación por segundo, el pico de VRAM/RAM, el tiempo de carga, el contexto utilizado, la validez de la salida estructurada, la licencia, la procedencia del modelo y el grado de evidencia. Pondere las métricas antes de realizar la prueba. Un equipo de codificación puede priorizar la precisión del repositorio privado y la confiabilidad de JSON/herramienta, mientras que un asistente de computadora portátil puede priorizar el espacio de memoria, la batería y la velocidad interactiva.

Preguntas frecuentes

¿whichllm descarga un modelo cuando solicito recomendaciones?

El flujo de clasificación recupera y almacena en caché los metadatos del modelo en lugar de descargar a todos los candidatos. el correr El flujo de trabajo puede descargar e iniciar un modelo seleccionado, así que revise el espacio en disco, la confianza del repositorio y las dependencias del tiempo de ejecución antes de usarlo.

¿Está garantizado que el resultado número uno encajará?

Ningún estimador puede garantizar todas las configuraciones de tiempo de ejecución. Deje espacio libre, verifique el hardware y el contexto detectados, luego pruebe el archivo y el backend exactos. Utilice filtros de velocidad y GPU completa cuando la previsibilidad sea importante.

¿Puede ayudar a elegir una GPU?

Sí. simulación de GPU, planear y actualizar puede comparar el hardware candidato. Trate el resultado como evidencia de planificación y confirme por separado las limitaciones de precio, potencia, chasis, conductor y puntos de referencia reales.

¿Es compatible con Apple Silicon y sistemas solo con CPU?

El proyecto documenta Apple Silicon, NVIDIA, AMD, Intel y detección de CPU. Apple Silicon y la clasificación solo de CPU está restringida a GGUF para la estabilidad del tiempo de ejecución. El rendimiento real aún varía según el chip, el ancho de banda de la memoria y la construcción del backend.

¿Puedo utilizar el resultado en automatización?

Sí. La salida JSON incluye metadatos de identidad, ajuste, memoria estimada y velocidad del modelo. Fije versiones y agregue validación porque los inventarios de modelos en vivo y los datos de referencia pueden cambiar el resultado principal.

¿Es el propio whichllm un corredor modelo?

Su valor principal es la selección y la planificación. el correr El comando puede crear un entorno aislado e invocar tiempos de ejecución compatibles, mientras que herramientas dedicadas como Ollama, llama.cpp o una pila de servicio pueden ser mejores para una implementación continua.

Fuentes oficiales

Revisado por última vez el 25 de julio de 2026. Los inventarios de modelos, las instantáneas de referencia, la compatibilidad del tiempo de ejecución y los precios del hardware cambian; Vuelva a ejecutar la CLI actual y valide el artefacto del modelo exacto antes de decidir.

Ready to try whichllm?

Visit the official website to get started

Visit whichllm

Quick Info

Added
6/10/2026
Published
6/10/2026
Updated
9/9/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

LMArena

LMArena

LMArena, antes conocido por la marca LMSYS Chatbot Arena/Chatbot Arena, es un leaderboard de preferencias humanas para comparar modelos de IA. Es útil para seguir reputación de modelos, pero debe combinarse con evaluaciones privadas.

LMArenaChatbot ArenaLMSYS
1060
Artificial Analysis

Artificial Analysis

Artificial Analysis es una plataforma independiente para comparar modelos de IA, LLMs, modelos de imagen y proveedores. Mide inteligencia, velocidad, precio, contexto, latencia, calidad y disponibilidad para elegir modelos antes de construir o comprar.

Artificial Analysisbenchmark IAranking LLM
2550
LiveCodeBench

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark of LLMs for code that continuously collects new problems over time. - Herramienta de IA inteligente para mejorar tu productividad.

llm-leaderboardfree
850
Price Per Token

Price Per Token

Compare LLM API pricing across 200+ models from OpenAI, Anthropic, Google, and more. Includes token counters, cost calculators, and benchmark comparisons. - Herramienta de IA inteligente para mejorar tu productividad.

llm-leaderboardfree
930