whichllm responde a una pregunta engañosamente difícil sobre la IA local: ¿qué modelo y cuantificación pueden ofrecer la mejor calidad útil en esta computadora específica? Detecta GPU, CPU, RAM y almacenamiento, recopila candidatos Hugging Face actuales, estima el ajuste del tiempo de ejecución y la velocidad de generación y luego combina esas limitaciones con evidencia comparativa. El resultado es un punto de partida clasificado, no una promesa de que el primer modelo será el mejor para cada solicitud.
Qué hace whichllm de manera diferente
Un selector de modelo básico pregunta cuántos parámetros caben en la VRAM. whichllm lo trata como una sola restricción. Su documentación describe una canalización que recupera modelos populares, recientemente modificados y seleccionados de Hugging Face; agrupa repositorios relacionados en familias modelo; evalúa las cuantificaciones disponibles; estima pesos, caché KV, activaciones y sobrecarga del marco; comprueba la GPU completa, la descarga parcial o el ajuste de la CPU; y luego clasifica a los candidatos utilizando evidencia de referencia normalizada.
Esto es importante porque el archivo ejecutable más grande no es automáticamente la mejor opción. Un modelo 27B más nuevo puede superar a un modelo 32B más antiguo, un modelo mixto de expertos puede generar más rápido de lo que sugiere su recuento total de parámetros, y un modelo que técnicamente se ajusta puede dejar muy poco espacio para un escritorio, caché de contexto o tiempo de ejecución. whichllm expone controles para estas compensaciones en lugar de ocultarlas detrás de una insignia de "recomendado".
Inicio rápido y el primer comando más seguro
uvx whichllm@latest
# Primer paso conservador: ajuste completo de GPU, velocidad utilizable, 1 GB de espacio libre
uvx whichllm@latest --sólo gpu --velocidad utilizable --vram-headroom 1GB
# Simular hardware antes de comprarlo
uvx whichllm@latest --gpu "RTX 4090"
# Comparar candidatos a actualización
uvx whichllm@última actualización "RTX 4090" "RTX 5090" "H100"
La clasificación predeterminada es intencionalmente ambiciosa: puede incluir ajustes de VRAM cercanos al borde y descarga parcial de RAM. El comando de selección más segura del proyecto es un mejor filtro inicial para los usuarios que valoran la capacidad de respuesta predecible. Si otro tiempo de ejecución aún informa memoria insuficiente, aumente el margen, acorte el contexto solicitado, elija una cuantificación más pequeña o inspeccione el uso de VRAM en segundo plano en lugar de asumir que el estimador es incorrecto.
Cómo funciona el canal de recomendaciones
| etapa | Qué evalúa whichllm | ¿Por qué cambia la respuesta? |
|---|---|---|
| Detección de hardware | NVIDIA, AMD, Intel, Apple Silicon, características de CPU, RAM y disco libre | El backend, la memoria unificada y el ancho de banda difieren incluso en tamaños de memoria anunciados similares |
| Descubrimiento de modelos | Repositorios populares y recientes de generación de texto/GGUF, identificaciones de frontera seleccionadas y candidatos de visión cuando se soliciten | Una lista estática se vuelve obsoleta rápidamente y puede perder conversiones utilizables. |
| Agrupación familiar | Metadatos del modelo base y nombres de repositorios normalizados | Evita que muchos reempaquetados de una familia abarroten la tabla de resultados. |
| Estimación de memoria | Pesos, caché KV, memoria de activación y sobrecarga del marco | Un archivo que cabe en el disco o que casi coincide con la VRAM aún puede fallar en tiempo de ejecución |
| Estimación de velocidad | Ancho de banda de memoria, cuantificación, backend, tipo de ajuste y parámetros MoE activos | "Ejecutable" puede significar inutilizablemente lento cuando las capas se derraman en la RAM del sistema |
| Clasificación de evidencia | Puntuación de referencia, frescura, calidad de coincidencia, cuantificación, ajuste, confianza en la fuente y popularidad | Separa la evidencia directa de los reclamos heredados o reportados por quienes los subieron |
Leer las etiquetas de evidencia
whichllm fusiona fuentes actuales como LiveBench, Artificial Analysis y Aider con fuentes congeladas más antiguas como la cobertura Open LLM Leaderboard v2 y Chatbot Arena. Las puntuaciones se normalizan y la evidencia más antigua se degrada según el linaje del modelo, por lo que una puntuación obsoleta no debería vencer silenciosamente a una generación más nueva. Esto es útil, pero los puntos de referencia fusionados aún representan la combinación de tareas de otra persona.
| evidencia | Significado | como usarlo |
|---|---|---|
| directo | Coincidencia exacta del modelo independiente | La mejor evidencia de clasificación disponible, pero aun así valida tu carga de trabajo |
| variante | Coincidencia de variante de instrucción o sin sufijo | Representante razonable; El comportamiento puede diferir después de la afinación o la cuantización. |
| modelo_base | Evidencia heredada a través de metadatos base de tarjetas modelo | Trátelo como direccional, especialmente para horquillas muy afinadas. |
| interp_linea | Interpolación basada en el tamaño dentro de una familia de modelos | Útil para el descubrimiento, débil para decisiones cercanas de compra o implementación. |
| auto_reportado | Evaluación proporcionada por el cargador | Grandes descuentos; buscar reproducción independiente |
| ninguno | No hay coincidencia de referencia utilizable | No lea el rango numérico como calidad de tarea medida |
El proyecto también rechaza algunas herencias sospechosas cuando el recuento de parámetros de un candidato difiere demasiado de su referencia familiar. Eso reduce errores como que un pequeño borrador tome prestado el punto de referencia de una base mucho más grande, pero ningún canal automatizado de nombres y metadatos puede identificar cada bifurcación inusual.
El ajuste, el contexto y la cuantificación están acoplados
Los pesos de los modelos son sólo el comienzo del uso de la memoria. Un contexto más prolongado aumenta la demanda de caché KV; las solicitudes simultáneas multiplican el estado de ejecución; las entradas de visión y los lotes grandes añaden presión; las cargas de trabajo de pantallas de escritorio consumen VRAM; y la asignación del marco puede fragmentar la memoria. Una recomendación elaborada para un contexto de 4K no es evidencia de que la misma cuantificación sirva para un contexto de 64K o para múltiples usuarios.
La cuantificación introduce una segunda compensación. Menos bits suelen reducir el peso de la memoria y pueden aumentar el rendimiento, pero la pérdida de calidad no es uniforme entre arquitecturas, tareas o cuantificadores. whichllm aplica una penalización de cuantificación como parte de la clasificación; sin embargo, los usuarios deben comparar al menos dos variantes adyacentes (a menudo una cuantificación media conservadora y un retroceso más pequeño) exactamente en las indicaciones que desean ejecutar.
Un flujo de trabajo práctico de selección de modelos locales
- Escribe el trabajo primero. Especifique chat, codificación, extracción, visión, trabajo multilingüe o matemáticas; contexto objetivo; latencia aceptable; y si los datos deben permanecer fuera de línea.
- Graba la máquina. Capture GPU y memoria exactas, RAM disponible, sistema operativo, controlador/backend, disco libre y uso de GPU en segundo plano.
- Genere una lista corta conservadora. Empezar con
--sólo gpu --velocidad utilizable --vram-headroom 1GB. uso--perfil,--longitud-contextoy--cuantitativopara adaptarse a la carga de trabajo real. - Inspeccionar la confianza. Prefiera evidencia directa o variante cuando las puntuaciones estén cercanas. Tenga en cuenta las fechas de las instantáneas, los marcadores de velocidad estimada y las advertencias de descarga parcial.
- Presenta tres candidatos. Pruebe la recomendación principal, un modelo o cuantificación adyacente y una línea de base rápida más pequeña. Un resultado no puede revelar la frontera costo-calidad.
- Utilice un conjunto de evaluación privado. Incluya indicaciones representativas, casos extremos, expectativas de rechazo, lenguajes requeridos, esquemas de salida estructurados y recuperación de contexto prolongado.
- Medida después de la corrección. Realice un seguimiento de las respuestas exitosas, el tiempo de corrección humana, los tokens por segundo, la latencia del primer token, la memoria máxima, el tiempo de carga y la energía, cuando sea relevante.
- Congele la implementación. Guarde el repositorio exacto, la revisión, el nombre de archivo, la cuantificación, el tiempo de ejecución, la configuración de contexto y la plantilla de aviso. El nombre de un modelo por sí solo no es reproducible.
Comandos útiles más allá de la clasificación predeterminada
| Objetivo | Patrón de comando | Decisión que apoya |
|---|---|---|
| Inspeccionar el hardware actual | whichllm hardware | Verifique la detección antes de confiar en las estimaciones de ajuste |
| Exija residencia completa de GPU | whichllm --solo gpu | Evite los candidatos de descarga lenta de PCIe/RAM del sistema |
| Establecer un piso de velocidad | whichllm --velocidad utilizable o --velocidad mínima 20 | Eliminar opciones técnicamente ejecutables pero operativamente lentas |
| Plan para un modelo | whichllm plan "nombre del modelo" | Estimar qué hardware y cuantificación necesita el objetivo. |
| Comparar máquinas | whichllm actualización "GPU A" "GPU B" | Vea cómo una compra cambia la frontera del candidato |
| Automatizar la selección | whichllm --top 1 --json | Alimente los ID de los modelos y ajuste los metadatos en los scripts |
| Iniciar un chat local | whichllm ejecutar | Descargue y pruebe un formato seleccionado en un entorno aislado |
Donde whichllm puede inducir a error
- La velocidad estimada no es un punto de referencia en su máquina. Las versiones de backend, los relojes, los límites térmicos, el procesamiento rápido y la configuración de descarga pueden alterar el rendimiento.
- La calidad agregada oculta los fallos de las tareas. Es posible que una puntuación general alta no prediga su idioma, base de código, corpus de recuperación, JSON confiabilidad o política de seguridad.
- Los metadatos del repositorio pueden estar incompletos. Los recuentos de parámetros, los enlaces del modelo base, las licencias y la calidad de la conversión no están documentados de manera uniforme en Hugging Face.
- Las fuentes en vivo pueden fallar o cambiar de forma. La herramienta almacena datos en caché y puede recurrir a instantáneas seleccionadas; Lea siempre la frescura y confianza mostradas.
- La descarga es una acción de la cadena de suministro. Revise la propiedad del repositorio, los archivos, los requisitos del código remoto, la licencia y los hash antes de ejecutar el modelo o los artefactos de Python.
- La adaptación de un solo usuario no equivale a capacidad de servicio. Los requisitos de simultaneidad, procesamiento por lotes, crecimiento del contexto y tiempo de actividad exigen una prueba de carga real.
Alternativas y cuándo son mejores
| Opción | Mejor ajuste | Compensación versus whichllm |
|---|---|---|
| LM Studio | Descubrimiento, descarga y chat de escritorio con GUI primero | Interacción más fácil; menos adecuado para canalizaciones de clasificación transparentes y programables |
| Ollama | Integración de aplicaciones, servicio y empaquetado de modelos locales simples | Excelente flujo de trabajo en tiempo de ejecución, pero la selección del modelo a menudo sigue siendo manual |
| llama.cpp | Control de tiempo de ejecución detallado GGUF y pruebas directas de rendimiento | Más control operativo; Se requieren más conocimientos para preseleccionar modelos. |
| Artificial Analysis | Comparación de inteligencia, velocidad y evidencia de calidad de modelos alojados/abiertos | Análisis de referencia más amplio; no reemplaza la estimación de ajuste local específica de la máquina |
| LMArena | Señales de preferencia humana y descubrimiento de modelos en paralelo | Evidencia de preferencia útil; no es una VRAM, cuantificación o planificador de velocidad local |
| Matriz de referencia manual | Equipos de alto riesgo con una carga de trabajo privada estable | Evidencia más relevante, pero costosa de construir y actualizar |
Cuadro de mando de decisiones
Para cada candidato, registre la tasa de aprobación de tareas, los minutos de corrección, la latencia del primer token, los tokens de generación por segundo, el pico de VRAM/RAM, el tiempo de carga, el contexto utilizado, la validez de la salida estructurada, la licencia, la procedencia del modelo y el grado de evidencia. Pondere las métricas antes de realizar la prueba. Un equipo de codificación puede priorizar la precisión del repositorio privado y la confiabilidad de JSON/herramienta, mientras que un asistente de computadora portátil puede priorizar el espacio de memoria, la batería y la velocidad interactiva.
Preguntas frecuentes
¿whichllm descarga un modelo cuando solicito recomendaciones?
El flujo de clasificación recupera y almacena en caché los metadatos del modelo en lugar de descargar a todos los candidatos. el correr El flujo de trabajo puede descargar e iniciar un modelo seleccionado, así que revise el espacio en disco, la confianza del repositorio y las dependencias del tiempo de ejecución antes de usarlo.
¿Está garantizado que el resultado número uno encajará?
Ningún estimador puede garantizar todas las configuraciones de tiempo de ejecución. Deje espacio libre, verifique el hardware y el contexto detectados, luego pruebe el archivo y el backend exactos. Utilice filtros de velocidad y GPU completa cuando la previsibilidad sea importante.
¿Puede ayudar a elegir una GPU?
Sí. simulación de GPU, planear y actualizar puede comparar el hardware candidato. Trate el resultado como evidencia de planificación y confirme por separado las limitaciones de precio, potencia, chasis, conductor y puntos de referencia reales.
¿Es compatible con Apple Silicon y sistemas solo con CPU?
El proyecto documenta Apple Silicon, NVIDIA, AMD, Intel y detección de CPU. Apple Silicon y la clasificación solo de CPU está restringida a GGUF para la estabilidad del tiempo de ejecución. El rendimiento real aún varía según el chip, el ancho de banda de la memoria y la construcción del backend.
¿Puedo utilizar el resultado en automatización?
Sí. La salida JSON incluye metadatos de identidad, ajuste, memoria estimada y velocidad del modelo. Fije versiones y agregue validación porque los inventarios de modelos en vivo y los datos de referencia pueden cambiar el resultado principal.
¿Es el propio whichllm un corredor modelo?
Su valor principal es la selección y la planificación. el correr El comando puede crear un entorno aislado e invocar tiempos de ejecución compatibles, mientras que herramientas dedicadas como Ollama, llama.cpp o una pila de servicio pueden ser mejores para una implementación continua.
Fuentes oficiales
- whichllm repositorio oficial de GitHub y README
- Documentación oficial de arquitectura y canalización de datos.
- Documentación oficial de puntuación
- Documentación oficial de detección y simulación de hardware.
- Flujo de trabajo oficial de ejecución y fragmentos de código
- Licencia MIT en el repositorio oficial
- Hugging Face catálogo de modelos utilizado para el descubrimiento de candidatos en vivo
Revisado por última vez el 25 de julio de 2026. Los inventarios de modelos, las instantáneas de referencia, la compatibilidad del tiempo de ejecución y los precios del hardware cambian; Vuelva a ejecutar la CLI actual y valide el artefacto del modelo exacto antes de decidir.




