whichllm
whichllm
Active

whichllm

whichllm 是一个开源 CLI,可检测本地硬件、估计内存和速度,并使用基准新鲜度和证据置信度对可运行的 Hugging Face 模型进行排名。本指南解释了其评分、安全安装设置、验证工作流程和替代方案。

169

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

本地 LLM 选择器硬件感知 AI基准测试排序离线模型

Product Preview

A quick visual look at whichllm before you visit the official site.

Published 6/10/2026
whichllm screenshot

Editorial Review

About whichllm

whichllm 回答了一个看似困难的本地人工智能问题:哪种模型和量化可能在这台特定计算机上提供最佳的有用质量?它检测 GPU、CPU、RAM 和存储,收集当前的 Hugging Face 候选者,估计运行时拟合和生成速度,然后将这些约束与基准证据相结合。结果是一个排名起点,而不是保证第一个模型最适合每个提示。

Official whichllm terminal demonstration showing hardware-aware local model recommendations
官方 whichllm 演示。有用的输出不仅仅是模型名称:拟合类型、内存、估计速度、分数和证据上下文有助于解释建议。图片来源:项目存储库。

whichllm 的不同之处

基本模型选择器会询问 VRAM 中适合多少参数。 whichllm 将其视为唯一一个约束。它的文档描述了一个从 Hugging Face 获取流行的、最近修改和策划的模型的管道;将相关存储库分组为模型系列;评估可用的量化;估计权重、KV 缓存、激活和框架开销;检查全 GPU、部分卸载或 CPU 适合度;然后使用标准化基准证据对候选人进行排名。

这很重要,因为最大的可运行文件并不自动是最佳选择。较新的 27B 模型可以胜过较旧的 32B 模型,专家混合模型的生成速度可以比其总参数计数建议的速度更快,并且技术上适合的模型可能为桌面、上下文缓存或运行时留下太少的空间。 whichllm 公开了这些权衡的控制,而不是将它们隐藏在“推荐”徽章后面。

快速启动和更安全的第一个命令

uvx whichllm@最新

# 保守的第一遍:完全 GPU 适配、可用速度、1 GB 净空
uvx whichllm@latest --gpu-only --可用速度 --vram-headroom 1GB

# 购买前模拟硬件
uvx whichllm@最新--gpu“RTX 4090”

# 比较升级候选者
uvx whichllm@最新升级“RTX 4090”“RTX 5090”“H100”

默认排名有意雄心勃勃:它可能包括近边缘 VRAM 适配和部分 RAM 卸载。对于重视可预测响应能力的用户来说,该项目的更安全的选择命令是更好的初始过滤器。如果另一个运行时仍然报告内存不足,请提高余量、缩短请求的上下文、选择较小的量化或检查后台 VRAM 使用情况,而不是假设估计器是错误的。

推荐管道的工作原理

舞台whichllm 评估什么为什么它改变了答案
硬件检测NVIDIA、AMD、Intel、Apple Silicon、CPU 功能、RAM 和可用磁盘即使宣传的内存大小相似,后端、统一内存和带宽也会有所不同
模型发现热门和最新的文本生成/GGUF 存储库、策划的前沿 ID 和愿景候选(应要求提供)静态列表很快就会过时,并且可能会错过可用的转换
家庭分组基础模型元数据和规范化存储库名称防止一个系列的多次重新包装挤满结果表
内存估计权重、KV 缓存、激活内存和框架开销适合磁盘或几乎匹配 VRAM 的文件在运行时仍可能失败
速度估算内存带宽、量化、后端、拟合类型和活动 MoE 参数当层溢出到系统 RAM 时,“可运行”可能意味着速度慢得无法使用
证据排名基准分数、新鲜度、匹配质量、量化、契合度、来源信任度和受欢迎度将直接证据与继承或上传者报告的声明分开

阅读证据标签

whichllm 将当前来源(例如 LiveBench、Artificial Analysis 和 Aider)与旧的冻结来源(例如 Open LLM Leaderboard v2 和 Chatbot Arena 覆盖范围)合并。分数被标准化,较旧的证据被模型谱系降级,因此过时的分数不应该默默地击败新一代。这很有用,但合并的基准仍然代表其他人的任务组合。

证据含义如何使用
直接精确的独立模型匹配最好的可用排名证据,但仍然验证您的工作量
变体后缀删除或指令变体匹配合理的代理;调谐或量化后行为可能会有所不同
基础模型通过模型卡基础元数据继承的证据视为方向性,特别是对于强力微调的前叉
行插补模型系列中的尺寸感知插值对于发现有用,但对于密切购买或部署决策较弱
自我报告上传者提供的评估大幅折扣;寻求独立繁衍
没有可用的基准匹配不要将数字排名视为衡量任务质量

当候选人的参数计数与其家族参考相差太远时,该项目还会拒绝一些可疑的继承。这减少了错误,例如小草案头借用了更大基础的基准,但没有自动命名和元数据管道可以识别每个不寻常的分叉。

拟合、上下文和量化是耦合的

模型权重只是内存使用的开始。更长的上下文会增加 KV 缓存需求;并发请求乘以运行时状态;视觉输入和大批量增加压力;桌面显示工作负载消耗 VRAM;框架分配可能会产生内存碎片。针对 4K 环境生成的建议并不能证明相同的量化可以为 64K 环境或多个用户提供服务。

量化引入了第二个权衡。较少的位数通常会减少内存重量并可能增加吞吐量,但质量损失在架构、任务或量化器之间并不统一。 whichllm 应用量化惩罚作为排名的一部分,但用户应该根据他们打算运行的提示来比较至少两个相邻的变体(通常是保守的中等量化和较小的后备)。

实用的本地模型选择工作流程

  1. 先写作业。 指定聊天、编码、提取、视觉、多语言工作或数学;目标环境;可接受的延迟;以及数据是否必须保持离线状态。
  2. 记录机器。 捕获准确的 GPU 和内存、可用 RAM、操作系统、驱动程序/后端、可用磁盘和后台 GPU 使用情况。
  3. 生成保守的候选名单。 开始于 --gpu-only --可用速度 --vram-headroom 1GB。使用 --个人资料, --上下文长度--定量 以配合实际工作量。
  4. 检查信心。 当分数接近时,更喜欢直接或变量证据。注意快照日期、估计速度标记和部分卸载警告。
  5. 竞选三名候选人。 测试最重要的推荐、相邻模型或量化以及较小的快速基线。一项结果无法揭示成本质量边界。
  6. 使用私人评估集。 包括代表性提示、边缘情况、拒绝期望、所需语言、结构化输出模式和长上下文检索。
  7. 校正后进行测量。 跟踪成功答案、人工纠正时间、每秒令牌、第一个令牌延迟、峰值内存、加载时间和相关能量。
  8. 冻结部署。 保存准确的存储库、修订版本、文件名、量化、运行时间、上下文设置和提示模板。单独的型号名称是不可复制的。

超出默认排名的有用命令

目标命令模式支持的决定
检查当前硬件whichllm 硬件在信任拟合估计之前验证检测
需要完整的 GPU 驻留whichllm --仅 GPU避免缓慢的 PCIe/系统 RAM 卸载候选者
设置速度楼层whichllm --可用速度--最小速度20删除技术上可运行但运行缓慢的选项
规划一种型号whichllm 计划“模型名称”估计目标需要什么硬件和量化
比较机器whichllm 升级“GPU A”“GPU B”了解购买如何改变候选边界
自动选择whichllm --top 1 --json提供模型 ID 并将元数据放入脚本中
开始本地聊天whichllm 运行在隔离环境中下载并测试选定的格式

whichllm 可能会产生误导

  • 估计速度不是您机器的基准。 后端版本、时钟、热限制、提示处理和卸载配置可以提高性能。
  • 总体质量隐藏了任务失败。 高总分可能无法预测您的语言、代码库、检索语料库、JSON 可靠性或安全策略。
  • 存储库元数据可能不完整。 Hugging Face 上未统一记录参数计数、基本模型链接、许可证和转换质量。
  • 实时源可能会发生故障或改变形状。 该工具会缓存数据并可以回退到策划的快照;始终阅读所表现出的新鲜感和自信。
  • 下载是供应链行为。 在执行模型或 Python 工件之前,检查存储库所有权、文件、远程代码要求、许可证和哈希值。
  • 单用户适配不是服务容量。 并发性、批处理、上下文增长和正常运行时间要求需要真正的负载测试。

替代方案以及何时它们更好

选项最适合与 whichllm 的权衡
LM StudioGUI 优先发现、下载和桌面聊天交互更便捷;不太适合透明、可编写脚本的排名管道
Ollama简单的本地模型打包、服务和应用程序集成出色的运行时工作流程,但模型选择通常仍然是手动的
llama.cpp细粒度的GGUF运行时控制和直接性能测试更多的操作控制;筛选模型需要更多知识
Artificial Analysis比较托管/开放模型的智能、速度和质量证据更广泛的基准分析;不取代特定于机器的局部拟合估计
LMArena人类偏好信号和并行模型发现有用的偏好证据;不是 VRAM、量化或本地速度规划器
手动基准矩阵具有稳定私人工作负载的高风险团队最相关的证据,但构建和更新成本高昂

决策记分卡

对于每个候选人,记录任务通过率、纠正分钟数、第一个令牌延迟、每秒生成令牌、峰值 VRAM/RAM、加载时间、使用的上下文、结构化输出有效性、许可证、模型来源和证据等级。在测试之前对指标进行加权。编码团队可能会优先考虑私有存储库的准确性和 JSON/工具可靠性,而笔记本电脑助手可能会优先考虑内存空间、电池和交互速度。

常见问题

当我请求推荐时,whichllm 是否会下载模型?

排名流程获取并缓存模型元数据,而不是下载每个候选者。的 工作流可以下载并启动选定的模型,因此在使用它之前请检查磁盘空间、存储库信任和运行时依赖性。

第一名的结果是否保证适合?

没有估算器可以保证每个运行时配置。留出空间,验证检测到的硬件和上下文,然后测试确切的文件和后端。当可预测性很重要时,请使用全 GPU 和速度过滤器。

它可以帮助选择 GPU 吗?

是的。 GPU模拟, 计划升级 可以比较候选硬件。将输出作为规划证据,并分别确认价格、功率、底盘、驾驶员和实际基准约束。

它是否支持 Apple Silicon 和仅 CPU 系统?

该项目记录了 Apple Silicon、NVIDIA、AMD、Intel 和 CPU 检测。为了运行时稳定性,Apple Silicon 和仅限 CPU 的排名仅限于 GGUF。实际性能仍然因芯片、内存带宽和后端构建而异。

我可以将结果用于自动化吗?

是的。 JSON 输出包括模型标识、拟合、估计内存和速度元数据。固定版本并添加验证,因为实时模型库存和基准数据可能会更改最高结果。

whichllm 本身是一个模型跑步者吗?

它的主要价值是选择和规划。的 命令可以创建一个隔离的环境并调用支持的运行时,而专用工具(例如 Ollama、llama.cpp 或服务堆栈)可能更适合持续部署。

官方消息来源

上次审核日期为 2026 年 7 月 25 日。模型库存、基准快照、运行时兼容性和硬件价格发生变化;在决定之前重新运行当前的 CLI 并验证确切的模型工件。

Ready to try whichllm?

Visit the official website to get started

Visit whichllm

Quick Info

Added
6/10/2026
Published
6/10/2026
Updated
9/8/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

LMArena

LMArena

LMArena,也就是过去常被称为 LMSYS Chatbot Arena / Chatbot Arena 的平台,是一个基于人类偏好的 AI 模型排行榜,覆盖文本和更多新模态。它适合追踪模型口碑,但不应作为唯一选型依据。

LMArenaChatbot ArenaLMSYS
1890
Artificial Analysis

Artificial Analysis

Artificial Analysis 是独立 AI 模型评测和对比平台,用于选择 LLM、图像模型和 AI 服务商。它追踪模型智能、速度、价格、上下文、延迟、质量和服务商可用性,帮助团队在接入模型前做决策。

Artificial AnalysisAI模型评测LLM排行榜
1380
LiveCodeBench

LiveCodeBench

LiveCodeBench is a holistic and contamination-free evaluation benchmark of LLMs for code that continuously collects new problems over time. - 智能 AI 工具,助力您的工作效率。

llm-leaderboardfree
1010
Price Per Token

Price Per Token

Compare LLM API pricing across 200+ models from OpenAI, Anthropic, Google, and more. Includes token counters, cost calculators, and benchmark comparisons. - 智能 AI 工具,助力您的工作效率。

llm-leaderboardfree
1200