whichllm 回答了一个看似困难的本地人工智能问题:哪种模型和量化可能在这台特定计算机上提供最佳的有用质量?它检测 GPU、CPU、RAM 和存储,收集当前的 Hugging Face 候选者,估计运行时拟合和生成速度,然后将这些约束与基准证据相结合。结果是一个排名起点,而不是保证第一个模型最适合每个提示。
whichllm 的不同之处
基本模型选择器会询问 VRAM 中适合多少参数。 whichllm 将其视为唯一一个约束。它的文档描述了一个从 Hugging Face 获取流行的、最近修改和策划的模型的管道;将相关存储库分组为模型系列;评估可用的量化;估计权重、KV 缓存、激活和框架开销;检查全 GPU、部分卸载或 CPU 适合度;然后使用标准化基准证据对候选人进行排名。
这很重要,因为最大的可运行文件并不自动是最佳选择。较新的 27B 模型可以胜过较旧的 32B 模型,专家混合模型的生成速度可以比其总参数计数建议的速度更快,并且技术上适合的模型可能为桌面、上下文缓存或运行时留下太少的空间。 whichllm 公开了这些权衡的控制,而不是将它们隐藏在“推荐”徽章后面。
快速启动和更安全的第一个命令
uvx whichllm@最新
# 保守的第一遍:完全 GPU 适配、可用速度、1 GB 净空
uvx whichllm@latest --gpu-only --可用速度 --vram-headroom 1GB
# 购买前模拟硬件
uvx whichllm@最新--gpu“RTX 4090”
# 比较升级候选者
uvx whichllm@最新升级“RTX 4090”“RTX 5090”“H100”
默认排名有意雄心勃勃:它可能包括近边缘 VRAM 适配和部分 RAM 卸载。对于重视可预测响应能力的用户来说,该项目的更安全的选择命令是更好的初始过滤器。如果另一个运行时仍然报告内存不足,请提高余量、缩短请求的上下文、选择较小的量化或检查后台 VRAM 使用情况,而不是假设估计器是错误的。
推荐管道的工作原理
| 舞台 | whichllm 评估什么 | 为什么它改变了答案 |
|---|---|---|
| 硬件检测 | NVIDIA、AMD、Intel、Apple Silicon、CPU 功能、RAM 和可用磁盘 | 即使宣传的内存大小相似,后端、统一内存和带宽也会有所不同 |
| 模型发现 | 热门和最新的文本生成/GGUF 存储库、策划的前沿 ID 和愿景候选(应要求提供) | 静态列表很快就会过时,并且可能会错过可用的转换 |
| 家庭分组 | 基础模型元数据和规范化存储库名称 | 防止一个系列的多次重新包装挤满结果表 |
| 内存估计 | 权重、KV 缓存、激活内存和框架开销 | 适合磁盘或几乎匹配 VRAM 的文件在运行时仍可能失败 |
| 速度估算 | 内存带宽、量化、后端、拟合类型和活动 MoE 参数 | 当层溢出到系统 RAM 时,“可运行”可能意味着速度慢得无法使用 |
| 证据排名 | 基准分数、新鲜度、匹配质量、量化、契合度、来源信任度和受欢迎度 | 将直接证据与继承或上传者报告的声明分开 |
阅读证据标签
whichllm 将当前来源(例如 LiveBench、Artificial Analysis 和 Aider)与旧的冻结来源(例如 Open LLM Leaderboard v2 和 Chatbot Arena 覆盖范围)合并。分数被标准化,较旧的证据被模型谱系降级,因此过时的分数不应该默默地击败新一代。这很有用,但合并的基准仍然代表其他人的任务组合。
| 证据 | 含义 | 如何使用 |
|---|---|---|
| 直接 | 精确的独立模型匹配 | 最好的可用排名证据,但仍然验证您的工作量 |
| 变体 | 后缀删除或指令变体匹配 | 合理的代理;调谐或量化后行为可能会有所不同 |
| 基础模型 | 通过模型卡基础元数据继承的证据 | 视为方向性,特别是对于强力微调的前叉 |
| 行插补 | 模型系列中的尺寸感知插值 | 对于发现有用,但对于密切购买或部署决策较弱 |
| 自我报告 | 上传者提供的评估 | 大幅折扣;寻求独立繁衍 |
| 无 | 没有可用的基准匹配 | 不要将数字排名视为衡量任务质量 |
当候选人的参数计数与其家族参考相差太远时,该项目还会拒绝一些可疑的继承。这减少了错误,例如小草案头借用了更大基础的基准,但没有自动命名和元数据管道可以识别每个不寻常的分叉。
拟合、上下文和量化是耦合的
模型权重只是内存使用的开始。更长的上下文会增加 KV 缓存需求;并发请求乘以运行时状态;视觉输入和大批量增加压力;桌面显示工作负载消耗 VRAM;框架分配可能会产生内存碎片。针对 4K 环境生成的建议并不能证明相同的量化可以为 64K 环境或多个用户提供服务。
量化引入了第二个权衡。较少的位数通常会减少内存重量并可能增加吞吐量,但质量损失在架构、任务或量化器之间并不统一。 whichllm 应用量化惩罚作为排名的一部分,但用户应该根据他们打算运行的提示来比较至少两个相邻的变体(通常是保守的中等量化和较小的后备)。
实用的本地模型选择工作流程
- 先写作业。 指定聊天、编码、提取、视觉、多语言工作或数学;目标环境;可接受的延迟;以及数据是否必须保持离线状态。
- 记录机器。 捕获准确的 GPU 和内存、可用 RAM、操作系统、驱动程序/后端、可用磁盘和后台 GPU 使用情况。
- 生成保守的候选名单。 开始于
--gpu-only --可用速度 --vram-headroom 1GB。使用--个人资料,--上下文长度和--定量以配合实际工作量。 - 检查信心。 当分数接近时,更喜欢直接或变量证据。注意快照日期、估计速度标记和部分卸载警告。
- 竞选三名候选人。 测试最重要的推荐、相邻模型或量化以及较小的快速基线。一项结果无法揭示成本质量边界。
- 使用私人评估集。 包括代表性提示、边缘情况、拒绝期望、所需语言、结构化输出模式和长上下文检索。
- 校正后进行测量。 跟踪成功答案、人工纠正时间、每秒令牌、第一个令牌延迟、峰值内存、加载时间和相关能量。
- 冻结部署。 保存准确的存储库、修订版本、文件名、量化、运行时间、上下文设置和提示模板。单独的型号名称是不可复制的。
超出默认排名的有用命令
| 目标 | 命令模式 | 支持的决定 |
|---|---|---|
| 检查当前硬件 | whichllm 硬件 | 在信任拟合估计之前验证检测 |
| 需要完整的 GPU 驻留 | whichllm --仅 GPU | 避免缓慢的 PCIe/系统 RAM 卸载候选者 |
| 设置速度楼层 | whichllm --可用速度 或 --最小速度20 | 删除技术上可运行但运行缓慢的选项 |
| 规划一种型号 | whichllm 计划“模型名称” | 估计目标需要什么硬件和量化 |
| 比较机器 | whichllm 升级“GPU A”“GPU B” | 了解购买如何改变候选边界 |
| 自动选择 | whichllm --top 1 --json | 提供模型 ID 并将元数据放入脚本中 |
| 开始本地聊天 | whichllm 运行 | 在隔离环境中下载并测试选定的格式 |
whichllm 可能会产生误导
- 估计速度不是您机器的基准。 后端版本、时钟、热限制、提示处理和卸载配置可以提高性能。
- 总体质量隐藏了任务失败。 高总分可能无法预测您的语言、代码库、检索语料库、JSON 可靠性或安全策略。
- 存储库元数据可能不完整。 Hugging Face 上未统一记录参数计数、基本模型链接、许可证和转换质量。
- 实时源可能会发生故障或改变形状。 该工具会缓存数据并可以回退到策划的快照;始终阅读所表现出的新鲜感和自信。
- 下载是供应链行为。 在执行模型或 Python 工件之前,检查存储库所有权、文件、远程代码要求、许可证和哈希值。
- 单用户适配不是服务容量。 并发性、批处理、上下文增长和正常运行时间要求需要真正的负载测试。
替代方案以及何时它们更好
| 选项 | 最适合 | 与 whichllm 的权衡 |
|---|---|---|
| LM Studio | GUI 优先发现、下载和桌面聊天 | 交互更便捷;不太适合透明、可编写脚本的排名管道 |
| Ollama | 简单的本地模型打包、服务和应用程序集成 | 出色的运行时工作流程,但模型选择通常仍然是手动的 |
| llama.cpp | 细粒度的GGUF运行时控制和直接性能测试 | 更多的操作控制;筛选模型需要更多知识 |
| Artificial Analysis | 比较托管/开放模型的智能、速度和质量证据 | 更广泛的基准分析;不取代特定于机器的局部拟合估计 |
| LMArena | 人类偏好信号和并行模型发现 | 有用的偏好证据;不是 VRAM、量化或本地速度规划器 |
| 手动基准矩阵 | 具有稳定私人工作负载的高风险团队 | 最相关的证据,但构建和更新成本高昂 |
决策记分卡
对于每个候选人,记录任务通过率、纠正分钟数、第一个令牌延迟、每秒生成令牌、峰值 VRAM/RAM、加载时间、使用的上下文、结构化输出有效性、许可证、模型来源和证据等级。在测试之前对指标进行加权。编码团队可能会优先考虑私有存储库的准确性和 JSON/工具可靠性,而笔记本电脑助手可能会优先考虑内存空间、电池和交互速度。
常见问题
当我请求推荐时,whichllm 是否会下载模型?
排名流程获取并缓存模型元数据,而不是下载每个候选者。的 跑 工作流可以下载并启动选定的模型,因此在使用它之前请检查磁盘空间、存储库信任和运行时依赖性。
第一名的结果是否保证适合?
没有估算器可以保证每个运行时配置。留出空间,验证检测到的硬件和上下文,然后测试确切的文件和后端。当可预测性很重要时,请使用全 GPU 和速度过滤器。
它可以帮助选择 GPU 吗?
是的。 GPU模拟, 计划 和 升级 可以比较候选硬件。将输出作为规划证据,并分别确认价格、功率、底盘、驾驶员和实际基准约束。
它是否支持 Apple Silicon 和仅 CPU 系统?
该项目记录了 Apple Silicon、NVIDIA、AMD、Intel 和 CPU 检测。为了运行时稳定性,Apple Silicon 和仅限 CPU 的排名仅限于 GGUF。实际性能仍然因芯片、内存带宽和后端构建而异。
我可以将结果用于自动化吗?
是的。 JSON 输出包括模型标识、拟合、估计内存和速度元数据。固定版本并添加验证,因为实时模型库存和基准数据可能会更改最高结果。
whichllm 本身是一个模型跑步者吗?
它的主要价值是选择和规划。的 跑 命令可以创建一个隔离的环境并调用支持的运行时,而专用工具(例如 Ollama、llama.cpp 或服务堆栈)可能更适合持续部署。
官方消息来源
- whichllm 官方 GitHub 存储库和自述文件
- 官方架构和数据管道文档
- 官方评分文档
- 官方硬件检测和仿真文档
- 正式运行和代码片段工作流程
- 官方存储库中的 MIT 许可证
- Hugging Face 用于实时候选发现的模型目录
上次审核日期为 2026 年 7 月 25 日。模型库存、基准快照、运行时兼容性和硬件价格发生变化;在决定之前重新运行当前的 CLI 并验证确切的模型工件。




