如何快速选出最适合的本地大模型whichllm 的 LLM 选型实操指南【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllmwhichllm 是一款本地大模型推荐工具自动检测你的 GPU、CPU 与内存再对真正能跑起来的模型排序。不按参数数量与下载量选模型而是用真实基准测试得分与速度估算告诉你显存不够时该选哪个。 下载量最高的模型往往不是你能跑的那一个模型库里几百个大模型按下载量排序70B 级别的模型排在最前面。可你真把它拖进本地推理工具发现 8GB 显存显卡上的专用内存连压缩版都装不下。反过来的情况也常见勉强能跑的那个可能是很久之前发布的微调衍生版基准测试数据还没人补全。下载量和参数数量只回答“多少人选过它”和“它有多大”不回答“你能不能跑”“跑起来卡不卡”“它到底好不好”。对“本地跑大模型怎么选”这个问题后面三个问题才关键。 选型前先把两边数据备齐设备侧和模型侧设备侧你的电脑里有什么whichllm 启动时先做一轮硬件扫描检测逻辑按厂商分模块实现NVIDIA 和 AMD 分别走 nvidia-smi 与 rocm-smi 这类官方管理工具Intel 与 Apple 各有独立检测器Windows 与 Linux 系统各有一套路径任一环节失败会降级到备用方案。入口在 硬件检测模块。GPU 之外它还会读 CPU 型号、物理核心数、AVX2 等指令集支持以及内存容量和磁盘剩余空间。没有独显时这些信息就是纯 CPU 方案或混合卸载估算的全部依据。模型侧模型库里有什么模型数据抓取模块 从 HuggingFace 拉取热门、近期更新和趋势中的模型逐个记下参数量、量化类型、文件大小、下载量、点赞数和发布日期。量化把模型参数压缩成更小的存储格式用一点质量换显存Q4_K_M、IQ4_XS 是常见的量化档位。whichllm 用文件大小和量化档位判断某个版本实际会占用多少空间。质量数据来自 多个基准测试来源包括 Chatbot Arena、Open LLM Leaderboard 等分数统一归一化到 0–100 分制方便横向比较。⏳ 筛选漏斗先问能不能跑再问跑多快第一问能不能跑——显存不够时的三种答案兼容性检查 对每个候选模型给出三种落地方式全部进显存权重和 KV 缓存模型用来记住上下文的内存都在显卡上速度最好显存 内存混合一部分权重放显存剩余放系统内存能跑但会慢一截纯 CPU全部压在 CPU 上基本只在没有独显、或显存明显不够时才落到这里。它还会核对上下文长度你打算处理的长文本内存够不够撑住。第二问跑多快——估算结果带一个区间对能跑的模型速度估算模块 大约算出每秒生成多少 tokent/s可理解成模型每秒“吐”多少字。依据主要是三样显存带宽、量化后的实际参数规模、模型落在显卡上的比例。这是估算不是实测。whichllm 会附带置信度和可能的波动区间让你知道“30 t/s”是个把握较大的数还是只是“有机会到”。⚖️ 评分拆解哪些因素加分哪些减分每个通过筛选的候选都会得到一个 0–100 的质量分。各因素的方向如下因素对得分的影响独立基准测试分越高越加分独立榜单来源权重更高上传者自报的分权重最低参数量一般越大知识量越多但按对数刻度计不会线性碾压量化档位精度越低扣分越多高精度损失少落地方式全进显存不扣显存内存混合按卸载比例扣分纯 CPU 扣得最重估算速度越快越加分下载量、点赞小幅辅助加分官方发布官方机构出品加分衍生、重打包命名小幅扣分模型代际新一代模型加分同一家族同一模型的不同量化版本只保留表现最好的一个速度太慢或得分过低的结果直接过滤。具体实现可以看 评分与排序代码。 快速上手三步拿到推荐结果第一步克隆仓库git clone https://gitcode.com/GitHub_Trending/wh/whichllm第二步进入目录并安装依赖仓库自带uv.lock依赖锁定文件cd whichllm uv sync第三步直接运行uv run whichllm全程不需要你输入任何硬件型号或显存大小检测是自动完成的也不需要指定要试哪些模型它自己扫库、排序。想要更稳妥的结果只给全进显存且速度够用的模型加一个--gpu-only参数即可。从硬件检测到最终排序这一步都由它自动完成——你只管挑。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
