项目详情

llmfit

「我的机器能跑什么模型?」——一条命令,从猜到算,从算到测

GitHub 地址 MIT 36.1k Stars / 7 个月 Rust · 单二进制 众包 benchmark 闭环

更新于 2026-09-12

← 返回汇总
项目速览

一句话定位

本地 LLM 的第一问,被工具化了

每个跑本地大模型的人都问过:「我这台机器到底能跑哪个模型?」llmfit 把这个问题工具化:自动检测 CPU/RAM/GPU/VRAM/统一内存,对数百个模型按 fit/speed/quality/context 四维评分,给出量化建议与 tok/s 预估。Rust 单二进制,TUI/Web/API 三形态,SignPath 签名,brew/scoop/crates/pip/Docker 全渠道发行。杀手锏是众包基准回流:TUI 内实测 tok/s 直接 PR 回项目,合并后随 release 分发——同硬件用户看到的是实测值而非估算。7 个月 36.1k stars。

项目速览

核心数据

36.1k
Stars(7 个月)
2,285
Forks
4 维
评分(fit/speed/质量/上下文)
10+
发行渠道
v1.1.15
高频 release
4 加速栈
CUDA/Metal/ROCm/OneAPI
5 运行时
Ollama/llama.cpp/MLX…
3 语言
README(英中日)

数据来源:GitHub API,采集于 2026-09-12。MIT;Rust 单二进制 + SignPath 代码签名;#1005 PR、v1.1.15——社区贡献高频合入。

为什么存在

本地 LLM 的第一问,没有第一工具

「能跑吗」全靠试

下载 33GB 的模型 → OOM → 换量化 → 再试。每一步十分钟,信息全靠社区帖子口口相传。GPU 差异(带宽/显存/统一内存)让经验不可迁移。

网页工具是静态的

「can my PC run it」类网页工具不检测真实硬件、不覆盖量化矩阵、更不会随新模型更新——答案永远是笼统的。

llmfit 的三步走

检测 → 评分 → 实测回流:本地硬件探测给出个性化推荐;估算带完整输入透明可查;实测数据社区回流形成数据飞轮。


7 个月 36.1k stars 的本质:本地 LLM 用户基数爆炸,而「第一问」此前只有论坛帖子没有工具。谁先工具化谁吃红利。

核心机制

四维评分与估算透明

输入:硬件探测 CPU 核数 · 系统 RAM · 离散/集成 GPU · VRAM 统一内存架构(Apple Silicon)· 加速栈(CUDA/Metal/ROCm/OneAPI) llmfit doctor 输出完整探测报告(issue 调试用) 模型目录 × 量化矩阵 数百模型 × GGUF/AWQ/GPTQ/EXL2 量化 MoE 架构支持 · 动态量化推荐 · 自定义模型可加 目录可持续扩充(社区 PR 主要来源) 四维评分输出 memory fit(内存余量)· estimated speed(内存带宽模型 tok/s)· quality(量化代价)· context(上下文支持) 透明原则:每个估算数字附带其输入假设——llmfit info 显示「这个数字假设了什么」以及「如何在你机器上验证」
输入与输出 匹配计算
杀手锏

众包基准回流:估算的终局是实测

① 估算 带宽模型 + 运行时采样 给出 tok/s 预估与全部输入假设 ② 下载实测 TUI 内下载模型 → 连本地运行时 llmfit bench 测真实 tok/s / TTFT ③ TUI 内直接 PR 结果先存本地(自己的表变实测) 无需 gh CLI / 第三方账号 ④ 随 release 分发 合并的数据进下个 release 同硬件用户直接见 ✓ 实测 飞轮:实测数据让估算越来越准 → 更多用户 → 更多实测数据 这一机制的本质:把「用户跑工具」这个动作变成数据生产——估算 → 实测 → 分发 → 再估算的工具型数据飞轮
单用户闭环 社区分发
形态与发行

一个引擎,三种形态,十条渠道

三形态

交互 TUI(默认,含排行榜/模拟/下载)· Web Dashboard + REST API(/api/v1/system · /api/v1/models,供编排器与 Agent 调用)· 经典 CLI(fit/recommend/info/bench/doctor)

发行面

scoop · brew · MacPorts · curl 脚本 · uv/pip · crates.io · 签名二进制(SignPath)· 多架构 Docker(TUI 与 headless 双模式)

生态位

入口层:fit 推荐之后接 Ollama/llama.cpp/MLX/LM Studio 下载执行——不做运行时,做运行时之上的「选型层」。另有 OpenClaw Agent 集成文档。


llmfit recommend --json  # JSON 输出供脚本/Agent 消费
llmfit bench --share     # 实测并回流社区
llmfit info "qwen3-32b"  # 单模型:估算依据 + 验证命令
工程文化

「估算附带输入」的透明原则

  • 估算可审计:llmfit info 显示每个 tok/s 数字的假设(带宽取值/量化/上下文)与在本机验证的命令——估算不装成实测
  • SignPath 代码签名:二进制签名分发——Rust CLI 工具里少见的供应链自觉
  • cargo fmt 纪律:README 把「CI 失败大多是格式问题」写在贡献指南第一条
  • 三语 README:英中日同步——本地 LLM 用户全球分布的直接响应
  • 生态矩阵:sympozium(K8s Agent)/ llmserve / llama-panel / 社区 GUI——作者围绕「本地 LLM 工具链」持续铺设产品面
  • 替代品坦诚列出:README 有 Alternatives 段落——自信的产品不怕对比
风险与局限

估算模型的天然边界

潜力评估

打分

维度评分依据
痛点精准度
本地 LLM 第一问的工具化,7 个月 36k stars 验证
数据飞轮
估算→实测→PR→分发的闭环设计是真正的护城河
工程完成度
Rust 单二进制/签名/全渠道/三形态/估算透明
估算精度
热门硬件准,长尾外推有偏差(机制上会收敛)
独立性
不做运行时只做选型层——定位克制,不与 Ollama 竞争

综合 8.5/10。产品定位克制、飞轮设计聪明、工程质量齐整——「估算透明 + 实测回流」是这个项目最值得抄的产品思路:不完美的估算 + 可信的校准通道,胜过完美的黑盒。

最终裁决

适合谁,不适合谁

用
  • 任何想跑本地 LLM 的人:装它,第一问不再靠猜
  • 多机用户/集群运维:REST API 输出 JSON 供编排器消费
  • Agent 开发者:作为 Skill 让 LLM 自己查询「这台机器能跑什么」(OpenClaw 集成文档现成)
  • 硬件极客:bench --share 给社区喂数据,赚一个 ✓ 标记
别指望
  • 代替实测(估算就是估算,冷门硬件偏差更大)
  • 推理性能调优(它告诉你能不能跑,不告诉你跑得快不快的极限)
  • 云端 GPU 选型(核心场景是本地硬件)

上一个
CloddsBot
下一个
LinkSwift
内存 fit 计算器 →
1 / 11