本地推理 · 硬件自检

我的电脑能跑哪些大模型

浏览器直接读取你的显卡与内存信息,按「模型 × 量化格式 × 推理框架 × 硬件」四要素给出兼容判定。 所有计算都在本地完成,不会上传任何硬件信息。

正在读取显卡信息…
量化
框架
上下文

量化越低体积越小、推理越快,但精度略降;显存紧张优先 Q4_K_M,追求质量上 Q6_K / Q8_0。 上下文越长 KV Cache 越大,判定会随之变化 —— 这不是同一个结论换个显示。

结果是怎么算出来的

  1. 权重体积总参数量 × 有效位宽 ÷ 8。有效位宽取自量化格式的实测口径 —— GGUF 的 k-quants 含 scale/zero-point 与打包对齐,Q4_K_M 实际约 4.85 bits/权重而非 4.0。 MoE 模型的专家权重必须全部常驻,因此按总参数量算体积;激活参数只用于速度估算。
  2. KV Cache:优先用模型结构精确计算2 × layers × kv_heads × head_dim × context × dtype; 缺结构字段时退化为按参数量的保守启发式,并如实标注为估算;两者都拿不到就返回「无法估算」, 不会编一个数字。
  3. 可用容量:独显扣除显示输出与驱动预留(计算卡无显示输出,预留更少); 统一内存按 macOS 允许 GPU 占用的上限折算,而不是把整机内存当显存。
  4. 速度:单路解码是彻底的 memory-bound,tokens/s ≈ 带宽 × 效率 ÷ 每 token 读取量。 MoE 每步只读激活的专家,因此比同规模 dense 快得多;需要 CPU 卸载时速度掉一个量级。 结果只给区间与档位 —— 报单值是虚假精确。
  5. 兼容性:容量之外还要过运行环境三关 —— 框架是否认这个格式(Ollama 不吃 AWQ)、 是否支持当前系统(vLLM 不支持 Windows / macOS)、是否支持当前显卡厂商(MLX 只认 Apple)。 任一不通过,显存再大也是「不建议」。

每条结论都带置信度:规格来源可信、依据完整才是「高置信」;靠推断补齐的会降档。 关键规格缺失时直接返回「数据不足」,不用 0 或默认值糊过去。 这些是量级估算,不是实测值 —— 用于选型足够,做容量规划请以实测为准。

致谢

本页的产品思路与交互形式参考了开源项目 canirun.ai(作者 midudev,MIT License)。 判定引擎、GPU 规格库与中文模型数据由 LLMCN 独立实现,与原项目无隶属关系。

canirun.ai 源码仓库

选好模型后,到 部署 拿一键运行命令; 想看完整的量化-显存对照表,点开模型详情页的「硬件需求」一节。