本地推理 · 硬件自检

我的电脑能跑哪些大模型

浏览器直接读取你的显卡与内存信息,逐个算出模型能装下的量化档位与大致生成速度。 所有计算都在本地完成,不会上传任何硬件信息。

正在读取显卡信息…
量化

结果是怎么算出来的

  1. 显存需求:权重体积 = 参数量 × 量化系数(Q4_K_M 取 0.6 GB/B、Q8_0 取 1.1、FP16 取 2.0), 再叠加 KV Cache、运行时开销与安全余量。MoE 模型的专家权重需全部常驻,因此按总参数计算占用。
  2. 生成速度:单路解码是彻底的 memory-bound —— 每吐一个 token 都要把权重完整读一遍,所以tokens/s ≈ 内存带宽 ÷ 权重体积 × 0.7。MoE 每步只读激活的那部分专家,因此明显更快; 需要把层卸载到内存由 CPU 计算时,速度会掉到约 1/8。
  3. 可用容量:独立显卡按显存减去约 1GB 显示与驱动占用;统一内存与纯内存推理按扣除系统占用后的约 70% 计。

这些是量级估算,不是实测值。实际表现还受量化实现、上下文长度、并发数与推理框架影响, 用于选型足够,做容量规划请以实测为准。

致谢

本页的产品思路与评级形式参考了开源项目 canirun.ai(作者 midudev,MIT License)。 评分算法、GPU 规格库与中文模型数据由 LLMCN 独立实现,与原项目无隶属关系。

canirun.ai 源码仓库

选好模型后,到 部署 拿一键运行命令; 想看完整的量化-显存对照表,点开模型详情页的「硬件需求」一节。