先看内存是否值得试
如果权重预算已经超限,就先降低模型规模或量化位宽,不要浪费时间下载后再 OOM。
先判断模型在内存层面是否值得尝试,再进入真实 runtime 测试。这个工具刻意不猜速度,只公开权重估算、平台安全余量和 Context/Runtime 预留。
如果权重预算已经超限,就先降低模型规模或量化位宽,不要浪费时间下载后再 OOM。
能装下只代表内存第一关通过。速度、首 Token、长上下文、并发和发热必须在目标设备上实测。
移动端和统一内存设备尤其需要给系统、UI、KV cache 和其他任务留下空间。工具默认使用保守预算。
量化的“有效 bits/weight”是用于预算的近似值,不代表每个 GGUF 文件都完全相同;不同模型架构的 KV cache、MoE 专家、Vision/Audio 模块和 runtime workspace 都可能显著改变真实占用。因此结果用于筛选“值不值得继续测试”,而不是替代 llama.cpp、MLX、Ollama 或 App 内真实加载数据。
它不是只计算模型权重,而是把平台安全保留和你自己设定的 Context/Runtime 预留一起扣除,回答“是否值得继续做真实加载测试”。它不提供速度预测。
不同平台需要给操作系统、图形栈、应用本身和其他任务留下不同余量。这里采用保守的预算档位,目的是避免把理论可装下误写成稳定可用。
生成速度取决于内存带宽、计算能力、runtime、算子实现、上下文长度、批量、KV cache、CPU/GPU offload 等。仅凭参数量和内存无法可靠推断。
不能完全等价。工具显示的是 dense 权重式内存预算,MoE 还要区分总参数、active parameters、专家加载方式和 runtime。遇到 MoE 时应把结果当作保守的第一步检查。
不会。输入和计算都在浏览器完成,不需要登录。分享链接只包含你主动选择的内存、参数量、量化和预留值。