Local AI / Memory Fit

Local AI Model Fit:本地模型内存预算与量化适配工具

先判断模型在内存层面是否值得尝试,再进入真实 runtime 测试。这个工具刻意不猜速度,只公开权重估算、平台安全余量和 Context/Runtime 预留。

浏览器本地计算GGUF 量化Apple / Mobile / GPU不预测速度

工具操作

Method

这个结果应该怎么用?

先看内存是否值得试

如果权重预算已经超限,就先降低模型规模或量化位宽,不要浪费时间下载后再 OOM。

再做真实 Runtime 测试

能装下只代表内存第一关通过。速度、首 Token、长上下文、并发和发热必须在目标设备上实测。

保留余量而不是卡极限

移动端和统一内存设备尤其需要给系统、UI、KV cache 和其他任务留下空间。工具默认使用保守预算。

计算边界

量化的“有效 bits/weight”是用于预算的近似值,不代表每个 GGUF 文件都完全相同;不同模型架构的 KV cache、MoE 专家、Vision/Audio 模块和 runtime workspace 都可能显著改变真实占用。因此结果用于筛选“值不值得继续测试”,而不是替代 llama.cpp、MLX、Ollama 或 App 内真实加载数据。

FAQ

常见问题

这个工具和普通 VRAM Calculator 有什么区别?

它不是只计算模型权重,而是把平台安全保留和你自己设定的 Context/Runtime 预留一起扣除,回答“是否值得继续做真实加载测试”。它不提供速度预测。

为什么 Apple 统一内存、手机共享内存和独立 GPU 使用不同预算?

不同平台需要给操作系统、图形栈、应用本身和其他任务留下不同余量。这里采用保守的预算档位,目的是避免把理论可装下误写成稳定可用。

为什么结果不能代表实际 tokens/s?

生成速度取决于内存带宽、计算能力、runtime、算子实现、上下文长度、批量、KV cache、CPU/GPU offload 等。仅凭参数量和内存无法可靠推断。

MoE 模型可以直接按总参数量计算吗?

不能完全等价。工具显示的是 dense 权重式内存预算,MoE 还要区分总参数、active parameters、专家加载方式和 runtime。遇到 MoE 时应把结果当作保守的第一步检查。

这些计算会上传我的设备数据吗?

不会。输入和计算都在浏览器完成,不需要登录。分享链接只包含你主动选择的内存、参数量、量化和预留值。