← 返回首页

模型内存拆解工具

参数量只能给出权重内存,不能直接回答“这张显卡能不能跑”。本工具把可计算的 静态部分拆开:模型权重、推理 KV Cache、全参数 AdamW 状态和 LoRA 可训练状态。 所有输入和计算都留在当前浏览器,不上传任何数据。

快速填入架构示例:
模型与运行场景
架构与上下文

这些字段用于 KV Cache;训练场景仍保留它们,便于切换比较。

Memory Breakdown

可计算的持久内存

自回归推理
模型权重 参数量 × 权重字节数
KV Cache K 与 V 的逐层缓存
训练状态 推理场景不创建梯度和优化器状态
静态小计 不含激活值和临时工作区
加 10%–25% 运行时余量后的参考区间

公式与口径

权重内存:

\[ M_{\text{weights}}=N_{\text{params}}\times b_{\text{weights}}. \]

KV Cache 近似值:

\[ M_{\mathrm{KV}} =2\times L\times B\times T\times h_{kv}\times d_h\times b_{\mathrm{cache}}, \qquad d_h=\frac{d_{\mathrm{model}}}{h_q}. \]

全参数混合精度 AdamW 通常需要约 16 bytes/参数的持久状态:FP16/BF16 权重、梯度、FP32 主权重以及两个 FP32 动量。LoRA 场景只对填写的可训练参数比例 应用这部分状态,量化基座仍按所选权重精度计算。

必须实测的部分:激活值、attention 临时矩阵、CUDA kernel 工作区、量化元数据、内存碎片、并行通信缓冲和框架实现差异可能非常大。 训练时激活值常常超过持久状态;本页的“余量区间”不能替代真实模型、批量和硬件上的 峰值显存测试,也不能作为采购或部署承诺。