← 返回首页
自回归推理
模型内存拆解工具
参数量只能给出权重内存,不能直接回答“这张显卡能不能跑”。本工具把可计算的 静态部分拆开:模型权重、推理 KV Cache、全参数 AdamW 状态和 LoRA 可训练状态。 所有输入和计算都留在当前浏览器,不上传任何数据。
快速填入架构示例:
Memory Breakdown
可计算的持久内存
模型权重
—
参数量 × 权重字节数
KV Cache
—
K 与 V 的逐层缓存
训练状态
—
推理场景不创建梯度和优化器状态
静态小计
—
不含激活值和临时工作区
加 10%–25% 运行时余量后的参考区间
—
—
公式与口径
权重内存:
\[
M_{\text{weights}}=N_{\text{params}}\times b_{\text{weights}}.
\]
KV Cache 近似值:
\[
M_{\mathrm{KV}}
=2\times L\times B\times T\times h_{kv}\times d_h\times b_{\mathrm{cache}},
\qquad d_h=\frac{d_{\mathrm{model}}}{h_q}.
\]
全参数混合精度 AdamW 通常需要约 16 bytes/参数的持久状态:FP16/BF16 权重、梯度、FP32 主权重以及两个 FP32 动量。LoRA 场景只对填写的可训练参数比例 应用这部分状态,量化基座仍按所选权重精度计算。
必须实测的部分:激活值、attention 临时矩阵、CUDA kernel
工作区、量化元数据、内存碎片、并行通信缓冲和框架实现差异可能非常大。
训练时激活值常常超过持久状态;本页的“余量区间”不能替代真实模型、批量和硬件上的
峰值显存测试,也不能作为采购或部署承诺。