资讯

训练和推理都用GPU——前向反向与缓存的三笔账

bilibili-36·2026/9/11 06:50:54🔗 原文

📋总体概括

删掉反向传播,显存为什么还在涨?训练与推理共享 GPU,却有三本不同的账。 本期内容: 1. 用一个参数拆开前向、反向与优化器更新,CPU 也能核验梯度 2. PyTorch 固定版本源码:eval 为什么不关闭自动微分 3. 梯度累积、Adam 历史与激活重算的生命周期 4. 分类、编码和自回归推理的边界 5. Prefill、decode 与分层 KV 缓存的容量公式 6. GPU 异步计时

关键信息

  • 删掉反向传播,显存为什么还在涨?训练与推理共享 GPU,却有三本不同的账。
  • 1. 用一个参数拆开前向、反向与优化器更新,CPU 也能核验梯度
  • 2. PyTorch 固定版本源码:eval 为什么不关闭自动微分
本文由本站自动聚合,以下为原始来源:前往 bilibili-36 阅读全文