群发资讯网

技术手册 《LLM Inference Handbook》LLM 推理手册地址:

技术手册 《LLM Inference Handbook》LLM 推理手册地址:handbook.modular.com/

LLM 推理手册集技术词汇、指南与参考于一体,全面涵盖您需要了解的 LLM 推理知识,从核心概念和性能指标(如首令牌耗时和每秒令牌数),到优化技术(如持续批处理和前缀缓存),再到 GPU 架构以及 BYOC 和本地部署等模式。

* 针对在生产环境中部署、扩展和运行 LLM 的实用指南。* 通过交互式计算器、模拟器和可视化工具探索相关概念。* 利用针对您的用例量身定制的优化技术提升性能。* 持续更新,紧跟最新最佳实践和经过实战检验的洞见。

创作动机

我们编写这本手册是为了解决开发者面临的一个常见问题:LLM 推理知识往往零散破碎,深埋在学术论文中,分散在供应商博客里,隐藏在 GitHub 问题下,或散布在 Discord 讨论串中。更糟糕的是,很多内容都假设您已经了解了整个技术栈的一半。

很少有资源能将所有内容整合在一起——比如推理与训练有何不同,为什么在满足服务等级目标方面,有效吞吐量比原始吞吐量更重要,或者预填充-解码分离在实践中是如何工作的。

因此,我们开始着手整合这一切。

目标读者

这本手册适用于在生产环境中部署、扩展或运行 LLM 的工程师,无论您是在微调一个小型开放模型,还是在自己的技术栈上运行大规模部署。

如果您的目标是让 LLM 推理更快、更便宜或更可靠,那么这本手册就是为您准备的。

本手册提供了多种交互式工具,帮助您通过直接尝试这些概念来学习:

* **LLM 推理可视化工具:** 遍历请求的生命周期,观察令牌如何流经预填充和解码阶段。* **LLM 生命周期可视化工具:** 查看训练和推理在模型生命周期中的位置,以及推理如何处理每个请求。* **逐令牌解码循环:** 逐步执行自回归解码,观察每个新令牌如何扩展序列和 KV 缓存。* **延迟时间线可视化工具:** 查看每个解码步骤之后如何跟随解令牌化,以及 TTFT、ITL 和 E2EL 涵盖哪些阶段。* **上下文窗口模拟器:** 观察完整对话如何在每次轮次中被重新发送并填满上下文窗口。* **延迟指标游乐场:** 探索 TTFT、E2EL、TPOT 和基于 SLO 的有效吞吐量。* **Top-p 与 Top-k 过滤器:** 比较每个过滤器如何处理尖峰、混合和平坦分布。* **模型浏览器:** 浏览流行的开源 LLM,并比较它们的架构、规模、上下文和典型 GPU 部署。* **GPU 对比表:** 将流行的开源 LLM 与合适的 NVIDIA 和 AMD GPU 进行匹配。* **GPU 内存计算器:** 估算服务 LLM 所需的 VRAM 量。* **量化内存影响可视化工具:** 比较不同量化格式下的权重内存占用。* **批处理策略模拟器:** 比较静态、动态和持续批处理行为。* **分块预填充调度器:** 观察完整的预填充如何阻塞正在进行的解码,以及分块如何让它们继续运行。* **KV 缓存内存计算器:** 估算 KV 缓存消耗的内存量。* **GPU 执行与内存映射:** 可视化线程、线程束、流式多处理器(SM)以及 GPU 内存层次结构是如何组合在一起的。