崔浩-LLM 推理优化与部署实战

崔浩-LLM 推理优化与部署实战
下载权限
查看
  • 免费下载
    评论并刷新后下载
    登录后下载
  • {{attr.name}}:
您当前的等级为
登录后免费下载登录 小黑屋反思中,不准下载! 评论后刷新页面下载评论 支付以后下载 请先登录 您今天的下载次数(次)用完了,请明天再来 支付积分以后下载立即支付 支付以后下载立即支付 您当前的用户组不允许下载升级会员
您已获得下载权限 您可以每天下载资源次,今日剩余
VIP开通会员,本资源免费下载立即开通
崔浩-LLM 推理优化与部署实战

├── 1-1 课程内容介绍
├── 1-2 LLM推理基础-预填充与解码阶段
├── 1-3 LLM推理基础-推理阶段与KVCache的关系
├── 1-4 LLM推理基础-生成KVCache过程推演
├── 1-5 LLM推理基础-为何需要对KVCache优化
├── 1-6 LLM推理基础-如何估算模型占用内存
├── 1-7 LLM推理基础-GPU内部运算原理与推理机制的关系
├── 1-8 LLM推理基础-列举LLM存储介质以及如何搬运参数
├── 1-9 LLM推理基础-优化思路-参数量化-运行时加速-IO优化
├── 1-10 LLM推理基础-章节总结
├── 1-11 LLM性能指标-内容介绍
├── 1-12 LLM性能指标-推理评估指标全景图
├── 1-13 LLM性能指标-首词生成时间
├── 1-14 LLM性能指标-每词生成时间
├── 1-15 LLM性能指标-端到端的请求时间
├── 1-16 LLM性能指标-系统吞吐量TPS
├── 1-17 LLM性能指标-业务指标SLO
├── 1-18 LLM性能指标-评测过程与评测工具
├── 1-19 LLM性能指标-章节总结
├── 1-20 模型压缩-内容介绍
├── 1-21 模型压缩-压缩策略-量化-剪枝-蒸馏
├── 1-22 模型压缩-模型量化-参数存储空间的组成
├── 1-23 模型压缩-模型量化前后使用的方法AWQ与GPTQ
├── 1-24 模型压缩-AWQ针对PPL的实验结果
├── 1-25 模型压缩-AWQ量化过程与实现
├── 1-26 模型压缩-GPTQ量化过程以及优化IO策略
├── 1-27 模型压缩-GPTQ量化工具与实践
├── 1-28 模型压缩-剪枝分类和过程详解
├── 1-29 模型压缩-模型蒸馏分类和应用场景
├── 1-30 模型压缩-章节总结
├── 1-31 运行时加速方案-内容介绍
├── 1-32 运行时加速方案-多头注意力机制原理与弊端
├── 1-33 运行时加速方案-多头注意力计算过程与分析
├── 1-34 运行时加速方案-MQA与GQA机制以及性能比较
├── 1-35 运行时加速方案-GPU运算与数据传输分析
├── 1-36 运行时加速方案-FlashAttention切块和算子
├── 1-37 运行时加速方案-PagedAttention原理解析
├── 1-38 运行时加速方案-持续批处理原理解析
├── 1-39 运行时加速方案-核心推理框架选型
├── 1-40 运行时加速方案-章节总结
├── 1-41 推理部署实战指导与总结
├── 2-1 vLLM产品介绍
├── 2-2 vLLM分布式推理
├── 2-3 显卡驱动安装与配置
├── 2-4 Docker进行vLLM模型安装与部署
├── 2-5 测试vLLM部署的大模型
├── 2-6 vLLM分布式部署思路
├── 2-7 系统构建网络配置和框架安装
├── 2-8 Head和Worker节点配置创建推理集群
├── 2-9 测试vLLM分布式部署
├── 3-1 量化实战-量化目的与结果介绍
├── 3-2 量化实战-思路与实战步骤讲解
├── 3-3 量化实战-了解硬件架构量化工具
├── 3-4 量化实战-安装WSL与Conda
├── 3-5 TensorRT模型优化器安装与配置
├── 3-6 NVFP4量化格式
├── 3-7 模型量化脚本解析与校准数据集
├── 3-8 模型量化以及结果查看
├── 3-9 测试量化之后模型查看返回结果
├── 3-10 介绍EvalScope与Perf命令组成
├── 3-11 使用EvalScope评测量化模型
├── 3-12 介绍LLMCompressor量化工具
├── 3-13 安装LLMCompressor
├── 3-14 使用LLMCompressor对GPTQ-AWQ-NV
├── 3-15 针对两种量化工具比较四种量化结果
└── 3-16 量化实战-课程总结

今日签到
搜索