添加一个部署框架 LMDeploy 和 InternLM 的教学课程

Question

lvhan028 opened this issue 4 months ago · comments

LMDeploy 支持 LLM 和 VL 模型的量化、推理和服务。它具备以下特点：

高效的推理：LMDeploy 开发了 Persistent Batch(即 Continuous Batch)，Blocked K/V Cache，动态拆分和融合，张量并行，高效的计算 kernel等重要特性。推理性能是 vLLM 的 1.8 倍

可靠的量化：LMDeploy 支持权重量化和 k/v 量化。4bit 模型推理效率是 FP16 下的 2.4 倍。量化模型的可靠性已通过 OpenCompass 评测得到充分验证。

便捷的服务：通过请求分发服务，LMDeploy 支持多模型在多机、多卡上的推理服务。

有状态推理：通过缓存多轮对话过程中 attention 的 k/v，记住对话历史，从而避免重复处理历史会话。显著提升长文本多轮对话场景中的效率。

浦语实战营包括了InternLM 从模型，到训练，到部署的全套教程