感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
騰訊混元生產基礎
- 騰訊混元模型服務場景概覽。
- 大型和MoE模型的生產特性。
- 常見的延遲、吞吐量及成本瓶頸。
- 定義推論工作負載的服務級目標。
部署架構與服務流程
- 生產推論堆疊的核心組件。
- 選擇容器化、本地或雲端部署模式。
- 模型加載、請求路由和GPU分配基礎知識。
- 設計以可靠性與運維簡化為重點的架構。
實踐中的延遲優化
- 在適用的情況下使用優化的推論引擎,如TensorRT。
- KV緩存概念及實際緩存調優。
- 減少啟動、預熱和響應開銷。
- 測量首次令牌時間與令牌生成速度。
吞吐量、批處理與GPU效率
- 連續批處理與請求批處理策略。
- 管理併發量與隊列行為。
- 在不損害用戶體驗的情況下提高GPU利用率。
- 處理長上下文和混合工作負載請求。
量化與成本控制
- 量化為何對生產服務至關重要。
- FP16、INT8及其他常見精度選項的實際權衡。
- 平衡模型質量、延遲及基礎設施成本。
- 建立簡易的成本優化清單。
運維、監控與就緒審查
- 推論服務的自動擴展觸發器。
- 監控延遲、吞吐量、緩存使用情況及GPU健康狀態。
- 日誌記錄、警報及事件響應基礎知識。
- 審查參考部署案例並制定改進計劃。
最低要求
- 對大型語言模型部署和推論工作流的 basic 理解。
- 擁有容器、雲或本地基礎設施以及基於API的服務的經驗。
- 具備Python或系統工程任務的工作知識。
受眾
- 將LLM部署到生產環境的ML工程師。
- 負責基於GPU的推論服務的平台工程師。
- 設計可擴展AI服務平台的解決方案架構師。