聯繫我們

課程簡介

騰訊混元生產基礎

  • 騰訊混元模型服務場景概覽。
  • 大型和MoE模型的生產特性。
  • 常見的延遲、吞吐量及成本瓶頸。
  • 定義推論工作負載的服務級目標。

部署架構與服務流程

  • 生產推論堆疊的核心組件。
  • 選擇容器化、本地或雲端部署模式。
  • 模型加載、請求路由和GPU分配基礎知識。
  • 設計以可靠性與運維簡化為重點的架構。

實踐中的延遲優化

  • 在適用的情況下使用優化的推論引擎,如TensorRT。
  • KV緩存概念及實際緩存調優。
  • 減少啟動、預熱和響應開銷。
  • 測量首次令牌時間與令牌生成速度。

吞吐量、批處理與GPU效率

  • 連續批處理與請求批處理策略。
  • 管理併發量與隊列行為。
  • 在不損害用戶體驗的情況下提高GPU利用率。
  • 處理長上下文和混合工作負載請求。

量化與成本控制

  • 量化為何對生產服務至關重要。
  • FP16、INT8及其他常見精度選項的實際權衡。
  • 平衡模型質量、延遲及基礎設施成本。
  • 建立簡易的成本優化清單。

運維、監控與就緒審查

  • 推論服務的自動擴展觸發器。
  • 監控延遲、吞吐量、緩存使用情況及GPU健康狀態。
  • 日誌記錄、警報及事件響應基礎知識。
  • 審查參考部署案例並制定改進計劃。

最低要求

  • 對大型語言模型部署和推論工作流的 basic 理解。
  • 擁有容器、雲或本地基礎設施以及基於API的服務的經驗。
  • 具備Python或系統工程任務的工作知識。

受眾

  • 將LLM部署到生產環境的ML工程師。
  • 負責基於GPU的推論服務的平台工程師。
  • 設計可擴展AI服務平台的解決方案架構師。
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類