感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 21 時間:
課程簡介
Ollama 擴展入門
- Ollama 架構與擴展考量
- 多使用者部署中的常見瓶頸
- 基礎設施就緒的最佳實務
資源分配與 GPU 最佳化
- CPU 與 GPU 的高效利用策略
- 記憶體與頻寬的考量
- 容器層級的資源限制
使用容器與 Kubernetes 進行部署
- 使用 Docker 將 Ollama 容器化
- 在 Kubernetes 叢集中運行 Ollama
- 負載平衡與服務發現
自動擴展與批次處理
- 為 Ollama 設計自動擴展策略
- 用於吞吐量最佳化的批次推論技術
- 延遲與吞吐量之間的權衡
延遲最佳化
- 剖析推論效能
- 快取策略與模型預熱
- 減少 I/O 與通信開銷
監控與可觀測性
- 整合 Prometheus 進行指標收集
- 使用 Grafana 構建儀表板
- Ollama 基礎設施的告警與事件響應
成本管理与擴展策略
- 考量成本的 GPU 分配
- 雲端與本地部署的考量
- 可持續擴展的策略
總結與後續步驟
最低要求
- 具備 Linux 系統管理經驗
- 理解容器化與編排技術
- 熟悉機器學習模型部署
目標受眾
- DevOps 工程師
- ML 基礎設施團隊
- 網站可靠性工程師(SRE)