聯繫我們
 課程時長 21 時間:

課程簡介

Ollama 擴展入門

  • Ollama 架構與擴展考量
  • 多使用者部署中的常見瓶頸
  • 基礎設施就緒的最佳實務

資源分配與 GPU 最佳化

  • CPU 與 GPU 的高效利用策略
  • 記憶體與頻寬的考量
  • 容器層級的資源限制

使用容器與 Kubernetes 進行部署

  • 使用 Docker 將 Ollama 容器化
  • 在 Kubernetes 叢集中運行 Ollama
  • 負載平衡與服務發現

自動擴展與批次處理

  • 為 Ollama 設計自動擴展策略
  • 用於吞吐量最佳化的批次推論技術
  • 延遲與吞吐量之間的權衡

延遲最佳化

  • 剖析推論效能
  • 快取策略與模型預熱
  • 減少 I/O 與通信開銷

監控與可觀測性

  • 整合 Prometheus 進行指標收集
  • 使用 Grafana 構建儀表板
  • Ollama 基礎設施的告警與事件響應

成本管理与擴展策略

  • 考量成本的 GPU 分配
  • 雲端與本地部署的考量
  • 可持續擴展的策略

總結與後續步驟

最低要求

  • 具備 Linux 系統管理經驗
  • 理解容器化與編排技術
  • 熟悉機器學習模型部署

目標受眾

  • DevOps 工程師
  • ML 基礎設施團隊
  • 網站可靠性工程師(SRE)

人數


每位參與者的報價

即將到來的課程

課程分類