聯繫我們

課程簡介

AI 主權與 LLM 本地部署

  • 雲端 LLM 的風險:數據保留、基於輸入的訓練、外國管轄權。
  • Ollama 架構:模型伺服器、註冊表和 OpenAI 兼容 API。
  • 與 vLLM、llama.cpp 和 Text Generation Inference 的比較。
  • 模型許可證:Llama、Mistral、Qwen 和 Gemma 的條款。

安裝與硬體設置

  • 在支援 CUDA 和 ROCm 的 Linux 上安裝 Ollama。
  • 僅 CPU 備用方案及 AVX/AVX2 優化。
  • Docker 部署與持久化卷掛載。
  • 多 GPU 設置與 VRAM 分配策略。

模型管理

  • 從 Ollama 註冊表提取模型:ollama pull llama3。
  • 從 HuggingFace 和 TheBloke 導入 GGUF 模型。
  • 量化級別:Q4_K_M、Q5_K_M、Q8_0 的權衡。
  • 模型切換與並行加載模型的限制。

自定義 Modelfiles

  • 編寫 Modelfile 語法:FROM、PARAMETER、SYSTEM、TEMPLATE。
  • 調優溫度(Temperature)、top_p 和 repeat_penalty。
  • 針對角色特定行為的系統提示詞工程。
  • 建立並發布自定義模型至本地註冊表。

API 整合

  • OpenAI 兼容的 /v1/chat/completions 端點。
  • 串流回應與 JSON 模式。
  • 與 LangChain、LlamaIndex 和自定義應用程式整合。
  • 透過反向代理進行身份驗證和速率限制。

性能優化

  • 上下文窗口大小設定與 KV 緩存管理。
  • 批量推理與並行請求處理。
  • CPU 線程分配與 NUMA 感知。
  • 監控 GPU 利用率和內存壓力。

安全與合規

  • 模型服務端點的網路隔離。
  • 輸入過濾與輸出審查管線。
  • 提示詞與完成內容的審計日誌記錄。
  • 模型來源證明與哈希驗證。

最低要求

  • 中級 Linux 和容器管理知識。
  • 對機器學習和 Transformer 模型有高水平的理解。
  • 熟悉 REST API 和 JSON。

受眾

  • 希望取代雲端 LLM API 的 AI 工程師和開發人員。
  • 因資料敏感性而無法使用雲端模型的組織。
  • 需要物理隔離語言模型的政府和國防團隊。
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類