感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
AI 主權與 LLM 本地部署
- 雲端 LLM 的風險:數據保留、基於輸入的訓練、外國管轄權。
- Ollama 架構:模型伺服器、註冊表和 OpenAI 兼容 API。
- 與 vLLM、llama.cpp 和 Text Generation Inference 的比較。
- 模型許可證:Llama、Mistral、Qwen 和 Gemma 的條款。
安裝與硬體設置
- 在支援 CUDA 和 ROCm 的 Linux 上安裝 Ollama。
- 僅 CPU 備用方案及 AVX/AVX2 優化。
- Docker 部署與持久化卷掛載。
- 多 GPU 設置與 VRAM 分配策略。
模型管理
- 從 Ollama 註冊表提取模型:ollama pull llama3。
- 從 HuggingFace 和 TheBloke 導入 GGUF 模型。
- 量化級別:Q4_K_M、Q5_K_M、Q8_0 的權衡。
- 模型切換與並行加載模型的限制。
自定義 Modelfiles
- 編寫 Modelfile 語法:FROM、PARAMETER、SYSTEM、TEMPLATE。
- 調優溫度(Temperature)、top_p 和 repeat_penalty。
- 針對角色特定行為的系統提示詞工程。
- 建立並發布自定義模型至本地註冊表。
API 整合
- OpenAI 兼容的 /v1/chat/completions 端點。
- 串流回應與 JSON 模式。
- 與 LangChain、LlamaIndex 和自定義應用程式整合。
- 透過反向代理進行身份驗證和速率限制。
性能優化
- 上下文窗口大小設定與 KV 緩存管理。
- 批量推理與並行請求處理。
- CPU 線程分配與 NUMA 感知。
- 監控 GPU 利用率和內存壓力。
安全與合規
- 模型服務端點的網路隔離。
- 輸入過濾與輸出審查管線。
- 提示詞與完成內容的審計日誌記錄。
- 模型來源證明與哈希驗證。
最低要求
- 中級 Linux 和容器管理知識。
- 對機器學習和 Transformer 模型有高水平的理解。
- 熟悉 REST API 和 JSON。
受眾
- 希望取代雲端 LLM API 的 AI 工程師和開發人員。
- 因資料敏感性而無法使用雲端模型的組織。
- 需要物理隔離語言模型的政府和國防團隊。
14 小時