前言
本課程將設定一個可運作的本地技術棧:
- Ollama 作為模型執行環境
- Gemma 4 作為主要模型
- Open WebUI 作為全團隊的聊天介面
1. 安裝 Ollama
brew install ollama
brew services start ollama
curl http://127.0.0.1:11434/api/tags
端點回傳 JSON 即表示執行環境已就緒。
2. 拉取 Gemma 4 模型
ollama pull gemma4
ollama run gemma4
RAM 較少的機器請選擇量化版本以避免 swap 壓力。
3. 執行 Open WebUI
docker run -d \
--name open-webui \
-p 3000:8080 \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data \
--restart unless-stopped \
ghcr.io/open-webui/open-webui:main
存取 http://localhost:3000 並建立第一個管理員帳號。
4. 標準化模型預設
依使用情境建立預設:
- 程式撰寫:低溫度、較高上下文
- 摘要:中等溫度、簡短格式
- 擷取:低溫度、固定 JSON 輸出
將預設儲存在內部文件中,確保新團隊成員使用正確的預設值。
5. Mac 上的資源監控
追蹤三項指標:
- 記憶體壓力
- Swap 使用量
- 實際 token/秒
Swap 急增時,先降低 num_ctx 或模型大小,再嘗試更深度的最佳化。
6. 快速疑難排解
- Docker 無法連接 Ollama:使用
host.docker.internal。 - 模型逐漸變慢:檢查 swap 與背景應用程式。
- UI 未顯示模型:確認
ollama list與OLLAMA_BASE_URL。
實作練習
- 安裝完整技術棧,擷取端點圖示。
- 為 3 個不同使用情境建立 3 組模型預設。
- 連續兩次執行同一長 prompt 並比較速度。
Demo 程式碼
安裝後確認 health check 端點:

Swagger UI 自動產生 API 文件:
