Chuyển đến nội dung chính

課程 2:在 Mac 上使用 Ollama 與 Open WebUI 設定 Gemma 4

在 Apple Silicon 上完整安裝執行環境、依 RAM 配置模型、 為 QA/PM/內容團隊部署內部聊天 UI。

🧠 AI & ML — L1 課程 2:在 Mac 上使用 Ollama 與 Open WebUI 設定 Gemma 4 Gemma 4 本地 AI 工程實戰 on Mac 第一部分:Foundation — Gemma 4 本地技術棧 xdev.asia

前言

本課程將設定一個可運作的本地技術棧:

  • Ollama 作為模型執行環境
  • Gemma 4 作為主要模型
  • Open WebUI 作為全團隊的聊天介面

1. 安裝 Ollama

brew install ollama
brew services start ollama
curl http://127.0.0.1:11434/api/tags

端點回傳 JSON 即表示執行環境已就緒。

2. 拉取 Gemma 4 模型

ollama pull gemma4
ollama run gemma4

RAM 較少的機器請選擇量化版本以避免 swap 壓力。

3. 執行 Open WebUI

docker run -d \
  --name open-webui \
  -p 3000:8080 \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data \
  --restart unless-stopped \
  ghcr.io/open-webui/open-webui:main

存取 http://localhost:3000 並建立第一個管理員帳號。

4. 標準化模型預設

依使用情境建立預設:

  • 程式撰寫:低溫度、較高上下文
  • 摘要:中等溫度、簡短格式
  • 擷取:低溫度、固定 JSON 輸出

將預設儲存在內部文件中,確保新團隊成員使用正確的預設值。

5. Mac 上的資源監控

追蹤三項指標:

  • 記憶體壓力
  • Swap 使用量
  • 實際 token/秒

Swap 急增時,先降低 num_ctx 或模型大小,再嘗試更深度的最佳化。

6. 快速疑難排解

  1. Docker 無法連接 Ollama:使用 host.docker.internal。
  2. 模型逐漸變慢:檢查 swap 與背景應用程式。
  3. UI 未顯示模型:確認 ollama list 與 OLLAMA_BASE_URL。

實作練習

  • 安裝完整技術棧,擷取端點圖示。
  • 為 3 個不同使用情境建立 3 組模型預設。
  • 連續兩次執行同一長 prompt 並比較速度。

Demo 程式碼

安裝後確認 health check 端點:

Health Check

Swagger UI 自動產生 API 文件:

Swagger 文件

原始碼:xdev-asia-labs/gemma-4-local-ai-engineering-on-mac

總結