Chuyển đến nội dung chính

レッスン 3: 適切なモデルを選択する - Mac 用 LLM を比較する

包括的な比較表: Llama 3.2 vs Gemma 3 vs Qwen 2.5 vs Mistral vs Phi-4。各モデル サイズの RAM 要件。量子化 (Q4、Q5、Q8) は速度と品質に影響します。ユースケースに応じてモデルを選択してください。

🧠 AI と ML — レッスン 2 レッスン 3: 適切なモデルを選択する - LLM を比較する Mac用

Apple Silicon で Ollama を使用して AI Local を実行する

パート 1: プラットフォーム - Ollama と Apple Silicon

xdev.asia

はじめに

Ollama レジストリには数百のモデルがあります。では、どのモデルを選ぶべきでしょうか?この記事は実際のチートシートです。最も人気のあるモデルを比較し、各タスクと Mac 構成に適したモデルを選択するのに役立ちます。


1. モデルの命名規則を理解する

見ると qwen2.5:14b-instruct-q4_K_M、読み方は次のとおりです。

qwen2.5    :  14b    -  instruct   -  q4_K_M
└── Family    └── Size   └── Variant    └── Quantization
  • ファミリー: 元のモデル名 (ラマ、ジェマ、クウェン、ミストラル...)
  • サイズ: パラメータの数 (1B、3B、7B、8B、14B、32B、70B...)
  • バリアント: instruct (チャット)、 base (生)、 code (コーディング)
  • 量子化: モデル圧縮レベル (Q4、Q5、Q8、F16)

2. 量子化 — どの Q を選択するか?

量子化は、重みの精度を下げることによってモデルのサイズを縮小する手法です。

量子化ビット/重量サイズ比品質スピード
F1616ビット100% (ベースライン)ベスト最も遅い
Q8_08ビット~50%F16とほぼ同等より速く
Q6_K6ビット~37%とても良い速い
Q5_K_M5ビット~31%良い速い
Q4_K_M4ビット~25%かなり良い最速
Q3_K_M3ビット~19%大幅な削減非常に速い
Q2_K2ビット~12%悪い非常に速い

💡 推奨: Q4_K_M は、ほとんどの場合のスイート スポットです。サイズは約 75% 縮小されましたが、依然として高品質です。もう少し高画質を求めるならQ5_K_M。

実際の例: Llama 3.2 8B

量子化ディスク上のサイズ必要なRAMトークン/秒 (M3 Pro)
F1616GB~18 GB~12 トーク/秒
Q8_08.5GB~10 GB~24 トーク/秒
Q4_K_M4.9GB~6.5GB~32 トーク/秒

3. 総合モデル比較表

小規模モデル グループ (1B-4B) — MacBook Air 8GB

モデルサイズ (Q4)RAM 最小値コードベトナム語概要
ラマ 3.2 3B2.0GB4GB★★★☆★★☆☆何でも屋
ジェマ3 4B3.3GB5GB★★★☆★★★☆優れた多言語
ファイ-4 ミニ 3.8B2.5GB4.5GB★★★★★★☆☆コード/数学は非常に強力です
クウェン 2.5 3B1.9GB4GB★★★☆★★★☆バランスが良い

中型モデル グループ (7B-14B) — MacBook 16-24GB

モデルサイズ (Q4)RAM 最小値コードベトナム語概要
ラマ 3.2 8B4.9GB7GB★★★★★★★☆オールラウンドに最適
ジェマ3 12B8.1GB10GB★★★★★★★★多言語チャンピオン
クウェン 2.5 14B9.0GB11GB★★★★★★★★★最高のベトナム料理
ミストラル 7B4.1GB6GB★★★★★★★☆コード/推論がしっかりしている
DeepSeek コーダー V2 16B10.2GB13GB★★★★★★★☆☆コーディングビースト

大規模モデル グループ (30B+) — MacBook 32GB+

モデルサイズ (Q4)RAM 最小値コードベトナム語概要
クウェン 2.5 32B18GB22GB★★★★★★★★★★最高のローカルモデル
ラマ 3.3 70B40GB48GB★★★★★★★★★64GB以上のRAMが必要
DeepSeek V3 (蒸留 32B)19GB23GB★★★★★★★★☆推理王

4. ユースケースに応じたモデルの選択

スマートチャットボット / Q&A

# Tiếng Việt tốt nhất
ollama run qwen2.5:14b

# Cân bằng nhất
ollama run llama3.2

# RAM ít (8GB)
ollama run gemma3:4b

コード作成 / コードレビュー

# Coding chuyên sâu
ollama run deepseek-coder-v2:16b

# Cân bằng code + chat
ollama run qwen2.5-coder:14b

# RAM ít
ollama run phi4-mini

要約/執筆

# Tiếng Việt
ollama run qwen2.5:14b

# Tiếng Anh
ollama run llama3.2

画像解析(ビジョン)

# Vision tốt nhất
ollama run gemma3:12b   # Có vision built-in

# Nhẹ hơn
ollama run llava:7b

5. Mac RAMに応じてモデルを選択します

8 GB RAM (MacBook Air M1/M2 ベース)

# Chỉ nên dùng model 3-4B
ollama run llama3.2:3b     # 2.0 GB, chạy tốt
ollama run phi4-mini       # 2.5 GB, code tốt
ollama run gemma3:1b       # 1.0 GB, cực nhẹ

⚠️ 8GB の場合は、モデル 3B を実行する前に Safari を閉じてください。 macOS のシステムには最大 4GB が必要です。

16 GB RAM

# Sweet spot
ollama run llama3.2        # 8B, 4.9 GB
ollama run qwen2.5:7b      # 7B, 4.7 GB
ollama run mistral          # 7B, 4.1 GB

24 ~ 36 GB RAM

# Mở rộng lên 12-14B
ollama run gemma3:12b      # 8.1 GB
ollama run qwen2.5:14b     # 9.0 GB, khuyến nghị
ollama run deepseek-coder-v2:16b  # 10.2 GB

48~64 GB+ RAM

# Model lớn, chất lượng gần cloud
ollama run qwen2.5:32b     # 18 GB
ollama run llama3.3:70b    # 40 GB, cần 48GB+ RAM

6. 現実的なベンチマーク

簡単なベンチマークを実行します。

# Đo thời gian generate
time ollama run llama3.2 "Viết function fibonacci bằng Python" --nowordwrap

または、Ollama API を使用して正確なメトリクスを取得します。

curl -s http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Explain Docker in 3 sentences",
  "stream": false
}' | python3 -c "
import sys, json
d = json.load(sys.stdin)
prompt_tokens = d['prompt_eval_count']
gen_tokens = d['eval_count']
prompt_time = d['prompt_eval_duration'] / 1e9
gen_time = d['eval_duration'] / 1e9
print(f'Prompt: {prompt_tokens} tokens in {prompt_time:.2f}s ({prompt_tokens/prompt_time:.1f} tok/s)')
print(f'Generate: {gen_tokens} tokens in {gen_time:.2f}s ({gen_tokens/gen_time:.1f} tok/s)')
"

7. 知っておくべきモデルタグ

モデルをプルするときのデフォルトのタグは次のとおりです。 latest (通常は + Q4_K_M を指示します)。ただし、次のように指定できます。

# Chất lượng cao hơn (tốn RAM hơn)
ollama pull llama3.2:8b-instruct-q8_0

# Nhẹ nhất có thể
ollama pull llama3.2:3b-instruct-q4_0

# Model vision
ollama pull gemma3:12b    # Tự động có vision

# Chỉ lấy text model
ollama pull gemma3:4b-it-q4_K_M

利用可能なすべてのタグを表示します。

# Truy cập: https://ollama.com/library/llama3.2/tags
# Hoặc: https://ollama.com/library/qwen2.5/tags

概要

| MacのRAM |おすすめモデル|サイズ | |----------|--------|---------------| | 8GB | llama3.2:3b、 phi4-mini | 2~3GB | | 16GB | llama3.2、 qwen2.5:7b | 4~5GB | | 24-36 GB | qwen2.5:14b、 gemma3:12b | 8~10GB | | 48GB以上 | qwen2.5:32b | 18GB |

量子化: 常に Q4_K_M から開始します (デフォルト)。より良い品質が必要で、追加の RAM がある場合にのみ、Q5/Q8 にアップグレードしてください。


演習

  1. Mac の RAM に基づいて、適切なモデルを 2 ~ 3 つ選択し、ダウンロードします。
  2. 各モデルについてベトナム語について同じ質問をし、どのモデルが最もよく答えるかを記録します。
  3. 上記のベンチマーク スクリプトを使用して、各モデルのトークン/秒を測定します。
  4. 同じモデルの Q4 と Q8 を比較します。品質に明らかな違いはありますか?どれくらい速度が違うの?

次の記事: MLX フレームワーク — 3x 推論の高速化 →