はじめに
Ollama レジストリには数百のモデルがあります。では、どのモデルを選ぶべきでしょうか?この記事は実際のチートシートです。最も人気のあるモデルを比較し、各タスクと Mac 構成に適したモデルを選択するのに役立ちます。
1. モデルの命名規則を理解する
見ると qwen2.5:14b-instruct-q4_K_M、読み方は次のとおりです。
qwen2.5 : 14b - instruct - q4_K_M
└── Family └── Size └── Variant └── Quantization
- ファミリー: 元のモデル名 (ラマ、ジェマ、クウェン、ミストラル...)
- サイズ: パラメータの数 (1B、3B、7B、8B、14B、32B、70B...)
- バリアント:
instruct(チャット)、base(生)、code(コーディング) - 量子化: モデル圧縮レベル (Q4、Q5、Q8、F16)
2. 量子化 — どの Q を選択するか?
量子化は、重みの精度を下げることによってモデルのサイズを縮小する手法です。
| 量子化 | ビット/重量 | サイズ比 | 品質 | スピード |
|---|---|---|---|---|
| F16 | 16ビット | 100% (ベースライン) | ベスト | 最も遅い |
| Q8_0 | 8ビット | ~50% | F16とほぼ同等 | より速く |
| Q6_K | 6ビット | ~37% | とても良い | 速い |
| Q5_K_M | 5ビット | ~31% | 良い | 速い |
| Q4_K_M | 4ビット | ~25% | かなり良い | 最速 |
| Q3_K_M | 3ビット | ~19% | 大幅な削減 | 非常に速い |
| Q2_K | 2ビット | ~12% | 悪い | 非常に速い |
💡 推奨: Q4_K_M は、ほとんどの場合のスイート スポットです。サイズは約 75% 縮小されましたが、依然として高品質です。もう少し高画質を求めるならQ5_K_M。
実際の例: Llama 3.2 8B
| 量子化 | ディスク上のサイズ | 必要なRAM | トークン/秒 (M3 Pro) |
|---|---|---|---|
| F16 | 16GB | ~18 GB | ~12 トーク/秒 |
| Q8_0 | 8.5GB | ~10 GB | ~24 トーク/秒 |
| Q4_K_M | 4.9GB | ~6.5GB | ~32 トーク/秒 |
3. 総合モデル比較表
小規模モデル グループ (1B-4B) — MacBook Air 8GB
| モデル | サイズ (Q4) | RAM 最小値 | コード | ベトナム語 | 概要 |
|---|---|---|---|---|---|
| ラマ 3.2 3B | 2.0GB | 4GB | ★★★☆ | ★★☆☆ | 何でも屋 |
| ジェマ3 4B | 3.3GB | 5GB | ★★★☆ | ★★★☆ | 優れた多言語 |
| ファイ-4 ミニ 3.8B | 2.5GB | 4.5GB | ★★★★ | ★★☆☆ | コード/数学は非常に強力です |
| クウェン 2.5 3B | 1.9GB | 4GB | ★★★☆ | ★★★☆ | バランスが良い |
中型モデル グループ (7B-14B) — MacBook 16-24GB
| モデル | サイズ (Q4) | RAM 最小値 | コード | ベトナム語 | 概要 |
|---|---|---|---|---|---|
| ラマ 3.2 8B | 4.9GB | 7GB | ★★★★ | ★★★☆ | オールラウンドに最適 |
| ジェマ3 12B | 8.1GB | 10GB | ★★★★ | ★★★★ | 多言語チャンピオン |
| クウェン 2.5 14B | 9.0GB | 11GB | ★★★★ | ★★★★★ | 最高のベトナム料理 |
| ミストラル 7B | 4.1GB | 6GB | ★★★★ | ★★★☆ | コード/推論がしっかりしている |
| DeepSeek コーダー V2 16B | 10.2GB | 13GB | ★★★★★ | ★★☆☆ | コーディングビースト |
大規模モデル グループ (30B+) — MacBook 32GB+
| モデル | サイズ (Q4) | RAM 最小値 | コード | ベトナム語 | 概要 |
|---|---|---|---|---|---|
| クウェン 2.5 32B | 18GB | 22GB | ★★★★★ | ★★★★★ | 最高のローカルモデル |
| ラマ 3.3 70B | 40GB | 48GB | ★★★★★ | ★★★★ | 64GB以上のRAMが必要 |
| DeepSeek V3 (蒸留 32B) | 19GB | 23GB | ★★★★★ | ★★★☆ | 推理王 |
4. ユースケースに応じたモデルの選択
スマートチャットボット / Q&A
# Tiếng Việt tốt nhất
ollama run qwen2.5:14b
# Cân bằng nhất
ollama run llama3.2
# RAM ít (8GB)
ollama run gemma3:4b
コード作成 / コードレビュー
# Coding chuyên sâu
ollama run deepseek-coder-v2:16b
# Cân bằng code + chat
ollama run qwen2.5-coder:14b
# RAM ít
ollama run phi4-mini
要約/執筆
# Tiếng Việt
ollama run qwen2.5:14b
# Tiếng Anh
ollama run llama3.2
画像解析(ビジョン)
# Vision tốt nhất
ollama run gemma3:12b # Có vision built-in
# Nhẹ hơn
ollama run llava:7b
5. Mac RAMに応じてモデルを選択します
8 GB RAM (MacBook Air M1/M2 ベース)
# Chỉ nên dùng model 3-4B
ollama run llama3.2:3b # 2.0 GB, chạy tốt
ollama run phi4-mini # 2.5 GB, code tốt
ollama run gemma3:1b # 1.0 GB, cực nhẹ
⚠️ 8GB の場合は、モデル 3B を実行する前に Safari を閉じてください。 macOS のシステムには最大 4GB が必要です。
16 GB RAM
# Sweet spot
ollama run llama3.2 # 8B, 4.9 GB
ollama run qwen2.5:7b # 7B, 4.7 GB
ollama run mistral # 7B, 4.1 GB
24 ~ 36 GB RAM
# Mở rộng lên 12-14B
ollama run gemma3:12b # 8.1 GB
ollama run qwen2.5:14b # 9.0 GB, khuyến nghị
ollama run deepseek-coder-v2:16b # 10.2 GB
48~64 GB+ RAM
# Model lớn, chất lượng gần cloud
ollama run qwen2.5:32b # 18 GB
ollama run llama3.3:70b # 40 GB, cần 48GB+ RAM
6. 現実的なベンチマーク
簡単なベンチマークを実行します。
# Đo thời gian generate
time ollama run llama3.2 "Viết function fibonacci bằng Python" --nowordwrap
または、Ollama API を使用して正確なメトリクスを取得します。
curl -s http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Explain Docker in 3 sentences",
"stream": false
}' | python3 -c "
import sys, json
d = json.load(sys.stdin)
prompt_tokens = d['prompt_eval_count']
gen_tokens = d['eval_count']
prompt_time = d['prompt_eval_duration'] / 1e9
gen_time = d['eval_duration'] / 1e9
print(f'Prompt: {prompt_tokens} tokens in {prompt_time:.2f}s ({prompt_tokens/prompt_time:.1f} tok/s)')
print(f'Generate: {gen_tokens} tokens in {gen_time:.2f}s ({gen_tokens/gen_time:.1f} tok/s)')
"
7. 知っておくべきモデルタグ
モデルをプルするときのデフォルトのタグは次のとおりです。 latest (通常は + Q4_K_M を指示します)。ただし、次のように指定できます。
# Chất lượng cao hơn (tốn RAM hơn)
ollama pull llama3.2:8b-instruct-q8_0
# Nhẹ nhất có thể
ollama pull llama3.2:3b-instruct-q4_0
# Model vision
ollama pull gemma3:12b # Tự động có vision
# Chỉ lấy text model
ollama pull gemma3:4b-it-q4_K_M
利用可能なすべてのタグを表示します。
# Truy cập: https://ollama.com/library/llama3.2/tags
# Hoặc: https://ollama.com/library/qwen2.5/tags
概要
| MacのRAM |おすすめモデル|サイズ |
|----------|--------|---------------|
| 8GB | llama3.2:3b、 phi4-mini | 2~3GB |
| 16GB | llama3.2、 qwen2.5:7b | 4~5GB |
| 24-36 GB | qwen2.5:14b、 gemma3:12b | 8~10GB |
| 48GB以上 | qwen2.5:32b | 18GB |
量子化: 常に Q4_K_M から開始します (デフォルト)。より良い品質が必要で、追加の RAM がある場合にのみ、Q5/Q8 にアップグレードしてください。
演習
- Mac の RAM に基づいて、適切なモデルを 2 ~ 3 つ選択し、ダウンロードします。
- 各モデルについてベトナム語について同じ質問をし、どのモデルが最もよく答えるかを記録します。
- 上記のベンチマーク スクリプトを使用して、各モデルのトークン/秒を測定します。
- 同じモデルの Q4 と Q8 を比較します。品質に明らかな違いはありますか?どれくらい速度が違うの?
次の記事: MLX フレームワーク — 3x 推論の高速化 →