はじめに
機械学習を初めて使用する場合、最も難しいのはコードではなく、モデル、データ、メトリクス、トレーニング/テスト、さらに AI、ディープ ラーニング、LLM の追加など、すべてが広すぎると感じることです。この記事の使命は、非常に明確な 1 つのことを行うことです。それは、何を学んでいるのか、何のために学習しているのか、圧倒されないようにどの順序で学習するのかを理解するための全体的なマップを作成することです。
レッスンの目標
- AI、機械学習、ディープラーニング、データサイエンスを区別する
- エンドツーエンドの ML プロセスを直感的なレベルで理解する
- どの問題を ML を使用して解決する必要があるか、どの問題に ML を必要としないかを知る
1. 機械学習とは何ですか?
機械学習は、私たちがすべてのルールを手作業で記述する代わりに、コンピューターがデータからルールを学習する方法です。
たとえば:
- 電子メールのスパム問題: 「無料の単語がある場合、それはスパムである」などのルールを何百も記述する代わりに、スパム/スパムではないというラベルを付けた数千の電子メールをモデルに与え、モデルがパターンを独自に学習できるようにします。
- 住宅価格予測問題: モデルはエリア、場所、部屋数、住宅築年数、販売価格の関係を学習します。
重要な点: ML は人間と同じように「知的」ではありません。データが十分に良好で、目標が十分に明確である場合にのみ、統計的規則性を見つけることができます。
2. よく混同されている概念を区別する
| コンセプト | 短い意味 | 例 |
|---|---|---|
| AI | 最も広い概念: 機械を知性のように動作させる | チャットボット、AI ゲーム |
| 機械学習 | データから学習するAIの分野 | チャーン予測、不正行為検出 |
| ディープラーニング | ML は多層ニューラル ネットワークを使用します。画像認識、音声認識 | |
| データサイエンス | データのマイニングによる洞察と意思決定のサポート | ダッシュボード、コホート分析 |
簡単に覚えられる方法:
- AI は「大きな箱」です。
- ML は AI を実行する一般的な方法です。
- ディープラーニングは、ML 内の一連のテクニックです。
- データ サイエンスは ML とまったく同じではありませんが、ML を強力なツールとして使用します。
3. エンドツーエンドの ML パイプライン
実際の ML プロジェクトは通常、次のフローに従います。
- ビジネス上の問題を特定します。
- ビジネス上の問題を予測問題に変換します。
- データを収集して理解します。
- 評価指標を選択します。
- ベースラインを作成します。
- モデルをベースラインよりも適切にトレーニングします。
- エラーをチェックし、結果を説明します。
- モデルを使用します。
- ドリフトを監視し、必要に応じて再トレーニングします。
チャーン問題の例:
- ビジネス上の質問: どの顧客がサービスをやめようとしていますか?
- ML の定式化: 顧客が今後 30 日間にキャンセルする確率を予測します。
- 入力機能: ログイン回数、サポートチケットの数、サービスパッケージ、使用時間。
- 出力: チャーン確率またはチャーン/チャーンラベルなし。
4. ML を使用すべき場合とそうでない場合は何ですか?
ML は次の場合に適しています。
- 過去のデータが十分にあります。
- 学習のための明確なアウトプットがあります。
- 難しいルールは難しいルールで書かれています。
- 予測が現在の予測よりも優れている場合、実用的な価値があります。
次の場合には ML を使用しないでください。
- この問題を解決するには、いくつかの固定ルールだけが必要です。
- データがないか、データが汚れすぎています。
- モデルの測定に正しい/間違った方法はありません。
- ML の導入コストはメリットよりも高くなります。
ML を使用しない例:
- 一定の法律に従って付加価値税を計算します。
- 請求書に自動的に番号を付けます。
- フィールドが空かどうかを確認します。
5. ML 問題の基本的なタイプ
回帰
実数を予測します。
たとえば:
- 住宅価格
- 来週の収益
- 温度
分類
ラベルを予測します。
たとえば:
- スパム/スパムなし
- チャーンあり / チャーンなし
- 不正行為をする/不正行為をしない
クラスタリング
組み込みのラベルはなく、モデルはデータ自体をグループ化します。
たとえば:
- 顧客のセグメンテーション
- 購買行動に応じて製品をグループ化する
異常検出
異常を見つけます。
たとえば:
- 異常な取引
- デバイスがエラー信号を生成する
6. ベースラインとは何ですか? なぜそれが必要ですか?
ベースラインは、比較のための最も単純なモデルまたは戦略です。
たとえば:
- トレーニング セットの平均価格を使用して住宅価格を予測します。
- すべての顧客に「離脱がない」と予測します。
新しいモデルがベースラインを上回らない場合、プロジェクトには価値がありません。初心者は、複雑なモデルが実際に何かを改善するかどうかを知らずに、すぐに XGBoost やニューラル ネットワークに飛び込むという間違いを犯すことがよくあります。
7. scikit-learn を使用した非常に短い例
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
X, y = load_iris(return_X_y=True)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
model = LogisticRegression(max_iter=300)
model.fit(X_train, y_train)
pred = model.predict(X_test)
print("Accuracy:", accuracy_score(y_test, pred))
このコードで重要なことは、各関数を覚えることではなく、構造を理解することです。
- データあり
X, y - 個別のトレーニング/テスト
- モデルを電車にフィットさせます
- テストで評価される
これは、ほとんどの ML ワークフローのバックボーンです。
##8 初心者はどのような順序で学べばよいでしょうか?
このシリーズの適切な順序は次のとおりです。
- 全体像を理解する。
- Pandas を使用してデータを操作する方法を理解します。
- 最初のモデルをすばやく作成します。
- メトリクスと過学習について早い段階で学びます。
- 次に、パイプライン、チューニング、本番環境に進みます。
たとえば、ベースラインを理解する前にチューニングに飛びつくなど、逆向きに学習すると、「ノートの丸暗記」が容易になります。
練習問題を練習する
- AI、ML、ディープラーニングの違いを自分の言葉で書いてください。
- 仕事や生活における問題を 3 つ選択し、回帰、分類、クラスタリングであるか、ML を使用すべきではないかを分類します。
- ML よりもルールベースを使用した方がうまく解決できる問題例を見つけます。
よくある間違い
- ビジネス上の問題を理解する前に、アルゴリズムを学習してください。
- 単純すぎる問題に対して ML を使用する。
- モデルのみに注目し、データとメトリクスを無視します。
完了基準
- ML とは何かを日常用語で説明する
- 4 つの基本的なタイプの問題を区別する
- エンドツーエンドの ML ワークフローを高レベルで説明する