はじめに
常にラベルがあるとは限りません。クラスタリングは、ラベルのないデータ内の隠れた構造を見つけるのに役立つ一連の手法です。実際には、顧客のセグメント化、行動のグループ化、データ検出によく使用されます。
レッスンの目標
- クラスタリングが教師あり学習とどのように異なるかを理解します。
- 基本レベルで K 平均法の使用方法を理解します。
- クラスタリング評価の限界を理解する。
K 平均法はどのように機能しますか?
- クラスターの数 k を選択します。
- 各点を最も近いクラスター中心に割り当てます。
- クラスター センターを再度更新します。
- 安定するまで繰り返します。
適切な実際的な問題
- 購買行動に応じて顧客をグループ化します。
- 埋め込みにより投稿やユーザーをグループ化します。
- ビジネス チームが異なる行動をとるためのセグメントを作成します。
クラスターの数を選択するにはどうすればよいですか?
絶対的な答えはありません。エルボーメソッド、シルエットスコア、そして最も重要なビジネス解釈を参照できます。
よくある間違い
- 生成されたクラスターは常に自然の真実であると考えてください。
- チャートが見栄えが良いという理由だけで k を選択します。
- クラスターのビジネス上の重要性をチェックしません。
練習問題を練習する
- データセットのセグメンテーションに対して K-Means を実行します。
- 各クラスターをビジネス言語で説明します。
- クラスターごとに異なるアクションを提案します。
完了基準
- ラベルを使用しないクラスタリングを理解します。
- スケーリングされたデータで K-Means を実行できます。
- ビジネスの観点からクラスターを解釈します。
段階的に練習する (上級)
- クラスタリングの前に特徴を正規化します。
- 複数の k 値を使用して K-Means を実行します。
- シルエットスコアとビジネス解釈を使用して評価します。
- 比較のために DBSCAN または Hierarchical を追加してみます。
- ビジネス言語に従ってクラスターに名前を付けます。
アーティファクトを送信する必要があります
- クラスタリングアルゴリズムの比較表。
- 各クラスターを説明するプロファイル (クラスター プロファイル)。
- 各クラスターの推奨アクションのリスト。
セルフテストの質問
- クラスタリングに絶対的な正解がないのはなぜですか?
- DBSCAN が K-Means よりも有益なのはどのような場合ですか?
- クラスターがビジネスに役立つかどうかをどのように評価するか?