Chuyển đến nội dung chính

第 2 課:設定生產標準 ML 學習環境

安裝Python、Jupyter、VS Code、NumPy/Pandas/scikit-learn;建立專案範本、管理依賴項和筆記本工作流程。

🧠 人工智慧與機器學習 — 第 1 課 第 2 課:設定標準 ML 學習環境 生產。生產

機器學習:從基礎到高級

第 0 部分:新手入門(第 0 週)

亞洲開發網

簡介

剛接觸 ML 的人通常會因為混亂的安裝環境而花費大量時間:Python 的許多版本、今天可以工作明天就不行的筆記本、隨意安裝的套件、沒有結構的專案文件。本文幫助您建立一個穩定的學習和工作環境,以便從下一課您可以只專注於學習 ML,而不是修復安裝錯誤。

課程目標

  • 為 ML 安裝乾淨的 Python 環境
  • 了解如何組織專案資料夾以學習和重複使用程式碼
  • 使用 NumPy、Pandas 和 scikit-learn 運行第一個筆記本

1. 選擇哪個Python版本?

推薦使用Python 3.11。

原因:

  • 大多數流行的 ML 庫都很好地支援它。
  • 比 3.9/3.10 更快、更穩定。
  • 與新版本相比,不相容的風險較小。

檢查版本:

python --version
python3 --version

2.使用venv還是Conda?

對於新手來說,有兩種流行的選擇:

venv

優點:

  • 可用於Python。
  • 輕、簡單。

缺點:

  • 使用具有複雜本機相依性的套件時較不方便。

康達/迷你康達

優點:

  • 良好的數據/機器學習環境管理。
  • 更容易安裝科學包。

缺點:

  • 稍微重一點。

在這個課程中,如果你是全新的,你可以使用它 venv。如果您打算長期進行深度學習,也許可以改用 Conda。

3.建立第一個項目

例如與 venv:

mkdir ml-course
cd ml-course

python -m venv .venv
source .venv/bin/activate

pip install --upgrade pip
pip install numpy pandas scikit-learn matplotlib jupyter

在 Windows PowerShell 上:

.venv\Scripts\Activate.ps1

4. 建議的資料夾結構

ml-course/
├── notebooks/
├── data/
│   ├── raw/
│   └── processed/
├── src/
│   ├── features/
│   ├── models/
│   └── utils/
├── outputs/
│   ├── figures/
│   └── models/
├── requirements.txt
└── README.md

意義:

  • notebooks/: 一個實驗和學習的地方。
  • data/raw/:原始數據,未經直接編輯。
  • data/processed/: 清理資料。
  • src/: 可重複使用的程式碼。
  • outputs/:模型、圖表、工件。

5. 應預先安裝工具

必填

  • 蟒蛇
  • VS代碼
  • 朱皮特
  • numpy, pandas, scikit-learn

應該有

  • matplotlib, seaborn
  • ipykernel
  • black 或類似的格式化程序
pip install seaborn ipykernel

6. 執行第一個筆記本

jupyter notebook

或使用VS Code開啟文件 .ipynb。

嘗試執行以下命令:

import numpy as np
import pandas as pd
from sklearn.datasets import load_iris

iris = load_iris(as_frame=True)
df = iris.frame

print(df.head())
print(df.shape)
print(df['target'].value_counts())

如果筆記本工作正常,您的環境足以完成本系列中的大部分基礎課程。

7. 文件應該從一開始就在那裡

requirements.txt

numpy
pandas
scikit-learn
matplotlib
seaborn
jupyter

README.md

最低自述文件應包含:

  • 專案目標
  • 如何安裝環境
  • 如何執行筆記本或腳本

8. 常見安裝錯誤

錯誤:已安裝軟體包但筆記本無法辨識它

原因通常是筆記本運行的核心與您剛安裝的環境不同。

如何處理:

python -m ipykernel install --user --name ml-course

然後在 VS Code/Jupyter 中選擇正確的核心。

### 錯誤: ModuleNotFoundError

檢查:

  • 環境已經啟動了嗎?
  • 你正確使用Python嗎?
  • 軟體包安裝到哪個環境?

錯誤:筆記本太亂

解決方案:

  • 筆記本僅用於探索
  • 可重複使用的程式碼切換 src/
  • 不要將所有內容放入 1000 行長的文件中

9. 從一開始就標準工作

三個小但極為重要的原則:

  1. 每個項目使用單獨的環境。 2.不要直接編輯原始資料。
  2. 在README中記錄如何運作項目。

如果你從一開始就做好這三件事,隨著專案數量的增加,你會省去很多麻煩。

練習練習

1.為本系列創建一個單獨的環境。 2. 根據上面的範例建立資料夾結構。 3. 執行第一個筆記本並儲存快照或輸出。

常見錯誤

  • 將套件安裝到全域環境。
  • 每個項目使用一個環境。
  • 我不知道筆記本使用的是哪個核心。

完成標準

  • 創造您自己的機器學習環境
  • 運行第一本筆記本
  • 擁有整潔、可重複使用的項目資料夾