MLT |Quiz 1|期末前複習 Session-1:PCA 與 Kernel 觀念一次整理

Author:

MLT |Quiz 1|Revision Session-1 這篇文章會把你在第一週與第二週最容易出題、也最容易卡住的觀念整理成「看得懂、算得出、講得清楚」的重點:從PCA(主成分分析)的演算法流程、幾何意義、投影與誤差,到變異量(variance)與Kernel相關的基礎理解,讓你面對 Quiz 不再只會背公式。

我第一次帶學生複習 PCA 時,發現大家最常犯的錯不是算不出特徵值,而是「投影到底在做什麼」講不完整。一次我在黑板上畫了兩維資料點,讓他們猜:主成分那條直線為什麼一定要跟資料的方向對齊?結果有人說是「看起來最長的方向」,有人說是「讓誤差最小的方向」,但都答不出為什麼誤差會長成那個向量式。後來我把投影向量 = xTw、誤差向量 = x − (xTw)w用同一張圖串起來,學生當場就能把 Quiz 的推導題對上。

📝 目錄

⚙️ 第一週核心:PCA 是什麼(Quiz 必考的前提)

PCA 是一種無監督學習方法:資料裡沒有「答案標籤」,你只有一組特徵向量,目標是找出能把資料用更少維度表示、同時保留最多變異的方向。

在 Revision Session-1 裡,講者一開始就強調:Quiz 的題目會圍繞 PCA 的演算法流程與幾何直覺。所以你要能回答的不只是「算什麼」,還要能說明「為什麼要這樣算」。我自己在教學時也會要求學生把流程用口頭講一次,因為只要你能講清楚,考試時通常就不會漏掉關鍵步驟。

PCA 的輸入是資料集:假設有 n 筆資料點,每筆資料點在 d 維空間中,寫成 x1, x2, …, xn。你接著會計算平均向量與共變異矩陣,再用特徵值與特徵向量找出主成分方向。

🧮 PCA 演算法流程:從平均到特徵分解(你要會算)

PCA 的標準流程是:平均 → 共變異矩陣 → 特徵值/特徵向量 → 選主成分方向。

先求平均向量。若題目假設 x̄ = 0(有些題會直接讓你省略),那你就不需要再做中心化;否則平均向量是所有資料點的平均。這一步在 Quiz 常用來檢查你是否理解「PCA 是找變異方向」,而不是直接拿原始座標硬找方向。

接著算共變異矩陣 C。當資料已中心化(或題目直接給 x̄=0)時,C 可寫成資料矩陣的形式(本質上是 1/n 乘上 XTX 的那類結構)。你需要熟悉它的來源:共變異矩陣把不同維度之間的共同變化關係濃縮成一個矩陣。

最後做特徵分解:你會得到特徵值與特徵向量,並使用特徵方程式把它們串起來。當你理解 特徵向量代表方向、特徵值代表該方向的變異量大小時,Quiz 題目就不會變成「只會套公式」。

📐 幾何意義:主成分方向為何要「互相垂直」?

主成分彼此互相垂直(正交),因為它們來自共變異矩陣的特徵向量,且特徵向量能構成一組正交基底。

講者在 Revision Session-1 中提醒:除了要知道怎麼算主成分,你要能用幾何方式描述每個主成分。當主成分是正交的,你就能把資料的變異拆成不同方向上的貢獻,這也是為什麼 PCA 可以逐步保留「最重要」的資訊。

在考題裡,常見會問你「每個主成分代表什麼物理意義?」你可以這樣回答:主成分方向是資料在該方向上投影後變異最大的方向;下一個主成分則在與前面方向正交的限制下,仍然讓投影變異最大。

因此主成分不是任意選一條線,而是由共變異矩陣的結構決定。你如果能把這句話講順,通常就能把後面投影與誤差題的語意接起來。

🎯 投影與誤差:Quiz 常考的「向量分解」

PCA 的核心幾何操作是:把資料點投影到主成分方向,並用誤差衡量投影損失。

在講者的兩維圖像中,你可以把每個資料點 x 看成向量,把主成分方向 w1 當成一條直線的方向向量。當你把 x 投影到 w1 上時,投影係數就是xTw1,也就是兩向量的內積(點積)。

投影後的向量可以表示成(xTw1)w1。這裡很重要:xTw1 是標量(投影長度/係數),乘上方向向量 w1 才會得到實際投影到直線上的向量。

接著定義誤差向量:e = x − (xTw1)w1。這個 e 正是「原始資料點與它投影到主成分直線上的那段垂直差」。Quiz 題目如果問「最小化誤差」或「用向量怎麼表示重建」,你就要能立刻寫出這個分解。

📉 目標函數:為什麼主成分是「讓誤差最小」的方向?

主成分方向會選成能讓重建誤差最小(或等價地讓投影變異最大)的方向。

講者用直覺說明:如果你在資料點附近畫無限多條直線(無限多個候選方向 w),只有其中一條會讓所有點投影後的近似最貼近原資料。這個「貼近」就是誤差向量的總量(或某種等價形式)最小。

你可以把它理解成:PCA 不是隨便找一個方向,而是在所有候選方向中挑選最能壓縮資料、又不丟掉太多資訊的那個方向。當你能把「投影」與「誤差」連起來,你就能回答 Quiz 常見的概念題,例如:為什麼主成分不是隨便選、為什麼要考慮正交性、為什麼特徵值與變異有關。

另外,Revision Session-1 的講者也提到過先前回顧時對「重建誤差與變異方向」的描述曾有小失誤,並在課堂中糾正。這提醒你:在 Quiz 裡,題目可能會要求你選對「沿哪個方向的量」才是你要的變異/誤差,因此務必把概念對齊,而不是只背關鍵字。

🔍 變異量(Variance)與特徵值:Quiz 你要講得出來

特徵值代表在對應特徵向量方向上的變異量大小。

當你完成共變異矩陣的特徵分解後,你得到一組特徵值與特徵向量。Quiz 的概念題很常問:哪個特徵值對應到「主成分保留最多資訊」?答案就是:特徵值越大,代表該方向上的資料投影變異越大,也就越值得保留。

因此你在選擇主成分時,通常會依特徵值大小排序,取前 k 個最大特徵值對應的特徵向量,形成新的低維表示。這一步也會在題目中以「計算要取哪個主成分」或「解釋 variance」的形式出現。

如果題目問「物理意義」,你可以用一句話回答:主成分方向就是資料在該方向上最會分散/變動的方向,特徵值就是這種分散程度的量化。

🧩 第二週銜接:Kernel 觀念你要先抓住什麼

Kernel 的核心用途是把資料映射到更高維,讓原本難分的結構變得更容易處理。

在 Revision Session-1 的後段,講者提到第二週的重要內容包含kernel。雖然完整推導可能在後續課程才會展開,但 Quiz 常會用「概念理解」方式考你:為什麼需要 kernel、它和「內積」的關係是什麼、以及它如何讓演算法在高維空間的效果得以計算。

你不需要在這一篇就把所有核函數公式背到倒背如流,但你要能回答:Kernel 是一種能在不明確計算高維映射的情況下,直接計算相似度/內積的工具。當你把這句話講清楚,面對 Quiz 的題型通常就能少錯一大半。

如果你同時還在複習 PCA,記得把兩者連起來:PCA 是在線性子空間做投影與重建;Kernel 相關內容則是為了處理更彎曲/更非線性的資料結構。

✅ 你在 Quiz 1 能直接用上的重點整理

把下面這些點背成「可口述」的版本,你就能應付大多數 Revision Session-1 對應的 Quiz 題。

  • PCA 是無監督學習:沒有標籤,靠資料本身找方向。
  • 流程:平均(中心化)→ 共變異矩陣 C → 特徵值/特徵向量 → 選最大特徵值對應方向。
  • 幾何:主成分方向彼此正交,用投影表示資料的近似。
  • 投影:投影係數是xTw,投影向量是(xTw)w。
  • 誤差:e = x − (xTw)w,最小化重建誤差/等價最大化投影變異。
  • Variance 與特徵值:特徵值對應該方向的變異大小。
  • Kernel(第二週銜接):用核函數在高維效果下處理相似度/內積。
Quiz 常問點 你要寫/要講的關鍵句
PCA 目的 找出保留最多變異的方向,把資料投影到低維近似。
投影公式 投影係數 xTw;投影向量 (xTw)w。
誤差向量 e = x − (xTw)w。
特徵值代表 該方向的變異量大小(variance)。
Kernel 概念 用核函數計算高維效果的相似度/內積。

🧾 總結:用投影與誤差把 PCA 觀念一次接起來

MLT |Quiz 1 | Revision Session-1 的重點其實很一致:你要把 PCA 從「演算法流程」理解到「投影與誤差的向量分解」,再連到特徵值/變異(variance)的意義;同時在第二週要先抓住kernel的概念定位,知道它是為了處理更非線性的結構。

我會建議你最後一次複習時,用自己的話把以下三句講出來:

  • 我先算共變異矩陣,再用特徵向量找方向。
  • 投影是 xTw,誤差是 x − (xTw)w。
  • 特徵值越大,代表該方向的 variance 越大,所以越值得保留。

❓ FAQ(Quiz 1 複習常見疑問)

🧠 PCA 投影到底是標量還是向量?

投影係數是標量,而投影結果是向量。 當你計算 xTw 時得到的是內積,因此是;若要得到投影到主成分方向的向量,就用 (xTw)w 乘回方向向量。

📉 誤差向量要怎麼寫才算對?

誤差向量是「原資料減去投影重建」。 以主成分方向 w 為例,誤差寫成 e = x − (xTw)w。這個 e 對應到圖上的垂直差,也就是投影近似造成的損失。

⚡ 特徵值在 PCA 裡代表什麼?

特徵值代表該特徵向量方向上的變異量大小。 在共變異矩陣的特徵分解後,特徵值越大,代表沿該方向資料投影的variance越大,因此通常會優先選擇對應的特徵向量作為主成分。

📺 來源影片參考