基礎知識指南

無監督學習

無監督學習尋找資料中的結構,但每個範例都沒有目標標籤。

閱讀時間約2分鐘最後更新

概述

常见任务包括对相似记录进行聚类以及将高维测量压缩为更少的维度。發現的模式仍然需要解釋和驗證。

重點摘要

  • 未標記的模式不是不言自明的。
  • 特徵和縮放會影響相似性。
  • 驗證穩定性和實際用途。

深入探討

聚类根据数学相似性规则对示例进行分组。该规则取决于特征、它们的缩放、算法及其设置。根據購買頻率找到的一組可能與根據產品偏好找到的一組不同。沒有自動保證任何一個都對應於有用的客戶類別。降維將測量值的集合轉換為更小的表示形式。它可以帮助可视化、压缩或其他模型。二維圖片會丟棄訊息,因此圖中的距離和明顯間隙不應被視為有關原始資料的不容置疑的事實。透過改變合理的預處理選擇或對不同的記錄進行取樣來評估穩定性。檢查代表性和邊緣範例。内部分数可以比较数学分组,但必须根据真实目的来判断有用性。如果部分資料存在標籤,它們可以提供額外的外部檢查。不尋常的例子可能是重要的、錯誤的,或者只是與大多數不同。異常分數是調查的信號,而不是不當行為的證據或診斷。在部署無人監督的偵測器之前確定警報發生後的情況。

技術洞察

特徵尺度改變了基於距離的方法。如果年度支出為數千,而造訪次數為數十,則未按比例計算的支出可能會主導計算的距離。

查看特徵尺度如何改變相似度

  1. 想像一下兩筆記錄相差 1 次造訪和 1,000 美元的支出。原始歐幾里德距離主要由美元差異決定。
  2. 使用參考資料集上擬合的統計資料縮放每個特徵,然後再次比較鄰居。
  3. 在命名之前檢查產生的群組是否穩定且對於規定的任務有用。

這個建構的範例解釋了建模選擇;它沒有建立通用的聚類方法。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

現實世界的實施

將文件分組供圖書館員審查和命名。

可視化感測器測量結果,同時保留原始尺寸。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄無監督學習在哪些方面有幫助以及哪些更簡單的方法更好。

資料來源與延伸閱讀

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Unsupervised Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

三元組損失和度量學習

常見問題

無監督學習能否發現真正的類別?

它在特定的假設下找到結構。結果組可能對應也可能不對應於對應用程式有意義的類別。