降维
降维将数据从许多列(特征)缩减到少数,同时保留重要的结构。
概述
It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.
深入探讨
真实的数据集通常具有数百或数千个特征:图像中的每个像素、词汇中的每个单词、机器上的每个传感器。在这样的高维空间中,数据点变得稀疏且相距较远,距离测量变得不可靠,并且模型往往会过度拟合噪声。这就是维度的诅咒。降维将数据映射到更少的维度,同时保留有意义的关系。 PCA 通过寻找最大方差的方向来线性地实现这一点。 t-SNE 和 UMAP 是非线性的,擅长揭示集群以进行可视化。降低维度可以消除冗余或噪声特征,减少内存和计算量,并且经常提高下游模型的准确性,因为混淆它的不相关信号较少。
技术洞察
PCA 的工作原理是计算特征的协方差并查找沿着最大方差方向指向的特征向量(“主成分”)。您保留最前面的几个组件并将数据投影到它们上,丢弃主要是噪声的低方差方向。相反,t-SNE 和 UMAP 对邻居关系进行建模:它们尝试将高维中接近的点保持在低维地图中接近的点。 UMAP 构建了附近点的图,这使得它比 t-SNE 更快,并且能够更好地保留更广泛的全局结构。
战略影响
更清晰的判决
它可以帮助您将清晰的技术声明与营销语言分开。
成本与预算
在花费金钱或时间之前,您可以提出更好的实施问题。
团队与工作流程
具有共同理解的团队可以做出更好的产品、政策和学习决策。
降维的未来
降维现在是大型人工智能管道中的例行步骤,而不是独立的任务。 UMAP 在很大程度上已成为探索大型语言和视觉模型嵌入的默认方式,工程师将数千个维度投影到 2D 地图中以检查模型学到了什么。预计与交互式仪表板的集成更加紧密,十亿行数据集的 GPU 加速实现速度更快,并且在可解释性工作中的使用越来越多,研究人员可以减少模型的内部激活来理解和调试其行为。
现实世界的实施
使用 UMAP 以 2D 形式绘制语言模型中的单词或句子嵌入,以查看模型将哪些概念组合在一起
在对疾病亚型进行聚类之前,将每个患者的数千个基因表达测量值压缩为几个组成部分
在将图像特征输入分类器之前减少图像特征,以便训练速度更快且不易过度拟合
将数百个指标的客户行为可视化为二维散点图,以发现不同的细分市场
风险与防护栏
不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。
基准测试可能看起来很强大,但实际性能却参差不齐。
忽视数据质量和评估计划通常会产生脆弱的结果。
实施路线图
从您需要的结果的简单语言定义开始。
在测试之前选择一种成功指标和一种失败条件。
使用代表性数据运行小型试点,而不是完善的演示集。
记录降维在哪些方面有帮助以及哪些更简单的方法更好。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dimensionality Reduction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Dimensionality Reduction?
降维将数据从许多列(特征)缩减到少数,同时保留重要的结构。它可以对抗“维数灾难”,加快模型速度,并让您真正以 2D 或 3D 方式可视化复杂数据。
什么是“维度诅咒”?
在非常高维的空间中,点分散得很远,距离测量失效,因此模型很难找到模式并且往往会过度拟合。
PCA 如何决定保留哪些方向?
PCA 找到主成分,即方差最大的轴,并保留顶部的成分,因为它们携带最多的信息。
为什么 PCA 被称为“线性”方法?
每个主成分都是原始特征的线性组合,因此 PCA 无法像 t-SNE 或 UMAP 那样捕获弯曲的非线性结构。
t-SNE 和 UMAP 特别擅长什么?
两者都是非线性技术,可将附近的点保持在低维地图中附近,从而使簇在 2D 或 3D 中可见。