การลดขนาดมิติ
การลดขนาดจะย่อข้อมูลจากหลายคอลัมน์ (คุณลักษณะ) เหลือเพียงไม่กี่คอลัมน์โดยยังคงรักษาโครงสร้างที่สำคัญไว้
ภาพรวม
It fights the 'curse of dimensionality,' speeds up models, and lets you actually visualize complex data in 2D or 3D.
เจาะลึก
ชุดข้อมูลจริงมักมีคุณสมบัตินับร้อยหรือนับพัน: ทุกพิกเซลในรูปภาพ ทุกคำในคำศัพท์ ทุกเซ็นเซอร์บนเครื่อง ในพื้นที่มิติสูงดังกล่าว จุดข้อมูลจะกระจัดกระจายและห่างกัน การวัดระยะทางไม่น่าเชื่อถือ และแบบจำลองมีแนวโน้มที่จะมีสัญญาณรบกวนมากเกินไป นี่คือคำสาปแห่งมิติ การลดขนาดจะจับคู่ข้อมูลในมิติที่น้อยลงมากโดยยังคงรักษาความสัมพันธ์ที่มีความหมายไว้ PCA ทำสิ่งนี้เป็นเส้นตรงโดยค้นหาทิศทางที่มีความแปรปรวนมากที่สุด t-SNE และ UMAP เป็นแบบไม่เป็นเชิงเส้นและเก่งในการเปิดเผยกลุ่มสำหรับการแสดงภาพ การลดขนาดจะลบคุณลักษณะที่ซ้ำซ้อนหรือเสียงรบกวน ตัดหน่วยความจำและการคำนวณ และบ่อยครั้งจะปรับปรุงความแม่นยำของโมเดลดาวน์สตรีม เนื่องจากมีสัญญาณที่ไม่เกี่ยวข้องน้อยกว่าที่จะสร้างความสับสน
ข้อมูลเชิงลึกทางเทคนิค
PCA ทำงานโดยการคำนวณความแปรปรวนร่วมของคุณลักษณะต่างๆ และค้นหาเวกเตอร์ลักษณะเฉพาะ ซึ่งเป็น 'องค์ประกอบหลัก' ที่ชี้ไปตามทิศทางของความแปรปรวนสูงสุด คุณเก็บส่วนประกอบอันดับต้นๆ และข้อมูลโปรเจ็กต์ไว้บนส่วนประกอบเหล่านั้น โดยละทิ้งทิศทางที่มีความแปรปรวนต่ำซึ่งส่วนใหญ่เป็นสัญญาณรบกวน t-SNE และ UMAP จำลองความสัมพันธ์เพื่อนบ้านแทน โดยพยายามเก็บจุดที่อยู่ใกล้ในมิติสูงไว้ใกล้ในแผนที่มิติต่ำ UMAP สร้างกราฟของจุดใกล้เคียง ซึ่งทำให้เร็วกว่า t-SNE และดีกว่าในการรักษาโครงสร้างระดับโลกที่กว้างขึ้น
ผลกระทบเชิงกลยุทธ์
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้
ต้นทุนและงบประมาณ
คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา
ทีมงานและขั้นตอนการทำงาน
ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น
อนาคตของการลดขนาดมิติ
ขณะนี้การลดขนาดเป็นขั้นตอนปกติภายในไปป์ไลน์ AI ขนาดใหญ่ แทนที่จะเป็นงานเดี่ยวๆ UMAP กลายเป็นค่าเริ่มต้นส่วนใหญ่สำหรับการสำรวจการฝังจากภาษาขนาดใหญ่และแบบจำลองการมองเห็น โดยที่วิศวกรฉายภาพหลายพันมิติลงในแผนที่ 2 มิติเพื่อตรวจสอบสิ่งที่แบบจำลองได้เรียนรู้ คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับแดชบอร์ดแบบโต้ตอบ การใช้งานที่เร่งด้วย GPU ที่เร็วขึ้นสำหรับชุดข้อมูลพันล้านแถว และการใช้งานที่เพิ่มมากขึ้นในงานการตีความ โดยที่นักวิจัยลดการเปิดใช้งานภายในของแบบจำลองเพื่อทำความเข้าใจและแก้ไขข้อบกพร่องของพฤติกรรม
การใช้งานจริงในโลกแห่งความเป็นจริง
พล็อตคำหรือประโยคที่ฝังจากโมเดลภาษาในรูปแบบ 2D ด้วย UMAP เพื่อดูว่าแนวคิดใดที่โมเดลจัดกลุ่มเข้าด้วยกัน
บีบอัดการวัดการแสดงออกของยีนหลายพันรายการต่อผู้ป่วยเป็นองค์ประกอบไม่กี่ส่วน ก่อนที่จะจัดกลุ่มชนิดย่อยของโรค
ลดฟีเจอร์รูปภาพก่อนป้อนเข้าเครื่องแยกประเภท เพื่อให้การฝึกเร็วขึ้นและมีแนวโน้มน้อยที่จะจัดวางมากเกินไป
การแสดงภาพพฤติกรรมของลูกค้าผ่านตัวชี้วัดหลายร้อยรายการในรูปแบบกระจายแบบ 2 มิติเพื่อระบุกลุ่มตลาดที่แตกต่างกัน
ความเสี่ยงและรั้ว
แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ
เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน
การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง
แผนงานการดำเนินงาน
เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ
เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ
ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม
เอกสารที่สามารถช่วยเรื่องการลดขนาดได้ และวิธีที่ง่ายกว่าจะดีกว่า
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dimensionality Reduction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Barlow Twins และการลดความซ้ำซ้อน
คำถามที่พบบ่อย
What is Dimensionality Reduction?
การลดขนาดจะย่อข้อมูลจากหลายคอลัมน์ (คุณลักษณะ) เหลือเพียงไม่กี่คอลัมน์โดยยังคงรักษาโครงสร้างที่สำคัญไว้ มันต่อสู้กับ 'คำสาปแห่งมิติ' เพิ่มความเร็วให้กับโมเดล และช่วยให้คุณเห็นภาพข้อมูลที่ซับซ้อนในแบบ 2 มิติหรือ 3 มิติได้อย่างแท้จริง
'คำสาปแห่งมิติ' คืออะไร?
ในพื้นที่มิติที่สูงมาก จุดจะกระจายออกจากกันและการวัดระยะทางจะพังทลายลง ดังนั้นแบบจำลองจึงประสบปัญหาในการค้นหารูปแบบและมีแนวโน้มที่จะมีขนาดพอดีเกินไป
PCA ตัดสินใจอย่างไรว่าจะคงทิศทางใด
PCA ค้นหาส่วนประกอบหลัก ซึ่งเป็นแกนที่มีความแปรปรวนมากที่สุด และเก็บส่วนประกอบอันดับต้นๆ ไว้เนื่องจากมีข้อมูลมากที่สุด
เหตุใด PCA จึงเรียกว่าวิธี 'เชิงเส้น'
ส่วนประกอบหลักแต่ละส่วนเป็นการผสมผสานเชิงเส้นของคุณลักษณะดั้งเดิม ดังนั้น PCA จึงไม่สามารถจับโครงสร้างโค้งและไม่เชิงเส้นอย่างที่ t-SNE หรือ UMAP สามารถทำได้
t-SNE และ UMAP มีประโยชน์อะไรเป็นพิเศษ?
ทั้งสองเทคนิคเป็นเทคนิคไม่เชิงเส้นที่ทำให้จุดใกล้เคียงใกล้เคียงในแผนที่มิติต่ำ ทำให้มองเห็นกระจุกดาวได้ในแบบ 2 มิติหรือ 3 มิติ