คู่มือพื้นฐาน

วิศวกรรมคุณสมบัติ

วิศวกรรมฟีเจอร์เป็นงานฝีมือในการเปลี่ยนข้อมูลดิบให้เป็นอินพุตข้อมูล (ฟีเจอร์) ที่ช่วยให้โมเดลเรียนรู้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

In classic machine learning it is often the single biggest driver of accuracy, more than the choice of algorithm.

เจาะลึก

โมเดลสามารถเรียนรู้ได้จากอินพุตที่คุณให้เท่านั้น และข้อมูลดิบมักไม่ค่อยได้มาในรูปแบบที่เป็นประโยชน์ วิศวกรรมฟีเจอร์ได้ปรับเปลี่ยนรูปแบบใหม่: แยกวันในสัปดาห์ออกจากการประทับเวลา คำนวณการซื้อโดยเฉลี่ยของลูกค้า การเข้ารหัสหมวดหมู่เป็นตัวเลข ปรับขนาดค่าให้อยู่ในช่วงทั่วไป หรือรวมคอลัมน์เป็นอัตราส่วน เมื่อทำได้ดี จะเผยให้เห็นรูปแบบที่อัลกอริทึมต้องการ ดังนั้นโมเดลที่เรียบง่ายที่มีฟีเจอร์ที่ยอดเยี่ยมมักจะเหนือกว่าโมเดลที่ซับซ้อนในข้อมูลดิบ นอกจากนี้ยังต้องใช้ความรู้โดเมน เนื่องจากการรู้ว่า 'ธุรกรรมต่อนาที' เป็นสัญญาณของการฉ้อโกงคือสิ่งที่สร้างคุณลักษณะที่มีประสิทธิภาพ ความเสี่ยงแบบคลาสสิกคือข้อมูลรั่วไหล โดยไม่ได้ตั้งใจสร้างฟีเจอร์จากข้อมูลที่ไม่พร้อมใช้งานในเวลาคาดการณ์ ซึ่งทำให้คะแนนการทดสอบสูงเกินจริงแต่ล้มเหลวในการใช้งานจริง การเรียนรู้เชิงลึกทำให้บางส่วนเป็นไปโดยอัตโนมัติ แต่ปัญหาที่มีโครงสร้าง/ตารางยังคงต้องอาศัยปัญหาดังกล่าวเป็นอย่างมาก

ข้อมูลเชิงลึกทางเทคนิค

เทคนิคทั่วไป ได้แก่ การทำให้เป็นมาตรฐานหรือการทำให้เป็นมาตรฐาน (การปรับขนาดตัวเลขเพื่อไม่ให้มีฟีเจอร์เดียวครอบงำ) การเข้ารหัสแบบฮอตเดียวหรือการเข้ารหัสเป้าหมายสำหรับตัวแปรหมวดหมู่ การรวมค่าที่ต่อเนื่องกัน และการสร้างคุณสมบัติการโต้ตอบหรือแบบรวม ระเบียบวินัยที่สำคัญคือการปรับการแปลงให้เหมาะสม (เช่น ค่าเฉลี่ยของสเกลเลอร์และส่วนเบี่ยงเบนมาตรฐาน) กับข้อมูลการฝึกเท่านั้น จากนั้นจึงนำไปใช้กับชุดทดสอบและการตรวจสอบความถูกต้อง การคำนวณบนชุดข้อมูลทั้งหมดจะทำให้ข้อมูลรั่วไหลและสร้างผลลัพธ์ในแง่ดีมากเกินไปซึ่งจะไม่ถือเป็นการปรับใช้

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของวิศวกรรมคุณลักษณะ

การเรียนรู้เชิงลึกมีการดึงคุณสมบัติอัตโนมัติสำหรับรูปภาพ เสียง และข้อความ โดยที่เครือข่ายเรียนรู้การนำเสนอโดยตรงจากอินพุตดิบ แต่สำหรับข้อมูลแบบตารางและข้อมูลธุรกิจ ซึ่งเป็นข้อมูลองค์กรส่วนใหญ่ วิศวกรรมฟีเจอร์ที่คำนึงถึงอย่างรอบคอบยังคงเป็นปัจจัยชี้ขาด สาขานี้กำลังเปลี่ยนไปสู่ระบบอัตโนมัติ (AutoML, การสร้างฟีเจอร์อัตโนมัติ) และ 'ที่เก็บฟีเจอร์' ที่สามารถนำกลับมาใช้ใหม่ได้ ซึ่งช่วยให้ทีมสามารถแชร์ฟีเจอร์ที่สม่ำเสมอและผ่านการทดสอบอย่างดีในโมเดลต่างๆ คาดว่าจะมีเครื่องมือเพิ่มเติมที่แนะนำคุณสมบัติและป้องกันการรั่วไหล ในขณะที่ความเชี่ยวชาญด้านโดเมนของมนุษย์ยังคงเป็นสิ่งสำคัญสำหรับคุณสมบัติที่มีมูลค่าสูงสุด

การใช้งานจริงในโลกแห่งความเป็นจริง

การตรวจจับการฉ้อโกง: รับคุณสมบัติต่างๆ เช่น ความถี่ในการทำธุรกรรม เวลาตั้งแต่การซื้อครั้งล่าสุด และระยะห่างจากสถานที่ปกติ

การคาดการณ์ความต้องการ: แยกวันในสัปดาห์ ธงวันหยุด และค่าเฉลี่ยต่อเนื่องจากการประทับเวลาการขายดิบ

การให้คะแนนเครดิต: เปลี่ยนประวัติดิบให้เป็นอัตราส่วน เช่น หนี้สินต่อรายได้ และจำนวนการชำระล่าช้าล่าสุด

การเลิกใช้งานของลูกค้า: การรวมกิจกรรมไว้ในฟีเจอร์ต่างๆ เช่น การเข้าสู่ระบบต่อเดือนและวันนับตั้งแต่การมีส่วนร่วมครั้งล่าสุด

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ Feature Engineering ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Engineering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ฟีเจอร์ไปป์ไลน์ทางวิศวกรรมและการกำหนดเวอร์ชันข้อมูล

คำถามที่พบบ่อย

What is Feature Engineering?

วิศวกรรมฟีเจอร์เป็นงานฝีมือในการเปลี่ยนข้อมูลดิบให้เป็นอินพุตข้อมูล (ฟีเจอร์) ที่ช่วยให้โมเดลเรียนรู้ ในแมชชีนเลิร์นนิงแบบคลาสสิกมักเป็นตัวขับเคลื่อนความแม่นยำที่ใหญ่ที่สุดเพียงตัวเดียว มากกว่าตัวเลือกของอัลกอริธึม

วิศวกรรมคุณลักษณะคืออะไร?

วิศวกรรมคุณลักษณะเป็นเรื่องเกี่ยวกับการสร้างอินพุต (คุณลักษณะ) จากข้อมูลดิบเพื่อให้แบบจำลองสามารถค้นหารูปแบบที่เป็นประโยชน์ได้

เหตุใดวิศวกรรมฟีเจอร์จึงมักถูกอธิบายว่ามีความสำคัญในการเรียนรู้ของเครื่องแบบคลาสสิก

สำหรับข้อมูลที่มีโครงสร้าง คุณลักษณะที่ออกแบบมาอย่างดีมักจะมีความสำคัญมากกว่ารุ่นเฉพาะ ดังนั้นโมเดลที่เรียบง่ายที่มีคุณลักษณะที่ยอดเยี่ยมจึงอาจชนะได้

การรั่วไหลของข้อมูลในวิศวกรรมฟีเจอร์คืออะไร?

การรั่วไหลหมายถึงคุณลักษณะที่แอบซ่อนอยู่ในข้อมูลที่คุณไม่มีจริงเมื่อคาดการณ์ ส่งผลให้คะแนนการทดสอบสูงเกินจริงแต่กลับล้มเหลวในการใช้งานจริง

เมื่อปรับขนาดคุณลักษณะ (เช่น การกำหนดมาตรฐาน) คุณควรคำนวณค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานที่ใด

ติดตั้งเครื่องปรับขนาดกับข้อมูลการฝึกอบรมเท่านั้น จากนั้นนำไปใช้กับที่อื่น ป้องกันการรั่วไหล และให้การประมาณประสิทธิภาพที่สมจริง

ข้อใดต่อไปนี้เป็นเทคนิควิศวกรรมฟีเจอร์ทั่วไปสำหรับข้อมูลหมวดหมู่

โดยทั่วไปตัวแปรหมวดหมู่จะถูกแปลงเป็นตัวเลขผ่านการเข้ารหัสแบบฮอตเดียวหรือการเข้ารหัสเป้าหมาย เพื่อให้โมเดลสามารถใช้งานได้