คู่มือพื้นฐาน

ถ่ายโอนการเรียนรู้

ถ่ายโอนการเรียนรู้นำแบบจำลองที่ได้รับการฝึกอบรมแล้วมาใช้กับชุดข้อมูลขนาดใหญ่และปรับให้เข้ากับงานใหม่ที่เกี่ยวข้องกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Instead of starting from scratch, you stand on the shoulders of a model that already learned useful general features, saving enormous time, data, and compute.

เจาะลึก

การฝึกโมเดลที่แข็งแกร่งจากศูนย์มักต้องการตัวอย่างที่มีป้ายชื่อนับล้านและฮาร์ดแวร์ที่จริงจัง ถ่ายทอดการเรียนรู้แบบก้าวข้ามสิ่งนั้น แบบจำลองที่ได้รับการฝึกอบรมบนชุดข้อมูลขนาดใหญ่ เช่น เครือข่ายรูปภาพที่ได้รับการฝึกอบรมบน ImageNet หรือแบบจำลองภาษาที่ได้รับการฝึกอบรมบนข้อความเว็บ ได้เรียนรู้รูปแบบที่เป็นประโยชน์ในวงกว้างแล้ว ได้แก่ ขอบและรูปร่างสำหรับการมองเห็น ไวยากรณ์ และความหมายของข้อความ คุณใช้แบบจำลองที่ได้รับการฝึกอบรมมาและปรับความรู้ให้เข้ากับปัญหาเล็กๆ น้อยๆ เฉพาะเจาะจงของคุณ มีสองสไตล์หลัก ในการแตกฟีเจอร์ คุณจะหยุดเครือข่ายส่วนใหญ่และฝึกเฉพาะเลเยอร์เอาต์พุตใหม่ที่อยู่ด้านบน ในการปรับแต่งอย่างละเอียด คุณยังยกเลิกการตรึงเลเยอร์ที่ลึกกว่านั้นและฝึกฝนต่อไปด้วยอัตราการเรียนรู้ที่ต่ำ เพื่อให้โมเดลค่อยๆ ปรับเข้ากับข้อมูลของคุณโดยไม่ลืมสิ่งที่รู้

ข้อมูลเชิงลึกทางเทคนิค

เครือข่ายที่ได้รับการฝึกล่วงหน้าจะเรียนรู้ลำดับชั้น: เลเยอร์แรกจะบันทึกคุณลักษณะทั่วไป (ขอบ พื้นผิว ความสัมพันธ์ของคำพื้นฐาน) ในขณะที่เลเยอร์ต่อมาจะบันทึกแนวคิดเฉพาะงาน ถ่ายทอดการเรียนรู้ใช้ประโยชน์จากสิ่งนี้ หากงานของคุณคล้ายกับงานต้นฉบับ ให้ตรึงเลเยอร์แรกๆ เป็นตัวแยกคุณลักษณะคงที่ และฝึกเฉพาะส่วนหัวใหม่ หากข้อมูลของคุณแตกต่างกันมากขึ้น ให้ปรับแต่งเลเยอร์ที่ลึกกว่าโดยใช้อัตราการเรียนรู้ที่น้อยมาก เพื่อให้การอัปเดตเป็นไปอย่างนุ่มนวล ความเสี่ยงใหญ่คือการเปลี่ยนโดเมน: หากข้อมูลใหม่ดูแตกต่างจากข้อมูลการฝึกอบรมล่วงหน้ามากเกินไป คุณลักษณะที่ยืมมาจะเข้ากันได้ไม่ดี

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตแห่งการเรียนรู้แบบถ่ายทอด

การเรียนรู้แบบถ่ายโอนได้กลายเป็นวิธีเริ่มต้นในการสร้าง AI ทุกวันนี้แทบจะไม่มีใครฝึกโมเดลวิสัยทัศน์หรือภาษาขนาดใหญ่ตั้งแต่เริ่มต้น ทีมปรับเปลี่ยนแบบจำลองพื้นฐานที่ได้รับการฝึกอบรมมาแทน ขอบเขตคือวิธีการที่มีประสิทธิภาพด้านพารามิเตอร์ เช่น LoRA และอะแดปเตอร์ ซึ่งปรับแต่งน้ำหนักเพียงเล็กน้อยเพื่อปรับแต่งโมเดลขนาดใหญ่ในราคาถูก คาดว่าแนวโน้มนี้จะลึกซึ้งยิ่งขึ้น: โมเดลขนาดเล็กที่มีความเชี่ยวชาญกลั่นกรองและปรับแต่งจากโมเดลขนาดใหญ่ บวกกับความสนใจที่เพิ่มขึ้นในการบรรเทาการเปลี่ยนแปลงโดเมน และหลีกเลี่ยง 'การลืมอย่างหายนะ' เมื่อมีการดัดแปลงแบบจำลองซ้ำๆ

การใช้งานจริงในโลกแห่งความเป็นจริง

การปรับแต่งเครือข่ายที่ได้รับการฝึกฝนล่วงหน้าของ ImageNet เพื่อตรวจจับข้อบกพร่องเฉพาะในสายการผลิตของโรงงานด้วยภาพถ่ายเพียงไม่กี่พันภาพ

การปรับโมเดลภาษาที่ได้รับการฝึกล่วงหน้าขนาดใหญ่เพื่อร่างบทสรุปทางกฎหมายหรือทางการแพทย์โดยการปรับแต่งคลังข้อมูลเฉพาะทางที่มีขนาดเล็กลง

การใช้แบบจำลองที่ได้รับการฝึกอบรมเกี่ยวกับคำพูดทั่วไปเป็นจุดเริ่มต้นในการสร้างตัวจดจำสำหรับสำเนียงหรือภาษาถิ่นที่เฉพาะเจาะจง

ฝึกอบรมเลเยอร์สุดท้ายของโมเดลการมองเห็นอีกครั้งเพื่อจำแนกโรคพืชจากรูปภาพใบไม้สำหรับแอปการทำฟาร์ม

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ Transfer Learning ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Transfer Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเรียนรู้แบบกึ่งกำกับดูแล

คำถามที่พบบ่อย

What is Transfer Learning?

ถ่ายโอนการเรียนรู้นำแบบจำลองที่ได้รับการฝึกอบรมแล้วมาใช้กับชุดข้อมูลขนาดใหญ่และปรับให้เข้ากับงานใหม่ที่เกี่ยวข้องกัน แทนที่จะเริ่มต้นใหม่ทั้งหมด คุณจะยืนอยู่บนไหล่ของโมเดลที่ได้เรียนรู้คุณสมบัติทั่วไปที่เป็นประโยชน์แล้ว ซึ่งช่วยประหยัดเวลา ข้อมูล และการคำนวณได้มหาศาล

แนวคิดหลักในการถ่ายโอนการเรียนรู้คืออะไร

การเรียนรู้แบบถ่ายโอนใช้แบบจำลองที่เรียนรู้คุณสมบัติทั่วไปแล้วมาปรับใช้ ซึ่งช่วยประหยัดข้อมูล เวลา และการคำนวณ

เหตุใดคุณจึงใช้อัตราการเรียนรู้ที่ต่ำมากเมื่อปรับแต่งเลเยอร์ที่ลึกยิ่งขึ้น

การอัปเดตขนาดใหญ่บนชุดข้อมูลขนาดเล็กสามารถเขียนทับฟีเจอร์ที่ได้รับการฝึกล่วงหน้าอันทรงคุณค่าและโอเวอร์ฟิตได้อย่างรวดเร็ว ดังนั้นการอัปเดตจึงมีขนาดเล็ก

สถานการณ์ใดเหมาะสมที่สุดสำหรับการแยกคุณสมบัติธรรมดา (การแช่แข็งฐาน)

เมื่องานเป้าหมายใกล้เคียงกับงานเดิมและข้อมูลมีจำกัด คุณลักษณะที่ตรึงไว้จะมีความเกี่ยวข้องอยู่แล้ว ดังนั้นคุณจึงต้องการเพียงหัวใหม่เท่านั้น

'การเปลี่ยนโดเมน' อธิบายปัญหาอะไรในการถ่ายโอนการเรียนรู้

หากโดเมนเป้าหมายดูแตกต่างอย่างมากจากโมเดลที่ได้รับการฝึกล่วงหน้า คุณลักษณะที่นำมาใช้ซ้ำอาจถ่ายโอนได้ไม่ดีและความแม่นยำลดลง

เหตุใดเลเยอร์แรกของเครือข่ายที่ได้รับการฝึกอบรมจึงมักจะนำมาใช้ซ้ำได้ง่ายกว่าในภายหลัง

เลเยอร์แรกจะจับรูปแบบระดับต่ำที่เป็นประโยชน์ในวงกว้าง ในขณะที่เลเยอร์ต่อมาจะมีความเฉพาะเจาะจงกับงานต้นฉบับมากกว่า