แบบจำลองที่ใช้พลังงาน
แบบจำลองที่อิงพลังงาน (EBM) เรียนรู้ฟังก์ชัน 'พลังงาน' แบบสเกลาร์ที่กำหนดค่าต่ำให้กับข้อมูลที่เป็นไปได้ และค่าสูงให้กับข้อมูลที่ไม่น่าเชื่อ โดยกำหนดการแจกแจงความน่าจะเป็นโดยไม่ต้องบังคับให้ทำให้เป็นมาตรฐานได้ง่าย
ภาพรวม
This flexibility makes them a unifying lens for much of machine learning, from classifiers to generative models.
เจาะลึก
แบบจำลองที่อิงพลังงานกำหนดความน่าจะเป็นผ่านการแจกแจงของ Boltzmann (Gibbs) โดยที่ p(x) เป็นสัดส่วนกับ exp(-E(x)) โดยที่ E(x) เป็นฟังก์ชันพลังงานที่เรียนรู้ ซึ่งมักเป็นโครงข่ายประสาทเทียม การฝึกอบรมจะลดพลังของข้อมูลจริงลง และเพิ่มพลังของสิ่งอื่นๆ ทั้งหมด สิ่งที่จับได้คือฟังก์ชันพาร์ติชัน Z ซึ่งเป็นผลรวมหรืออินทิกรัลของ exp(-E(x)) เหนืออินพุตที่เป็นไปได้ทั้งหมด ซึ่งโดยทั่วไปยากต่อการคำนวณ ดังนั้น EBM จึงได้รับการฝึกอบรมด้วยการประมาณค่า: ความแตกต่างเชิงคอนทราสต์ การจับคู่คะแนน หรือการประมาณค่าเชิงตรงกันข้ามสัญญาณรบกวน และสุ่มตัวอย่างผ่านวิธี MCMC เช่น ไดนามิกของ Langevin ที่เป็นไปตามการไล่ระดับพลังงาน ตัวอย่างคลาสสิก ได้แก่ เครือข่าย Hopfield และเครื่อง Boltzmann ที่จำกัด; งานสมัยใหม่เชื่อมโยง EBM กับแบบจำลองการแพร่กระจาย GAN และแม้แต่ตัวแยกประเภทธรรมดาที่ถูกตีความใหม่ว่าเป็นฟังก์ชันพลังงาน
ข้อมูลเชิงลึกทางเทคนิค
แบบจำลองกำหนดความน่าจะเป็น p(x) = exp(-E(x)) / Z เนื่องจาก Z (ตัวปรับมาตรฐานของอินพุตทั้งหมด) นั้นยาก คุณจึงไม่ค่อยคำนวณความน่าจะเป็นโดยตรง แทนที่จะเป็นเช่นนั้น ให้จับคู่คะแนนและการสุ่มตัวอย่าง Langevin โดยใช้ประโยชน์จากการไล่ระดับสีของบันทึก p(x) เท่ากับ -gradient ของ E(x) ดังนั้น Z จึงหลุดออกไป จากนั้น Langevin Dynamics จะสร้างตัวอย่างโดยการดัน x ลงเนินในพลังงานซ้ำๆ และเพิ่มสัญญาณรบกวน โดยเดินไปยังบริเวณที่มีพลังงานต่ำและมีโอกาสสูง
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของแบบจำลองพลังงาน
EBM กำลังเพลิดเพลินกับความสนใจครั้งใหม่ เนื่องจากพวกมันเป็นสะพานเชื่อมทางทฤษฎีระหว่างแบบจำลองการแพร่กระจาย แบบจำลองกำเนิดตามคะแนน และเครือข่ายที่เลือกปฏิบัติ คะแนนที่แบบจำลองการแพร่กระจายเรียนรู้นั้นโดยพื้นฐานแล้วคือการไล่ระดับพลังงาน คาดหวังระบบไฮบริดที่ใช้ฟังก์ชันพลังงานสำหรับข้อจำกัดที่ยืดหยุ่นและแยกย่อยได้ (รวมพลังงานหลายชนิดเพื่อควบคุมการผลิต) การสุ่มตัวอย่างที่ดีกว่าและเร็วกว่า MCMC และการประยุกต์ใช้ในการให้เหตุผลและการวางแผน โดยที่ 'ค้นหาการกำหนดค่าพลังงานต่ำสุด' จะแสดงการปรับให้เหมาะสมและความพึงพอใจตามข้อจำกัดตามธรรมชาติ
การใช้งานจริงในโลกแห่งความเป็นจริง
เครือข่ายฮอปฟิลด์ทำหน้าที่เป็นหน่วยความจำเชื่อมโยงที่เรียกคืนรูปแบบที่เก็บไว้จากอินพุตที่มีเสียงดังหรือบางส่วนโดยการตกตะกอนในสถานะพลังงานต่ำ
เครื่องจักร Boltzmann แบบจำกัดที่ใช้ในอดีตเพื่อการกรองการทำงานร่วมกันและการฝึกอบรมเครือข่ายความเชื่อเชิงลึกล่วงหน้า
การตีความตัวแยกประเภทมาตรฐานใหม่เป็นแบบจำลองที่ใช้พลังงาน (แนวทาง JEM) เพื่อปรับปรุงการสอบเทียบ ความทนทาน และการตรวจจับไม่กระจาย
การทำนายแบบมีโครงสร้างและความพึงพอใจตามข้อจำกัด โดยที่วิธีแก้ไขจะพบได้โดยการลดพลังงานที่เรียนรู้ไปเหนือตัวแปรที่มีปฏิสัมพันธ์หลายอย่าง (เช่น การประมาณค่าหรือการจัดวาง)
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Energy-Based Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โมเดลกำเนิดตามคะแนน
คำถามที่พบบ่อย
What is Energy-Based Models?
แบบจำลองที่อิงพลังงาน (EBM) เรียนรู้ฟังก์ชัน 'พลังงาน' แบบสเกลาร์ที่กำหนดค่าต่ำให้กับข้อมูลที่เป็นไปได้ และค่าสูงให้กับข้อมูลที่ไม่น่าเชื่อ โดยกำหนดการแจกแจงความน่าจะเป็นโดยไม่ต้องบังคับให้ทำให้เป็นมาตรฐานได้ง่าย ความยืดหยุ่นนี้ทำให้พวกเขาเป็นเลนส์ที่รวมการเรียนรู้ของเครื่องส่วนใหญ่ ตั้งแต่ตัวแยกประเภทไปจนถึงโมเดลเชิงกำเนิด
ในแบบจำลองที่ใช้พลังงาน พลังงานเกี่ยวข้องกับความน่าจะเป็นของจุดข้อมูลอย่างไร
ด้วยการแจกแจงแบบ Boltzmann นั้น p(x) จะเป็นสัดส่วนกับ exp(-E(x)) ดังนั้นข้อมูลที่เป็นไปได้จึงถูกกำหนดให้มีพลังงานต่ำและมีความน่าจะเป็นสูง
อะไรทำให้การฝึกอบรมโมเดลที่เน้นพลังงานเป็นเรื่องยาก
การประมวลผล Z จำเป็นต้องมีการรวมหรือการบูรณาการ exp(-E(x)) ในพื้นที่อินพุตทั้งหมด ซึ่งโดยทั่วไปเป็นไปไม่ได้ ทำให้ต้องใช้วิธีการฝึกอบรมโดยประมาณ
โดยทั่วไปจะใช้วิธีสุ่มตัวอย่างใดเพื่อดึงตัวอย่างจาก EBM
ไดนามิกของ Langevin จะเคลื่อนตัวอย่างลงเนินซ้ำๆ ไปตามการไล่ระดับพลังงานในขณะที่เพิ่มสัญญาณรบกวน และมาบรรจบกันไปยังบริเวณที่มีพลังงานต่ำ
เหตุใดวิธีการเช่นการจับคู่คะแนนจึงสามารถหลีกเลี่ยงการคำนวณฟังก์ชันพาร์ติชัน Z ได้
เนื่องจาก Z ไม่ได้ขึ้นอยู่กับ x การหาอนุพันธ์ของบันทึก p(x) เทียบกับ x จึงเป็นการยกเลิก เหลือเพียงเกรเดียนต์พลังงานซึ่งสามารถลากได้
ข้อใดต่อไปนี้คือโมเดลที่ใช้พลังงานแบบคลาสสิก
เครือข่าย Hopfield เป็นโมเดลที่ใช้พลังงานในยุคแรกๆ ซึ่งจัดเก็บรูปแบบเป็นสถานะพลังงานต่ำและเรียกคืนโดยการลดพลังงาน