Perplexity และการวัดภาษา
Perplexity เป็นคะแนนคลาสสิกว่าโมเดลภาษามีความ 'ประหลาดใจ' เพียงใดจากข้อความจริง หากต่ำกว่าหมายความว่าสามารถคาดเดาคำศัพท์ได้อย่างมั่นใจมากขึ้น
ภาพรวม
It and metrics like BLEU and ROUGE are how researchers actually measure whether a model is getting better.
เจาะลึก
โมเดลภาษาจะกำหนดความน่าจะเป็นให้กับคำถัดไปทุกคำ Perplexity เปลี่ยนความน่าจะเป็นเหล่านั้นให้เป็นตัวเลขตัวเดียวที่ถามว่า โดยเฉลี่ยแล้ว มีทางเลือกที่เป็นไปได้เท่าๆ กันกี่ตัวเลือกในแต่ละขั้นตอน หากแบบจำลองมีความมั่นใจและถูกต้องอย่างสมบูรณ์ ความฉงนสนเท่ห์คือ 1; ถ้าเดาได้สม่ำเสมอใน 50,000 คำ ความฉงนคือ 50,000 ต่ำกว่าจะดีกว่า มันเป็นเลขชี้กำลังทางคณิตศาสตร์ของการสูญเสียโดยเฉลี่ยต่อคำ ดังนั้นจึงติดตามการฝึกได้โดยตรง แต่ความฉงนสนเท่ห์จะวัดเฉพาะการคาดเดาคำถัดไปเท่านั้น ไม่ใช่ว่าผลลัพธ์จะเป็นประโยชน์ จริง หรือเขียนได้ดี นั่นคือเหตุผลที่งานสร้างเพิ่มหน่วยเมตริก เช่น BLEU (การทับซ้อนกันของ n-gram สำหรับการแปล) และ ROUGE (การทับซ้อนสำหรับการสรุป) และเหตุใดการประเมินสมัยใหม่จึงต้องพึ่งพาการให้คะแนนของมนุษย์และการวัดประสิทธิภาพงานมากขึ้น
ข้อมูลเชิงลึกทางเทคนิค
Perplexity เท่ากับเลขยกกำลังของโอกาสบันทึกเชิงลบโดยเฉลี่ยที่แบบจำลองกำหนดให้กับข้อความที่ค้างไว้: exp(-(1/N) * ผลรวมของบันทึก P(คำ | คำก่อนหน้า)) มันเป็นเวอร์ชันที่เปลี่ยนแปลงอย่างแท้จริงของการสูญเสียข้ามเอนโทรปี เพียงแสดงเป็นปัจจัยการแตกแขนงที่มีประสิทธิภาพแทนที่จะเป็นบิตหรือ nats เนื่องจากขึ้นอยู่กับคำศัพท์และโทเค็นไนเซอร์ที่แน่นอนของโมเดล ค่าความฉงนสนเท่ห์จึงสามารถเทียบเคียงได้เฉพาะระหว่างโมเดลที่ใช้โทเค็นไนเซชันเดียวกันเท่านั้น การเปรียบเทียบโมเดลระดับคำกับโมเดลคำย่อยโดยตรงจึงไม่มีความหมาย
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของ Perplexity และการวัดทางภาษา
Perplexity จะยังคงเป็นการวินิจฉัยหลักในช่วงเวลาการฝึกอบรมเนื่องจากมีราคาถูกและติดตามการปรับให้เหมาะสมได้อย่างราบรื่น แต่ภาคสนามได้ก้าวข้ามการวินิจฉัยไปเป็นส่วนใหญ่เพื่อการตัดสินความสามารถที่แท้จริง เมื่อโมเดลอิ่มตัว การประเมินจะเปลี่ยนไปใช้เกณฑ์มาตรฐานงาน เช่น MMLU การจัดอันดับความชอบของมนุษย์ และการให้คะแนน LLM ในฐานะผู้ตัดสินเกี่ยวกับความช่วยเหลือและความถูกต้อง คาดว่าความงุนงงจะยังคงที่วิศวกรเมตริกแดชบอร์ดจับตาดูในระหว่างการฝึกล่วงหน้า ในขณะที่การกล่าวอ้างของสาธารณชนเกี่ยวกับแบบจำลองที่ 'ดีกว่า' นั้นอาศัยชุดเกณฑ์มาตรฐานและการประเมินแบบตัวต่อตัวโดยมนุษย์ที่รวบรวมเหตุผลและความฉงนสนเท่ห์ตามความเป็นจริงไม่สามารถทำได้
การใช้งานจริงในโลกแห่งความเป็นจริง
การติดตามความยุ่งยากในการตรวจสอบความถูกต้องในระหว่างการฝึกล่วงหน้าเพื่อยืนยันว่าโมเดลยังคงเรียนรู้อยู่ และเพื่อตรวจสอบเมื่อเริ่มมีการติดตั้งมากเกินไป
การใช้คะแนน BLEU เพื่อเปรียบเทียบระบบการแปลด้วยเครื่องใหม่กับการแปลโดยมนุษย์
การรายงาน ROUGE-L ซ้อนทับกันเพื่อเปรียบเทียบโมเดลการสรุปข่าวกับสรุปมาตรฐานทองคำ
การเปรียบเทียบจุดตรวจสอบแบบจำลองสองจุดบนคลังข้อมูลที่ยื่นออกมาเดียวกัน เพื่อตัดสินใจว่าจุดตรวจใดจะทำนายข้อความได้อย่างมั่นใจมากขึ้น
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Perplexity and Language Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างแบบจำลองภาษา
คำถามที่พบบ่อย
What is Perplexity and Language Metrics?
Perplexity เป็นคะแนนคลาสสิกว่าโมเดลภาษามีความ 'ประหลาดใจ' เพียงใดจากข้อความจริง หากต่ำกว่าหมายความว่าสามารถคาดเดาคำศัพท์ได้อย่างมั่นใจมากขึ้น ข้อมูลดังกล่าวและหน่วยเมตริก เช่น BLEU และ ROUGE เป็นวิธีที่นักวิจัยใช้วัดว่าแบบจำลองกำลังดีขึ้นหรือไม่
คะแนนความงุนงง LOWER บ่งบอกถึงอะไรเกี่ยวกับแบบจำลองภาษา
Perplexity วัดความประหลาดใจของโมเดลด้วยข้อความจริง ความฉงนสนเท่ห์ที่ต่ำกว่าหมายความว่าจะกำหนดความน่าจะเป็นที่สูงกว่าให้กับคำถัดไปจริง ดังนั้นจึงคาดการณ์ได้อย่างมั่นใจมากขึ้น
Perplexity ได้มาจากคณิตศาสตร์จำนวนการฝึกอบรมใด
Perplexity เป็นเลขชี้กำลังของความน่าจะเป็นของบันทึกเชิงลบโดยเฉลี่ย ทำให้เป็นการเปลี่ยนแปลงโดยตรงของการสูญเสียเอนโทรปีข้ามแบบที่แบบจำลองได้รับการฝึกฝนเพื่อลดให้เหลือน้อยที่สุด
แบบจำลองกำหนดความน่าจะเป็นแบบสม่ำเสมอสำหรับคำศัพท์ 10,000 คำโดยไม่ต้องเรียนรู้ ความฉงนสนเท่ห์ของมันคืออะไร?
Perplexity คือจำนวนที่มีประสิทธิผลของตัวเลือกที่มีโอกาสเท่าเทียมกัน ชุดเครื่องแบบล้วนๆ การเดามากกว่า 10,000 คำ ทำให้เกิดความสับสนถึง 10,000 คำ
เหตุใดคะแนนความฉงนสนเท่ห์จากแบบจำลองสองแบบที่แตกต่างกันจึงทำให้เข้าใจผิดเมื่อเปรียบเทียบโดยตรง
เนื่องจากความงุนงงได้รับการคำนวณต่อโทเค็น โมเดลระดับคำและแบบจำลองคำย่อยจึงแยกข้อความต่างกัน ทำให้ค่าความงุนงงแบบดิบไม่สามารถเปรียบเทียบได้โดยตรง
ตัวชี้วัดใดที่เกี่ยวข้องกับการประเมินการแปลด้วยเครื่องด้วยการซ้อนทับของ n-gram พร้อมการอ้างอิงมากที่สุด
BLEU จะวัดการทับซ้อนกันของคำ n-gram ระหว่างการแปลของระบบและการอ้างอิงโดยมนุษย์ และเป็นมาตรฐานที่มีมายาวนานสำหรับการประเมินการแปล