การสร้างแบบจำลองภาษา
การสร้างแบบจำลองภาษาเป็นงานง่ายๆ ที่หลอกลวงในการคาดเดาคำหรือโทเค็นที่จะตามมาในข้อความจนถึงขณะนี้
ภาพรวม
เป้าหมายเดียวนี้เมื่อขยายขนาดอย่างมาก คือสิ่งที่สร้างแชทบอทและผู้ช่วยเขียนที่ทรงพลังในปัจจุบัน
เจาะลึก
โดยแก่นแท้แล้ว โมเดลภาษาจะกำหนดความน่าจะเป็นให้กับลำดับของข้อความ เมื่อได้รับข้อความแจ้งว่า 'เมืองหลวงของฝรั่งเศสคือ' ระบบจะประเมินว่าโทเค็นถัดไปที่เป็นไปได้แต่ละอันเป็นไปได้เพียงใด และ 'ปารีส' น่าจะทำคะแนนได้สูง แบบจำลองภาษาในยุคแรกๆ เป็น n-gram ทางสถิติที่เพิ่งนับความถี่ที่ลำดับคำปรากฏ แต่ต้องดิ้นรนกับบริบทที่ยาวและวลีที่มองไม่เห็น โมเดลภาษาประสาทแทนที่การนับด้วยการนำเสนอที่เรียนรู้ และสถาปัตยกรรม Transformer ตั้งแต่ปี 2017 ช่วยให้โมเดลจัดการกับข้อความที่ยาวได้อย่างมีประสิทธิภาพ โมเดลภาษาขนาดใหญ่สมัยใหม่ เช่น ตระกูล GPT ได้รับการฝึกฝนเกี่ยวกับคลังข้อความขนาดใหญ่โดยมีวัตถุประสงค์เดียว นั่นคือ ทำนายโทเค็นถัดไป น่าสังเกตที่การทำเช่นนี้จะทำให้แบบจำลองต้องซึมซับไวยากรณ์ ข้อเท็จจริง รูปแบบการให้เหตุผล และรูปแบบ เนื่องจากการทำนายข้อความอย่างถูกต้องต้องอาศัยความเข้าใจ การสร้างทำงานโดยการทำนายโทเค็นถัดไปซ้ำแล้วซ้ำอีกและป้อนกลับเข้าไป
ข้อมูลเชิงลึกทางเทคนิค
โมเดลภาษาสมัยใหม่ส่วนใหญ่จะเป็นแบบถดถอยอัตโนมัติ โดยจะแยกความน่าจะเป็นของประโยคเป็นผลคูณของความน่าจะเป็นของโทเค็นถัดไป โดยทำนายทีละโทเค็นจากซ้ายไปขวา การฝึกอบรมจะช่วยลดการสูญเสียเอนโทรปีข้าม ซึ่งให้รางวัลแก่การกำหนดความน่าจะเป็นสูงให้กับโทเค็นถัดไปจริงในข้อความการฝึกอบรม นี่เป็นการควบคุมดูแลด้วยตนเอง ป้ายกำกับจะเป็นอิสระจากข้อความ ดังนั้นจึงไม่จำเป็นต้องมีคำอธิบายประกอบโดยมนุษย์ ในช่วงเวลาแห่งการสร้าง กลยุทธ์การสุ่มตัวอย่าง เช่น อุณหภูมิ top-k และ top-p (นิวเคลียส) จะควบคุมการแลกเปลี่ยนระหว่างเอาต์พุตที่คาดการณ์ได้กับเอาต์พุตที่สร้างสรรค์
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการสร้างแบบจำลองภาษา
การคาดการณ์โทเค็นถัดไปได้รับการพิสูจน์แล้วว่ามีประสิทธิภาพอย่างน่าประหลาดใจ และกฎหมายการปรับขนาดแสดงให้เห็นว่าแบบจำลองที่ใหญ่กว่าและข้อมูลที่มากขึ้นยังคงปรับปรุงขีดความสามารถ แม้ว่าการได้รับจะช้าลงและข้อมูลคุณภาพสูงก็ขาดแคลน ขอบเขตกำลังเปลี่ยนไปสู่การใช้เหตุผล หน้าต่างบริบทที่ยาวขึ้น และวิธีการหลังการฝึกอบรม เช่น การเรียนรู้แบบเสริมกำลังจากความคิดเห็นของมนุษย์ที่ส่งผลต่อพฤติกรรมหลังจากสร้างแบบจำลองพื้นฐานแล้ว คาดว่าจะมีการผสมผสานการสร้างแบบจำลองภาษาเข้ากับเครื่องมือ การดึงข้อมูล และอินพุตหลายรูปแบบอย่างต่อเนื่อง ในขณะที่วัตถุประสงค์พื้นฐานของการทำนายโทเค็นถัดไปยังคงเป็นรากฐานที่ทุกสิ่งทุกอย่างสร้างขึ้น
การใช้งานจริงในโลกแห่งความเป็นจริง
เติมข้อความอัตโนมัติในแป้นพิมพ์โทรศัพท์หรืออีเมลเพื่อแนะนำคำถัดไปขณะที่คุณพิมพ์
แชทบอทอย่าง ChatGPT สร้างคำตอบได้อย่างคล่องแคล่วด้วยการทำนายโทเค็นถัดไปซ้ำๆ
โปรแกรมแก้ไขโค้ด เช่น GitHub Copilot ทำนายบรรทัดถัดไปของโค้ดจากบริบทโดยรอบ
ระบบการรู้จำเสียงโดยใช้แบบจำลองภาษาเพื่อเลือกการถอดเสียงที่เป็นไปได้มากที่สุดในบรรดาตัวเลือกที่ฟังดูคล้ายกัน
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างแบบจำลองภาษามาสก์
คำถามที่พบบ่อย
การสร้างแบบจําลองภาษาคืออะไร?
การสร้างแบบจำลองภาษาเป็นงานง่ายๆ ที่หลอกลวงในการคาดเดาคำหรือโทเค็นที่จะตามมาในข้อความจนถึงตอนนี้ วัตถุประสงค์เดียวนี้ซึ่งขยายใหญ่ขึ้นอย่างมหาศาลคือสิ่งที่สร้างแชทบอทและผู้ช่วยการเขียนที่ทรงพลังในปัจจุบัน
งานหลักที่โมเดลภาษาดำเนินการคืออะไร?
แบบจำลองภาษาจะประมาณความน่าจะเป็นของสิ่งที่เกิดขึ้นถัดไปตามลำดับ และการสร้างจะทำงานโดยการทำนายซ้ำๆ และผนวกโทเค็นถัดไป
อะไรคือข้อจำกัดที่สำคัญของโมเดลภาษา n-gram ในยุคแรกๆ
แบบจำลอง N-gram อาศัยการนับลำดับคำสั้น ๆ ดังนั้นจึงจัดการบริบทระยะยาวได้ไม่ดีและล้มเหลวกับวลีที่ไม่เคยเห็น
เหตุใดการฝึกอบรมโมเดลภาษาจึงเรียกว่า 'การควบคุมตนเอง'
โทเค็นถัดไปที่ถูกต้องมีอยู่แล้วในข้อความ ดังนั้นโมเดลจึงสร้างเป้าหมายของตัวเองโดยไม่มีคำอธิบายประกอบด้วยตนเอง
'การถดถอยอัตโนมัติ' หมายถึงอะไรสำหรับโมเดลภาษา
โมเดลแบบถดถอยอัตโนมัติจะสร้างโทเค็นข้อความตามโทเค็น โดยปรับการคาดการณ์ใหม่กับทุกสิ่งที่สร้างขึ้นจนถึงตอนนี้
โดยทั่วไปแล้วฟังก์ชันการสูญเสียใดที่ใช้ในการฝึกโมเดลภาษา
การฝึกอบรมช่วยลดเอนโทรปีข้าม ให้รางวัลแก่แบบจำลองสำหรับการกำหนดความน่าจะเป็นสูงให้กับโทเค็นถัดไปจริงที่สังเกตได้ในข้อความการฝึกอบรม