คู่มือ AI ภาษา

โมเดลตามลำดับต่อลำดับ

โมเดลตามลำดับจะจับคู่ลำดับหนึ่งไปยังอีกลำดับหนึ่งที่มีความยาวต่างกัน เช่น การแปลประโยคหรือการสรุปเอกสาร

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They introduced the encoder-decoder design and the attention mechanism that paved the way for the Transformer.

เจาะลึก

โมเดลลำดับต่อลำดับ (seq2seq) มีสองส่วน ได้แก่ ตัวเข้ารหัสที่อ่านลำดับอินพุตและบีบอัดความหมายของมัน และตัวถอดรหัสที่สร้างลำดับเอาต์พุตทีละโทเค็น ผลงานสำคัญประจำปี 2014 ของ Sutskever, Vinyals และ Le ใช้ LSTM แบบเรียงซ้อนสำหรับการแปลด้วยเครื่อง จุดอ่อนเกิดขึ้น: การอัดทั้งประโยคให้เป็นเวกเตอร์ที่มีความยาวคงที่เพียงตัวเดียวทำให้ข้อมูลอินพุตยาวหายไป ในปี 2015 Bahdanau ได้แนะนำความสนใจ โดยให้ตัวถอดรหัสมองย้อนกลับไปที่สถานะของตัวเข้ารหัสทั้งหมด และมุ่งเน้นไปที่สถานะที่เกี่ยวข้องมากที่สุดสำหรับคำที่ส่งออกแต่ละคำ วิธีนี้ช่วยแก้ปัญหาคอขวดและปรับปรุงการแปลได้อย่างมาก แนวคิดนี้ครอบคลุมงานข้อความอินพุตเป็นเอาท์พุตและเป็นแรงบันดาลใจโดยตรงต่อสถาปัตยกรรมการเอาใจใส่ตนเองเต็มรูปแบบของ Transformer ในปี 2560

ข้อมูลเชิงลึกทางเทคนิค

ตัวเข้ารหัสจะสร้างลำดับของสถานะที่ซ่อนอยู่ ตัวถอดรหัสจะสร้างเอาต์พุตแบบถดถอยอัตโนมัติ โดยมีเงื่อนไขกับเอาต์พุตก่อนหน้าและบริบทของตัวเข้ารหัส Attention คำนวณผลรวมถ่วงน้ำหนักของสถานะตัวเข้ารหัสโดยใช้คะแนนการจัดตำแหน่ง ดังนั้นแต่ละขั้นตอนการถอดรหัสจะวาดเวกเตอร์บริบทแบบกำหนดเอง วิธีนี้จะแยกความยาวเอาต์พุตออกจากเวกเตอร์คอขวดเดี่ยว และให้การจัดตำแหน่งที่นุ่มนวลระหว่างตำแหน่งอินพุตและเอาต์พุต ซึ่งสามารถตีความได้ว่าคำต้นฉบับใดขับเคลื่อนคำที่แปลแต่ละคำ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของแบบจำลองตามลำดับต่อลำดับ

seq2seq สมัยใหม่ถูกครอบงำโดยโมเดลตัวเข้ารหัสและตัวถอดรหัส Transformer เช่น T5 และ BART ซึ่งจัดเฟรมงาน NLP เกือบทุกงานเป็นข้อความเป็นข้อความ seq2seq ที่ใช้ RNN ส่วนใหญ่จะอิงตามประวัติ แต่รูปแบบตัวเข้ารหัส-ตัวถอดรหัสประสบความสำเร็จในการแปล การสรุป และการรู้จำเสียง คาดหวังการเติบโตอย่างต่อเนื่องในระบบ seq2seq หลายภาษาและหลายรูปแบบ บวกกับประสิทธิภาพที่เพิ่มขึ้นจากตัวถอดรหัสแบบไม่ถอยอัตโนมัติและแบบกลั่น ซึ่งปล่อยเอาต์พุตเร็วขึ้นในขณะที่ยังคงคุณภาพไว้

การใช้งานจริงในโลกแห่งความเป็นจริง

ระบบแปลภาษาด้วยเครื่องแปลงประโยคภาษาอังกฤษเป็นภาษาฝรั่งเศสหรือภาษาญี่ปุ่น

การสรุปข้อความเชิงนามธรรมที่เขียนบทความยาวๆ ให้เป็นบทสรุปสั้นๆ

การรู้จำเสียงจับคู่ลำดับรูปคลื่นเสียงกับการถอดเสียงข้อความ

ระบบแชทบอทและบทสนทนาที่จับคู่คำพูดของผู้ใช้กับการตอบกลับที่สร้างขึ้น

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sequence-to-Sequence Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ครูบังคับในแบบจำลองลำดับ

คำถามที่พบบ่อย

What is Sequence-to-Sequence Models?

โมเดลตามลำดับจะจับคู่ลำดับหนึ่งไปยังอีกลำดับหนึ่งที่มีความยาวต่างกัน เช่น การแปลประโยคหรือการสรุปเอกสาร พวกเขาแนะนำการออกแบบตัวเข้ารหัส-ตัวถอดรหัส และกลไกความสนใจที่ปูทางไปสู่ ​​Transformer

องค์ประกอบหลักสองประการของโมเดลลำดับต่อลำดับคืออะไร

ตัวเข้ารหัสจะอ่านและบีบอัดอินพุต และเครื่องถอดรหัสจะสร้างลำดับเอาต์พุต

กลไกความสนใจแก้ปัญหาสำคัญอะไรในโมเดล seq2seq

โปรดทราบ ให้ตัวถอดรหัสเข้าถึงสถานะของตัวเข้ารหัสทั้งหมด แทนที่จะอาศัยเวกเตอร์ที่บีบอัดเพียงตัวเดียว เพื่อแก้ไขประสิทธิภาพของประโยคยาว

โมเดลการแปล seq2seq ดั้งเดิมปี 2014 ใช้สถาปัตยกรรมใด

ซุตสเคเวอร์ และคณะ ใช้เครือข่ายที่เกิดซ้ำ LSTM แบบเรียงซ้อนสำหรับตัวเข้ารหัสและตัวถอดรหัส

ความสนใจสร้างบริบทสำหรับแต่ละขั้นตอนการถอดรหัสอย่างไร

ความสนใจจะกำหนดน้ำหนักให้กับสถานะตัวเข้ารหัส ดังนั้นแต่ละขั้นตอนเอาต์พุตจะเน้นที่ตำแหน่งอินพุตที่เกี่ยวข้องมากที่สุด

เหตุใดเอาต์พุต seq2seq จึงมีความยาวแตกต่างจากอินพุตได้

ตัวถอดรหัสจะสร้างการถดถอยอัตโนมัติและสามารถหยุดที่โทเค็นจุดสิ้นสุดของลำดับได้ ซึ่งจะทำให้ความยาวเอาต์พุตแปรผันได้