คู่มือ AI ภาษา

อคติตำแหน่ง ALiBi

ALiBi (Attention with Linear Biases) เป็นวิธีที่ชาญฉลาดในการทำให้หม้อแปลงไฟฟ้าเข้าใจถึงลำดับคำโดยไม่ต้องฝังตำแหน่งแบบเดิมๆ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It lets a model trained on short text handle much longer inputs at inference time.

เจาะลึก

หม้อแปลงไฟฟ้าไม่มีแนวคิดเรื่องการเรียงลำดับคำในตัว ดังนั้น จึงต้องมีวิธีการเข้ารหัสตำแหน่ง วิธีการแบบคลาสสิกจะเพิ่มการฝังตำแหน่งให้กับเวกเตอร์โทเค็น ALiBi ซึ่งเปิดตัวโดย Press, Smith และ Lewis ในปี 2021 โยนสิ่งเหล่านั้นออกไปโดยสิ้นเชิง แต่จะสะกิดคะแนนความสนใจโดยตรงแทน: เมื่อโทเค็นการสืบค้นดูโทเค็นคีย์ ALiBi จะลบค่าปรับตามสัดส่วนของระยะห่างระหว่างโทเค็นเหล่านั้น โทเค็นที่อยู่ห่างกันจะได้รับการลงโทษที่ใหญ่กว่า ดังนั้นโมเดลจึงชอบบริบทใกล้เคียงโดยธรรมชาติ เฮดความสนใจแต่ละอันจะมีค่าปรับคงที่ ดังนั้นบางเฮดจึงมองในพื้นที่ในขณะที่บางตัวมองเห็นได้ไกลกว่า เนื่องจากความลำเอียงเป็นเพียงฟังก์ชันของระยะทาง ALiBi จึงคาดการณ์ลำดับที่ยาวกว่าที่เห็นในการฝึกซ้อมได้อย่างงดงาม

ข้อมูลเชิงลึกทางเทคนิค

สำหรับการสืบค้นที่ตำแหน่ง i และคีย์ที่ตำแหน่ง j นั้น ALiBi จะเพิ่ม m * (j - i) เข้ากับคะแนนความสนใจดิบก่อน softmax โดยที่ m คือค่าคงที่เฉพาะส่วนหัว (ความชันสร้างลำดับทางเรขาคณิต เช่น 1/2, 1/4, 1/8) เนื่องจาก j น้อยกว่าหรือเท่ากับ i ในความสนใจเชิงสาเหตุ เทอมนี้จึงเป็นศูนย์หรือลบ ซึ่งจะลงโทษโทเค็นที่อยู่ห่างไกล ไม่มีพารามิเตอร์ที่เรียนรู้และไม่มีการฝัง ดังนั้นโอเวอร์เฮดเพียงอย่างเดียวคือเมทริกซ์อคติที่คำนวณไว้ล่วงหน้า

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของอคติตำแหน่ง ALiBi

ALiBi พิสูจน์ให้เห็นว่าอคติที่สัมพันธ์กันตามระยะทางเอาชนะการฝังตำแหน่งสัมบูรณ์สำหรับลักษณะทั่วไปของความยาว และแนวคิดดังกล่าวได้แทรกซึมการออกแบบบริบทยาวสมัยใหม่ในปัจจุบัน โมเดลล่าสุดบางรุ่นชอบการฝังแบบหมุน (RoPE) แทน แต่ ALiBi ยังคงได้รับความนิยมในกรณีที่การประมาณค่าแบบสุดโต่งมีความสำคัญ และใช้ในโมเดลอย่าง BLOOM และ MPT คาดว่าจะมีการทดลองแบบไฮบริดอย่างต่อเนื่อง โดยผสมผสานอคติด้านระยะทางเข้ากับการปรับขนาด RoPE ในขณะที่ห้องปฏิบัติการผลักดันหน้าต่างบริบทไปยังโทเค็นนับล้านโดยไม่ต้องฝึกอบรมใหม่ตั้งแต่ต้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ฝึกอบรมแชทบอตเกี่ยวกับตัวอย่างโทเค็น 1,024 รายการ แต่ปรับใช้กับเอกสารโทเค็น 4,096 รายการโดยไม่ต้องฝึกอบรมใหม่ โดยอาศัยการคาดการณ์ของ ALiBi

BLOOM 176B รุ่นหลายภาษา ซึ่งใช้ ALiBi สำหรับการจัดการตำแหน่ง

โมเดล MPT ของ MosaicML ซึ่งใช้ ALiBi เพื่อโฆษณาความยาวบริบทไม่จำกัดอย่างมีประสิทธิภาพในการอนุมาน

สรุปสัญญาทางกฎหมายที่ยาวนานซึ่งเกินระยะเวลาการฝึกอบรมดั้งเดิมของโมเดล โดยที่อคติในบริบทใกล้เคียงทำให้ความสนใจสอดคล้องกัน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแก้ไขตำแหน่งสำหรับการขยายบริบท

คำถามที่พบบ่อย

What is ALiBi Position Bias?

ALiBi (Attention with Linear Biases) เป็นวิธีที่ชาญฉลาดในการทำให้หม้อแปลงไฟฟ้าเข้าใจถึงลำดับคำโดยไม่ต้องฝังตำแหน่งแบบเดิมๆ ช่วยให้โมเดลที่ได้รับการฝึกเกี่ยวกับข้อความสั้นสามารถจัดการอินพุต ณ เวลาอนุมานได้นานขึ้นมาก

อาลีบี ย่อมาจากอะไร?

ALiBi ย่อมาจาก Attention with Linear Biases ซึ่งตั้งชื่อตามการลงโทษเชิงเส้นที่เพิ่มให้กับคะแนนความสนใจ

ALiBi ลงโทษโทเค็นระยะไกลอย่างไร

ALiBi จะลบค่าตามสัดส่วนของระยะห่างของคีย์การค้นหาออกจากคะแนนความสนใจ ดังนั้นโทเค็นที่อยู่ไกลออกไปจะมีน้ำหนักน้อยลง

อะไรคือข้อได้เปรียบในทางปฏิบัติที่โด่งดังที่สุดของ ALiBi?

เนื่องจากอคตินั้นขึ้นอยู่กับระยะทางเท่านั้น โมเดลที่ได้รับการฝึกในลำดับสั้นๆ จึงสามารถจัดการกับโมเดลที่ยาวกว่ามากในเวลาอนุมานได้

อะไรคือความแตกต่างเกี่ยวกับอคติเชิงเส้นในหัวความสนใจ?

ALiBi กำหนดความชันคงที่ให้กับหัวแต่ละหัวที่แตกต่างกัน (เช่น 1/2, 1/4, 1/8) เพื่อให้หัวที่แตกต่างกันเข้าร่วมในช่วงที่ต่างกัน

เมื่อเปรียบเทียบกับการฝังตำแหน่งแบบเดิม ALiBi จะเพิ่มพารามิเตอร์ที่เรียนรู้จำนวนเท่าใด

ALiBi ไม่แนะนำพารามิเตอร์ที่เรียนรู้ใหม่ ความลาดชันต่อหัวเป็นค่าคงที่ที่กำหนดไว้ล่วงหน้า