คู่มือ AI ภาษา

RWKV ความสนใจเชิงเส้น

RWKV เป็นสถาปัตยกรรมที่ฝึกเหมือนกับ Transformer แต่รันการอนุมานเหมือนเครือข่ายเกิดซ้ำ โดยให้เวลาเชิงเส้นตรงและการสร้างหน่วยความจำคงที่

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันปรับรูปแบบความสนใจใหม่จนไม่มีต้นทุนกําลังสองและไม่มีแคชคีย์ค่าที่เพิ่มขึ้น

เจาะลึก

RWKV (ออกเสียงว่า 'RwaKuv') ย่อมาจาก Receptance, Weight, Key, Value ซึ่งเป็นองค์ประกอบหลักสี่ประการ สร้างขึ้นส่วนใหญ่เป็นโครงการเปิดกว้างที่ขับเคลื่อนโดยชุมชนซึ่งนำโดยบ่อเป็ง เป้าหมายคือการรักษาความสามารถในการฝึกอบรมแบบคู่ขนานของ Transformers ขณะเดียวกันก็ลดการอนุมานที่มีราคาแพง ความสนใจมาตรฐานจะจัดเก็บแคชคีย์-ค่าที่จะขยายตามโทเค็นทุกอัน และเปรียบเทียบโทเค็นใหม่แต่ละรายการกับโทเค็นก่อนหน้าทั้งหมด RWKV กลับมีสถานะซ่อนเร้นขนาดเล็กไปข้างหน้า โดยอัปเดตด้วยกฎการสลายตัวของเวลา เพื่อให้ข้อมูลที่เก่าจางหายไปอย่างราบรื่น ในระหว่างการฝึกสามารถคลี่ออกได้ในรูปแบบที่ขนานกัน ในระหว่างการสร้างจะทำหน้าที่เป็น RNN ที่สร้างโทเค็นทีละรายการด้วยต้นทุนคงที่ สิ่งนี้ทำให้น่าสนใจสำหรับบริบทที่ยาวนานและการปรับใช้ที่จำกัดทรัพยากร

ข้อมูลเชิงลึกทางเทคนิค

RWKV แทนที่ความสนใจแบบ dot-product ของ softmax ด้วยการเกิดซ้ำในลักษณะความสนใจเชิงเส้น น้ำหนักการสลายตัวตามเวลา (W) ที่เรียนรู้ต่อช่องจะควบคุมความเร็วของคีย์ที่ผ่านมาจะสูญเสียอิทธิพลไป ประตูรับ (R) จะตัดสินใจว่าจะอ่านสถานะสะสมมากน้อยเพียงใด และเวกเตอร์ของคีย์/ค่าจะป้อนผลรวมแบบถ่วงน้ำหนักที่กำลังดำเนินอยู่ เนื่องจากแต่ละขั้นตอนจะขึ้นอยู่กับสถานะก่อนหน้าเท่านั้น หน่วยความจำจึงคงที่ และงานต่อโทเค็นจะไม่เพิ่มขึ้นตามความยาวของลำดับ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของความสนใจเชิงเส้น RWKV

RWKV ทำซ้ำอย่างรวดเร็วผ่านเวอร์ชันต่างๆ (v4, v5 Eagle, v6 Finch และอื่นๆ) ซึ่งช่วยลดช่องว่างด้านคุณภาพด้วย Transformers ในขณะที่ยังคงรักษาต้นทุนเชิงเส้นไว้ คาดหวังการเติบโตอย่างต่อเนื่องในรุ่นหลายภาษาแบบเปิด การใช้งาน Edge และ CPU ที่หน่วยความจำคงที่มีความสำคัญ และการออกแบบแบบไฮบริด การอนุมานที่เกิดซ้ำอย่างสมบูรณ์ทำให้เป็นตัวเลือกที่แข็งแกร่งสำหรับการสตรีมแอปพลิเคชันและบริบทที่ยาวมากซึ่งแคชคีย์-ค่าอาจระเบิดได้

การใช้งานจริงในโลกแห่งความเป็นจริง

การใช้งานโมเดลการแชทแบบโอเพ่นซอร์สที่มีความสามารถบน CPU หรืออุปกรณ์หน่วยความจำเหลือน้อยโดยมีหน่วยความจำคงที่ต่อโทเค็น

การสตรีมการสร้างข้อความโดยสร้างโทเค็นทีละรายการโดยไม่มีแคชเพิ่มขึ้น

การประมวลผลเอกสารขนาดยาวโดยที่แคชคีย์-ค่าของ Transformer จะมีขนาดใหญ่มาก

โครงการจำลองชุมชนและหลายภาษาที่ต้องการสถาปัตยกรรมที่มีประสิทธิภาพและได้รับอนุญาตอย่างเปิดเผย

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the RWKV Linear Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ความสนใจเชิงเส้นและเคอร์เนลของนักแสดง

คำถามที่พบบ่อย

RWKV Linear Attention คืออะไร?

RWKV เป็นสถาปัตยกรรมที่ฝึกเหมือนกับ Transformer แต่รันการอนุมานเหมือนเครือข่ายเกิดซ้ำ โดยให้เวลาเชิงเส้นตรงและการสร้างหน่วยความจำคงที่ โดยจะปรับความสนใจใหม่เพื่อไม่ให้ต้นทุนกำลังสองและไม่มีแคชคีย์-ค่าเพิ่มขึ้น

คุณสมบัติพาดหัวของ RWKV คืออะไร?

เป้าหมายการออกแบบของ RWKV คือการฝึกอบรมแบบ Transformer แบบขนานรวมกับการอนุมานต้นทุนคงที่ที่เกิดขึ้นซ้ำๆ

ตัวอักษรใน RWKV ย่อมาจากอะไร?

RWKV ตั้งชื่อตามองค์ประกอบสี่ประการ: การรับ น้ำหนัก คีย์ และมูลค่า

RWKV รักษาหน่วยความจำให้คงที่ระหว่างการสร้างอย่างไร

เช่นเดียวกับ RNN RWKV จะอัปเดตสถานะที่มีขนาดคงที่ในแต่ละขั้นตอน ดังนั้นหน่วยความจำจะไม่เพิ่มขึ้นตามความยาวของลำดับ

น้ำหนักที่ลดลงตามเวลา (W) มีบทบาทอย่างไร?

น้ำหนักการสลายตัวต่อแชนเนลที่เรียนรู้จะกำหนดความเร็วของคีย์ที่ผ่านไปในสถานะกำลังทำงาน

เมื่อเปรียบเทียบกับความสนใจแบบ softmax การเกิดซ้ำของความสนใจเชิงเส้นของ RWKV จะหลีกเลี่ยงอะไรได้บ้าง

ด้วยการใช้การเกิดซ้ำ RWKV จะก้าวเท้าเลี่ยงการเปรียบเทียบทุกโทเค็นกับโทเค็นอื่น ๆ โดยลบต้นทุนกำลังสองออก