คู่มือ AI ภาษา

การถอดรหัสแบบขนานโครงกระดูกของความคิด

Skeleton-of-Thought (SoT) เป็นเทคนิคการกระตุ้นและถอดรหัสที่ขอให้โมเดลภาษาร่างโครงร่างจุดคำตอบสั้นๆ จากนั้นจึงขยายแต่ละจุดแบบขนาน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it can cut the wall-clock latency of long answers by roughly 2x without retraining the model.

เจาะลึก

โดยทั่วไปโมเดลภาษาขนาดใหญ่จะสร้างโทเค็นครั้งละหนึ่งโทเค็น ดังนั้นคำตอบที่ยาวจึงช้าเพียงเพราะแต่ละคำจะรอคำที่อยู่ข้างหน้า Skeleton-of-Thought เปิดตัวโดยนักวิจัยที่ Tsinghua และ Microsoft ในปี 2023 ได้ปรับโครงสร้างงานใหม่ การโทรครั้งแรกจะถามนางแบบเกี่ยวกับโครงกระดูกสั้นๆ ซึ่งเป็นรายการที่มีหมายเลขกำกับหัวข้อ 3 ถึง 10 จุด โดยแต่ละรายการเป็นเพียงคำไม่กี่คำ การเรียกชุดที่สองจะขยายทุกจุดอย่างอิสระและพร้อมกัน เนื่องจากแต่ละจุดไม่ได้ขึ้นอยู่กับอีกจุดหนึ่ง การขยายจะถูกต่อกลับเข้าด้วยกันเป็นคำตอบสุดท้าย เนื่องจากขั้นตอนการขยายที่ช้าทำงานไปพร้อมๆ กัน เวลาแฝงทั้งหมดจึงลดลงอย่างรวดเร็วสำหรับคำถามที่คำตอบถูกแยกย่อยออกเป็นส่วนๆ อย่างเป็นธรรมชาติ เช่น การแสดงรายการเคล็ดลับหรือตัวเลือกการเปรียบเทียบ

ข้อมูลเชิงลึกทางเทคนิค

SoT หาประโยชน์จากการอนุมานของตัวถอดรหัสนั้นขึ้นอยู่กับเวลาแฝง และไม่ได้ผูกกับการคำนวณเสมอไป: คำขอเดียวมักจะทำให้ GPU ใช้งานน้อยเกินไป การขยายจุดที่ทำงานเป็นชุดจะทำให้ฮาร์ดแวร์ไม่ว่างและทับซ้อนกับการสร้างจุดต่อจุด ด้วยโมเดล API การขยายจะออกตามคำขอพร้อมกัน สำหรับรุ่นท้องถิ่น พวกเขาแชร์การส่งต่อแบบกลุ่มหนึ่งชุด ขั้นตอนโครงกระดูกเพิ่มค่าใช้จ่ายระยะสั้นคงที่ ดังนั้นการเร่งความเร็วสุทธิจึงเพิ่มขึ้นตามความยาวของคำตอบและจำนวนคะแนนที่เป็นอิสระ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการถอดรหัสแบบขนานของโครงกระดูกแห่งความคิด

คาดว่าแนวคิด SoT จะรวมเข้ากับการกำหนดเส้นทางแบบปรับเปลี่ยนได้: ระบบจะตรวจจับเมื่อแบบสอบถามสลายตัวอย่างสมบูรณ์และสลับไปใช้การขยายแบบขนาน โดยถอยกลับไปใช้การใช้เหตุผลตามลำดับสำหรับงานที่ต้องพึ่งพาอาศัยกันอย่างแน่นหนา เช่น การพิสูจน์ทางคณิตศาสตร์ ตัวแปรต่างๆ เช่น SoT ที่มีการขึ้นต่อกันของกราฟแบบไดนามิกช่วยให้จุดที่อ้างอิงถึงกันและกันได้ เนื่องจากเฟรมเวิร์กการให้บริการเพิ่มการรองรับคำขอย่อยแบบเนทีฟแบบแบตช์และการถอดรหัสเชิงคาดเดา กลยุทธ์การแยกส่วนแบบขนานจะกลายเป็นเลเยอร์การลดเวลาแฝงมาตรฐาน แทนที่จะเป็นเคล็ดลับแจ้งด้วยตนเอง

การใช้งานจริงในโลกแห่งความเป็นจริง

เร่งความเร็วแชทบอทที่ตอบว่า 'ขอ 8 เคล็ดลับในการลดต้นทุนคลาวด์ให้ฉัน' โดยขยายเคล็ดลับทั้ง 8 ข้อในคราวเดียว

ผู้ช่วยฝ่ายสนับสนุนลูกค้าที่สร้างคู่มือการแก้ไขปัญหาแบบหลายส่วนที่มีโครงสร้างพร้อมเวลาแฝงในการตอบสนองที่ต่ำกว่า

สร้างคำตอบเปรียบเทียบ (ข้อดีข้อเสียของผลิตภัณฑ์สองรายการ) โดยเติมกระสุนแต่ละนัดพร้อมกัน

ระบบการให้บริการแบ็กเอนด์ที่แยกส่วนคำตอบอิสระเป็นชุดเพื่อเพิ่มการใช้งาน GPU ในระหว่างการสร้างรูปแบบยาว

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Skeleton-of-Thought Parallel Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การถอดรหัสโทเค็น MaskGIT แบบขนาน

คำถามที่พบบ่อย

What is Skeleton-of-Thought Parallel Decoding?

Skeleton-of-Thought (SoT) เป็นเทคนิคการกระตุ้นและถอดรหัสที่ขอให้โมเดลภาษาร่างโครงร่างจุดคำตอบสั้นๆ จากนั้นจึงขยายแต่ละจุดแบบขนาน สิ่งสำคัญคือสามารถลดเวลาแฝงของนาฬิกาแขวนของคำตอบยาวๆ ได้ประมาณ 2 เท่าโดยไม่ต้องฝึกอบรมโมเดลใหม่

ขั้นแรกของ Skeleton-of-Thought ก่อให้เกิดอะไร?

ก่อนอื่น SoT จะแจ้งให้โมเดลปล่อยโครงกระดูกสั้น ๆ ของส่วนหัวของจุด ซึ่งจากนั้นจะขยายแยกกัน

เหตุใดระยะการขยายจุดจึงสามารถทำงานแบบขนานได้

จุดโครงกระดูกได้รับการออกแบบให้เป็นอิสระ ดังนั้นการขยายจุดเหล่านี้จึงไม่ต้องรอพี่น้อง

เป้าหมายคอขวด SoT หลักในการถอดรหัส LLM ปกติคืออะไร

การถอดรหัสมาตรฐานมีความล่าช้าเนื่องจากแต่ละโทเค็นรอโทเค็นก่อนหน้า SoT ซ้อนทับกันเพื่อลดเวลานาฬิกาแขวน

SoT ให้การเร่งความเร็วที่ใหญ่ที่สุดสำหรับคำถามประเภทใด

คำตอบที่แยกย่อยออกเป็นส่วนๆ หลายๆ ส่วนจะได้รับประโยชน์สูงสุด เนื่องจากแต่ละส่วนจะขยายออกพร้อมกัน

SoT เพิ่มค่าใช้จ่ายอะไรเมื่อเทียบกับการสร้างลำดับเดียว

ขั้นตอนโครงกระดูกจะเพิ่มเวลาแฝงคงที่เล็กน้อย ซึ่งมีมากกว่าการขยายแบบขนานสำหรับคำตอบที่ยาว