เกิดอะไรขึ้น
นักวิจัยได้จำแนกลักษณะการทำงานของโมเดลภาษาที่ปกปิดไว้ภายใต้ภาระการให้บริการบนฮาร์ดแวร์จริง โดยพบว่าเวลาแฝงและความต้องการในการแบทช์แตกต่างจากโมเดลภาษาแบบถดถอยอัตโนมัติทั่วไป
บทความที่ส่งไปยัง arXiv เมื่อวันที่ 24 สิงหาคม ตรวจสอบโมเดลภาษาที่ปกปิดหรือ dLLM ซึ่งแตกต่างจากระบบ autoregressive ที่สร้างข้อความตามลำดับ dLLM สามารถปฏิเสธโทเค็นหลายรายการพร้อมกันได้ ผู้เขียนยืนยันว่าความแตกต่างนี้ทำให้การออกแบบระบบการให้บริการ dLLM มีความเสี่ยงโดยเพียงแค่แบกรับสมมติฐานจากการให้บริการโมเดลแบบถดถอยอัตโนมัติ การมีส่วนร่วมหลักของพวกเขาคือการอธิบายลักษณะเชิงประจักษ์ภายใต้ภาระที่เกิดขึ้นพร้อมกันมากกว่าการอภิปรายเชิงทฤษฎีล้วนๆ บทความนี้จึงวางกรอบคำถามการให้บริการเกี่ยวกับผลการดำเนินงานของกลไกการสร้างนั้น การเปรียบเทียบเป็นเรื่องเกี่ยวกับพฤติกรรมของระบบภายใต้โหลด โดยโมเดลจะสร้างโทเค็นหลายรายการผ่านการดีนอยซ์ซ้ำๆ แทนที่จะติดตามเส้นทางลำดับเดียว
นักวิจัยใช้ LLaDA-8B-Instruct กับอะแดปเตอร์ Discrete Diffusion Forcing LoRA บน GPU NVIDIA H200 ตัวเดียว พวกเขาประเมินการตั้งค่าบน GSM8K และ HumanEval บทความรายงานว่าคำขอความยากลำบากนั้นแยกจากกัน: คำขอแบ่งออกเป็น 11 ระดับขั้นตอน denoising คงที่ ผู้เขียนทดสอบว่าสัญญาณใดๆ สามารถทำนายระดับของคำขอก่อนที่จะเริ่มการสร้างได้หรือไม่ แต่ค่า R2 ที่รายงานที่ดีที่สุดคือ 0.150 ซึ่งบ่งชี้ถึงประสิทธิภาพในการทำนายที่อ่อนแอภายในการทดสอบของพวกเขา ตัวเลือกเหล่านี้จะกำหนดขอบเขตของการวัด การสังเกตการณ์ที่รายงานจะอธิบายถึงการผสมผสานระหว่างรุ่น อะแดปเตอร์ GPU และเกณฑ์มาตรฐานที่ผ่านการทดสอบ และการทดสอบการคาดการณ์ถูกนำเสนอเป็นส่วนหนึ่งของลักษณะเฉพาะเดียวกันนั้น
การศึกษายังรายงานด้วยว่างบประมาณการสร้างระยะสั้นสามารถปกปิดความแปรปรวนในการให้บริการได้ ตามรายงาน งบประมาณที่ต่ำกว่า 320 โทเค็นอาจตัดคำขอออกก่อนที่จะมองเห็นการแพร่กระจายของเวลาในการตอบสนอง ในระดับคำขอเดียว เวลานาฬิกาแขวนเพียง 24% เท่านั้นที่เป็นการประมวลผล GPU ในขณะที่ส่วนที่เหลือเป็นค่าใช้จ่ายในการจัดส่งฝั่ง CPU เมื่อคำขอถูกแบทช์เพื่อให้มีการแชร์การส่งต่อหนึ่งครั้งต่อขั้นตอนการดีนอยซ์ ปริมาณงานจะสูงขึ้น 16.0 เท่าในขนาดแบตช์ 16 เมื่อเทียบกับพื้นฐานการจัดส่งต่อคำขอ เอกสารนี้ยังใช้กฎการหมดเวลาแบทช์สำหรับแบทช์ซิงโครไนซ์การเติมคงที่ภายใต้การมาถึงของปัวซอง การวัดเหล่านี้ร่วมกันจะเชื่อมโยงพฤติกรรมระดับคำขอเข้ากับการจัดกำหนดการระดับระบบ โดยจะอธิบายทั้งเวลาที่ใช้ไปและวิธีที่การแบ่งปันงานระหว่างคำขอเปลี่ยนแปลงปริมาณงานที่รายงาน ขณะเดียวกันก็รักษาการวิเคราะห์การหมดเวลาแบบแบตช์ที่เชื่อมโยงกับโมเดลการมาถึง
ทำไมมันถึงสำคัญ
การค้นพบนี้สามารถช่วยให้วิศวกรออกแบบโครงสร้างพื้นฐานที่มีประสิทธิภาพมากขึ้นสำหรับโมเดลภาษาที่อิงการแพร่กระจาย ขณะเดียวกันก็แสดงให้เห็นว่าเกณฑ์มาตรฐานและสมมติฐานสั้นๆ ที่สืบทอดมาจากการให้บริการแบบถดถอยอัตโนมัติสามารถซ่อนต้นทุนการดำเนินงานที่สำคัญได้
ความสำคัญในทางปฏิบัติคือการให้บริการ dLLM อาจต้องมีการทำงานแบบขนานในระดับที่แตกต่างจากการให้บริการอัตโนมัติ ในบัญชีของรายงาน หน่วยสำคัญในการแบ่งปันงานคือแต่ละขั้นตอนการปฏิเสธ ไม่ใช่เพียงคำขอทั้งหมด ซึ่งจะเปลี่ยนวิธีที่ระบบการให้บริการควรคำนึงถึงการรับเข้า การแบ่งกลุ่ม และการไล่ออก เมื่อมีคำขอหลายรายการกำลังดำเนินการผ่านการคำนวณที่ใช้ร่วมกัน ผลลัพธ์คือบทเรียนเกี่ยวกับระบบเกี่ยวกับการจับคู่โครงสร้างพื้นฐานกับกระบวนการสร้างโมเดล ความแตกต่างนั้นส่งผลต่อวิธีการประเมินส่วนประกอบที่ให้บริการ การรับเข้า การแบ่งกลุ่ม และการขับไล่ไม่ได้เป็นเพียงรายละเอียดการดำเนินการในกรอบนี้เท่านั้น พวกเขาเป็นส่วนหนึ่งของการปรับระบบให้เข้ากับกระบวนการลดสัญญาณรบกวนของโมเดล
การค้นหาโอเวอร์เฮดของ CPU มีความเกี่ยวข้องอย่างยิ่งกับการประหยัดในการใช้งานและวิศวกรรมประสิทธิภาพ หากใช้เวลานาฬิกาแขวนคำขอเดียวเพียงเล็กน้อยในการคำนวณ GPU ในการกำหนดค่าที่ทดสอบนี้ การเพิ่มความจุตัวเร่งความเร็วมากขึ้นอาจไม่ช่วยแก้ปัญหาคอขวดที่โดดเด่นด้วยตัวมันเอง ผลการจัดชุดที่รายงานแสดงให้เห็นว่าคำขอประสานงานสามารถตัดค่าใช้จ่ายในการจัดส่งได้ แม้ว่าผลลัพธ์ของเอกสารจะเชื่อมโยงกับรุ่น อะแดปเตอร์ ฮาร์ดแวร์ ปริมาณงาน และพื้นฐานที่เฉพาะเจาะจงก็ตาม ความหมายคือจำเป็นต้องตรวจสอบเส้นทางทั้งหมดตั้งแต่การมาถึงของคำขอไปจนถึงการทำงานของตัวเร่งความเร็ว การวัดของกระดาษทำให้มองเห็นเส้นทางนั้นได้ในการตั้งค่าที่ทดสอบ และผลการจัดกลุ่มแสดงให้เห็นว่าเหตุใดตำแหน่งของค่าใช้จ่ายจึงมีความสำคัญเมื่อมีการประเมินประสิทธิภาพ
บทความนี้ยังท้าทายวิธีการเปรียบเทียบ dLLM งบประมาณการสร้างระยะสั้นสามารถทำให้เวลาแฝงปรากฏสม่ำเสมอมากกว่าที่เป็นอยู่ เนื่องจากคำขอสิ้นสุดลงก่อนที่จะเกิดขั้นตอนการ denoising รูปแบบเต็มรูปแบบ นั่นสำคัญสำหรับทุกคนในการเปรียบเทียบระบบการให้บริการหรือการประมาณเวลาตอบสนองที่ผู้ใช้มองเห็น ผู้เขียนโต้แย้งในเชิงโครงสร้างว่าคุณภาพเอาต์พุตไม่ควรลดลงเมื่อขนาดแบตช์เพิ่มขึ้นภายใต้สมมติฐานสามข้อที่ระบุไว้ แต่รายงานแหล่งที่มาวัดความแม่นยำของ GSM8K ในระดับคำขอเดียวเท่านั้น ซึ่งอยู่ที่ 74% ถึง 76% สิ่งนี้ไม่ได้สร้างคุณภาพที่ไม่เปลี่ยนแปลงในทุกเงื่อนไขของการจัดชุด นี่คือสาเหตุที่บทความนี้แยกการใช้เหตุผลเชิงโครงสร้างออกจากหลักฐานที่วัดได้ สมมติฐานสนับสนุนข้อโต้แย้งของผู้เขียน ในขณะที่การวัดความแม่นยำที่รายงานยังคงจำกัดอยู่เฉพาะผลลัพธ์คำขอเดี่ยวที่ระบุไว้ และไม่ได้ตอบคำถามชุดงานที่กว้างขึ้น
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
การศึกษานี้เป็นการระบุลักษณะเฉพาะเบื้องต้นโดยอิงจากการกำหนดค่ารุ่นเดียว, GPU หนึ่งตัว และการวัดประสิทธิภาพสองค่า จำเป็นต้องมีการทดสอบแยกกันระหว่างรุ่น ฮาร์ดแวร์ ปริมาณงาน และการตั้งค่าการใช้งานจริงเพื่อกำหนดว่าผลลัพธ์จะนำไปใช้ในวงกว้างเพียงใด
สิ่งที่ไม่ทราบที่ใหญ่ที่สุดคือความสามารถทั่วไป การทดลองใช้การกำหนดค่าโมเดลการแพร่กระจายแบบมาสก์หนึ่งรายการ LLaDA-8B-สั่งงานด้วยอะแดปเตอร์ D2F LoRA และ GPU NVIDIA H200 หนึ่งตัว แหล่งที่มาไม่ได้กำหนดว่าระดับการนับก้าว 11 ระดับที่เหมือนกัน ความสามารถในการคาดการณ์ล่วงหน้าก่อนการสร้างที่อ่อนแอ ความสมดุลของเวลาระหว่าง CPU กับ GPU หรือการเพิ่มแบทช์ 16.0 เท่า จะปรากฏพร้อมกับ dLLM อะแดปเตอร์ ตัวเร่งความเร็ว สแต็กซอฟต์แวร์ หรือคำขอมิกซ์อื่นๆ หรือไม่ ขอบเขตเหล่านั้นมีความสำคัญเมื่อตีความผลลัพธ์ การค้นพบนี้เป็นหลักฐานเกี่ยวกับการตั้งค่าที่ทดสอบ ไม่ใช่แผนผังที่สมบูรณ์ของพฤติกรรมการให้บริการแบบปกปิดในการกำหนดค่าที่เป็นไปได้ทั้งหมด
การทำงานเพิ่มเติมควรทดสอบปริมาณการใช้งานจริงและผลลัพธ์ที่ยาวหรือหลากหลายมากขึ้น เอกสารฉบับนี้เตือนเป็นพิเศษว่างบประมาณที่ต่ำกว่า 320 โทเค็นสามารถซ่อนการแพร่กระจายของเวลาแฝงได้ ดังนั้นการประเมินควรรวมปริมาณงานที่นานพอที่จะเปิดเผยพฤติกรรมการลดสัญญาณรบกวนทั้งหมด นอกจากนี้ การวัดเวลาแฝง ปริมาณการประมวลผล การใช้หน่วยความจำ และคุณภาพร่วมกันยังเป็นสิ่งสำคัญ แทนที่จะถือว่าตัวเลขปริมาณงานเพียงค่าเดียวเป็นหลักฐานที่เพียงพอของความได้เปรียบในการปรับใช้ การวัดดังกล่าวจะช่วยให้แยกแยะการปรับปรุงปริมาณงานโดยเฉลี่ยได้ง่ายขึ้นจากการปรับปรุงที่ยังคงมีประโยชน์ภายใต้การรับส่งข้อมูลจริง นอกจากนี้ยังจะแสดงให้เห็นว่าพฤติกรรมการจัดกำหนดการที่สังเกตยังคงมีอยู่เมื่อปริมาณงานและความยาวเอาต์พุตเปลี่ยนแปลงหรือไม่
การเรียกร้องคุณภาพยังคงมีเงื่อนไข ผู้เขียนระบุว่าคุณภาพไม่ควรลดลงตามขนาดแบทช์ภายใต้สมมติฐานสามประการ แต่แหล่งที่มาไม่ได้ระบุชุดผลลัพธ์ความแม่นยำของขนาดแบทช์ในวงกว้าง และไม่ได้รายงานความพร้อมในการผลิตหรือการปรับใช้ที่ผู้ใช้ต้องเผชิญ การจำลองแบบแยกกันระหว่าง GSM8K, HumanEval และงานอื่นๆ จะช่วยพิจารณาว่าการซิงโครไนซ์แบทช์เป็นหลักการออกแบบที่มีประโยชน์ในวงกว้างหรือเป็นการเพิ่มประสิทธิภาพสำหรับการตั้งค่าการทดลองนี้เป็นหลัก การอ่านค่าที่สามารถป้องกันได้มากที่สุดนั้นมีเงื่อนไขจนกว่าการทดสอบเหล่านั้นจะพร้อมใช้งาน: การแบทช์แบบซิงโครไนซ์เป็นหลักการออกแบบที่น่ามีแนวโน้มในการตั้งค่าที่รายงาน ในขณะที่ยังคงต้องมีการกำหนดมูลค่าการใช้งานที่กว้างขึ้น