กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

การศึกษาพบว่าโมเดลภาษาที่แพร่กระจายแบบสวมหน้ากากจำเป็นต้องมีกลยุทธ์การให้บริการที่แตกต่างกัน

การศึกษา arXiv ใหม่โดยใช้ GPU NVIDIA H200 พบว่าโมเดลภาษาที่ปกปิดใช้เวลาส่วนใหญ่ในคำขอเดียวในการจัดส่ง CPU และการแบทช์ที่ซิงโครไนซ์สามารถปรับปรุงปริมาณงานได้อย่างมาก

5 min readRead the primary source
Source-page capture accompanying Study finds masked-diffusion language models need different serving strategies
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.23807
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

LoRA (การปรับตัวระดับต่ำ)
วิธีการปรับแต่งแบบละเอียดที่มีประสิทธิภาพด้วยพารามิเตอร์ที่เพิ่มเมทริกซ์อะแด็ปเตอร์ระดับต่ำ
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
แบบจำลองการแพร่กระจาย
สถาปัตยกรรมเชิงกำเนิดที่เรียนรู้ที่จะย้อนกลับสัญญาณรบกวนเพื่อสังเคราะห์ภาพ เสียง หรือเนื้อหาอื่นๆ
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยได้จำแนกลักษณะการทำงานของโมเดลภาษาที่ปกปิดไว้ภายใต้ภาระการให้บริการบนฮาร์ดแวร์จริง โดยพบว่าเวลาแฝงและความต้องการในการแบทช์แตกต่างจากโมเดลภาษาแบบถดถอยอัตโนมัติทั่วไป

บทความที่ส่งไปยัง arXiv เมื่อวันที่ 24 สิงหาคม ตรวจสอบโมเดลภาษาที่ปกปิดหรือ dLLM ซึ่งแตกต่างจากระบบ autoregressive ที่สร้างข้อความตามลำดับ dLLM สามารถปฏิเสธโทเค็นหลายรายการพร้อมกันได้ ผู้เขียนยืนยันว่าความแตกต่างนี้ทำให้การออกแบบระบบการให้บริการ dLLM มีความเสี่ยงโดยเพียงแค่แบกรับสมมติฐานจากการให้บริการโมเดลแบบถดถอยอัตโนมัติ การมีส่วนร่วมหลักของพวกเขาคือการอธิบายลักษณะเชิงประจักษ์ภายใต้ภาระที่เกิดขึ้นพร้อมกันมากกว่าการอภิปรายเชิงทฤษฎีล้วนๆ บทความนี้จึงวางกรอบคำถามการให้บริการเกี่ยวกับผลการดำเนินงานของกลไกการสร้างนั้น การเปรียบเทียบเป็นเรื่องเกี่ยวกับพฤติกรรมของระบบภายใต้โหลด โดยโมเดลจะสร้างโทเค็นหลายรายการผ่านการดีนอยซ์ซ้ำๆ แทนที่จะติดตามเส้นทางลำดับเดียว

นักวิจัยใช้ LLaDA-8B-Instruct กับอะแดปเตอร์ Discrete Diffusion Forcing LoRA บน GPU NVIDIA H200 ตัวเดียว พวกเขาประเมินการตั้งค่าบน GSM8K และ HumanEval บทความรายงานว่าคำขอความยากลำบากนั้นแยกจากกัน: คำขอแบ่งออกเป็น 11 ระดับขั้นตอน denoising คงที่ ผู้เขียนทดสอบว่าสัญญาณใดๆ สามารถทำนายระดับของคำขอก่อนที่จะเริ่มการสร้างได้หรือไม่ แต่ค่า R2 ที่รายงานที่ดีที่สุดคือ 0.150 ซึ่งบ่งชี้ถึงประสิทธิภาพในการทำนายที่อ่อนแอภายในการทดสอบของพวกเขา ตัวเลือกเหล่านี้จะกำหนดขอบเขตของการวัด การสังเกตการณ์ที่รายงานจะอธิบายถึงการผสมผสานระหว่างรุ่น อะแดปเตอร์ GPU และเกณฑ์มาตรฐานที่ผ่านการทดสอบ และการทดสอบการคาดการณ์ถูกนำเสนอเป็นส่วนหนึ่งของลักษณะเฉพาะเดียวกันนั้น

การศึกษายังรายงานด้วยว่างบประมาณการสร้างระยะสั้นสามารถปกปิดความแปรปรวนในการให้บริการได้ ตามรายงาน งบประมาณที่ต่ำกว่า 320 โทเค็นอาจตัดคำขอออกก่อนที่จะมองเห็นการแพร่กระจายของเวลาในการตอบสนอง ในระดับคำขอเดียว เวลานาฬิกาแขวนเพียง 24% เท่านั้นที่เป็นการประมวลผล GPU ในขณะที่ส่วนที่เหลือเป็นค่าใช้จ่ายในการจัดส่งฝั่ง CPU เมื่อคำขอถูกแบทช์เพื่อให้มีการแชร์การส่งต่อหนึ่งครั้งต่อขั้นตอนการดีนอยซ์ ปริมาณงานจะสูงขึ้น 16.0 เท่าในขนาดแบตช์ 16 เมื่อเทียบกับพื้นฐานการจัดส่งต่อคำขอ เอกสารนี้ยังใช้กฎการหมดเวลาแบทช์สำหรับแบทช์ซิงโครไนซ์การเติมคงที่ภายใต้การมาถึงของปัวซอง การวัดเหล่านี้ร่วมกันจะเชื่อมโยงพฤติกรรมระดับคำขอเข้ากับการจัดกำหนดการระดับระบบ โดยจะอธิบายทั้งเวลาที่ใช้ไปและวิธีที่การแบ่งปันงานระหว่างคำขอเปลี่ยนแปลงปริมาณงานที่รายงาน ขณะเดียวกันก็รักษาการวิเคราะห์การหมดเวลาแบบแบตช์ที่เชื่อมโยงกับโมเดลการมาถึง

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

การค้นพบนี้สามารถช่วยให้วิศวกรออกแบบโครงสร้างพื้นฐานที่มีประสิทธิภาพมากขึ้นสำหรับโมเดลภาษาที่อิงการแพร่กระจาย ขณะเดียวกันก็แสดงให้เห็นว่าเกณฑ์มาตรฐานและสมมติฐานสั้นๆ ที่สืบทอดมาจากการให้บริการแบบถดถอยอัตโนมัติสามารถซ่อนต้นทุนการดำเนินงานที่สำคัญได้

ความสำคัญในทางปฏิบัติคือการให้บริการ dLLM อาจต้องมีการทำงานแบบขนานในระดับที่แตกต่างจากการให้บริการอัตโนมัติ ในบัญชีของรายงาน หน่วยสำคัญในการแบ่งปันงานคือแต่ละขั้นตอนการปฏิเสธ ไม่ใช่เพียงคำขอทั้งหมด ซึ่งจะเปลี่ยนวิธีที่ระบบการให้บริการควรคำนึงถึงการรับเข้า การแบ่งกลุ่ม และการไล่ออก เมื่อมีคำขอหลายรายการกำลังดำเนินการผ่านการคำนวณที่ใช้ร่วมกัน ผลลัพธ์คือบทเรียนเกี่ยวกับระบบเกี่ยวกับการจับคู่โครงสร้างพื้นฐานกับกระบวนการสร้างโมเดล ความแตกต่างนั้นส่งผลต่อวิธีการประเมินส่วนประกอบที่ให้บริการ การรับเข้า การแบ่งกลุ่ม และการขับไล่ไม่ได้เป็นเพียงรายละเอียดการดำเนินการในกรอบนี้เท่านั้น พวกเขาเป็นส่วนหนึ่งของการปรับระบบให้เข้ากับกระบวนการลดสัญญาณรบกวนของโมเดล

การค้นหาโอเวอร์เฮดของ CPU มีความเกี่ยวข้องอย่างยิ่งกับการประหยัดในการใช้งานและวิศวกรรมประสิทธิภาพ หากใช้เวลานาฬิกาแขวนคำขอเดียวเพียงเล็กน้อยในการคำนวณ GPU ในการกำหนดค่าที่ทดสอบนี้ การเพิ่มความจุตัวเร่งความเร็วมากขึ้นอาจไม่ช่วยแก้ปัญหาคอขวดที่โดดเด่นด้วยตัวมันเอง ผลการจัดชุดที่รายงานแสดงให้เห็นว่าคำขอประสานงานสามารถตัดค่าใช้จ่ายในการจัดส่งได้ แม้ว่าผลลัพธ์ของเอกสารจะเชื่อมโยงกับรุ่น อะแดปเตอร์ ฮาร์ดแวร์ ปริมาณงาน และพื้นฐานที่เฉพาะเจาะจงก็ตาม ความหมายคือจำเป็นต้องตรวจสอบเส้นทางทั้งหมดตั้งแต่การมาถึงของคำขอไปจนถึงการทำงานของตัวเร่งความเร็ว การวัดของกระดาษทำให้มองเห็นเส้นทางนั้นได้ในการตั้งค่าที่ทดสอบ และผลการจัดกลุ่มแสดงให้เห็นว่าเหตุใดตำแหน่งของค่าใช้จ่ายจึงมีความสำคัญเมื่อมีการประเมินประสิทธิภาพ

บทความนี้ยังท้าทายวิธีการเปรียบเทียบ dLLM งบประมาณการสร้างระยะสั้นสามารถทำให้เวลาแฝงปรากฏสม่ำเสมอมากกว่าที่เป็นอยู่ เนื่องจากคำขอสิ้นสุดลงก่อนที่จะเกิดขั้นตอนการ denoising รูปแบบเต็มรูปแบบ นั่นสำคัญสำหรับทุกคนในการเปรียบเทียบระบบการให้บริการหรือการประมาณเวลาตอบสนองที่ผู้ใช้มองเห็น ผู้เขียนโต้แย้งในเชิงโครงสร้างว่าคุณภาพเอาต์พุตไม่ควรลดลงเมื่อขนาดแบตช์เพิ่มขึ้นภายใต้สมมติฐานสามข้อที่ระบุไว้ แต่รายงานแหล่งที่มาวัดความแม่นยำของ GSM8K ในระดับคำขอเดียวเท่านั้น ซึ่งอยู่ที่ 74% ถึง 76% สิ่งนี้ไม่ได้สร้างคุณภาพที่ไม่เปลี่ยนแปลงในทุกเงื่อนไขของการจัดชุด นี่คือสาเหตุที่บทความนี้แยกการใช้เหตุผลเชิงโครงสร้างออกจากหลักฐานที่วัดได้ สมมติฐานสนับสนุนข้อโต้แย้งของผู้เขียน ในขณะที่การวัดความแม่นยำที่รายงานยังคงจำกัดอยู่เฉพาะผลลัพธ์คำขอเดี่ยวที่ระบุไว้ และไม่ได้ตอบคำถามชุดงานที่กว้างขึ้น

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

การศึกษานี้เป็นการระบุลักษณะเฉพาะเบื้องต้นโดยอิงจากการกำหนดค่ารุ่นเดียว, GPU หนึ่งตัว และการวัดประสิทธิภาพสองค่า จำเป็นต้องมีการทดสอบแยกกันระหว่างรุ่น ฮาร์ดแวร์ ปริมาณงาน และการตั้งค่าการใช้งานจริงเพื่อกำหนดว่าผลลัพธ์จะนำไปใช้ในวงกว้างเพียงใด

สิ่งที่ไม่ทราบที่ใหญ่ที่สุดคือความสามารถทั่วไป การทดลองใช้การกำหนดค่าโมเดลการแพร่กระจายแบบมาสก์หนึ่งรายการ LLaDA-8B-สั่งงานด้วยอะแดปเตอร์ D2F LoRA และ GPU NVIDIA H200 หนึ่งตัว แหล่งที่มาไม่ได้กำหนดว่าระดับการนับก้าว 11 ระดับที่เหมือนกัน ความสามารถในการคาดการณ์ล่วงหน้าก่อนการสร้างที่อ่อนแอ ความสมดุลของเวลาระหว่าง CPU กับ GPU หรือการเพิ่มแบทช์ 16.0 เท่า จะปรากฏพร้อมกับ dLLM อะแดปเตอร์ ตัวเร่งความเร็ว สแต็กซอฟต์แวร์ หรือคำขอมิกซ์อื่นๆ หรือไม่ ขอบเขตเหล่านั้นมีความสำคัญเมื่อตีความผลลัพธ์ การค้นพบนี้เป็นหลักฐานเกี่ยวกับการตั้งค่าที่ทดสอบ ไม่ใช่แผนผังที่สมบูรณ์ของพฤติกรรมการให้บริการแบบปกปิดในการกำหนดค่าที่เป็นไปได้ทั้งหมด

การทำงานเพิ่มเติมควรทดสอบปริมาณการใช้งานจริงและผลลัพธ์ที่ยาวหรือหลากหลายมากขึ้น เอกสารฉบับนี้เตือนเป็นพิเศษว่างบประมาณที่ต่ำกว่า 320 โทเค็นสามารถซ่อนการแพร่กระจายของเวลาแฝงได้ ดังนั้นการประเมินควรรวมปริมาณงานที่นานพอที่จะเปิดเผยพฤติกรรมการลดสัญญาณรบกวนทั้งหมด นอกจากนี้ การวัดเวลาแฝง ปริมาณการประมวลผล การใช้หน่วยความจำ และคุณภาพร่วมกันยังเป็นสิ่งสำคัญ แทนที่จะถือว่าตัวเลขปริมาณงานเพียงค่าเดียวเป็นหลักฐานที่เพียงพอของความได้เปรียบในการปรับใช้ การวัดดังกล่าวจะช่วยให้แยกแยะการปรับปรุงปริมาณงานโดยเฉลี่ยได้ง่ายขึ้นจากการปรับปรุงที่ยังคงมีประโยชน์ภายใต้การรับส่งข้อมูลจริง นอกจากนี้ยังจะแสดงให้เห็นว่าพฤติกรรมการจัดกำหนดการที่สังเกตยังคงมีอยู่เมื่อปริมาณงานและความยาวเอาต์พุตเปลี่ยนแปลงหรือไม่

การเรียกร้องคุณภาพยังคงมีเงื่อนไข ผู้เขียนระบุว่าคุณภาพไม่ควรลดลงตามขนาดแบทช์ภายใต้สมมติฐานสามประการ แต่แหล่งที่มาไม่ได้ระบุชุดผลลัพธ์ความแม่นยำของขนาดแบทช์ในวงกว้าง และไม่ได้รายงานความพร้อมในการผลิตหรือการปรับใช้ที่ผู้ใช้ต้องเผชิญ การจำลองแบบแยกกันระหว่าง GSM8K, HumanEval และงานอื่นๆ จะช่วยพิจารณาว่าการซิงโครไนซ์แบทช์เป็นหลักการออกแบบที่มีประโยชน์ในวงกว้างหรือเป็นการเพิ่มประสิทธิภาพสำหรับการตั้งค่าการทดลองนี้เป็นหลัก การอ่านค่าที่สามารถป้องกันได้มากที่สุดนั้นมีเงื่อนไขจนกว่าการทดสอบเหล่านั้นจะพร้อมใช้งาน: การแบทช์แบบซิงโครไนซ์เป็นหลักการออกแบบที่น่ามีแนวโน้มในการตั้งค่าที่รายงาน ในขณะที่ยังคงต้องมีการกำหนดมูลค่าการใช้งานที่กว้างขึ้น

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIหม้อแปลงไฟฟ้าการฝึกอบรมเอไอChatGPT และ LLMทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?