กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

แบบสำรวจระบุเส้นทางที่ยังไม่ได้รับการแก้ไขเพื่อสร้าง AI ต่อเนื่องหลายรูปแบบที่เร็วขึ้น

การสำรวจและการศึกษาเชิงประจักษ์ใหม่ของ arXiv พบว่าการร่างแบบคู่ขนานที่ใช้การแพร่กระจายส่วนใหญ่ยังไม่มีการสำรวจสำหรับ AI ต่อเนื่องหลายรูปแบบ แม้ว่าจะมีรายงานการเร่งความเร็วในการสร้างข้อความก็ตาม

6 min readRead the primary source
Primary-source image accompanying Survey maps the unresolved path to faster multimodal AI generation
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.20743
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

OCR (การรู้จำอักขระด้วยแสง)
เทคโนโลยีที่แปลงข้อความในภาพหรือสแกนให้เป็นข้อความที่เครื่องอ่านได้
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
การถอดรหัสเก็งกำไร
วิธีการเร่งความเร็วอนุมานที่แบบจำลองร่างขนาดเล็กเสนอโทเค็นที่แบบจำลองขนาดใหญ่ตรวจสอบพร้อมกัน
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

เอกสาร arXiv ที่ส่งมาเมื่อวันที่ 21 สิงหาคม สำรวจการถอดรหัสเชิงคาดเดาสำหรับระบบภาษาภาพ ภาษาวิดีโอ เสียง และระบบการกระทำด้วยภาษาวิสัยทัศน์ แยกการร่างแบบคู่ขนานออกจากตัวเลือกการออกแบบอื่นๆ และเปรียบเทียบวิธีการที่มีอยู่ใน OCR การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และเกณฑ์มาตรฐานคำบรรยายภาพ ผู้เขียนสรุปว่าการร่างแบบบล็อกขนานโดยใช้การแพร่กระจาย ซึ่งเร่งการสร้างข้อความ ยังไม่ได้รับการกำหนดไว้อย่างเพียงพอสำหรับแบบจำลองหลายรูปแบบ

บทความนี้จะตรวจสอบการถอดรหัสแบบเก็งกำไร ซึ่งเป็นวิธีเร่งการสร้างระบบอัตโนมัติแบบถดถอย ระบบร่างที่เล็กกว่าจะเสนอโทเค็นในอนาคตหลายรายการ ในขณะที่ระบบเป้าหมายที่ใหญ่กว่าจะตรวจสอบโทเค็นเหล่านั้นพร้อมกัน หากข้อเสนอได้รับการยอมรับ ระบบเป้าหมายจะสามารถสร้างผลลัพธ์โดยมีขั้นตอนตามลำดับน้อยลง แหล่งข่าวกล่าวว่าแนวทางนี้ได้กระตุ้นให้ผู้ร่างสร้างบล็อกในแบบคู่ขนาน รวมถึงวิธีการแบบกระจายเช่น DFlash และ DSpark วิธีการเหล่านี้ทำให้งานแชททั่วไปในแต่ละวันเร็วขึ้นถึง 3.6 เท่า ตามข้อมูลสรุปของงานก่อนหน้า ตัวเลขดังกล่าวไม่ได้ถูกนำเสนอเนื่องจากผลการวิจัยนี้เพิ่งกำหนดขึ้นสำหรับระบบหลายรูปแบบ คำถามหลักคือทิศทางทั่วไปเดียวกันนั้นใช้งานได้หรือไม่เมื่อระบบ AI ต้องจัดการมากกว่าข้อความ

ผู้เขียนได้สำรวจตระกูลสถาปัตยกรรมกว้างๆ 4 ตระกูล ได้แก่ โมเดลภาษาวิสัยทัศน์ โมเดลภาษาวิดีโอ โมเดลเสียง และระบบการกระทำด้วยภาษาวิสัยทัศน์ ระบบเหล่านี้แตกต่างกันในข้อมูลที่ได้รับและวิธีโต้ตอบระหว่างการสร้าง บทความนี้ระบุว่าจนถึงขณะนี้การวิจัยการถอดรหัสเก็งกำไรหลายรูปแบบมุ่งเน้นไปที่การบีบอัดอินพุต การจัดตำแหน่งอะแดปเตอร์ ความครอบคลุมของตัวเลือก และการตรวจสอบเฉพาะรูปแบบ ในทางตรงกันข้าม การร่างแบบกำเนิดแบบบล็อกขนานยังคงไม่ได้รับการสำรวจเป็นส่วนใหญ่ในการตั้งค่าแบบหลายรูปแบบ ผู้เขียนแนะนำอนุกรมวิธานที่มีจุดมุ่งหมายเพื่อแยกแยะความเท่าเทียมของผู้ร่างจากส่วนอื่นๆ ของระบบถอดรหัสเชิงเก็งกำไร ความแตกต่างนี้มีความสำคัญเนื่องจากระบบสามารถใช้การสร้างผู้สมัครที่มีรูปทรงต้นไม้หรือกลยุทธ์การตรวจสอบเฉพาะ โดยไม่ต้องทำให้กระบวนการร่างขนานกัน การแยกองค์ประกอบเหล่านั้นอาจทำให้การเปรียบเทียบมีความหมายมากขึ้นและช่วยให้นักวิจัยระบุได้ว่าองค์ประกอบใดที่รับผิดชอบต่อผลกำไรที่รายงาน แหล่งที่มาอธิบายอนุกรมวิธานนี้ว่าเป็นวิธีการจัดระเบียบฟิลด์ที่วิธีการมักจะรวมตัวเลือกการออกแบบหลายอย่างเข้าด้วยกัน

บทความนี้ยังรายงานการเปรียบเทียบเชิงประจักษ์ข้ามสถาปัตยกรรมภายใต้ระดับความเท่าเทียมที่ต่างกัน การประเมินครอบคลุมงานมาตรฐานที่เกี่ยวข้องกับการรู้จำอักขระด้วยภาพ การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และคำบรรยายภาพ บทคัดย่อจะไม่เปิดเผยคะแนนเกณฑ์มาตรฐาน ชื่อรุ่น การกำหนดค่าฮาร์ดแวร์ การวัดค่าความหน่วง หรืออัตราการยอมรับ ดังนั้นจึงกำหนดขอบเขตของการศึกษาและคำถามการวิจัย แต่ไม่ใช่การอธิบายเชิงตัวเลขที่สมบูรณ์ว่าวิธีใดทำงานได้ดีที่สุดในแต่ละสภาพแวดล้อม แหล่งที่มานำเสนองานเป็นการสำรวจและวินิจฉัยความพร้อม ไม่ใช่การประกาศผลิตภัณฑ์หรือสาธิตการใช้งาน

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ระบบ AI ต่อเนื่องหลายรูปแบบจะประมวลผลรูปภาพ วิดีโอ เสียง หรืออินพุตจากโลกทางกายภาพ และความหน่วงสามารถจำกัดการใช้งานจริงได้ การสร้างที่เร็วขึ้นสามารถลดเวลาในการรอและต้นทุนการอนุมานได้ แต่รายงานระบุว่าเทคนิคที่พัฒนาขึ้นสำหรับโมเดลเฉพาะข้อความไม่สามารถสันนิษฐานได้ว่าถ่ายโอนไปยังระบบหลายรูปแบบ คุณค่าของมันคือการวินิจฉัยเป็นหลัก โดยจะระบุสิ่งที่ต้องทดสอบก่อนที่จะถือว่าวิธีการเร่งความเร็วเหล่านี้เชื่อถือได้

ปัญหาในทางปฏิบัติคือความล่าช้า ระบบหลายรูปแบบสามารถใช้เพื่อตีความเอกสาร ตอบคำถามเกี่ยวกับรูปภาพ อธิบายเนื้อหาภาพ ประมวลผลเสียงหรือวิดีโอ หรือเชื่อมโยงการรับรู้กับการกระทำ ในแต่ละกรณี การสร้างที่ต้องใช้ขั้นตอนต่อเนื่องหลายขั้นตอนอาจทำให้แอปพลิเคชันทำงานช้าลงและมีราคาแพงกว่าในการทำงาน วิธีการถอดรหัสเก็งกำไรที่ประสบความสำเร็จอาจทำให้แบบจำลองเป้าหมายขนาดใหญ่สามารถตรวจสอบขั้นตอนที่เสนอหลายขั้นตอนร่วมกัน ซึ่งอาจลดปริมาณการคำนวณตามลำดับ การอภิปรายในรายงานฉบับนี้ทำให้แนวทางนี้เป็นไปได้ทางวิศวกรรม แต่ไม่ได้ทำให้เกิดการลดต้นทุนการผลิต

บทความนี้มีประโยชน์เนื่องจากท้าทายสมมติฐานทั่วไปในการเพิ่มประสิทธิภาพ AI นั่นคือเทคนิคที่ใช้กับข้อความจะถ่ายโอนไปยังรูปแบบอื่นโดยอัตโนมัติ ระบบหลายรูปแบบต้องประสานงานข้อมูลระหว่างอินพุต และเอาต์พุตอาจมีโครงสร้างและรูปแบบข้อผิดพลาดที่แตกต่างกัน ร่างที่เป็นที่ยอมรับสำหรับรูปแบบหรืองานหนึ่งๆ อาจไม่เป็นที่ยอมรับเมื่อมีข้อมูลภาพ เสียง ชั่วคราว หรือการกระทำเข้ามาเกี่ยวข้อง ด้วยการเปรียบเทียบสถาปัตยกรรมและประเภทงานต่างๆ การศึกษานี้สามารถช่วยให้นักวิจัยเห็นว่าวิธีการทั่วไปล้มเหลวตรงไหน และการออกแบบเฉพาะรูปแบบยังจำเป็นอยู่จุดใด อนุกรมวิธานยังมีผลกระทบต่อวิธีการสื่อสารคำกล่าวอ้างประสิทธิภาพของ AI การเร่งความเร็วที่รายงานอาจเกิดขึ้นได้จากหลายแหล่ง รวมถึงอินพุตที่สั้นกว่า อะแดปเตอร์ที่ได้รับการจัดตำแหน่งที่ดีขึ้น ความครอบคลุมของตัวเลือกที่กว้างขึ้น การตรวจสอบที่มีประสิทธิภาพมากขึ้น หรือการขนานแท้ในตัวร่าง กลไกเหล่านั้นมีการแลกเปลี่ยนที่แตกต่างกันและอาจไม่สรุปอย่างเท่าเทียมกัน

การแยกชิ้นส่วนเหล่านี้ช่วยให้วิศวกรและผู้ซื้อตัดสินได้ง่ายขึ้นว่าการอ้างสิทธิ์การเร่งความเร็วมีผลกับปริมาณงานของตนเองหรือไม่ สิ่งนี้มีความเกี่ยวข้องโดยเฉพาะอย่างยิ่งสำหรับองค์กรที่ประเมินระบบต่อเนื่องหลายรูปแบบโดยผสมผสานงานเอกสาร รูปภาพ วิดีโอ และเสียง แทนที่จะใช้เกณฑ์มาตรฐานเดียว แหล่งที่มาไม่ได้แสดงให้เห็นว่าการร่างแบบกระจายพร้อมสำหรับการนำไปใช้ในวงกว้าง อย่างไรก็ตาม จะช่วยระบุจุดคอขวดที่เป็นรูปธรรมในเส้นทางตั้งแต่ต้นแบบการวิจัยไปจนถึงบริการต่อเนื่องหลายรูปแบบที่เชื่อถือได้ ซึ่งพิสูจน์ได้ว่าความเร็วที่เพิ่มขึ้นสามารถอยู่รอดได้ทั่วทั้งสถาปัตยกรรมและงานต่างๆ โดยไม่สูญเสียคุณภาพที่ยอมรับไม่ได้ ความสำคัญของบทความนี้จึงเป็นระเบียบวิธีพอๆ กับทางเทคนิค โดยให้กรอบการทำงานในฟิลด์สำหรับการถามว่าการปรับให้เหมาะสมจะปรับปรุงพฤติกรรมการอนุมานจริงหรือไม่ แทนที่จะอาศัยผลลัพธ์จากโมเดลแบบข้อความเท่านั้นหรือในรูปแบบเดียว

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

หลักฐานสำคัญถัดไปคือการทดสอบหลายรูปแบบโดยตรงของผู้ร่างแบบกระจาย รวมถึงการรักษาคุณภาพ ค่าใช้จ่ายในการตรวจสอบ และประสิทธิภาพในรูปแบบต่างๆ บทคัดย่อของบทความนี้ไม่ได้ให้ผลลัพธ์เชิงตัวเลขโดยละเอียด รายละเอียดการนำไปปฏิบัติ หรือหลักฐานของการนำไปใช้งาน ดังนั้น ผู้อ่านจึงควรถือว่าโอกาสที่รายงานเป็นเพียงผลการวิจัยและปัญหาที่เปิดกว้าง ไม่ใช่เป็นข้อพิสูจน์ว่ามีวิธีเร่งความเร็วที่พร้อมสำหรับการผลิตอยู่

คำถามแรกคืองานในอนาคตสามารถสาธิตการร่างแบบกระจายหลายรูปแบบด้วยการวัดค่าตั้งแต่ต้นทางถึงปลายทางที่ทำซ้ำได้หรือไม่ รายงานที่เป็นประโยชน์จะต้องแสดงมากกว่าการเร่งความเร็วในการสร้างแบบร่าง พวกเขาควรระบุเป้าหมายและแบบจำลองการร่าง ฮาร์ดแวร์ เงื่อนไขของแบทช์ ความยาวลำดับ ขั้นตอนการตรวจสอบ และจำนวนเอาต์พุตที่ยอมรับ หากไม่มีรายละเอียดเหล่านั้น เป็นการยากที่จะเปรียบเทียบผลลัพธ์หรือตัดสินว่ากำไรที่ชัดเจนนั้นมาจากวิธีการร่างเองหรือจากการเปลี่ยนแปลงระบบที่ไม่เกี่ยวข้องกัน

การรักษาคุณภาพจะมีความสำคัญไม่แพ้กัน ขอบเขตเกณฑ์มาตรฐานของรายงานประกอบด้วย OCR การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และคำบรรยายภาพ แต่บทคัดย่อไม่ได้ให้ผลลัพธ์สำหรับงานเหล่านั้น การประเมินในอนาคตควรแสดงให้เห็นว่าการร่างแบบขนานจะรักษาความถูกต้องและการต่อสายดินหลายรูปแบบหรือไม่ เมื่อระดับความขนานเพิ่มขึ้น วิธีการที่รวดเร็วในการบรรยายภาพแต่ไม่น่าเชื่อถือในการให้เหตุผลด้วยภาพจะมีบทบาทเชิงปฏิบัติที่แคบกว่าการกล่าวอ้างการเร่งความเร็วทั่วไปที่แนะนำ นอกจากนี้ สาขานี้ยังจำเป็นต้องมีหลักฐานทั้งในระบบวิดีโอ เสียง และระบบการมองเห็น ภาษา และการกระทำ ไม่ใช่แค่ปริมาณงานภาพนิ่งและข้อความเท่านั้น การตั้งค่าเหล่านี้แนะนำข้อมูลชั่วคราวหรือที่เกี่ยวข้องกับการดำเนินการที่อาจทำให้การตรวจสอบยากขึ้น แหล่งที่มาระบุว่าสถาปัตยกรรมเหล่านี้เป็นส่วนหนึ่งของการสำรวจ แต่ไม่ได้บอกว่าการร่างแบบกระจายได้รับการแก้ไขแล้ว

ดังนั้นการอ้างสิทธิ์การปรับใช้จึงควรได้รับการประเมินแยกกันตามรูปแบบ สถาปัตยกรรม และงาน สุดท้ายนี้ ผู้อ่านควรดูว่าการวิจัยก่อให้เกิดการใช้งานแบบเปิด โปรโตคอลการประเมินที่ได้มาตรฐาน และการจำลองแบบที่เป็นอิสระหรือไม่ แหล่งที่มาไม่ได้ให้ข้อมูลเกี่ยวกับความพร้อมใช้งานของโค้ด การบูรณาการเชิงพาณิชย์ การเข้าถึงของผู้ใช้ หรือการทดสอบการปฏิบัติงาน สิ่งที่ไม่ทราบเหล่านี้มีความสำคัญเนื่องจากวิธีการอาจดูมีแนวโน้มในเกณฑ์มาตรฐานที่มีการควบคุม แต่ยังต้องเผชิญกับค่าใช้จ่ายเพิ่มเติมจากการใช้หน่วยความจำ การตรวจสอบ การจัดระบบ หรือการจัดการความล้มเหลวในบริการที่ใช้งานอยู่ จนกว่าหลักฐานดังกล่าวจะปรากฏขึ้น ข้อสรุปที่สามารถป้องกันได้ก็คือ การถอดรหัสแบบเก็งกำไรหลายรูปแบบเป็นพื้นที่การวิจัยที่กระตือรือร้นพร้อมโอกาสที่แมปไว้ ไม่ใช่ความสามารถในการผลิตที่ตกลงกันไว้

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIหม้อแปลงไฟฟ้าการฝึกอบรมเอไออนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?