เกิดอะไรขึ้น
เอกสาร arXiv ที่ส่งมาเมื่อวันที่ 21 สิงหาคม สำรวจการถอดรหัสเชิงคาดเดาสำหรับระบบภาษาภาพ ภาษาวิดีโอ เสียง และระบบการกระทำด้วยภาษาวิสัยทัศน์ แยกการร่างแบบคู่ขนานออกจากตัวเลือกการออกแบบอื่นๆ และเปรียบเทียบวิธีการที่มีอยู่ใน OCR การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และเกณฑ์มาตรฐานคำบรรยายภาพ ผู้เขียนสรุปว่าการร่างแบบบล็อกขนานโดยใช้การแพร่กระจาย ซึ่งเร่งการสร้างข้อความ ยังไม่ได้รับการกำหนดไว้อย่างเพียงพอสำหรับแบบจำลองหลายรูปแบบ
บทความนี้จะตรวจสอบการถอดรหัสแบบเก็งกำไร ซึ่งเป็นวิธีเร่งการสร้างระบบอัตโนมัติแบบถดถอย ระบบร่างที่เล็กกว่าจะเสนอโทเค็นในอนาคตหลายรายการ ในขณะที่ระบบเป้าหมายที่ใหญ่กว่าจะตรวจสอบโทเค็นเหล่านั้นพร้อมกัน หากข้อเสนอได้รับการยอมรับ ระบบเป้าหมายจะสามารถสร้างผลลัพธ์โดยมีขั้นตอนตามลำดับน้อยลง แหล่งข่าวกล่าวว่าแนวทางนี้ได้กระตุ้นให้ผู้ร่างสร้างบล็อกในแบบคู่ขนาน รวมถึงวิธีการแบบกระจายเช่น DFlash และ DSpark วิธีการเหล่านี้ทำให้งานแชททั่วไปในแต่ละวันเร็วขึ้นถึง 3.6 เท่า ตามข้อมูลสรุปของงานก่อนหน้า ตัวเลขดังกล่าวไม่ได้ถูกนำเสนอเนื่องจากผลการวิจัยนี้เพิ่งกำหนดขึ้นสำหรับระบบหลายรูปแบบ คำถามหลักคือทิศทางทั่วไปเดียวกันนั้นใช้งานได้หรือไม่เมื่อระบบ AI ต้องจัดการมากกว่าข้อความ
ผู้เขียนได้สำรวจตระกูลสถาปัตยกรรมกว้างๆ 4 ตระกูล ได้แก่ โมเดลภาษาวิสัยทัศน์ โมเดลภาษาวิดีโอ โมเดลเสียง และระบบการกระทำด้วยภาษาวิสัยทัศน์ ระบบเหล่านี้แตกต่างกันในข้อมูลที่ได้รับและวิธีโต้ตอบระหว่างการสร้าง บทความนี้ระบุว่าจนถึงขณะนี้การวิจัยการถอดรหัสเก็งกำไรหลายรูปแบบมุ่งเน้นไปที่การบีบอัดอินพุต การจัดตำแหน่งอะแดปเตอร์ ความครอบคลุมของตัวเลือก และการตรวจสอบเฉพาะรูปแบบ ในทางตรงกันข้าม การร่างแบบกำเนิดแบบบล็อกขนานยังคงไม่ได้รับการสำรวจเป็นส่วนใหญ่ในการตั้งค่าแบบหลายรูปแบบ ผู้เขียนแนะนำอนุกรมวิธานที่มีจุดมุ่งหมายเพื่อแยกแยะความเท่าเทียมของผู้ร่างจากส่วนอื่นๆ ของระบบถอดรหัสเชิงเก็งกำไร ความแตกต่างนี้มีความสำคัญเนื่องจากระบบสามารถใช้การสร้างผู้สมัครที่มีรูปทรงต้นไม้หรือกลยุทธ์การตรวจสอบเฉพาะ โดยไม่ต้องทำให้กระบวนการร่างขนานกัน การแยกองค์ประกอบเหล่านั้นอาจทำให้การเปรียบเทียบมีความหมายมากขึ้นและช่วยให้นักวิจัยระบุได้ว่าองค์ประกอบใดที่รับผิดชอบต่อผลกำไรที่รายงาน แหล่งที่มาอธิบายอนุกรมวิธานนี้ว่าเป็นวิธีการจัดระเบียบฟิลด์ที่วิธีการมักจะรวมตัวเลือกการออกแบบหลายอย่างเข้าด้วยกัน
บทความนี้ยังรายงานการเปรียบเทียบเชิงประจักษ์ข้ามสถาปัตยกรรมภายใต้ระดับความเท่าเทียมที่ต่างกัน การประเมินครอบคลุมงานมาตรฐานที่เกี่ยวข้องกับการรู้จำอักขระด้วยภาพ การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และคำบรรยายภาพ บทคัดย่อจะไม่เปิดเผยคะแนนเกณฑ์มาตรฐาน ชื่อรุ่น การกำหนดค่าฮาร์ดแวร์ การวัดค่าความหน่วง หรืออัตราการยอมรับ ดังนั้นจึงกำหนดขอบเขตของการศึกษาและคำถามการวิจัย แต่ไม่ใช่การอธิบายเชิงตัวเลขที่สมบูรณ์ว่าวิธีใดทำงานได้ดีที่สุดในแต่ละสภาพแวดล้อม แหล่งที่มานำเสนองานเป็นการสำรวจและวินิจฉัยความพร้อม ไม่ใช่การประกาศผลิตภัณฑ์หรือสาธิตการใช้งาน
ทำไมมันถึงสำคัญ
ระบบ AI ต่อเนื่องหลายรูปแบบจะประมวลผลรูปภาพ วิดีโอ เสียง หรืออินพุตจากโลกทางกายภาพ และความหน่วงสามารถจำกัดการใช้งานจริงได้ การสร้างที่เร็วขึ้นสามารถลดเวลาในการรอและต้นทุนการอนุมานได้ แต่รายงานระบุว่าเทคนิคที่พัฒนาขึ้นสำหรับโมเดลเฉพาะข้อความไม่สามารถสันนิษฐานได้ว่าถ่ายโอนไปยังระบบหลายรูปแบบ คุณค่าของมันคือการวินิจฉัยเป็นหลัก โดยจะระบุสิ่งที่ต้องทดสอบก่อนที่จะถือว่าวิธีการเร่งความเร็วเหล่านี้เชื่อถือได้
ปัญหาในทางปฏิบัติคือความล่าช้า ระบบหลายรูปแบบสามารถใช้เพื่อตีความเอกสาร ตอบคำถามเกี่ยวกับรูปภาพ อธิบายเนื้อหาภาพ ประมวลผลเสียงหรือวิดีโอ หรือเชื่อมโยงการรับรู้กับการกระทำ ในแต่ละกรณี การสร้างที่ต้องใช้ขั้นตอนต่อเนื่องหลายขั้นตอนอาจทำให้แอปพลิเคชันทำงานช้าลงและมีราคาแพงกว่าในการทำงาน วิธีการถอดรหัสเก็งกำไรที่ประสบความสำเร็จอาจทำให้แบบจำลองเป้าหมายขนาดใหญ่สามารถตรวจสอบขั้นตอนที่เสนอหลายขั้นตอนร่วมกัน ซึ่งอาจลดปริมาณการคำนวณตามลำดับ การอภิปรายในรายงานฉบับนี้ทำให้แนวทางนี้เป็นไปได้ทางวิศวกรรม แต่ไม่ได้ทำให้เกิดการลดต้นทุนการผลิต
บทความนี้มีประโยชน์เนื่องจากท้าทายสมมติฐานทั่วไปในการเพิ่มประสิทธิภาพ AI นั่นคือเทคนิคที่ใช้กับข้อความจะถ่ายโอนไปยังรูปแบบอื่นโดยอัตโนมัติ ระบบหลายรูปแบบต้องประสานงานข้อมูลระหว่างอินพุต และเอาต์พุตอาจมีโครงสร้างและรูปแบบข้อผิดพลาดที่แตกต่างกัน ร่างที่เป็นที่ยอมรับสำหรับรูปแบบหรืองานหนึ่งๆ อาจไม่เป็นที่ยอมรับเมื่อมีข้อมูลภาพ เสียง ชั่วคราว หรือการกระทำเข้ามาเกี่ยวข้อง ด้วยการเปรียบเทียบสถาปัตยกรรมและประเภทงานต่างๆ การศึกษานี้สามารถช่วยให้นักวิจัยเห็นว่าวิธีการทั่วไปล้มเหลวตรงไหน และการออกแบบเฉพาะรูปแบบยังจำเป็นอยู่จุดใด อนุกรมวิธานยังมีผลกระทบต่อวิธีการสื่อสารคำกล่าวอ้างประสิทธิภาพของ AI การเร่งความเร็วที่รายงานอาจเกิดขึ้นได้จากหลายแหล่ง รวมถึงอินพุตที่สั้นกว่า อะแดปเตอร์ที่ได้รับการจัดตำแหน่งที่ดีขึ้น ความครอบคลุมของตัวเลือกที่กว้างขึ้น การตรวจสอบที่มีประสิทธิภาพมากขึ้น หรือการขนานแท้ในตัวร่าง กลไกเหล่านั้นมีการแลกเปลี่ยนที่แตกต่างกันและอาจไม่สรุปอย่างเท่าเทียมกัน
การแยกชิ้นส่วนเหล่านี้ช่วยให้วิศวกรและผู้ซื้อตัดสินได้ง่ายขึ้นว่าการอ้างสิทธิ์การเร่งความเร็วมีผลกับปริมาณงานของตนเองหรือไม่ สิ่งนี้มีความเกี่ยวข้องโดยเฉพาะอย่างยิ่งสำหรับองค์กรที่ประเมินระบบต่อเนื่องหลายรูปแบบโดยผสมผสานงานเอกสาร รูปภาพ วิดีโอ และเสียง แทนที่จะใช้เกณฑ์มาตรฐานเดียว แหล่งที่มาไม่ได้แสดงให้เห็นว่าการร่างแบบกระจายพร้อมสำหรับการนำไปใช้ในวงกว้าง อย่างไรก็ตาม จะช่วยระบุจุดคอขวดที่เป็นรูปธรรมในเส้นทางตั้งแต่ต้นแบบการวิจัยไปจนถึงบริการต่อเนื่องหลายรูปแบบที่เชื่อถือได้ ซึ่งพิสูจน์ได้ว่าความเร็วที่เพิ่มขึ้นสามารถอยู่รอดได้ทั่วทั้งสถาปัตยกรรมและงานต่างๆ โดยไม่สูญเสียคุณภาพที่ยอมรับไม่ได้ ความสำคัญของบทความนี้จึงเป็นระเบียบวิธีพอๆ กับทางเทคนิค โดยให้กรอบการทำงานในฟิลด์สำหรับการถามว่าการปรับให้เหมาะสมจะปรับปรุงพฤติกรรมการอนุมานจริงหรือไม่ แทนที่จะอาศัยผลลัพธ์จากโมเดลแบบข้อความเท่านั้นหรือในรูปแบบเดียว
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
หลักฐานสำคัญถัดไปคือการทดสอบหลายรูปแบบโดยตรงของผู้ร่างแบบกระจาย รวมถึงการรักษาคุณภาพ ค่าใช้จ่ายในการตรวจสอบ และประสิทธิภาพในรูปแบบต่างๆ บทคัดย่อของบทความนี้ไม่ได้ให้ผลลัพธ์เชิงตัวเลขโดยละเอียด รายละเอียดการนำไปปฏิบัติ หรือหลักฐานของการนำไปใช้งาน ดังนั้น ผู้อ่านจึงควรถือว่าโอกาสที่รายงานเป็นเพียงผลการวิจัยและปัญหาที่เปิดกว้าง ไม่ใช่เป็นข้อพิสูจน์ว่ามีวิธีเร่งความเร็วที่พร้อมสำหรับการผลิตอยู่
คำถามแรกคืองานในอนาคตสามารถสาธิตการร่างแบบกระจายหลายรูปแบบด้วยการวัดค่าตั้งแต่ต้นทางถึงปลายทางที่ทำซ้ำได้หรือไม่ รายงานที่เป็นประโยชน์จะต้องแสดงมากกว่าการเร่งความเร็วในการสร้างแบบร่าง พวกเขาควรระบุเป้าหมายและแบบจำลองการร่าง ฮาร์ดแวร์ เงื่อนไขของแบทช์ ความยาวลำดับ ขั้นตอนการตรวจสอบ และจำนวนเอาต์พุตที่ยอมรับ หากไม่มีรายละเอียดเหล่านั้น เป็นการยากที่จะเปรียบเทียบผลลัพธ์หรือตัดสินว่ากำไรที่ชัดเจนนั้นมาจากวิธีการร่างเองหรือจากการเปลี่ยนแปลงระบบที่ไม่เกี่ยวข้องกัน
การรักษาคุณภาพจะมีความสำคัญไม่แพ้กัน ขอบเขตเกณฑ์มาตรฐานของรายงานประกอบด้วย OCR การตอบคำถามด้วยภาพ การใช้เหตุผลด้วยภาพ และคำบรรยายภาพ แต่บทคัดย่อไม่ได้ให้ผลลัพธ์สำหรับงานเหล่านั้น การประเมินในอนาคตควรแสดงให้เห็นว่าการร่างแบบขนานจะรักษาความถูกต้องและการต่อสายดินหลายรูปแบบหรือไม่ เมื่อระดับความขนานเพิ่มขึ้น วิธีการที่รวดเร็วในการบรรยายภาพแต่ไม่น่าเชื่อถือในการให้เหตุผลด้วยภาพจะมีบทบาทเชิงปฏิบัติที่แคบกว่าการกล่าวอ้างการเร่งความเร็วทั่วไปที่แนะนำ นอกจากนี้ สาขานี้ยังจำเป็นต้องมีหลักฐานทั้งในระบบวิดีโอ เสียง และระบบการมองเห็น ภาษา และการกระทำ ไม่ใช่แค่ปริมาณงานภาพนิ่งและข้อความเท่านั้น การตั้งค่าเหล่านี้แนะนำข้อมูลชั่วคราวหรือที่เกี่ยวข้องกับการดำเนินการที่อาจทำให้การตรวจสอบยากขึ้น แหล่งที่มาระบุว่าสถาปัตยกรรมเหล่านี้เป็นส่วนหนึ่งของการสำรวจ แต่ไม่ได้บอกว่าการร่างแบบกระจายได้รับการแก้ไขแล้ว
ดังนั้นการอ้างสิทธิ์การปรับใช้จึงควรได้รับการประเมินแยกกันตามรูปแบบ สถาปัตยกรรม และงาน สุดท้ายนี้ ผู้อ่านควรดูว่าการวิจัยก่อให้เกิดการใช้งานแบบเปิด โปรโตคอลการประเมินที่ได้มาตรฐาน และการจำลองแบบที่เป็นอิสระหรือไม่ แหล่งที่มาไม่ได้ให้ข้อมูลเกี่ยวกับความพร้อมใช้งานของโค้ด การบูรณาการเชิงพาณิชย์ การเข้าถึงของผู้ใช้ หรือการทดสอบการปฏิบัติงาน สิ่งที่ไม่ทราบเหล่านี้มีความสำคัญเนื่องจากวิธีการอาจดูมีแนวโน้มในเกณฑ์มาตรฐานที่มีการควบคุม แต่ยังต้องเผชิญกับค่าใช้จ่ายเพิ่มเติมจากการใช้หน่วยความจำ การตรวจสอบ การจัดระบบ หรือการจัดการความล้มเหลวในบริการที่ใช้งานอยู่ จนกว่าหลักฐานดังกล่าวจะปรากฏขึ้น ข้อสรุปที่สามารถป้องกันได้ก็คือ การถอดรหัสแบบเก็งกำไรหลายรูปแบบเป็นพื้นที่การวิจัยที่กระตือรือร้นพร้อมโอกาสที่แมปไว้ ไม่ใช่ความสามารถในการผลิตที่ตกลงกันไว้