เกิดอะไรขึ้น
นักวิจัยได้เสนอ AffectOmni ซึ่งเป็นกรอบการทำงานสำหรับการฝึกอบรมโมเดลภาษาขนาดใหญ่หลายรูปแบบเพื่อให้เหตุผลเกี่ยวกับอารมณ์ ความตั้งใจ และสัญญาณทางอารมณ์อื่นๆ ในภาพหรือฉากที่เกี่ยวข้องกับสังคมและศิลปะ พิมพ์ล่วงหน้าระบุว่าบางครั้งแบบจำลองสามารถเข้าถึงคำตอบที่ถูกต้องโดยอาศัยบริบทโดยรอบในขณะที่มองข้ามหลักฐานที่เน้นผู้คนเป็นศูนย์กลางซึ่งจะทำให้การตรวจสอบเหตุผลง่ายขึ้น
เอกสารที่ส่งไปยัง arXiv เมื่อวันที่ 24 สิงหาคม อธิบายถึง AffectOmni ซึ่งเป็นเฟรมเวิร์กการเรียนรู้แบบเสริมกำลังสำหรับการให้เหตุผลทางอารมณ์ที่ตรวจสอบได้ในรูปแบบภาษาขนาดใหญ่หลายรูปแบบ บทความนี้มุ่งเน้นไปที่ฉากที่เกี่ยวข้องกับสังคมและศิลปะ ซึ่งระบบอาจจำเป็นต้องอนุมานอารมณ์ เจตนา หรือการเรียงลำดับเหตุการณ์ ผู้เขียนระบุจุดอ่อนเฉพาะในระบบที่มีอยู่: แบบจำลองสามารถให้คำตอบที่ถูกต้องในขณะที่ใช้ทางลัดตามบริบทของฉากกว้างๆ แทนที่จะสนใจสัญญาณที่เน้นผู้คนเป็นศูนย์กลาง เช่น การแสดงออกแบบจุลภาคและภาษากาย
กรอบการทำงานเพิ่มองค์ประกอบรางวัลสองส่วนที่เรียกว่าการมุ่งเน้นผู้คนและระเบียบชั่วคราว ตามแหล่งที่มา People Focus สนับสนุนให้โมเดลเลือกหลักฐานที่เกี่ยวข้องกับผู้คน ในขณะที่ Temporal Order สนับสนุนการให้เหตุผลซึ่งมีโครงสร้างเมื่อมีเหตุการณ์เกิดขึ้น บทความนี้กล่าวว่าสัญญาณเหล่านี้มีจุดมุ่งหมายเพื่อลดพฤติกรรมทางลัดและปรับปรุงการเชื่อมโยงระหว่างคำตอบของแบบจำลองกับหลักฐานเชิงภาพที่รองรับ แหล่งที่มาไม่ได้ให้รายละเอียดเพียงพอที่จะกำหนดว่ารางวัลเหล่านี้ทำงานอย่างไรในฉากทุกประเภท หรือไม่ว่าจะป้องกันทางลัดในการทดสอบอิสระหรือไม่
AffectOmni ยังใช้การให้คะแนนเปรียบเทียบภายในกลุ่มระหว่างการเรียนรู้แบบเสริมกำลัง ผู้เขียนกล่าวว่าสิ่งนี้มีจุดมุ่งหมายเพื่อจัดการกับการรวมกลุ่มคะแนนในการตัดสินด้วยแบบจำลองภาษาขนาดใหญ่ ซึ่งคำตอบของผู้สมัครจำนวนมากได้รับคะแนนที่ใกล้เคียงกัน ดังนั้นจึงสร้างสัญญาณการฝึกอบรมที่มีการเลือกปฏิบัติอย่างอ่อน หลังจากที่แบบจำลองสร้างเหตุผลในรูปแบบอิสระแล้ว Thinking Summarizer จะแปลงเหตุผลดังกล่าวเป็นคำแนะนำเชิงประจักษ์ที่สามารถดำเนินการได้ คำแนะนำเหล่านั้นจะถูกต่อลงในพื้นที่หลักฐานระดับพิกเซลโดยใช้ SAM3 สร้างสิ่งที่ผู้เขียนอธิบายว่าเป็นอินเทอร์เฟซที่ตรวจสอบได้จากภายนอกนอกลูปการฝึกอบรม
แหล่งที่มารายงานการทดลองโดยใช้เกณฑ์มาตรฐาน 3 รายการ ได้แก่ IntentBench, Daily Omni และ WorldSense เมื่อเทียบกับโมเดลโอเพ่นซอร์สในระดับ 7B ผู้เขียนรายงานการปรับปรุงอย่างต่อเนื่อง รวมถึงการเพิ่มขึ้น 4.66% ในด้านการรับรู้อารมณ์ และ 14.29% สำหรับงานที่มีความละเอียดอ่อนชั่วคราว แหล่งที่มาไม่ได้ระบุว่าตัวเลขเหล่านี้เป็นเปอร์เซ็นต์ที่เพิ่มขึ้นแบบสัมบูรณ์หรือการปรับปรุงเปอร์เซ็นต์สัมพัทธ์ และไม่ได้ให้จำนวนตัวอย่าง ช่วงความเชื่อมั่น แถบข้อผิดพลาด หรือการเปรียบเทียบกับระบบที่เป็นกรรมสิทธิ์ที่แข็งแกร่งที่สุด พิมพ์ล่วงหน้าบอกว่าโค้ดพร้อมใช้งาน แต่แหล่งที่มาไม่มีลิงก์ที่เก็บข้อมูลที่ใช้งานได้หรืออธิบายข้อกำหนดสิทธิ์การใช้งาน
ทำไมมันถึงสำคัญ
การจดจำผลกระทบเป็นความสามารถที่เป็นผลสืบเนื่องสำหรับระบบที่ตีความปฏิสัมพันธ์ทางสังคม แต่ป้ายกำกับที่ถูกต้องไม่จำเป็นต้องแสดงว่าแบบจำลองสังเกตเห็นบุคคล การแสดงออก หรือท่าทางที่เกี่ยวข้อง แนวทางของ AffectOmni จัดการกับปัญหาการตรวจสอบย้อนกลับโดยการจับคู่การให้เหตุผลของแบบจำลองกับขอบเขตหลักฐานที่สามารถตรวจสอบได้นอกกระบวนการฝึกอบรม หากผลกำไรที่รายงานเกินกว่าเกณฑ์มาตรฐานของผู้เขียน วิธีการดังกล่าวอาจเสนอวิธีที่มีความรับผิดชอบมากขึ้นในการประเมินระบบหลายรูปแบบที่ตีความพฤติกรรมของมนุษย์
ประเด็นในทางปฏิบัติไม่ใช่แค่ว่าแบบจำลองต่อเนื่องหลายรูปแบบสามารถบอกชื่ออารมณ์ได้หรือไม่ ในแอปพลิเคชันที่ตีความฉากทางสังคม ผู้ใช้อาจจำเป็นต้องรู้ว่าหลักฐานใดที่มองเห็นได้ซึ่งนำไปสู่การตัดสิน ระบบที่ติดป้ายกำกับฉากอย่างถูกต้องด้วยเหตุผลที่ไม่ถูกต้องอาจล้มเหลวได้เมื่อพื้นหลัง เสื้อผ้า การตั้งค่า หรือบริบทอื่นๆ เปลี่ยนไป การเน้นย้ำของบทความนี้เกี่ยวกับหลักฐานที่เน้นผู้คนเป็นศูนย์กลาง กล่าวถึงช่องว่างความน่าเชื่อถือโดยตรง แม้ว่าแหล่งข่าวจะรายงานการตีความของผู้เขียนมากกว่าการค้นพบที่ได้รับการตรวจสอบโดยอิสระ
ขั้นตอนการลงพื้นฐานหลักฐานอาจทำให้ผลลัพธ์ของโมเดลเชิงอารมณ์ตรวจสอบได้ง่ายขึ้น ด้วยการแปลเหตุผลเป็นคำสั่งและเชื่อมโยงกับขอบเขตระดับพิกเซล AffectOmni นำเสนอสิ่งที่เป็นรูปธรรมที่ผู้ประเมินสามารถตรวจสอบได้ นี่เป็นการดำเนินการมากกว่าคำขอทั่วไปสำหรับแบบจำลองในการอธิบายตัวเอง: การกล่าวอ้างจะเชื่อมโยงกับตำแหน่งในภาพที่นำเข้า ถึงกระนั้นก็ตาม ภูมิภาคที่ไฮไลต์ไม่ควรถือเป็นข้อพิสูจน์การให้เหตุผลเชิงสาเหตุโดยอัตโนมัติ แหล่งที่มาไม่ได้ระบุว่าภูมิภาคต่างๆ เปิดเผยกระบวนการภายในที่สร้างคำตอบอย่างซื่อสัตย์
การปรับปรุงที่รายงานอาจมีประโยชน์เนื่องจากความเข้าใจชั่วคราวและการตีความทางอารมณ์เป็นจุดล้มเหลวทั่วไปในระบบหลายรูปแบบ การปรับปรุง 14.29% สำหรับงานที่มีความละเอียดอ่อนชั่วคราว หากทำซ้ำอย่างอิสระและกำหนดไว้อย่างชัดเจน อาจมีความสำคัญสำหรับระบบที่วิเคราะห์ลำดับมากกว่าภาพนิ่งที่แยกออกมา แหล่งข่าวไม่ได้บอกว่างานนั้นยากแค่ไหน วิธีสร้างเกณฑ์มาตรฐาน หรือว่าผลลัพธ์ที่ได้จะแปลงเป็นการใช้งานที่ตามมาหรือไม่ เช่น การศึกษา การเข้าถึง การกลั่นกรอง หรือการโต้ตอบระหว่างมนุษย์กับคอมพิวเตอร์
งานนี้ยังแสดงให้เห็นถึงตัวเลือกการออกแบบที่กว้างขึ้นในการประเมิน AI โดยให้รางวัลไม่เพียงแต่ผลลัพธ์เท่านั้น แต่ยังรวมถึงการเลือกและการจัดระเบียบหลักฐานที่สนับสนุนอีกด้วย วิธีการดังกล่าวสามารถช่วยให้นักวิจัยแยกแยะความแตกต่างระหว่างการมองเห็นที่แท้จริงจากคำตอบที่เกิดจากการเชื่อมโยงชุดข้อมูลได้ อย่างไรก็ตาม การตัดสินอย่างมีอารมณ์มักมีความอ่อนไหวต่อบริบทและการตีความ วิธีการให้รางวัลมุ่งเน้นไปที่สัญญาณของมนุษย์ที่มองเห็นได้อาจยังคงเข้ารหัสสมมติฐานเกี่ยวกับการแสดงออกทางอารมณ์ บรรทัดฐานทางสังคม หรือความหมายของท่าทาง โดยเฉพาะอย่างยิ่งเมื่อสมมติฐานเหล่านั้นสะท้อนอยู่ในข้อมูลการฝึกอบรม
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
จะดูอะไรต่อไป.
ผลลัพธ์มาจากการพิมพ์ล่วงหน้า arXiv 12 หน้าเดียวและรายงานโดยผู้เขียน แหล่งที่มาไม่ได้สร้างการจำลองแบบอิสระ การใช้งานจริง หรือประสิทธิภาพในกลุ่มประชากรและการตั้งค่าที่กว้างขึ้น งานติดตามผลควรทดสอบว่ากรอบการทำงานยังคงเชื่อถือได้กับวัฒนธรรมที่ไม่คุ้นเคย การโต้ตอบที่ไม่ชัดเจน คุณภาพของภาพที่ไม่ดี และฉากที่สัญญาณทางอารมณ์มีความละเอียดอ่อนหรือขัดแย้งกัน สิ่งสำคัญคือต้องพิจารณาว่าขอบเขตหลักฐานสะท้อนกระบวนการตัดสินใจของแบบจำลองอย่างแท้จริงหรือเพียงจัดเตรียมตำแหน่งสนับสนุนที่น่าเชื่อถือหลังจากสร้างคำตอบแล้ว
คำถามแรกคือการจำลองแบบ AffectOmni ถูกนำเสนอเป็นการพิมพ์ล่วงหน้าของ arXiv ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิหรือผ่านการตรวจสอบอย่างอิสระ นักวิจัยควรตรวจสอบว่าผลกำไรที่รายงานยังคงอยู่ภายใต้เกณฑ์วิธีการประเมินเดียวกันหรือไม่ ไม่ว่าจะยังคงอยู่หลังจากควบคุมข้อมูลการฝึกอบรมเพิ่มเติมหรือขนาดแบบจำลองหรือไม่ และวิธีการปรับปรุงการสอบเทียบและการตรวจจับข้อผิดพลาด แทนที่จะเป็นเพียงคะแนนเกณฑ์มาตรฐานเท่านั้น
ขอบเขตการวัดประสิทธิภาพจะมีความสำคัญ แหล่งที่มาตั้งชื่อ IntentBench, Daily Omni และ WorldSense แต่ไม่ได้อธิบายความครอบคลุมทางประชากร ภาษา คุณภาพของภาพ การตั้งค่าทางวัฒนธรรม หรือความสมดุลของสถานการณ์ทางสังคม การประเมินในอนาคตควรทดสอบอารมณ์ที่ไม่ชัดเจน สัญญาณผสม ใบหน้าที่ถูกบัง ตำแหน่งของร่างกายที่ผิดปกติ และฉากที่บุคคลที่สำคัญที่สุดไม่ใช่แหล่งที่มาของหลักฐานที่เกี่ยวข้อง พวกเขาควรรายงานผลลัพธ์ของกลุ่มย่อยที่การตีความอาจแตกต่างกันไปตามวัฒนธรรมหรือความพิการ
การกล่าวอ้างความสามารถในการตรวจสอบสมควรได้รับการทดสอบแบบกำหนดเป้าหมาย ผู้ประเมินสามารถเปรียบเทียบบริเวณที่ไฮไลต์กับคำอธิบายประกอบของมนุษย์ รบกวนพื้นที่ที่เลือก ซ่อนหรือเปลี่ยนบริบทพื้นหลังโดยคงหลักฐานที่เน้นผู้คนเป็นศูนย์กลางไว้คงที่ การทดสอบดังกล่าวจะช่วยพิจารณาว่าขอบเขตหลักฐานจำเป็นต่อการตัดสินใจของแบบจำลองหรือสร้างขึ้นหลังจากข้อเท็จจริง แหล่งที่มาไม่ได้รายงานการทดลองเหล่านี้ ดังนั้นจึงยังไม่ทราบขอบเขตของการยืนยันที่อ้างสิทธิ์
ท้ายที่สุด ข้อจำกัดในทางปฏิบัติไม่ได้ถูกกำหนดขึ้น ไม่มีข้อมูลเกี่ยวกับเวลาแฝง ต้นทุนการประมวลผล สิทธิ์การใช้งาน ความพร้อมใช้งาน การปกป้องความเป็นส่วนตัว หรือการใช้งานในระบบที่ใช้งานจริงในแหล่งที่มา ผู้เขียนรายงานผลลัพธ์เทียบกับข้อมูลพื้นฐานระดับโอเพ่นซอร์ส 7B แต่แหล่งที่มาไม่ได้แสดงให้เห็นว่า AffectOmni สามารถแข่งขันกับโมเดลที่ใหญ่กว่าหรือแข็งแกร่งนอกเกณฑ์มาตรฐานทั้งสามที่ระบุชื่อได้หรือไม่ จนกว่าจะตอบคำถามเหล่านั้นได้ งานนี้ถือเป็นที่เข้าใจดีที่สุดว่าเป็นข้อเสนอการวิจัยที่มีรายงานผลที่น่าหวัง ไม่ใช่เป็นวิธีแก้ปัญหาสำหรับการตีความอารมณ์ของผู้คน