กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

AffectOmni ฝึก AI ต่อเนื่องหลายรูปแบบเพื่ออธิบายอารมณ์โดยใช้หลักฐานทางภาพที่คำนึงถึงผู้คนเป็นศูนย์กลาง

การพิมพ์ล่วงหน้าใหม่อธิบายถึง AffectOmni ซึ่งเป็นเฟรมเวิร์กการเรียนรู้แบบเสริมกำลังที่ออกแบบมาเพื่อสร้างโมเดล AI ต่อเนื่องหลายรูปแบบ ใช้การตัดสินทางอารมณ์บนสัญญาณที่เน้นผู้คนเป็นศูนย์กลาง เช่น การแสดงออกทางสีหน้า ภาษากาย และระเบียบเวลา ผู้เขียนรายงานการปรับปรุงเหนือเส้นฐานระดับ 7B ของโอเพ่นซอร์สบนเกณฑ์มาตรฐานสามประการ...

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.26193
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
โมเดลต่อเนื่องหลายรูปแบบ
โมเดลที่สามารถประมวลผลหรือสร้างข้อมูลหลายประเภท เช่น ข้อความ รูปภาพ และเสียง
การสอบเทียบ
คะแนนความเชื่อมั่นของแบบจำลองตรงกับความน่าจะเป็นที่ถูกต้องตามจริงเพียงใด
ทดสอบตัวเองเอไอคืออะไร? แบบทดสอบ

เกิดอะไรขึ้น

นักวิจัยได้เสนอ AffectOmni ซึ่งเป็นกรอบการทำงานสำหรับการฝึกอบรมโมเดลภาษาขนาดใหญ่หลายรูปแบบเพื่อให้เหตุผลเกี่ยวกับอารมณ์ ความตั้งใจ และสัญญาณทางอารมณ์อื่นๆ ในภาพหรือฉากที่เกี่ยวข้องกับสังคมและศิลปะ พิมพ์ล่วงหน้าระบุว่าบางครั้งแบบจำลองสามารถเข้าถึงคำตอบที่ถูกต้องโดยอาศัยบริบทโดยรอบในขณะที่มองข้ามหลักฐานที่เน้นผู้คนเป็นศูนย์กลางซึ่งจะทำให้การตรวจสอบเหตุผลง่ายขึ้น

เอกสารที่ส่งไปยัง arXiv เมื่อวันที่ 24 สิงหาคม อธิบายถึง AffectOmni ซึ่งเป็นเฟรมเวิร์กการเรียนรู้แบบเสริมกำลังสำหรับการให้เหตุผลทางอารมณ์ที่ตรวจสอบได้ในรูปแบบภาษาขนาดใหญ่หลายรูปแบบ บทความนี้มุ่งเน้นไปที่ฉากที่เกี่ยวข้องกับสังคมและศิลปะ ซึ่งระบบอาจจำเป็นต้องอนุมานอารมณ์ เจตนา หรือการเรียงลำดับเหตุการณ์ ผู้เขียนระบุจุดอ่อนเฉพาะในระบบที่มีอยู่: แบบจำลองสามารถให้คำตอบที่ถูกต้องในขณะที่ใช้ทางลัดตามบริบทของฉากกว้างๆ แทนที่จะสนใจสัญญาณที่เน้นผู้คนเป็นศูนย์กลาง เช่น การแสดงออกแบบจุลภาคและภาษากาย

กรอบการทำงานเพิ่มองค์ประกอบรางวัลสองส่วนที่เรียกว่าการมุ่งเน้นผู้คนและระเบียบชั่วคราว ตามแหล่งที่มา People Focus สนับสนุนให้โมเดลเลือกหลักฐานที่เกี่ยวข้องกับผู้คน ในขณะที่ Temporal Order สนับสนุนการให้เหตุผลซึ่งมีโครงสร้างเมื่อมีเหตุการณ์เกิดขึ้น บทความนี้กล่าวว่าสัญญาณเหล่านี้มีจุดมุ่งหมายเพื่อลดพฤติกรรมทางลัดและปรับปรุงการเชื่อมโยงระหว่างคำตอบของแบบจำลองกับหลักฐานเชิงภาพที่รองรับ แหล่งที่มาไม่ได้ให้รายละเอียดเพียงพอที่จะกำหนดว่ารางวัลเหล่านี้ทำงานอย่างไรในฉากทุกประเภท หรือไม่ว่าจะป้องกันทางลัดในการทดสอบอิสระหรือไม่

AffectOmni ยังใช้การให้คะแนนเปรียบเทียบภายในกลุ่มระหว่างการเรียนรู้แบบเสริมกำลัง ผู้เขียนกล่าวว่าสิ่งนี้มีจุดมุ่งหมายเพื่อจัดการกับการรวมกลุ่มคะแนนในการตัดสินด้วยแบบจำลองภาษาขนาดใหญ่ ซึ่งคำตอบของผู้สมัครจำนวนมากได้รับคะแนนที่ใกล้เคียงกัน ดังนั้นจึงสร้างสัญญาณการฝึกอบรมที่มีการเลือกปฏิบัติอย่างอ่อน หลังจากที่แบบจำลองสร้างเหตุผลในรูปแบบอิสระแล้ว Thinking Summarizer จะแปลงเหตุผลดังกล่าวเป็นคำแนะนำเชิงประจักษ์ที่สามารถดำเนินการได้ คำแนะนำเหล่านั้นจะถูกต่อลงในพื้นที่หลักฐานระดับพิกเซลโดยใช้ SAM3 สร้างสิ่งที่ผู้เขียนอธิบายว่าเป็นอินเทอร์เฟซที่ตรวจสอบได้จากภายนอกนอกลูปการฝึกอบรม

แหล่งที่มารายงานการทดลองโดยใช้เกณฑ์มาตรฐาน 3 รายการ ได้แก่ IntentBench, Daily Omni และ WorldSense เมื่อเทียบกับโมเดลโอเพ่นซอร์สในระดับ 7B ผู้เขียนรายงานการปรับปรุงอย่างต่อเนื่อง รวมถึงการเพิ่มขึ้น 4.66% ในด้านการรับรู้อารมณ์ และ 14.29% สำหรับงานที่มีความละเอียดอ่อนชั่วคราว แหล่งที่มาไม่ได้ระบุว่าตัวเลขเหล่านี้เป็นเปอร์เซ็นต์ที่เพิ่มขึ้นแบบสัมบูรณ์หรือการปรับปรุงเปอร์เซ็นต์สัมพัทธ์ และไม่ได้ให้จำนวนตัวอย่าง ช่วงความเชื่อมั่น แถบข้อผิดพลาด หรือการเปรียบเทียบกับระบบที่เป็นกรรมสิทธิ์ที่แข็งแกร่งที่สุด พิมพ์ล่วงหน้าบอกว่าโค้ดพร้อมใช้งาน แต่แหล่งที่มาไม่มีลิงก์ที่เก็บข้อมูลที่ใช้งานได้หรืออธิบายข้อกำหนดสิทธิ์การใช้งาน

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

การจดจำผลกระทบเป็นความสามารถที่เป็นผลสืบเนื่องสำหรับระบบที่ตีความปฏิสัมพันธ์ทางสังคม แต่ป้ายกำกับที่ถูกต้องไม่จำเป็นต้องแสดงว่าแบบจำลองสังเกตเห็นบุคคล การแสดงออก หรือท่าทางที่เกี่ยวข้อง แนวทางของ AffectOmni จัดการกับปัญหาการตรวจสอบย้อนกลับโดยการจับคู่การให้เหตุผลของแบบจำลองกับขอบเขตหลักฐานที่สามารถตรวจสอบได้นอกกระบวนการฝึกอบรม หากผลกำไรที่รายงานเกินกว่าเกณฑ์มาตรฐานของผู้เขียน วิธีการดังกล่าวอาจเสนอวิธีที่มีความรับผิดชอบมากขึ้นในการประเมินระบบหลายรูปแบบที่ตีความพฤติกรรมของมนุษย์

ประเด็นในทางปฏิบัติไม่ใช่แค่ว่าแบบจำลองต่อเนื่องหลายรูปแบบสามารถบอกชื่ออารมณ์ได้หรือไม่ ในแอปพลิเคชันที่ตีความฉากทางสังคม ผู้ใช้อาจจำเป็นต้องรู้ว่าหลักฐานใดที่มองเห็นได้ซึ่งนำไปสู่การตัดสิน ระบบที่ติดป้ายกำกับฉากอย่างถูกต้องด้วยเหตุผลที่ไม่ถูกต้องอาจล้มเหลวได้เมื่อพื้นหลัง เสื้อผ้า การตั้งค่า หรือบริบทอื่นๆ เปลี่ยนไป การเน้นย้ำของบทความนี้เกี่ยวกับหลักฐานที่เน้นผู้คนเป็นศูนย์กลาง กล่าวถึงช่องว่างความน่าเชื่อถือโดยตรง แม้ว่าแหล่งข่าวจะรายงานการตีความของผู้เขียนมากกว่าการค้นพบที่ได้รับการตรวจสอบโดยอิสระ

ขั้นตอนการลงพื้นฐานหลักฐานอาจทำให้ผลลัพธ์ของโมเดลเชิงอารมณ์ตรวจสอบได้ง่ายขึ้น ด้วยการแปลเหตุผลเป็นคำสั่งและเชื่อมโยงกับขอบเขตระดับพิกเซล AffectOmni นำเสนอสิ่งที่เป็นรูปธรรมที่ผู้ประเมินสามารถตรวจสอบได้ นี่เป็นการดำเนินการมากกว่าคำขอทั่วไปสำหรับแบบจำลองในการอธิบายตัวเอง: การกล่าวอ้างจะเชื่อมโยงกับตำแหน่งในภาพที่นำเข้า ถึงกระนั้นก็ตาม ภูมิภาคที่ไฮไลต์ไม่ควรถือเป็นข้อพิสูจน์การให้เหตุผลเชิงสาเหตุโดยอัตโนมัติ แหล่งที่มาไม่ได้ระบุว่าภูมิภาคต่างๆ เปิดเผยกระบวนการภายในที่สร้างคำตอบอย่างซื่อสัตย์

การปรับปรุงที่รายงานอาจมีประโยชน์เนื่องจากความเข้าใจชั่วคราวและการตีความทางอารมณ์เป็นจุดล้มเหลวทั่วไปในระบบหลายรูปแบบ การปรับปรุง 14.29% สำหรับงานที่มีความละเอียดอ่อนชั่วคราว หากทำซ้ำอย่างอิสระและกำหนดไว้อย่างชัดเจน อาจมีความสำคัญสำหรับระบบที่วิเคราะห์ลำดับมากกว่าภาพนิ่งที่แยกออกมา แหล่งข่าวไม่ได้บอกว่างานนั้นยากแค่ไหน วิธีสร้างเกณฑ์มาตรฐาน หรือว่าผลลัพธ์ที่ได้จะแปลงเป็นการใช้งานที่ตามมาหรือไม่ เช่น การศึกษา การเข้าถึง การกลั่นกรอง หรือการโต้ตอบระหว่างมนุษย์กับคอมพิวเตอร์

งานนี้ยังแสดงให้เห็นถึงตัวเลือกการออกแบบที่กว้างขึ้นในการประเมิน AI โดยให้รางวัลไม่เพียงแต่ผลลัพธ์เท่านั้น แต่ยังรวมถึงการเลือกและการจัดระเบียบหลักฐานที่สนับสนุนอีกด้วย วิธีการดังกล่าวสามารถช่วยให้นักวิจัยแยกแยะความแตกต่างระหว่างการมองเห็นที่แท้จริงจากคำตอบที่เกิดจากการเชื่อมโยงชุดข้อมูลได้ อย่างไรก็ตาม การตัดสินอย่างมีอารมณ์มักมีความอ่อนไหวต่อบริบทและการตีความ วิธีการให้รางวัลมุ่งเน้นไปที่สัญญาณของมนุษย์ที่มองเห็นได้อาจยังคงเข้ารหัสสมมติฐานเกี่ยวกับการแสดงออกทางอารมณ์ บรรทัดฐานทางสังคม หรือความหมายของท่าทาง โดยเฉพาะอย่างยิ่งเมื่อสมมติฐานเหล่านั้นสะท้อนอยู่ในข้อมูลการฝึกอบรม

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

จะดูอะไรต่อไป.

ผลลัพธ์มาจากการพิมพ์ล่วงหน้า arXiv 12 หน้าเดียวและรายงานโดยผู้เขียน แหล่งที่มาไม่ได้สร้างการจำลองแบบอิสระ การใช้งานจริง หรือประสิทธิภาพในกลุ่มประชากรและการตั้งค่าที่กว้างขึ้น งานติดตามผลควรทดสอบว่ากรอบการทำงานยังคงเชื่อถือได้กับวัฒนธรรมที่ไม่คุ้นเคย การโต้ตอบที่ไม่ชัดเจน คุณภาพของภาพที่ไม่ดี และฉากที่สัญญาณทางอารมณ์มีความละเอียดอ่อนหรือขัดแย้งกัน สิ่งสำคัญคือต้องพิจารณาว่าขอบเขตหลักฐานสะท้อนกระบวนการตัดสินใจของแบบจำลองอย่างแท้จริงหรือเพียงจัดเตรียมตำแหน่งสนับสนุนที่น่าเชื่อถือหลังจากสร้างคำตอบแล้ว

คำถามแรกคือการจำลองแบบ AffectOmni ถูกนำเสนอเป็นการพิมพ์ล่วงหน้าของ arXiv ไม่ใช่ผลลัพธ์ที่ผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิหรือผ่านการตรวจสอบอย่างอิสระ นักวิจัยควรตรวจสอบว่าผลกำไรที่รายงานยังคงอยู่ภายใต้เกณฑ์วิธีการประเมินเดียวกันหรือไม่ ไม่ว่าจะยังคงอยู่หลังจากควบคุมข้อมูลการฝึกอบรมเพิ่มเติมหรือขนาดแบบจำลองหรือไม่ และวิธีการปรับปรุงการสอบเทียบและการตรวจจับข้อผิดพลาด แทนที่จะเป็นเพียงคะแนนเกณฑ์มาตรฐานเท่านั้น

ขอบเขตการวัดประสิทธิภาพจะมีความสำคัญ แหล่งที่มาตั้งชื่อ IntentBench, Daily Omni และ WorldSense แต่ไม่ได้อธิบายความครอบคลุมทางประชากร ภาษา คุณภาพของภาพ การตั้งค่าทางวัฒนธรรม หรือความสมดุลของสถานการณ์ทางสังคม การประเมินในอนาคตควรทดสอบอารมณ์ที่ไม่ชัดเจน สัญญาณผสม ใบหน้าที่ถูกบัง ตำแหน่งของร่างกายที่ผิดปกติ และฉากที่บุคคลที่สำคัญที่สุดไม่ใช่แหล่งที่มาของหลักฐานที่เกี่ยวข้อง พวกเขาควรรายงานผลลัพธ์ของกลุ่มย่อยที่การตีความอาจแตกต่างกันไปตามวัฒนธรรมหรือความพิการ

การกล่าวอ้างความสามารถในการตรวจสอบสมควรได้รับการทดสอบแบบกำหนดเป้าหมาย ผู้ประเมินสามารถเปรียบเทียบบริเวณที่ไฮไลต์กับคำอธิบายประกอบของมนุษย์ รบกวนพื้นที่ที่เลือก ซ่อนหรือเปลี่ยนบริบทพื้นหลังโดยคงหลักฐานที่เน้นผู้คนเป็นศูนย์กลางไว้คงที่ การทดสอบดังกล่าวจะช่วยพิจารณาว่าขอบเขตหลักฐานจำเป็นต่อการตัดสินใจของแบบจำลองหรือสร้างขึ้นหลังจากข้อเท็จจริง แหล่งที่มาไม่ได้รายงานการทดลองเหล่านี้ ดังนั้นจึงยังไม่ทราบขอบเขตของการยืนยันที่อ้างสิทธิ์

ท้ายที่สุด ข้อจำกัดในทางปฏิบัติไม่ได้ถูกกำหนดขึ้น ไม่มีข้อมูลเกี่ยวกับเวลาแฝง ต้นทุนการประมวลผล สิทธิ์การใช้งาน ความพร้อมใช้งาน การปกป้องความเป็นส่วนตัว หรือการใช้งานในระบบที่ใช้งานจริงในแหล่งที่มา ผู้เขียนรายงานผลลัพธ์เทียบกับข้อมูลพื้นฐานระดับโอเพ่นซอร์ส 7B แต่แหล่งที่มาไม่ได้แสดงให้เห็นว่า AffectOmni สามารถแข่งขันกับโมเดลที่ใหญ่กว่าหรือแข็งแกร่งนอกเกณฑ์มาตรฐานทั้งสามที่ระบุชื่อได้หรือไม่ จนกว่าจะตอบคำถามเหล่านั้นได้ งานนี้ถือเป็นที่เข้าใจดีที่สุดว่าเป็นข้อเสนอการวิจัยที่มีรายงานผลที่น่าหวัง ไม่ใช่เป็นวิธีแก้ปัญหาสำหรับการตีความอารมณ์ของผู้คน

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

เอไอคืออะไร?อธิบายโมเดล AIหม้อแปลงไฟฟ้าจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?