Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

AffectOmni đào tạo AI đa phương thức để giải thích cảm xúc bằng cách sử dụng bằng chứng trực quan lấy con người làm trung tâm

Một bản in trước mới mô tả AffectOmni, một khung học tập tăng cường được thiết kế để tạo ra các mô hình AI đa phương thức dựa trên các đánh giá tình cảm dựa trên các tín hiệu lấy con người làm trung tâm như nét mặt, ngôn ngữ cơ thể và trật tự thời gian. Các tác giả báo cáo những cải tiến so với đường cơ sở quy mô 7B nguồn mở trên ba điểm chuẩn…

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.26193
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Học tăng cường
Đào tạo bằng các tín hiệu khen thưởng trong đó nhân viên học các hành động nhằm tối đa hóa lợi nhuận dài hạn.
Mô hình đa phương thức
Một mô hình có thể xử lý hoặc tạo ra nhiều loại dữ liệu như văn bản, hình ảnh và âm thanh.
Hiệu chuẩn
Điểm tin cậy của mô hình phù hợp với xác suất chính xác thực tế như thế nào.
Tự kiểm traAI là gì? Câu đố

Chuyện gì đã xảy ra

Các nhà nghiên cứu đã đề xuất AffectOmni, một khuôn khổ đào tạo các mô hình ngôn ngữ lớn đa phương thức để suy luận về cảm xúc, ý định và các tín hiệu tình cảm khác trong các hình ảnh hoặc cảnh liên quan đến nghệ thuật và xã hội. Bản in trước lập luận rằng các mô hình đôi khi có thể đạt được câu trả lời chính xác bằng cách dựa vào bối cảnh xung quanh trong khi bỏ qua các bằng chứng lấy con người làm trung tâm sẽ giúp kiểm tra lý luận của chúng dễ dàng hơn.

Bản in trước được gửi tới arXiv vào ngày 24 tháng 8 mô tả AffectOmni, một khung học tập tăng cường để lập luận tình cảm có thể kiểm chứng được trong các mô hình ngôn ngữ lớn đa phương thức. Bài viết tập trung vào các bối cảnh liên quan đến xã hội và nghệ thuật trong đó hệ thống có thể cần suy ra cảm xúc, ý định hoặc thứ tự của các sự kiện. Các tác giả xác định một điểm yếu cụ thể trong các hệ thống hiện có: một mô hình có thể đưa ra câu trả lời đúng trong khi sử dụng các phím tắt dựa trên bối cảnh bối cảnh rộng thay vì chú ý đến các tín hiệu lấy con người làm trung tâm như biểu cảm vi mô và ngôn ngữ cơ thể.

Khung này bổ sung thêm hai thành phần phần thưởng được gọi là Tập trung vào con người và Trật tự tạm thời. Theo nguồn tin, People Focus khuyến khích mô hình chọn bằng chứng liên quan đến con người, trong khi Trật tự tạm thời khuyến khích lý luận được cấu trúc xung quanh thời điểm các sự kiện xảy ra. Bài báo cho biết những tín hiệu này nhằm mục đích giảm hành vi đi tắt và cải thiện mối liên hệ giữa câu trả lời của mô hình và bằng chứng trực quan hỗ trợ nó. Nguồn không cung cấp đủ thông tin chi tiết để xác định cách thức hoạt động của các phần thưởng này trên tất cả các loại cảnh hoặc liệu chúng có ngăn chặn việc rút ngắn trong các thử nghiệm độc lập hay không.

AffectOmni cũng sử dụng tính điểm so sánh trong nhóm trong quá trình học tăng cường. Các tác giả cho biết điều này nhằm giải quyết vấn đề phân cụm điểm trong việc đánh giá theo mô hình ngôn ngữ lớn, trong đó nhiều câu trả lời của ứng viên nhận được điểm tương tự và do đó tạo ra các tín hiệu đào tạo có tính phân biệt yếu. Sau khi mô hình tạo ra cơ sở lý luận dạng tự do, Công cụ tóm tắt tư duy sẽ chuyển đổi cơ sở lý luận đó thành các hướng dẫn bằng chứng có thể thực thi được. Sau đó, các hướng dẫn đó được căn cứ vào các vùng bằng chứng ở cấp độ pixel bằng SAM3, tạo ra thứ mà các tác giả mô tả là giao diện có thể kiểm tra được bên ngoài bên ngoài vòng đào tạo.

Nguồn báo cáo các thử nghiệm trên ba điểm chuẩn: IntentBench, Daily Omni và WorldSense. So với các mô hình nguồn mở ở thang đo 7B, các tác giả báo cáo những cải tiến nhất quán, bao gồm mức tăng 4,66% về nhận dạng cảm xúc và mức tăng 14,29% đối với các nhiệm vụ nhạy cảm về mặt thời gian. Nguồn không chỉ rõ liệu những số liệu này là mức tăng điểm phần trăm tuyệt đối hay mức cải thiện phần trăm tương đối và nó không cung cấp số lượng mẫu, khoảng tin cậy, thanh lỗi hoặc so sánh với các hệ thống độc quyền mạnh nhất. Bản in trước cho biết mã có sẵn nhưng nguồn không cung cấp liên kết kho lưu trữ có thể sử dụng được hoặc mô tả các điều khoản cấp phép.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Nhận dạng ảnh hưởng là một khả năng mang tính hệ quả đối với các hệ thống diễn giải các tương tác xã hội, nhưng một nhãn chính xác không nhất thiết phải cho thấy rằng một mô hình đã chú ý đến người, biểu hiện hoặc cử chỉ có liên quan. Cách tiếp cận của AffectOmni giải quyết vấn đề truy xuất nguồn gốc đó bằng cách ghép nối lý luận mô hình với các vùng bằng chứng có thể được kiểm tra bên ngoài quá trình đào tạo. Nếu lợi ích được báo cáo vượt quá tiêu chuẩn của tác giả thì phương pháp này có thể đưa ra một cách có trách nhiệm hơn để đánh giá các hệ thống đa phương thức diễn giải hành vi của con người.

Vấn đề thực tế không chỉ đơn giản là liệu một mô hình đa phương thức có thể đặt tên cho một cảm xúc hay không. Trong các ứng dụng diễn giải các bối cảnh xã hội, người dùng có thể cần biết bằng chứng rõ ràng nào dẫn đến phán quyết. Một hệ thống gắn nhãn cảnh một cách chính xác vì lý do sai có thể bị lỗi khi phông nền, quần áo, bối cảnh hoặc các tín hiệu ngữ cảnh khác thay đổi. Sự nhấn mạnh của bài viết vào bằng chứng lấy con người làm trung tâm giải quyết trực tiếp khoảng cách về độ tin cậy, mặc dù nguồn báo cáo cách giải thích của tác giả chứ không phải là một phát hiện được xác minh độc lập.

Bước làm cơ sở bằng chứng có thể giúp kiểm toán kết quả đầu ra của mô hình cảm tính dễ dàng hơn. Bằng cách chuyển lý do thành hướng dẫn và liên kết chúng với các vùng cấp pixel, AffectOmni cung cấp một tạo phẩm cụ thể mà người đánh giá có thể kiểm tra. Điều này mang tính thực tế hơn là yêu cầu chung để mô hình tự giải thích: xác nhận quyền sở hữu được gắn với các vị trí trong hình ảnh đầu vào. Mặc dù vậy, các vùng được tô sáng sẽ không tự động được coi là bằng chứng cho lý luận nhân quả. Nguồn không chứng minh rằng các khu vực tiết lộ một cách trung thực quá trình nội bộ tạo ra câu trả lời.

Những cải tiến được báo cáo có khả năng hữu ích vì sự hiểu biết về thời gian và diễn giải cảm xúc là những điểm thất bại phổ biến trong các hệ thống đa phương thức. Cải thiện 14,29% đối với các tác vụ nhạy cảm về mặt thời gian, nếu được sao chép độc lập và xác định rõ ràng, có thể quan trọng đối với các hệ thống phân tích trình tự thay vì hình ảnh tĩnh bị cô lập. Nguồn không cho biết mức độ khó của các nhiệm vụ, cách xây dựng các điểm chuẩn hoặc liệu lợi ích thu được có chuyển sang các mục đích sử dụng mang tính hệ quả như giáo dục, khả năng tiếp cận, kiểm duyệt hoặc tương tác giữa con người với máy tính hay không.

Công trình cũng minh họa sự lựa chọn thiết kế rộng hơn trong đánh giá AI: khen thưởng không chỉ kết quả đầu ra mà cả việc lựa chọn và tổ chức bằng chứng hỗ trợ. Cách tiếp cận đó có thể giúp các nhà nghiên cứu phân biệt nền tảng trực quan thực sự với các câu trả lời được tạo ra thông qua các liên kết dữ liệu. Tuy nhiên, những đánh giá tình cảm vốn rất nhạy cảm với bối cảnh và cách giải thích. Phương pháp khen thưởng tập trung vào các tín hiệu hữu hình của con người vẫn có thể mã hóa các giả định về biểu hiện cảm xúc, chuẩn mực xã hội hoặc ý nghĩa của cử chỉ, đặc biệt khi những giả định đó được phản ánh trong dữ liệu đào tạo.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Xem gì tiếp theo

Các kết quả đến từ một bản in trước arXiv dài 12 trang và được báo cáo bởi các tác giả của nó; nguồn không thiết lập bản sao độc lập, triển khai trong thế giới thực hoặc hiệu suất trên các nhóm và cài đặt rộng hơn. Công việc tiếp theo nên kiểm tra xem khung có còn đáng tin cậy với các nền văn hóa xa lạ, tương tác không rõ ràng, chất lượng hình ảnh kém và những cảnh có tín hiệu cảm xúc tinh tế hoặc mâu thuẫn hay không. Điều quan trọng nữa là xác định xem liệu các vùng bằng chứng có phản ánh chân thực quá trình ra quyết định của mô hình hay chỉ đơn thuần cung cấp các vị trí hỗ trợ hợp lý sau khi câu trả lời được hình thành.

Câu hỏi đầu tiên là sự sao chép. AffectOmni được trình bày dưới dạng bản in trước arXiv, không phải là kết quả được đánh giá ngang hàng hoặc được xác thực độc lập. Các nhà nghiên cứu nên kiểm tra xem mức tăng được báo cáo có còn tồn tại theo cùng một giao thức đánh giá hay không, liệu chúng có còn tồn tại sau khi kiểm soát dữ liệu đào tạo hoặc kích thước mô hình bổ sung hay không và liệu phương pháp này có cải thiện hiệu chuẩn và phát hiện lỗi thay vì chỉ điểm chuẩn hay không.

Phạm vi điểm chuẩn sẽ có vấn đề. Nguồn tên IntentBench, Daily Omni và WorldSense nhưng không mô tả phạm vi nhân khẩu học, ngôn ngữ, chất lượng hình ảnh, bối cảnh văn hóa hoặc sự cân bằng của các tình huống xã hội. Các đánh giá trong tương lai nên kiểm tra những cảm xúc mơ hồ, tín hiệu lẫn lộn, khuôn mặt bị che khuất, vị trí cơ thể bất thường và những cảnh trong đó người nổi bật nhất không phải là nguồn gốc của bằng chứng liên quan. Họ cũng nên báo cáo kết quả của phân nhóm trong đó cách giải thích có thể khác nhau giữa các nền văn hóa hoặc khuyết tật.

Tuyên bố về khả năng kiểm toán xứng đáng được thử nghiệm có mục tiêu. Người đánh giá có thể so sánh các vùng được đánh dấu với chú thích của con người, làm xáo trộn các vùng đã chọn, ẩn chúng hoặc thay thế bối cảnh nền trong khi vẫn giữ nguyên bằng chứng lấy con người làm trung tâm. Những thử nghiệm như vậy sẽ giúp xác định xem các vùng bằng chứng có cần thiết cho quyết định của mô hình hay được tạo ra sau thực tế. Nguồn không báo cáo các thử nghiệm này, vì vậy mức độ xác minh được yêu cầu vẫn chưa được biết.

Cuối cùng, các giới hạn thực tế không được thiết lập. Không có thông tin nào trong nguồn về độ trễ, chi phí tính toán, cấp phép, tính sẵn sàng triển khai, các biện pháp bảo vệ quyền riêng tư hoặc việc sử dụng trong các hệ thống trực tiếp. Các tác giả báo cáo kết quả dựa trên các đường cơ sở quy mô 7B nguồn mở, nhưng nguồn không cho biết liệu AffectOmni có khả năng cạnh tranh với các mô hình lớn hơn hay mạnh mẽ ngoài ba điểm chuẩn được nêu tên. Cho đến khi những câu hỏi đó được trả lời, tốt nhất nên hiểu công trình này là một đề xuất nghiên cứu với những kết quả được báo cáo đầy hứa hẹn chứ không phải là một giải pháp đã được xác thực để giải thích cảm xúc của con người.

Hướng dẫn và câu hỏi liên quan

AI là gì?Giải thích về mô hình AIMáy biến ápĐạo đức AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?