Chuyện gì đã xảy ra
Các nhà nghiên cứu đã giới thiệu RoboPhys-3D, một chuẩn mực để đánh giá các mô hình thế giới được thể hiện thông qua việc tái tạo 3D, hiểu biết trạng thái và các biện pháp ở cấp độ nhiệm vụ. Điểm chuẩn bao gồm 50 nhiệm vụ thao tác, 5.000 tập và 25.000 video chân thực có nhiều lượt xem. Bài báo báo cáo rằng Cosmos 3 đã đạt được RoboPhyscore cao nhất trong số bốn mô hình thế giới video được thử nghiệm, trong khi các số liệu dựa trên cơ sở thực thi đã bộc lộ những điểm yếu mà các đánh giá về nhận thức và mô hình ngôn ngữ tầm nhìn không nắm bắt được.
Một bài báo được gửi tới arXiv vào ngày 28 tháng 8 năm 2026, giới thiệu RoboPhys-3D như một chuẩn mực cho các mô hình thế giới hiện thân. Các tác giả giải quyết vấn đề xung quanh các mô hình thế giới video được sử dụng làm công cụ dữ liệu, công cụ lập kế hoạch hành động và trình mô phỏng cho AI hiện thân. Lời chỉ trích của họ là các đánh giá mô hình thế giới được thể hiện thông thường không cung cấp một giao thức thống nhất dựa trên cấu trúc cảnh ba chiều và các hành động thực thi. RoboPhys-3D được xây dựng trên RoboTwin 2.0 và bao gồm 50 nhiệm vụ thao tác trên bốn chế độ, với 5.000 tập và 25.000 video chân thực có nhiều chế độ xem.
Các quy trình điểm chuẩn đã tạo ra các video và video chân thực thông qua cùng một quy trình tái tạo 3D. Theo bài báo, thiết kế này nhằm mục đích tách các lỗi do quá trình tái thiết gây ra khỏi các lỗi do video được tạo ra. RoboPhys-3D nhóm 50 số liệu thành 18 thứ nguyên phụ và bốn cấp độ đánh giá: độ trung thực ở cấp độ pixel, tính nhất quán của hình học 3D, hiểu biết ở cấp độ trạng thái và mức độ hoàn thành ở cấp độ nhiệm vụ. Các tác giả cũng giới thiệu Điểm đầy đủ trung bình, tính trung bình tất cả 50 số liệu và RoboPhyscore, điểm phù hợp với nhiệm vụ nhỏ hơn dựa trên các số liệu mà họ báo cáo là có mối tương quan chặt chẽ nhất với thành công của nhiệm vụ.
Báo cáo tóm tắt kết quả cho bốn mô hình thế giới video tiêu biểu. Cosmos 3 nhận được RoboPhyscore cao nhất, với số điểm 0,6330, được mô tả là 92,7% điểm thực tế. Bài báo nói rằng các biện pháp dựa trên trạng thái và thực thi đã bộc lộ những thất bại đáng kể mà các thước đo hoặc phán đoán về nhận thức từ các mô hình ngôn ngữ thị giác không thể nắm bắt được. Nó cũng báo cáo sự thống nhất chặt chẽ giữa RoboPhyscore và đánh giá của con người, với tương quan Pearson là 0,9761 và tương quan Spearman là 0,8962. Đây là những tuyên bố từ bản in trước arXiv phiên bản một; nguồn không cung cấp xác minh độc lập hoặc chi tiết thử nghiệm đầy đủ đằng sau bản tóm tắt.
Tại sao nó quan trọng
Công việc này giải quyết một vấn đề trọng tâm trong AI được thể hiện: một video được tạo ra có thể trông thuyết phục trong khi trình bày sai cảnh hoặc không hỗ trợ một hành động có thể sử dụng được. Một điểm chuẩn kết nối dự đoán trực quan với trạng thái 3D và hoàn thành nhiệm vụ có thể cung cấp cho các nhà nghiên cứu một cách thực tế hơn để so sánh các hệ thống, mặc dù bài báo là bản in sẵn và bản tóm tắt không xác định hiệu suất trên robot vật lý hoặc bên ngoài cài đặt điểm chuẩn của nó.
Đóng góp trọng tâm của bài báo là nỗ lực đo lường nhiều hơn liệu việc triển khai được tạo ra có hợp lý hay không. Đối với một hệ thống nhằm mục đích hướng dẫn robot, chỉ sự giống nhau về mặt hình ảnh có thể là không đủ nếu hình học, trạng thái đối tượng hoặc chuỗi hành động được dự đoán sai. Bằng cách bao gồm tính nhất quán 3D và tính hoàn chỉnh ở cấp độ tác vụ cùng với độ trung thực ở cấp pixel, RoboPhys-3D có thể giúp tách việc tạo video hấp dẫn khỏi các dự đoán giúp lưu giữ thông tin cần thiết cho việc lập kế hoạch và thực hiện. Sự khác biệt đó có liên quan trực tiếp đến cách đánh giá và cải thiện các hệ thống AI hiện có.
Quy trình tái thiết được chia sẻ có thể hữu ích vì nó cung cấp cho các video được tạo và tham chiếu một quy trình đo lường chung. Nếu các tạo tác tái tạo ảnh hưởng đến cả hai mặt của so sánh theo cách có thể so sánh được, thì các nhà nghiên cứu có thể xác định tốt hơn liệu điểm thấp phản ánh vấn đề trong mô hình thế giới hay trong người đánh giá. Nguồn chỉ nói rằng đường dẫn cho phép phân biệt này; nó không chứng minh rằng sự phân tách là hoàn hảo hoặc mọi lỗi tái thiết đều có thể được chẩn đoán một cách đáng tin cậy.
Mối quan hệ được báo cáo giữa RoboPhyscore và đánh giá của con người cho thấy rằng điểm số nhỏ gọn được đề xuất có thể theo dõi các đánh giá của con người trong môi trường được thử nghiệm. Nếu được nhân rộng, điểm số phù hợp với nhiệm vụ có thể giúp việc so sánh dễ dàng hơn so với việc báo cáo hàng tá số liệu không liên quan. Tuy nhiên, bằng chứng vẫn bị giới hạn bởi tiêu chuẩn riêng của bài báo, bốn mô hình đại diện và thiết kế đánh giá đã nêu. Nguồn không cho thấy rằng RoboPhyscore cao đảm bảo thao tác vật lý thành công, khái quát hóa cho các môi trường không thể nhìn thấy hoặc dự đoán hiệu suất trong các hoạt động triển khai quan trọng về an toàn.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các bước quan trọng tiếp theo là sao chép độc lập, xuất bản nhiệm vụ chi tiết của điểm chuẩn và quy trình đánh giá cũng như bằng chứng cho thấy RoboPhyscore dự đoán hiệu suất trong môi trường mới hoặc trên phần cứng thực. Người đọc cũng nên xem liệu thứ hạng mô hình có ổn định giữa các loại nhiệm vụ hay không, lỗi tái cấu trúc ảnh hưởng đến điểm số như thế nào và liệu thỏa thuận được báo cáo với đánh giá của con người có được duy trì trong thử nghiệm rộng hơn hay không.
Giá trị thực tế của điểm chuẩn sẽ phụ thuộc vào các chi tiết không có trong bản tóm tắt của nguồn: danh tính và cấu hình của cả bốn mô hình được thử nghiệm, chế độ nhiệm vụ chính xác, 50 số liệu, việc triển khai tái thiết và tiêu chí được sử dụng để xác định các số liệu tương quan với thành công của nhiệm vụ. Những chi tiết đó rất quan trọng để nhân rộng và đánh giá xem RoboPhyscore có đo lường khả năng rộng rãi hay phù hợp chặt chẽ với việc phân bổ nhiệm vụ của điểm chuẩn hay không.
Một ẩn số quan trọng là việc truyền dữ liệu ra ngoài các video đã ghi và các tập được mô phỏng hoặc đo điểm chuẩn do RoboTwin 2.0 đại diện. Nguồn không báo cáo các thử nghiệm trên robot vật lý, môi trường mới, tiếng ồn cảm biến, các hạn chế trong thời gian thực hoặc cách sắp xếp vật thể lạ. Công việc tiếp theo nên kiểm tra xem liệu điểm số có dự đoán thành công của hành động trong những điều kiện đó hay không, trong đó các lỗi nhỏ về hình học hoặc trạng thái có thể gây ra hậu quả lớn hơn so với khi chúng xảy ra trong đánh giá ngoại tuyến.
Các nhà nghiên cứu cũng nên kiểm tra mức độ ổn định của xếp hạng mô hình được báo cáo. Bản tóm tắt đưa ra RoboPhyscore của Cosmos 3 nhưng không xác định điểm số, phạm vi không chắc chắn hoặc biến thể theo nhiệm vụ của các hệ thống khác. Các phiên bản trong tương lai và các nghiên cứu độc lập có thể cho biết liệu các đánh giá về mô hình ngôn ngữ-ngôn ngữ và nhận thức có nhất quán bỏ sót các loại lỗi giống nhau hay không, liệu các lựa chọn tái thiết có thay đổi đáng kể thứ hạng hay không và liệu các mô hình có thể tối ưu hóa điểm chuẩn mà không cải thiện khả năng thực thi trong thế giới thực hay không. Các mối tương quan Pearson và Spearman được báo cáo cũng đảm bảo nhân rộng trên các mẫu đánh giá con người rộng hơn và các nhóm nhiệm vụ khác nhau.