Chuyện gì đã xảy ra
Các nhà nghiên cứu đã giới thiệu PhysElite, một chuẩn mực đa phương thức song ngữ được thiết kế để kiểm tra các mô hình ngôn ngữ lớn về các vấn đề vật lý cấp độ Olympic. Bộ dữ liệu chứa 11.586 bài toán, sơ đồ trực quan, dẫn xuất lời giải Trung-Anh và câu trả lời cuối cùng. Bài viết báo cáo kết quả đánh giá 18 mô hình ngôn ngữ đa phương thức nguồn mở và nguồn đóng, trong đó mô hình mạnh nhất đạt độ chính xác câu trả lời 33,7%.
Bài báo trình bày PhysElite như một chuẩn mực cho lý luận vật lý cấp độ Olympic bằng mô hình ngôn ngữ lớn đa phương thức. Nó đã được gửi tới arXiv vào ngày 25 tháng 8 năm 2026. Các tác giả cho rằng các điểm chuẩn vật lý hiện tại còn hạn chế vì chúng không chứa đủ các vấn đề có độ khó cao và không bao quát toàn diện thông tin trực quan, các lĩnh vực kiến thức vật lý và quy trình giải quyết từng bước.
Theo bản tóm tắt của bài báo, PhysElite chứa 11.586 bài toán cấp độ Olympic bằng cả tiếng Trung và tiếng Anh. Mỗi vấn đề được ghép nối với một sơ đồ trực quan, một dẫn xuất song ngữ được chia thành các bước và đáp án cuối cùng. Nguồn cho biết tập dữ liệu đã được phát hành, mặc dù văn bản được cung cấp không bao gồm liên kết đích hoặc mô tả các yêu cầu về giấy phép, định dạng hoặc quyền truy cập của nó.
Các tác giả đã đánh giá 18 mô hình ngôn ngữ đa phương thức, bao gồm cả hệ thống nguồn mở và nguồn đóng. Mô hình mạnh nhất đạt độ chính xác câu trả lời là 33,7%. Các nhà nghiên cứu cũng tiến hành đánh giá quy trình ở cấp độ từng bước để xác định vị trí các mô hình bị lỗi trong chuỗi suy luận. Nguồn không cung cấp tên của các mô hình, số lần thử cho mỗi vấn đề, quy tắc tính điểm hoặc kết quả chi tiết theo loại vấn đề.
Tại sao nó quan trọng
Kết quả cho thấy rằng hiệu suất cao trong các bài kiểm tra vật lý hiện tại hoặc các bài kiểm tra lý luận tổng quát có thể không chuyển thành các giải pháp đáng tin cậy cho các vấn đề vật lý khó, phụ thuộc vào sơ đồ, nhiều bước. PhysElite nhằm mục đích làm cho những điểm yếu đó trở nên rõ ràng hơn bằng cách đánh giá cả câu trả lời cuối cùng và các giai đoạn riêng lẻ trong quá trình suy luận của mô hình.
Điểm chuẩn này giải quyết một điểm yếu thực tế trong cách đánh giá hệ thống suy luận AI. Một mô hình có thể đưa ra những lời giải thích trôi chảy hoặc thực hiện tốt các câu hỏi ngắn hơn nhưng vẫn thất bại khi phải diễn giải sơ đồ, chọn các nguyên tắc vật lý phù hợp, thực hiện một số suy luận liên kết và đi đến câu trả lời chính xác. PhysElite được thiết kế xoay quanh thử thách kết hợp đó thay vì coi vật lý chỉ là câu trả lời bằng văn bản.
Kết quả 33,7% được báo cáo là có tính hệ quả vì nó đặt ra giới hạn rõ ràng về những gì hệ thống được thử nghiệm đã thể hiện đối với nhiệm vụ có độ khó cao đặc biệt này. Nó không chứng tỏ rằng các mô hình ngôn ngữ đa phương thức không có khả năng giải quyết vấn đề vật lý Olympic và nó không chứng minh rằng mọi mô hình đều thực hiện ở cùng một cấp độ. Theo bài báo, nó cho thấy rằng ngay cả hệ thống được đánh giá mạnh nhất cũng không giải quyết được hầu hết các vấn đề về điểm chuẩn một cách chính xác.
Việc đánh giá ở cấp độ từng bước có thể hữu ích hơn một điểm số cuối cùng duy nhất cho các nhà nghiên cứu và người dùng. Nếu lỗi xảy ra chủ yếu trong khi diễn giải sơ đồ, chọn phương trình, thực hiện phép tính hoặc kết nối các kết quả trung gian, thì các nhà phát triển có thể nhắm mục tiêu vào những điểm yếu đó một cách chính xác hơn. Nguồn được cung cấp không nêu rõ giai đoạn nào tạo ra nhiều lỗi nhất, do đó giá trị chẩn đoán của điểm chuẩn vẫn chưa thể được đánh giá chi tiết.
Đối với công chúng, những phát hiện này đưa ra lời cảnh báo đối với việc coi các hệ thống AI có mục đích chung là những vật thay thế đáng tin cậy cho lý luận vật lý chuyên môn. Một hệ thống đưa ra giải pháp gồm nhiều bước hợp lý nhưng không chính xác có thể khó kiểm tra đối với người không phải là chuyên gia. Thiết kế song ngữ và trực quan của điểm chuẩn cũng có thể giúp bộc lộ những hạn chế bị ẩn giấu bởi các đánh giá tập trung vào văn bản tiếng Anh hoặc các dạng câu trả lời cuối cùng ngắn.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Các câu hỏi chính là liệu tập dữ liệu và mã đánh giá có đủ khả năng truy cập để sao chép độc lập hay không, hiệu suất thay đổi như thế nào giữa các chủ đề vật lý và định dạng trực quan cũng như liệu các mô hình trong tương lai có cải thiện điểm chuẩn mà không cần dựa vào các giải pháp đã ghi nhớ hay không. Nguồn không xác định các mô hình được thử nghiệm hoặc cung cấp phân tích đánh giá, do đó, 33,7% được báo cáo không nên được sử dụng để xếp hạng các hệ thống cụ thể.
Nhân rộng độc lập là thử nghiệm ngay lập tức. Các nhà nghiên cứu sẽ cần kiểm tra các vấn đề, sơ đồ, giải pháp và quy trình chấm điểm được đưa ra để xác định xem liệu điểm chuẩn có còn mơ hồ, các mục trùng lặp hoặc các yếu tố khác có thể ảnh hưởng đến kết quả hay không. Nguồn xác nhận việc phát hành tập dữ liệu nhưng không cung cấp đủ thông tin để đánh giá khả năng truy cập hoặc khả năng tái tạo của nó.
Phạm vi đưa tin trong tương lai sẽ cho thấy con số 33,7% được chia thành các chủ đề vật lý, mức độ khó, loại sơ đồ, ngôn ngữ và định dạng câu trả lời như thế nào. Điều quan trọng nữa là phải biết liệu các mô hình có nhận được lời nhắc giống nhau hay không, liệu các công cụ như máy tính có được phép hay không và cách xử lý một phần tín dụng. Không có chi tiết nào trong số đó xuất hiện trong nguồn được cung cấp.
Điểm chuẩn có thể mang lại nhiều thông tin hơn nếu các đánh giá sau này so sánh các phiên bản mô hình theo thời gian và báo cáo cả độ chính xác của câu trả lời cuối cùng cũng như độ tin cậy ở cấp độ từng bước. Các nhà nghiên cứu cũng nên kiểm tra xem liệu các mô hình có thể nhận ra sự không chắc chắn, xác định các bước trung gian không chính xác hoặc yêu cầu làm rõ khi sơ đồ không rõ ràng hay không. Bản tóm tắt của bài báo không báo cáo những hành vi đó.
Điều chưa biết quan trọng nhất là PhysElite đại diện cho công việc vật lý thực sự như thế nào. Các bài toán Olympic có chủ ý là khó và có thể không phản ánh các bài tập trên lớp, phân tích trong phòng thí nghiệm, thiết kế kỹ thuật hoặc thực hành nghiên cứu. Nguồn thiết lập phạm vi của điểm chuẩn và kết quả được báo cáo, nhưng nó không thiết lập hiệu suất trên PhysElite dự đoán hiệu suất trong các cài đặt khác đó như thế nào.
Kết hợp lại với nhau, mô tả có sẵn hỗ trợ việc giải thích kết quả một cách hạn chế. Con số 33,7% thuộc về đánh giá độ chính xác của câu trả lời được báo cáo của 18 mô hình ngôn ngữ đa phương thức được thử nghiệm trên điểm chuẩn này. Nó nên được đọc cùng với các vấn đề song ngữ, sơ đồ trực quan, dẫn xuất và câu trả lời cuối cùng của tập dữ liệu, cũng như đánh giá quy trình ở cấp độ riêng biệt. Vì nguồn được cung cấp không bao gồm tên mô hình, quy tắc tính điểm, số lần thử, phân tích chủ đề hoặc mã đánh giá nên người đọc không thể chỉ sử dụng phần tóm tắt để xây dựng lại sự so sánh hoặc xác định phần nào của nhiệm vụ dẫn đến kết quả. Do đó, những chi tiết còn thiếu đó là trọng tâm để hiểu các báo cáo tiếp theo về PhysElite.