Chuyện gì đã xảy ra
Bản in trước arXiv báo cáo hai nghiên cứu in-silico được liên kết xem xét cách đánh giá tính toán định hình sự phát triển được hỗ trợ bởi AI của các hạng mục đánh giá Big Five. Trên 32.000 mục được chọn, các tác giả nhận thấy rằng các chính sách về đại diện, sàng lọc cấu trúc và hình thức ứng cử viên đã ảnh hưởng đến cách diễn đạt và xây dựng bằng chứng đạt được sự xem xét của chuyên gia.
Nguồn là bản in trước arXiv được gửi vào ngày 24 tháng 8 năm 2026, bởi Christopher Brooks thuộc Trường Thông tin của Đại học Michigan và một tác giả khác. Nó kiểm tra một quy trình công việc cụ thể được hỗ trợ bởi AI: các mục được tạo, chuyển đổi thành các biểu diễn ngữ nghĩa, sàng lọc bằng chứng cấu trúc, xếp hạng hoặc lựa chọn và tập hợp thành các biểu mẫu ứng cử viên để chuyên gia tâm lý đánh giá. Tuyên bố chính của bài báo là công cụ đánh giá tính toán là một phần của thiết kế đo lường vì các quyết định của nó xác định những hạng mục và bằng chứng mà các chuyên gia con người nhìn thấy.
Các tác giả mô tả hai nghiên cứu liên kết trong silico bao gồm 32.000 mặt hàng Big Five được chọn. Họ báo cáo sự thống nhất rộng rãi về hình học ngữ nghĩa nhưng có những khác biệt cục bộ mang tính hệ quả: cách diễn đạt giống hệt nhau có thể thu được bằng chứng xây dựng khác nhau, các mục khác nhau có thể được sàng lọc và các thuộc tính dự định có thể biến mất ngay cả khi thư từ cộng đồng được cải thiện. Nói cách khác, thỏa thuận ở cấp độ cao không đảm bảo rằng cùng một nguyên liệu dự kiến sẽ được vận chuyển qua đường ống. Ở ranh giới xem xét cuối cùng, bản in trước cho biết hai chính sách về tính đủ điều kiện sẽ lấp đầy mọi ô nội dung ở mọi dạng có thể đánh giá được nhưng lại trình bày cách diễn đạt khác nhau.
Trên các cấu hình nhúng, các biểu mẫu chính bao gồm chỉ có trung bình sáu trong số 40 mục. Kết quả, như các tác giả đã trình bày, là các hình thức hoàn chỉnh và các bản tóm tắt tổng thể ổn định có thể che giấu sự bất ổn trong nội dung cụ thể đến tay các nhà đo lường tâm lý. Nguồn được cung cấp không cung cấp cấu hình chi tiết, định nghĩa chính sách, cấu trúc nguồn-dân số hoặc các ví dụ ở cấp độ hạng mục cần thiết để đánh giá các kết quả đó một cách đầy đủ hơn. Bằng chứng của bài viết mang tính tính toán chứ không phải là một báo cáo về các đánh giá được triển khai hoặc một nghiên cứu tương lai trên con người. Nguồn không nói rõ rằng các nhà đo lường tâm lý đã thay đổi phán đoán của họ, rằng những người tham gia bài kiểm tra đã trải qua những kết quả khác nhau hoặc bất kỳ đánh giá cụ thể nào ít nhiều đã trở nên có giá trị. Đó là những ranh giới quan trọng xung quanh những gì bản in trước thiết lập: nó xác định mức độ nhạy cảm trong quy trình phát triển được hỗ trợ bởi AI, chứ không phải tác động đã được chứng minh đối với điểm số hoặc quyết định của mọi người.
Tại sao nó quan trọng
Nghiên cứu thách thức giả định rằng sàng lọc tính toán chỉ đơn thuần là sự chuẩn bị trung lập cho kiến thức chuyên môn của con người. Nếu các lựa chọn đánh giá xác định mục nào còn tồn tại thì một biểu mẫu đánh giá có vẻ hoàn chỉnh hoặc ổn định vẫn có thể phản ánh sự khác biệt đáng kể tiềm ẩn trong những gì các chuyên gia được yêu cầu đánh giá.
Ý nghĩa thực tiễn nằm ở chỗ AI bước vào quá trình phát triển. Một hệ thống xếp hạng hoặc lọc các mục ứng cử viên có thể định hình bằng chứng mà các chuyên gia nhận được trước khi các chuyên gia đó đưa ra phán đoán của mình. Điều đó làm cho giai đoạn sàng lọc trở nên quan trọng ngay cả khi con người vẫn chịu trách nhiệm đánh giá cuối cùng. Lập luận của bản in trước không phải là việc đánh giá tính toán thay thế các chuyên gia, mà là người đánh giá giúp xác định tài liệu mà hoạt động chuyên môn dựa trên đó.
Sự chồng chéo trung bình 6/40 được báo cáo đặc biệt có liên quan vì nó đối lập sự không ổn định ở cấp độ mục với tính hoàn chỉnh rõ ràng ở cấp độ biểu mẫu. Hai biểu mẫu có thể đáp ứng các yêu cầu về nội dung giống nhau trong khi có cách diễn đạt khác nhau đáng kể. Đối với các tổ chức sử dụng AI để tạo hoặc thu hẹp nội dung đánh giá, điều này cho thấy rằng việc chỉ báo cáo mức độ bao phủ tổng hợp hoặc mức độ tương đồng toàn cầu có thể không tiết lộ mức độ thay đổi quan trọng đã chọn theo các cách trình bày hoặc chính sách khác nhau. Những phát hiện này có thể quan trọng hơn việc phát triển sản phẩm Big Five ở bất cứ nơi nào các ứng cử viên do AI tạo ra được sàng lọc trước khi con người đánh giá. Bản thân nguồn không khẳng định rằng kết quả của nó khái quát hóa cho mọi hình thức đánh giá AI và việc khái quát hóa đó vẫn là một câu hỏi mở.
Tuy nhiên, đóng góp cụ thể của nó là cảnh báo rằng các lựa chọn thường được coi là bước sơ bộ về mặt kỹ thuật—sự trình bày, sự rút gọn và lựa chọn về mặt cấu trúc—có thể ảnh hưởng đến bằng chứng thực chất có sẵn cho người xem xét. Bài viết cũng đưa ra một cách nhìn chính xác hơn về khả năng kiểm toán. Nếu việc đánh giá tính toán ảnh hưởng đến nhóm ứng viên thì các lựa chọn đại diện, quy tắc sàng lọc và chính sách lựa chọn sẽ trở thành đối tượng để kiểm tra và sửa đổi. Bản thân điều này không cho thấy chính sách nào là tốt nhất. Nó cho thấy tại sao biểu mẫu cuối cùng, ma trận nội dung hoàn chỉnh hoặc số liệu thống kê tổng hợp ổn định không được tự động coi là bằng chứng cho thấy quá trình lựa chọn cơ bản là ổn định.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Xem gì tiếp theo
Câu hỏi quan trọng tiếp theo là liệu những khác biệt được mô phỏng này có làm thay đổi tính hợp lệ, tính công bằng hoặc hữu ích của các đánh giá sau khi có sự xem xét của con người và thử nghiệm trong thế giới thực hay không. Nguồn được cung cấp không thiết lập các tác động tiếp theo đó, xác định cấu hình nhúng chính xác và chính sách đủ điều kiện hoặc báo cáo sao chép độc lập.
Công việc tiếp theo sẽ kiểm tra xem liệu sự khác biệt trong in silico của bản in trước có còn tồn tại hay không khi các chuyên gia có trình độ xem xét các biểu mẫu kết quả. Việc theo dõi hữu ích sẽ so sánh các đánh giá, sửa đổi và bất đồng của chuyên gia trên các biểu mẫu được tạo ra theo các cấu hình nhúng và chính sách đủ điều kiện khác nhau. Nguồn hiện tại không báo cáo đánh giá của con người như vậy, vì vậy mối liên hệ giữa tính không ổn định trong tính toán và các quyết định của chuyên gia vẫn chưa được biết.
Các nhà nghiên cứu và thực hành cũng nên kiểm tra các đặc tính đo lường tiếp theo. Nguồn được cung cấp không cho biết liệu các hình thức thay thế có khác nhau về độ tin cậy, tính hợp lệ của cấu trúc, hiệu suất của nhóm con, kiểu phản hồi hay quyết định thực tế dựa trên điểm số hay không. Những kết quả đó sẽ xác định liệu sự thay đổi được báo cáo chủ yếu là do vấn đề thiết kế hay tạo ra những hậu quả nghiêm trọng đối với những người thực hiện hoặc dựa vào các đánh giá. Nhân rộng là một thử nghiệm quan trọng khác. Báo cáo in trước là kết quả của hai nghiên cứu được liên kết và một số cấu hình, nhưng đoạn trích nguồn không xác định chính xác các mô hình, cách trình bày, nhóm nguồn được tạo hoặc cài đặt chính sách. Các nhà nghiên cứu độc lập sẽ cần phải tái tạo các điều kiện đó và kiểm tra các nhóm vật phẩm khác để xác định mức độ nhạy cảm xuất hiện trên phạm vi rộng.
Cuối cùng, người đọc nên xem cách quy trình đo lường được hỗ trợ bởi AI ghi lại các lựa chọn trung gian của họ. Kết luận của các tác giả hướng tới những người đánh giá có thể kiểm tra được hơn là quá trình tiền xử lý không rõ ràng. Ở mức tối thiểu, việc giám sát có ý nghĩa sẽ đòi hỏi phải biết các mục ứng cử viên được thể hiện, sàng lọc và lựa chọn như thế nào, những lựa chọn thay thế nào đã bị loại bỏ và liệu nội dung cuối cùng được chuyên gia đánh giá có ổn định dưới những thay đổi hợp lý đối với những lựa chọn đó hay không. Nguồn đề xuất hướng này nhưng không thiết lập một tiêu chuẩn kiểm toán chung.