Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Nghiên cứu cho thấy điểm sáng tạo tự động có thể khác với đánh giá của con người về các câu chuyện LLM

Bản in trước arXiv mới báo cáo rằng các số liệu tự động và đánh giá LLM thường không phù hợp với đánh giá của con người về tính sáng tạo trong truyện ngắn, trong đó các đánh giá thiên về phong cách viết do AI tạo ra một cách có hệ thống.

5 min readRead the primary source
Source-provided image accompanying Study finds automatic creativity scores can diverge from human judgments of LLM stories
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.23705
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Mô hình ngôn ngữ lớn (LLM)
Một mô hình ngôn ngữ được đào tạo trên kho văn bản lớn để tạo và phân tích văn bản.
Độ chính xác
Tỷ lệ các kết quả dương tính được dự đoán thực sự đúng.
Tập dữ liệu
Một tập hợp các ví dụ có cấu trúc hoặc phi cấu trúc được sử dụng để đào tạo, xác nhận hoặc kiểm tra.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Bản in trước được gửi tới arXiv vào ngày 24 tháng 8 để kiểm tra xem liệu hệ thống tự động có thể đánh giá một cách đáng tin cậy khả năng sáng tạo trong các câu chuyện được tạo ra bởi các mô hình ngôn ngữ lớn hay không. Các tác giả so sánh đánh giá của con người với các số liệu và đánh giá khách quan do các thẩm phán dựa trên LLM đưa ra.

Bài báo có tiêu đề “Giới hạn của việc tự động đánh giá khả năng sáng tạo trong các mô hình ngôn ngữ lớn” nghiên cứu khoảng cách giữa các biện pháp tính toán về khả năng sáng tạo và khả năng phán đoán của con người. Các tác giả sử dụng các truyện ngắn từ bộ dữ liệu WritingPrompts, bao gồm các câu chuyện do con người viết và các câu chuyện do hệ thống AI tạo ra, đồng thời thu thập các đánh giá của con người trên 11 khía cạnh sáng tạo. Nguồn không xác định người đánh giá hoặc cung cấp số lượng câu chuyện trong bản tóm tắt của nó. Theo nghĩa đó, sự so sánh của nghiên cứu là về mối quan hệ giữa các loại đánh giá khác nhau, chứ không phải để thay thế một định nghĩa cuối cùng về sự sáng tạo bằng một định nghĩa khác. Bản tóm tắt đóng khung tác phẩm như một cuộc điều tra về độ tin cậy và sự liên kết.

Những đánh giá của con người đó được so sánh với hai loại đánh giá tự động rộng rãi: số liệu khách quan và hệ thống LLM-as-a-Judge. Bài báo báo cáo “sự sai lệch đáng kể” giữa kết quả tự động và đánh giá của con người. Nó cũng báo cáo rằng các số liệu tự động được sử dụng rộng rãi cho thấy mối tương quan gần như bằng 0 với các đánh giá của con người đối với cả câu chuyện do con người tạo ra và do AI tạo ra. Kết quả được trình bày ở mức độ tương ứng giữa điểm số và đánh giá. Trong văn bản được cung cấp, nó không xác định một số liệu duy nhất chịu trách nhiệm về sự không khớp, do đó, danh mục rộng rãi các số liệu khách quan không nên được đọc dưới dạng đánh giá về mọi số liệu.

Phát hiện cụ thể nhất liên quan đến các thẩm phán dựa trên LLM. Theo bản tóm tắt, những giám khảo này ưa thích những câu chuyện do AI tạo ra một cách có hệ thống, ưu tiên các đặc điểm văn phong của chúng hơn là tính khó đoán và các phẩm chất khác liên quan đến văn bản do con người tạo ra. Nguồn trình bày đây là kết quả thử nghiệm của tác giả; nó không chứng minh rằng mọi thẩm phán LLM đều hành xử theo cách này hoặc kết quả đó áp dụng cho tất cả các bài viết sáng tạo. Trình độ chuyên môn đó giữ cho phát hiện gắn liền với so sánh được báo cáo. Nó cũng tách biệt sở thích quan sát được trong thí nghiệm với kết luận chung về giá trị văn học của một trong hai nguồn, điều mà phần tóm tắt không tạo ra.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Những phát hiện này thách thức một giả định chung rằng chất lượng sáng tạo có thể được đo lường một cách đáng tin cậy chỉ bằng cách chấm điểm tự động. Nếu các hệ thống đánh giá khen thưởng các tín hiệu phong cách liên quan đến bài viết do AI tạo ra trong khi thiếu những phẩm chất mà người đọc đánh giá cao, thì chúng có thể làm sai lệch sự so sánh giữa con người và mô hình ngôn ngữ.

Sự sáng tạo thường được coi là một phẩm chất duy nhất có thể được tóm tắt bằng điểm số, nhưng bài báo mô tả nó là đa chiều và chủ quan. Mối tương quan gần như bằng 0 được báo cáo của nó cho thấy rằng một số liệu có thể tạo ra một con số mà không nắm bắt được các khía cạnh của công việc sáng tạo mà độc giả con người coi là quan trọng. Sự khác biệt đó rất quan trọng khi đánh giá tự động được sử dụng để so sánh các mô hình, hướng dẫn phát triển hoặc đánh giá nội dung được tạo. Điều đó cũng có nghĩa là độ chính xác rõ ràng của kết quả tự động phải được xem xét riêng biệt với việc liệu kết quả đó có phản ánh những phẩm chất mà người đọc được yêu cầu đánh giá hay không.

Việc ưu tiên các câu chuyện do AI tạo ra được báo cáo đã đặt ra mối lo ngại về đo lường cụ thể. Nếu giám khảo LLM dễ dàng khen thưởng những mẫu văn phong dễ nhận biết hơn là sự ngạc nhiên hoặc khó đoán, thì một hệ thống có thể tỏ ra sáng tạo hơn vì nó phù hợp với sở thích của giám khảo chứ không phải vì nó tạo ra bài viết mà độc giả con người đánh giá cao hơn. Nguồn không mô tả việc triển khai hoặc quyết định thể chế được ghi lại, vì vậy đây là những ý nghĩa thực tế của các phát hiện của nghiên cứu chứ không phải là những hậu quả trong thế giới thực được báo cáo. Do đó, mối quan tâm là làm thế nào một đánh giá có thể định hình cách diễn giải, đặc biệt khi điểm của nó được coi là bản tóm tắt trực tiếp về chất lượng sáng tạo.

Công trình này cũng liên quan đến những tuyên bố rằng các mô hình ngôn ngữ đang tiến gần hoặc vượt xa hiệu suất của con người trong các nhiệm vụ sáng tạo. Điểm cao từ người đánh giá tự động không nhất thiết là bằng chứng về tính vượt trội về mặt sáng tạo nếu người đánh giá không phù hợp với khả năng phán đoán của con người. Đồng thời, nguồn tin không nói rằng con người là những thẩm phán đáng tin cậy hoặc không thiên vị, cũng không cho thấy những câu chuyện do AI tạo ra nhìn chung kém sáng tạo hơn. Nó báo cáo sự bất đồng giữa các phương pháp đánh giá. Sự bất đồng đó nhường chỗ cho việc đọc kỹ hơn các kết quả so sánh, trong đó hành vi của người đánh giá được coi là một phần của bằng chứng chứ không phải là bối cảnh trung lập.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Bài viết là bản in sẵn và văn bản nguồn không cung cấp thông tin chi tiết về người đánh giá, mô hình đánh giá, lời nhắc, phương pháp thống kê hoặc quy mô và thành phần của mẫu câu chuyện. Công việc tiếp theo nên kiểm tra xem liệu sự không khớp được báo cáo có đúng với các thể loại, ngôn ngữ, mô hình và các nhóm độc giả độc lập hay không.

Điều chưa biết chính là cách các thí nghiệm được tiến hành chi tiết. Nguồn được cung cấp không nêu rõ số lượng câu chuyện do con người và do AI tạo ra đã được đánh giá, mô hình ngôn ngữ nào đã tạo ra các câu chuyện về AI, cách xác định 11 khía cạnh sáng tạo hoặc cách tổng hợp xếp hạng của con người. Những chi tiết đó rất quan trọng để đánh giá sức mạnh và phạm vi của các kết luận được báo cáo. Chúng cũng sẽ giúp người đọc hiểu được so sánh được báo cáo phản ánh chặt chẽ đến mức nào các điều kiện mà theo đó các kết quả sau này có thể được diễn giải hoặc sao chép.

Cần xem xét kỹ lưỡng hơn các số liệu khách quan và các đánh giá LLM được sử dụng trong so sánh. Bản tóm tắt không nêu tên, mô tả lời nhắc của họ hoặc cho biết liệu các giám khảo có được kiểm tra độ tin cậy qua các lần đánh giá lặp đi lặp lại hay không. Kết quả có thể phụ thuộc vào việc lựa chọn thước đo, mô hình đánh giá, hướng dẫn, độ dài câu chuyện hoặc phong cách viết. Nếu không có những chi tiết cụ thể đó, phát hiện tổng quát sẽ mang tính thông tin nhưng khó kết nối với một thiết lập đánh giá cụ thể. Việc làm rõ thiết lập sẽ giúp dễ dàng phân biệt giới hạn chung với kết quả gắn liền với các công cụ hoặc hướng dẫn cụ thể.

Bản sao sẽ cho biết liệu mẫu được báo cáo có vượt ra ngoài tập dữ liệu WritingPrompts và truyện ngắn hay không. Các thử nghiệm hữu ích sẽ bao gồm các thể loại, ngôn ngữ, nhóm kiểu mẫu, nhóm độc giả con người và các định dạng sáng tạo khác. Nguồn cũng để ngỏ liệu các phương pháp đánh giá được cải tiến có thể phản ánh tốt hơn các đánh giá của con người hay không, hay liệu một số khía cạnh của sự sáng tạo sẽ vẫn chống lại bất kỳ điểm số tự động nào. Những câu hỏi mở này xác định giai đoạn giải thích tiếp theo: xác định mức độ không phù hợp lâu dài và loại đánh giá nào có thể giải quyết nó.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIChatGPT & LLMĐạo đức AIĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?