Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Bản in đề xuất các mô hình ngôn ngữ đáng tin cậy để phơi bày sự không chắc chắn và phát hiện ảo giác

Một bản in trước mới đề xuất một cách tiếp cận dựa trên tổng thể để đo lường mức độ cam kết của các mô hình ngôn ngữ đối với câu trả lời, báo cáo kết quả hiệu chỉnh cạnh tranh và phát hiện ảo giác trên ba mô hình mở và bốn bộ dữ liệu trả lời câu hỏi.

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.23244
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

LoRA (Thích ứng cấp thấp)
Một phương pháp tinh chỉnh tham số hiệu quả bằng cách thêm các ma trận bộ điều hợp cấp thấp.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
ảo giác
Khi một mô hình tạo ra thông tin trôi chảy nhưng sai hoặc không được hỗ trợ.
Tự kiểm traChatGPT & Câu đố LLM

Chuyện gì đã xảy ra

Bản in trước được gửi tới arXiv vào ngày 24 tháng 8 giới thiệu Mô hình ngôn ngữ lớn Credal, hay CLLM, sử dụng một tập hợp các bộ điều hợp LoRA để thể hiện một loạt các dự đoán hợp lý thay vì phân phối xác suất duy nhất. Các tác giả lấy điểm cam kết ở cấp độ mã thông báo và cấp độ ngữ nghĩa và đánh giá chúng để trả lời câu hỏi, hiệu chỉnh, dự đoán có chọn lọc, phát hiện ảo giác và lý luận.

Bài viết mô tả một hạn chế theo cách thông thường mà các mô hình ngôn ngữ thể hiện sự không chắc chắn: một mô hình chuẩn tạo ra một phân phối dự đoán duy nhất, mà các tác giả cho rằng có thể kết hợp sự thiếu hiểu biết với sự mơ hồ thực sự. Thay vào đó, CLLM được đề xuất của họ sử dụng một tập hợp các bộ điều hợp LoRA để tạo thành cái mà bài báo gọi là bộ tín chỉ. Về mặt thực tế, phương pháp này nhằm duy trì sự bất đồng hoặc chênh lệch giữa các phân bố dự đoán hợp lý thay vì nén tất cả sự không chắc chắn vào một đầu ra softmax. Nguồn không khẳng định rằng cách trình bày này làm cho mô hình trở nên chính xác; nó tuyên bố rằng nó có thể làm cho mức độ cam kết của mô hình trở nên giàu thông tin hơn.

Các tác giả giới thiệu hai biện pháp liên quan. Cam kết mã thông báo tín dụng, hoặc CTC, hoạt động trong không gian mã thông báo và kết hợp hỗ trợ giới hạn thấp hơn, độ rộng tín dụng và entropy giao nhau. Bản tóm tắt cho biết CTC có thể được tính toán mà không cần tạo thêm, điều này có thể quan trọng đối với các hệ thống mà việc lấy mẫu lặp lại sẽ làm tăng thêm độ trễ hoặc chi phí. Tính nhất quán cam kết ngữ nghĩa, hay SCC, mở rộng ý tưởng sang không gian ngữ nghĩa bằng cách sử dụng các phần hoàn thành được lấy mẫu. Bài viết cũng định nghĩa SCC-Gap để đo lường sự không phù hợp giữa hỗ trợ cấp mã thông báo và hỗ trợ cấp độ ngữ nghĩa. Những điểm số này được trình bày dưới dạng công cụ để xác định khi nào độ tin cậy ở cấp độ bề mặt của mô hình có thể không phù hợp với phạm vi ý nghĩa được thể hiện bằng các câu trả lời có thể có của nó.

Đánh giá bao gồm Gemma-2-9B, Llama-3.1-8B và Qwen2.5-7B trên OpenBookQA, CoQA, TriviaQA và ARC-Challenge. Theo bản tóm tắt, CLLM là phương pháp có hiệu quả tốt nhất về độ chính xác của việc trả lời câu hỏi trong khi vẫn duy trì sai số hiệu chuẩn dự kiến ​​mang tính cạnh tranh. Các tác giả cũng báo cáo rằng CTC nằm trong phạm vi 1,5 điểm phần trăm của khu vực phát hiện ảo giác tốt nhất dưới đường cong đặc tính vận hành máy thu trong hầu hết các cài đặt mà không cần tạo thêm. Về dự đoán chọn lọc ở mức độ bao phủ 80%, bản tóm tắt báo cáo độ chính xác 99,0% trên OpenBookQA cho CLLM với SCC. Nó bắt đầu nêu kết quả Thử thách ARC cho CLLM với độ tin cậy Csem nhưng bị cắt bớt trước khi đưa ra kết quả, do đó không thể đánh giá xác nhận quyền sở hữu đó từ nguồn được cung cấp.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Các mô hình ngôn ngữ có thể tạo ra những câu trả lời trôi chảy với sự tự tin không chính đáng. Nếu kết quả được báo cáo đúng, việc đo lường độ không chắc chắn trên nhiều phân bố dự đoán hợp lý có thể giúp hệ thống xác định các câu trả lời cần xác minh, bỏ phiếu trắng hoặc xem xét của con người mà không cần tạo thêm trong nhiều trường hợp.

Vấn đề thực tiễn trọng tâm không chỉ đơn giản là liệu một mô hình ngôn ngữ có thể trả lời một câu hỏi hay không mà là liệu nó có thể phân biệt được kiến ​​thức với sự không chắc chắn hay không. Một câu trả lời trôi chảy nhưng không chính xác có thể nguy hiểm hơn một lời từ chối rõ ràng khi người dùng coi sự tự tin là bằng chứng. Cách trình bày bằng chứng xác thực được đề xuất của bài báo giải quyết vấn đề đó bằng cách duy trì sự bất đồng giữa các dự đoán dựa trên bộ điều hợp. Nếu phương pháp này khái quát hóa, nó có thể cung cấp cho các nhà phát triển tín hiệu phía mô hình để quyết định thời điểm trả lời trực tiếp, yêu cầu xác minh, chuyển câu hỏi đến hệ thống khác hoặc liên quan đến một người.

Kết quả dự đoán có chọn lọc được báo cáo đặc biệt phù hợp với việc triển khai vì các hệ thống chọn lọc không cần phải trả lời mọi câu hỏi. Một hệ thống có thể duy trì độ chính xác cao trong khi chỉ bao gồm các trường hợp mà nó cho là được hỗ trợ đầy đủ có thể hữu ích hơn trong những môi trường mà lỗi gây ra chi phí đáng kể. Độ chính xác 99,0% được báo cáo ở mức độ bao phủ 80% trên OpenBookQA là đáng khích lệ trong tập dữ liệu và cấu hình đó, nhưng nó nên được hiểu là kết quả trên giấy hơn là bằng chứng cho thấy hệ thống được triển khai sẽ đạt được hiệu suất tương tự. Bản tóm tắt không nêu rõ số lượng ví dụ, phương pháp so sánh hoặc định nghĩa hoạt động của phạm vi bao phủ.

Tuyên bố không tạo thêm thế hệ cho CTC cũng có thể quan trọng đối với thiết kế suy luận. Nhiều kỹ thuật không chắc chắn dựa vào việc tạo ra nhiều lần hoàn thành, điều này có thể làm tăng tính toán và độ trễ. Nguồn tin cho biết CTC kết hợp một số đại lượng liên quan đến độ không đảm bảo mà không tạo thêm, trong khi SCC sử dụng rõ ràng các số liệu hoàn thành được lấy mẫu. Sự khác biệt đó mang lại cho bài viết một góc độ kỹ thuật cụ thể: một điểm có thể áp dụng rẻ hơn, trong khi điểm kia có thể nắm bắt sự bất đồng về ngữ nghĩa một cách trực tiếp hơn. Tuy nhiên, bản tóm tắt không định lượng được chi phí của bản thân nhóm LoRA, do đó, tổng mức đánh đổi phân phối vẫn chưa được biết.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Xem gì tiếp theo

Kết quả hiện tại là bản đánh giá trước khi xuất bản do tác giả báo cáo, không phải là kết quả phát hiện hiệu suất được thiết lập độc lập. Các chi tiết quan trọng vẫn chưa có trong bản tóm tắt được cung cấp, bao gồm kết quả ARC-Challenge đầy đủ, đường cơ sở chính xác, chi phí tính toán và mức độ chuyển giao của phương pháp ngoài các mô hình và bộ dữ liệu đã được thử nghiệm.

Câu hỏi đầu tiên là liệu lợi ích được báo cáo có tồn tại được khi sao chép độc lập hay không. Nguồn là bản in trước arXiv được gửi vào ngày 24 tháng 8 năm 2026 và tài liệu được cung cấp chỉ chứa phần tóm tắt. Do đó, kết quả là những tuyên bố của tác giả chứ không phải sự thật được xác minh độc lập. Quá trình giám sát tiếp theo nên kiểm tra các bảng đầy đủ, đường cơ sở, định nghĩa độ tin cậy, biến thể thống kê và liệu các ưu điểm được báo cáo có nhất quán trên cả bốn tập dữ liệu và cả ba họ mô hình hay không.

Câu ARC-Challenge của bản tóm tắt chưa đầy đủ: nó nói rằng CLLM với độ tin cậy Csem đạt được kết quả nhưng không cung cấp giá trị. Thông tin bị thiếu đó sẽ hạn chế việc so sánh với yêu cầu OpenBookQA hoàn chỉnh và ngăn cản việc đánh giá đầy đủ về hiệu suất lập luận của phương pháp. Bài báo cũng báo cáo kết quả phát hiện ảo giác nằm trong khoảng 1,5 điểm phần trăm so với AUROC tốt nhất trong hầu hết các cài đặt, nhưng nguồn được cung cấp không xác định được điểm tuyệt đối, phương pháp cạnh tranh tốt nhất hoặc các trường hợp ngoại lệ.

Các câu hỏi về triển khai cũng quan trọng không kém. Bài viết sử dụng một tập hợp các bộ điều hợp LoRA và bản tóm tắt không nêu rõ số lượng bộ điều hợp được yêu cầu, cách chúng được đào tạo hoặc thời gian suy luận và bộ nhớ mà chúng thêm vào. Nó cũng chỉ đánh giá ba mô hình ngôn ngữ được đặt tên và bốn bộ dữ liệu trả lời câu hỏi. Vẫn chưa biết liệu điểm số có hoạt động cho các cuộc hội thoại dài hơn, thế hệ kết thúc mở, đầu vào đa ngôn ngữ, tác vụ theo miền cụ thể hay các mô hình nằm ngoài phạm vi kiến ​​trúc và quy mô được thử nghiệm hay không. Cho đến khi những câu hỏi đó được trả lời, CLLM tốt nhất nên được coi là một phương pháp nghiên cứu đầy hứa hẹn để đo lường độ không đảm bảo thay vì một biện pháp bảo vệ đã được xác thực để sử dụng với mức độ rủi ro cao.

Hướng dẫn và câu hỏi liên quan

ChatGPT & LLMGiải thích về mô hình AIĐạo đức AIĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?