Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Bài báo DirEAG đề xuất một cách tốt hơn để hiệu chỉnh độ tin cậy của AI trong các câu trả lời toán học

Một bài báo arXiv mới giới thiệu DirEAG, một phương pháp kết hợp các báo cáo độ tin cậy từ nhiều lời nhắc thành bằng chứng hiệu chỉnh về các câu trả lời có thể có, bao gồm cả khả năng không có câu trả lời nào đúng.

5 min readRead the primary source
Primary-source image accompanying DirEAG paper proposes a better way to calibrate AI confidence in math answers
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.20717
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Khái quát hóa
Mô hình hoạt động tốt như thế nào trên dữ liệu mới, chưa được nhìn thấy bên ngoài tập huấn luyện.
Hiệu chuẩn
Điểm tin cậy của mô hình phù hợp với xác suất chính xác thực tế như thế nào.
Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Tự kiểm traChatGPT & Câu đố LLM

Chuyện gì đã xảy ra

Các nhà nghiên cứu đề xuất DirEAG, một phương pháp Tổng hợp Bằng chứng Dirichlet để hiệu chỉnh độ tin cậy bằng lời nói từ các mô hình ngôn ngữ giải quyết các vấn đề toán học. Bài viết báo cáo việc hiệu chuẩn tốt hơn so với phương pháp tổng hợp trung bình trực tiếp và heuristic trên ba tập dữ liệu và ba họ mô hình, trong khi vẫn duy trì việc lựa chọn câu trả lời mang tính cạnh tranh.

Một bài báo được đăng lên arXiv vào ngày 21 tháng 8 năm 2026, đề xuất DirEAG, viết tắt của Tập hợp bằng chứng Dirichlet. Chủ đề của nó là một điểm yếu cụ thể trong các mô hình ngôn ngữ lớn được sử dụng cho lý luận toán học: việc hỏi một mô hình về độ tin cậy của nó không tự động tạo ra điểm tin cậy tương ứng một cách đáng tin cậy với tính chính xác. Các tác giả mô tả độ tin cậy bằng lời nói của hộp đen là khó hiệu chỉnh vì ý nghĩa số học của câu trả lời của mô hình có thể thay đổi theo lời nhắc, mô hình hoặc tập dữ liệu.

Phương pháp này sử dụng nhiều lời nhắc định hướng sự tự tin cho cùng một vấn đề. Mỗi lời nhắc tạo ra một quan sát về độ tin cậy của câu trả lời. Thay vì chỉ đơn giản lấy trung bình các giá trị tin cậy đó, DirEAG chuyển đổi từng quan sát thành bằng chứng mềm được phân bổ trên các câu trả lời của ứng viên được tạo ra trong quá trình. Nó cũng thêm trạng thái null thể hiện khả năng không có ứng cử viên nào đúng. Thiết kế này quan trọng vì nó coi các báo cáo độ tin cậy là bằng chứng về các câu trả lời cạnh tranh thay vì giả định rằng mọi tỷ lệ phần trăm được báo cáo đều đã ở quy mô chung, có ý nghĩa.

Bài viết báo cáo các thử nghiệm trên GSM8K, SVAMP và GSM-Hard, ba bộ dữ liệu lý luận toán học có tên trong nguồn. Nó kiểm tra các mô hình từ các dòng Qwen, Mistral và Gemma. Theo các tác giả, DirEAG thường tạo ra sự hiệu chỉnh tốt hơn so với việc lấy trung bình độ tin cậy trực tiếp và tổng hợp định hướng niềm tin theo kinh nghiệm, trong khi vẫn duy trì hiệu suất cạnh tranh trong việc lựa chọn câu trả lời. Nguồn không nêu rõ điểm hiệu chỉnh chính xác, điểm lựa chọn câu trả lời, phiên bản mô hình hoặc cài đặt thử nghiệm.

Các tác giả cũng báo cáo kết quả cắt bỏ chỉ ra rằng hai phần của phương pháp này giải quyết các vấn đề khác nhau. Việc tổng hợp bằng chứng kết hợp thông tin từ các quan sát về độ tin cậy của câu trả lời, trong khi bước hiệu chỉnh nhị phân cuối cùng xử lý một phần khác của nhiệm vụ hiệu chỉnh. Bài báo dài 16 trang, bao gồm ba hình, cho biết mã đã có sẵn và được liệt kê là được PRICAI 2026 chấp nhận. Nguồn xác định tác phẩm là bản in trước và không mô tả bản sao độc lập hoặc kết quả được bình duyệt ngoài tuyên bố chấp nhận đó.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Các tuyên bố về độ tin cậy của mô hình ngôn ngữ có thể khó diễn giải, đặc biệt là khi lời nhắc thay đổi quy mô về mức độ chắc chắn mà mô hình tự báo cáo. Một phương pháp tách biệt tốt hơn việc lựa chọn câu trả lời với ước tính độ không đảm bảo có thể giúp các nhà phát triển xác định khi nào một câu trả lời toán học xứng đáng được kiểm tra bổ sung, mặc dù nguồn không cung cấp bằng chứng nào về việc triển khai ngoài các thử nghiệm được báo cáo.

Vấn đề thực tế không chỉ đơn giản là liệu một mô hình ngôn ngữ có thể tạo ra câu trả lời toán học hay không. Vấn đề là liệu người dùng hay hệ thống hạ nguồn có thể diễn giải sự chắc chắn đã nêu của mô hình khi quyết định nên tin tưởng vào điều gì hay không. Nếu giá trị độ tin cậy thay đổi ý nghĩa giữa các lời nhắc thì số cao trong cài đặt này có thể không thể so sánh được với số cao trong cài đặt khác. Đóng góp trọng tâm của bài viết là nỗ lực giải quyết vấn đề so sánh đó một cách có cấu trúc.

Trạng thái null của DirEAG là một tính năng hữu ích của đề xuất vì nó cho phép phương pháp thể hiện sự không chắc chắn mà các câu trả lời của ứng viên đang xem xét không giải quyết được. Một hệ thống phải lựa chọn trong số các câu trả lời được liệt kê có thể có vẻ chắc chắn hơn đơn giản vì nó không có vị trí rõ ràng để thể hiện rằng tất cả các ứng cử viên có sẵn đều có thể sai. Nguồn trình bày điều này như một phần của phương pháp; nó không cho biết liệu trạng thái null có cải thiện độ an toàn hoặc khả năng ra quyết định trong các hệ thống được triển khai hay không.

Sự tách biệt giữa lựa chọn câu trả lời và hiệu chỉnh cũng mang lại cho nghiên cứu một góc độ chẩn đoán hữu ích. Một mô hình có thể chọn câu trả lời đúng tương đối thường xuyên trong khi vẫn thể hiện sự tự tin kém hoặc nó có thể điều chỉnh độ tin cậy trong khi lựa chọn câu trả lời kém hiệu quả hơn. Sự cắt bỏ được báo cáo cho thấy rằng các tác giả không coi những điều đó là cùng một mục tiêu. Sự khác biệt đó có thể liên quan đến việc các nhà phát triển đánh giá các hệ thống cần cả đầu ra chính xác và tín hiệu đáng tin cậy để biết thời điểm yêu cầu xem xét.

Bằng chứng vẫn còn giới hạn trong các thí nghiệm của chính bài báo. Nguồn báo cáo kết quả dựa trên các điểm chuẩn toán học và một số họ mô hình, nhưng không chứng minh rằng DirEAG cải thiện ước tính độ tin cậy cho mã hóa, phân tích khoa học, câu hỏi y tế hoặc các nhiệm vụ khác. Nó cũng không báo cáo cách so sánh phương pháp này với mọi phương pháp ước tính độ không đảm bảo khác, liệu nó có bổ sung thêm chi phí tính toán hoặc độ trễ có ý nghĩa hay không, liệu lợi ích của nó có đủ lớn để thay đổi các quyết định vận hành hay không. Những giới hạn đó khiến kết quả thuộc loại nghiên cứu đầy hứa hẹn hơn là khả năng sản xuất được chứng minh.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Xem gì tiếp theo

Các câu hỏi quan trọng tiếp theo là liệu DirEAG có vượt qua các tiêu chuẩn toán học đã được kiểm tra hay không, mức tăng hiệu chuẩn của nó lớn đến mức nào và liệu nó có còn hữu ích trên các kích thước mô hình, chiến lược nhắc nhở và ứng dụng thực tế hay không. Nguồn không cung cấp kết quả bằng số, chi tiết triển khai hoặc bằng chứng từ hệ thống vận hành.

Điểm xác minh đầu tiên là định lượng. Bản tóm tắt cho biết DirEAG thường đạt được hiệu chuẩn tốt hơn và lựa chọn câu trả lời mang tính cạnh tranh, nhưng nó không cung cấp quy mô, tính nhất quán hoặc ý nghĩa thống kê của những lợi ích đó. Người đọc nên xem toàn bộ bài báo và mã đã phát hành để biết các số liệu hiệu chuẩn cụ thể, phạm vi tin cậy, đường cơ sở, phần tách bộ dữ liệu, điểm kiểm tra mô hình và kết quả chạy lặp lại cần thiết để đánh giá mức độ chắc chắn của tuyên bố.

Câu hỏi thứ hai mang tính khái quát. GSM8K, SVAMP và GSM-Hard đều liên quan đến lý luận toán học, vì vậy bằng chứng được báo cáo không cho thấy liệu phương pháp này có hoạt động hay không khi các câu trả lời còn mở, bằng chứng không đầy đủ hoặc khó xác định tính chính xác hơn. Thử nghiệm trên các lĩnh vực bổ sung sẽ làm rõ liệu DirEAG có nắm bắt được đặc tính chung của độ tin cậy của mô hình bằng lời nói hay chủ yếu giải quyết cấu trúc của các điểm chuẩn này.

Phương pháp này cũng có thể phụ thuộc vào cách tạo ra câu trả lời của ứng viên và lời nhắc về sự tự tin. Nguồn không cho biết có bao nhiêu lời nhắc được sử dụng, cách chọn câu trả lời ứng viên, trạng thái null được tham số hóa như thế nào hoặc cách hiệu chuẩn nhị phân cuối cùng được huấn luyện. Những chi tiết đó có thể ảnh hưởng đến chi phí, khả năng tái sản xuất và hiệu suất. Điều quan trọng là phải xem liệu cách tiếp cận này có còn hiệu quả hay không khi lời nhắc, phiên bản mô hình hoặc bộ dữ liệu thay đổi.

Cuối cùng, bài kiểm tra thực tế có liên quan là liệu độ tin cậy đã được hiệu chỉnh có cải thiện các quyết định thay vì chỉ các số liệu chuẩn hay không. Nguồn không báo cáo việc triển khai, nghiên cứu người dùng, kết quả đánh giá của con người hoặc tích hợp với các công cụ toán học. Công việc tiếp theo nên kiểm tra xem DirEAG có giúp mọi người xác định các câu trả lời không chính xác, phân bổ nỗ lực xác minh hoặc tránh tin tưởng quá mức vào một mô hình hay không, đồng thời đo lường mọi trường hợp lỗi và độ phức tạp bổ sung.

Hướng dẫn và câu hỏi liên quan

ChatGPT & LLMGiải thích về mô hình AIĐào tạo AIĐạo đức AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?