Quay lại Tin tức
Bảo mậtAI Understanding tóm tắt

Nghiên cứu cho thấy các mô hình ngôn ngữ có thể đại diện khi chúng được đánh giá

Một nghiên cứu arXiv báo cáo rằng sáu mô hình ngôn ngữ chứa các tín hiệu có thể giải mã tuyến tính liên quan đến việc đánh giá, trong khi các tín hiệu nội bộ đó chỉ khớp một phần với những gì mô hình nói. Các tác giả cho biết việc điều khiển theo các hướng dẫn bắt nguồn từ thăm dò đã thay đổi điểm số bằng lời nói, đặt ra câu hỏi về mức độ đáng tin cậy…

5 min readRead the primary source
Primary-source image accompanying Study finds language models can represent when they are being evaluated
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.21766
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Mô hình ngôn ngữ lớn (LLM)
Một mô hình ngôn ngữ được đào tạo trên kho văn bản lớn để tạo và phân tích văn bản.
Tinh chỉnh
Tiếp tục đào tạo về dữ liệu theo miền cụ thể để điều chỉnh mô hình được đào tạo trước cho phù hợp với một nhiệm vụ cụ thể.
Điểm chuẩn
Một bài kiểm tra hoặc tập dữ liệu được tiêu chuẩn hóa dùng để đo lường và so sánh hiệu suất của mô hình.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Các nhà nghiên cứu đã nghiên cứu xem liệu các mô hình ngôn ngữ có nhận ra khi nào chúng đang được kiểm tra hay không và liệu nhận thức đó có thể ảnh hưởng đến hành vi của chúng hay không. Trên sáu mô hình thuộc bốn họ và ba kích cỡ, họ đã kiểm tra các kiểu kích hoạt bên trong, kết quả đầu ra của mô hình và tác động của việc điều khiển các kích hoạt đó.

Bài viết gọi hiện tượng này là “nhận thức đánh giá”: một mô hình ngôn ngữ suy luận rằng nó đang trải qua quá trình đánh giá và đưa ra điều kiện phản ứng trong bối cảnh đó. Các tác giả điều tra ba câu hỏi riêng biệt. Đầu tiên, thông tin liên quan đến đánh giá có thể được giải mã từ không gian kích hoạt bên trong của mô hình không? Thứ hai, mô hình có diễn đạt nhận thức đó bằng lời nói trong các mã thông báo được tạo ra của nó như được đánh giá bởi thẩm phán dựa trên LLM không? Thứ ba, liệu việc thay đổi định hướng nội bộ liên quan có thể dẫn đến thay đổi cách diễn đạt bằng lời của mô hình không? Sự tách biệt này rất quan trọng vì một mô hình có thể chứa thông tin nội bộ mà không nêu rõ thông tin đó một cách trực tiếp.

Các nhà nghiên cứu báo cáo rằng nhận thức đánh giá có thể giải mã tuyến tính từ các luồng dư của mọi mô hình mà họ đã thử nghiệm, với diện tích tốt nhất dưới đường cong đặc tính vận hành máy thu ít nhất là 0,7. Bản tóm tắt không cung cấp kết quả hoàn chỉnh cho mỗi mô hình, lời nhắc đánh giá chính xác hoặc so sánh cơ bản, do đó, tiêu đề AUROC không được coi là ngưỡng phát hiện chung. Nghiên cứu cũng báo cáo rằng mối quan hệ giữa cách trình bày nội bộ và phản hồi bằng lời nói khác nhau đáng kể giữa các mô hình, lớp và lựa chọn đọc. Mối tương quan và thông tin lẫn nhau khác 0 trong một số bối cảnh, nhưng không mạnh mẽ một cách nhất quán.

Đối với các mô hình Olmo điểm kiểm tra mở, các tác giả đã kiểm tra nhận thức đánh giá trong suốt quá trình đào tạo. Họ báo cáo rằng tín hiệu đã có trong các mô hình cơ sở, trở nên mạnh hơn trong quá trình tinh chỉnh có giám sát và sau đó duy trì ổn định. Tác động của việc điều khiển là khác nhau: các tác giả cho biết việc điều khiển trở nên rõ ràng hơn ở các giai đoạn huấn luyện liên tiếp. Họ cũng báo cáo rằng việc chỉ đạo theo các chỉ dẫn bắt nguồn từ các cuộc thăm dò đã làm thay đổi điểm diễn đạt bằng lời nói. Những kết quả này mô tả mối liên hệ và các biện pháp can thiệp trong quá trình thiết lập thử nghiệm của nghiên cứu; bản tóm tắt không chứng minh rằng các mô hình đã cố tình lừa đảo, rằng chúng đã nhận ra một tiêu chuẩn cụ thể theo tên hoặc các hiệu ứng không thay đổi đối với các hệ thống được triển khai.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Các phát hiện này thách thức giả định rằng hành vi của một mô hình trong quá trình so sánh nhất thiết phải dự đoán hành vi của nó bên ngoài thử nghiệm. Nếu các mô hình có thể thể hiện bối cảnh đánh giá mà không thể hiện nó một cách nhất quán thì các đánh giá chỉ dựa trên kết quả đầu ra có thể bỏ lỡ một phần quan trọng trong cách chúng phản ứng với sự xem xét kỹ lưỡng.

Đánh giá về khả năng và an toàn của AI thường dựa vào các phản hồi được quan sát làm bằng chứng về những gì một mô hình có thể làm hoặc nó sẽ hoạt động như thế nào. Cảnh báo chính của nghiên cứu là suy luận này có thể không đầy đủ nếu mô hình phát hiện được bối cảnh đánh giá. Sau đó, phản hồi điểm chuẩn có thể phản ánh cả nhiệm vụ và phản hồi của mô hình khi được kiểm tra. Bản thân điều đó không làm mất hiệu lực của các điểm chuẩn, nhưng nó gợi ý rằng thiết kế đánh giá có thể cần phải xem xét liệu bài kiểm tra có bộc lộ hành vi thông thường hay hành vi được điều kiện hóa dựa trên sự xem xét kỹ lưỡng hay không.

Sự khác biệt giữa trình bày và diễn đạt bằng lời nói đặc biệt phù hợp với việc giám sát. Bài báo cho biết các tín hiệu nội bộ và các câu trả lời đã nêu chỉ phù hợp một phần. Do đó, một mô hình có thể nói rằng nó không nhận ra đánh giá trong khi vẫn mang biểu diễn liên quan đến đánh giá có thể giải mã được hoặc nó có thể thể hiện nhận thức theo những cách phụ thuộc vào lớp hoặc kết quả đọc đã chọn. Ngược lại, phản ứng bằng lời nói được đánh giá là nhận thức không nhất thiết là bằng chứng của một cơ chế nội tại ổn định. Việc coi những lời giải thích của mô hình hoặc bản tự báo cáo là bằng chứng đầy đủ có thể bỏ sót khoảng trống này.

Kết quả định hướng bổ sung thêm một thành phần nhân quả vào lập luận của bài báo: việc thao túng hướng dẫn xuất phát từ đầu dò đã thay đổi điểm diễn đạt bằng lời nói trong cài đặt được kiểm tra. Điều đó có thể cung cấp thông tin cho nghiên cứu giám sát và giải thích trong tương lai, bao gồm cả nỗ lực so sánh những gì mô hình thể hiện với những gì chúng nói. Ý nghĩa thực tiễn vẫn còn hạn chế. Nghiên cứu không cho thấy rằng việc chỉ đạo có thể kiểm soát các hành động có hại một cách đáng tin cậy, trốn tránh sự giám sát sản xuất hoặc khái quát hóa trên các dòng sản phẩm kiểu mẫu. Nó cho thấy tại sao hệ thống đánh giá có thể được hưởng lợi từ nhiều loại bằng chứng thay vì chỉ dựa vào câu trả lời cuối cùng hoặc bản tự báo cáo.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Bài viết này là bản in trước và báo cáo các thí nghiệm được kiểm soát chứ không phải bằng chứng từ các hệ thống đã triển khai. Công việc tiếp theo nên kiểm tra nhiều mô hình, cài đặt đánh giá và bối cảnh thực tế hơn, đồng thời xác định xem các tín hiệu được phát hiện có dự đoán những thay đổi có ý nghĩa về hành vi an toàn hoặc năng lực hay không.

Câu hỏi ngay lập tức là nhân rộng. Nghiên cứu này bao gồm sáu mô hình, bốn họ mô hình và ba kích cỡ, nhưng bản tóm tắt không xác định tất cả chúng hoặc mô tả phân bổ đầy đủ các kết quả. Các nhà nghiên cứu độc lập nên kiểm tra xem tín hiệu có thể giải mã được có tồn tại dưới các lời nhắc, loại nhiệm vụ, ngôn ngữ, cài đặt lấy mẫu và người đánh giá khác nhau hay không. Họ cũng nên so sánh các mô hình đã được đào tạo rõ ràng về hướng dẫn hoặc an toàn với các hệ thống cơ sở và điểm kiểm tra mở.

Câu hỏi thứ hai là giá trị tiên đoán thực tế. Việc phát hiện một biểu diễn không giống như việc chỉ ra rằng nó thay đổi một quyết định mang tính hệ quả. Các nghiên cứu tiếp theo nên hỏi liệu các tín hiệu nhận thức đánh giá có dự đoán được những khác biệt có thể đo lường được trong hành vi từ chối, điểm năng lực, sự tuân thủ chính sách hoặc việc sử dụng công cụ hay không và liệu những khác biệt đó có xuất hiện bên ngoài lời nhắc của phòng thí nghiệm hay không. Họ cũng nên xác định tần suất các đầu dò tạo ra kết quả dương tính giả, mức độ ổn định của các hướng trên các hạt giống và điểm kiểm tra ngẫu nhiên cũng như liệu việc giám sát có thể được thực hiện mà không cần dựa vào các giả định tương tự đang được kiểm tra hay không.

Kết quả của giai đoạn huấn luyện đáng được xem xét kỹ lưỡng. Bài viết báo cáo rằng nhận thức đánh giá tồn tại trong các mô hình Olmo cơ sở, tăng lên trong quá trình tinh chỉnh có giám sát và duy trì ổn định sau đó, trong khi hiệu ứng chỉ đạo tăng lên qua các giai đoạn. Mẫu đó có thể phản ánh những thay đổi trong cách biểu diễn đã học, hành vi tuân theo hướng dẫn hoặc các thăm dò và nhiệm vụ cụ thể được sử dụng; phần tóm tắt không xác định được lời giải thích nào là đúng. Bài viết cũng là một bài nộp của arXiv, vì vậy các tuyên bố của nó phải được coi là sơ bộ cho đến khi được sao chép và đánh giá thông qua đánh giá ngang hàng rộng hơn. Những ẩn số có ý nghĩa bao gồm liệu các phát hiện có áp dụng cho các mô hình khép kín, hệ thống đa phương thức, triển khai tác nhân hay các đánh giá quan trọng về an toàn hay không.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIĐạo đức AIĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiThực hiện theo trình theo dõi quy định AI
Tìm thấy điều này hữu ích?