Chuyện gì đã xảy ra
Anthropic đã công bố chương trình tài trợ trị giá 5 triệu đô la cho nghiên cứu độc lập về tác động của AI đối với sức khỏe của người dùng. Nó cho biết những người được cấp sẽ nhận được tài trợ trực tiếp, quyền truy cập vào các mô hình Anthropic và hỗ trợ kỹ thuật trong khi vẫn hoàn toàn độc lập và xuất bản các đánh giá của họ dưới dạng các dự án nguồn mở.
Vào ngày 25 tháng 8, Anthropic đã công bố chương trình tài trợ trị giá 5 triệu đô la tập trung vào nghiên cứu độc lập về cách hệ thống trí tuệ nhân tạo ảnh hưởng đến sức khỏe của người dùng. Công ty cho biết chương trình sẽ cung cấp kinh phí trực tiếp, quyền truy cập vào các mô hình và hỗ trợ kỹ thuật cho các nhà nghiên cứu xây dựng các đánh giá nguồn mở. Anthropic mô tả kết quả đầu ra dự kiến là các dự án đánh giá và điểm chuẩn mà các nhà phát triển trong toàn ngành có thể sử dụng, thay vì các đánh giá chỉ giới hạn ở hệ thống nội bộ của Anthropic.
Anthropic cho biết những người được cấp sẽ làm việc hoàn toàn độc lập và xuất bản tác phẩm của họ dưới dạng các dự án nguồn mở. Thông báo không nêu rõ cách phân bổ các khoản tài trợ, số lượng dự án sẽ được chọn, quy mô của từng giải thưởng hoặc những biện pháp bảo vệ chính thức nào sẽ bảo vệ tính độc lập trong nghiên cứu trong khi những người được cấp quyền nhận được quyền truy cập mô hình và hỗ trợ kỹ thuật từ Anthropic. Những chi tiết đó vẫn chưa được biết từ nguồn.
Công ty đặt ra nhu cầu về vai trò ngày càng tăng của AI trong công việc, giáo dục, giải quyết vấn đề và các cuộc trò chuyện hỗ trợ về mặt cảm xúc. Họ cho biết vẫn chưa có tiêu chuẩn ngành rõ ràng cho các tình huống như người dùng tìm kiếm sự đồng hành từ một người mẫu hoặc sử dụng AI trong cuộc khủng hoảng sức khỏe tâm thần. Anthropic cũng cho biết khó đánh giá mức độ an toàn hơn nhiều hành vi mô hình vì rủi ro của cuộc trò chuyện có thể thay đổi theo thời gian và có thể phụ thuộc vào thông tin được tiết lộ trước đó.
Ví dụ: Anthropic cho biết phản hồi về chế độ ăn kiêng hoặc tập thể dục có thể có vẻ hợp lý nếu tách riêng nhưng sẽ trở nên không phù hợp nếu người dùng có tiền sử rối loạn ăn uống. Họ cho biết các biện pháp bảo vệ của riêng họ nhằm xác định các bối cảnh như vậy và hướng dẫn các phản ứng của Claude, trong khi nghiên cứu của họ về các cuộc trò chuyện với Claude giúp cung cấp thông tin cho việc phát triển và đánh giá các biện pháp bảo vệ. Những tuyên bố này mô tả cách tiếp cận và tuyên bố của Anthropic; thông báo không đưa ra kết quả độc lập nào cho thấy các biện pháp bảo vệ có hiệu quả.
Chi tiết nguồn: anthropic.com ↗
Tại sao nó quan trọng
Chương trình nhắm đến một lỗ hổng khó khăn trong đánh giá AI: rủi ro về sức khỏe có thể xuất hiện dần dần qua các cuộc trò chuyện dài và phụ thuộc nhiều vào bối cảnh của người dùng. Các tiêu chuẩn độc lập tốt hơn có thể giúp các nhà phát triển đánh giá cả việc tuân thủ có hại và việc từ chối quá mức, mặc dù Anthropic chưa tiết lộ quy mô trợ cấp, số lượng người nhận hoặc mức độ độc lập sẽ được quản lý như thế nào.
Đề xuất giải quyết điểm yếu chính trong việc đánh giá AI đàm thoại: một câu trả lời duy nhất có thể không tiết lộ liệu hệ thống có xử lý tương tác nhạy cảm một cách an toàn hay không. Tình huống của người dùng có thể trở nên rõ ràng hơn qua nhiều lượt và phản hồi được chấp nhận trong bối cảnh này có thể gây hại trong bối cảnh khác. Những đánh giá nắm bắt được những thay đổi đó có thể mang lại cho các nhà phát triển và nhà nghiên cứu cơ sở thực tế hơn để đánh giá sự an toàn khi sử dụng nhạy cảm về mặt cảm xúc.
Hướng dẫn của Anthropic yêu cầu đánh giá để xác định rõ ràng thế nào là đạt hay không đạt và tại sao tiêu chuẩn đó lại quan trọng. Nó cũng yêu cầu các nhà nghiên cứu thu hút sự tham gia của các chuyên gia lâm sàng và chuyên gia về chủ đề này vào việc thiết kế và xác nhận. Sự nhấn mạnh đó là hệ quả vì các đánh giá về sức khỏe có thể liên quan đến sức khỏe tâm thần, rối loạn ăn uống, ứng phó với khủng hoảng và các lĩnh vực khác mà các bài kiểm tra chất lượng ngôn ngữ chung có thể bỏ sót những rủi ro quan trọng.
Công ty cũng cho biết các đánh giá nên kiểm tra cả biện pháp phòng ngừa và tác hại. Điều đó có nghĩa là kiểm tra không chỉ liệu một mô hình có tuân thủ quá dễ dàng với một yêu cầu rủi ro hay không, mà còn xem liệu nó có từ chối quá rộng rãi khi có phản hồi hữu ích hay không. Sự khác biệt giữa tuân thủ quá mức và từ chối quá mức này có thể làm cho các đánh giá có nhiều thông tin hơn đối với người dùng thực, nhưng nguồn không xác định ngưỡng hoặc định nghĩa nào mà người được cấp quyền cuối cùng sẽ áp dụng.
Anthropic muốn các kịch bản giống với việc sử dụng thực tế, thường thông qua các cuộc trò chuyện nhiều lượt, trong đó rủi ro leo thang và bối cảnh thay đổi. Nó còn nói thêm rằng các công cụ chấm điểm tự động phải được xác nhận dựa trên các chuyên gia thực sự về chủ đề đó. Nếu được triển khai một cách nghiêm ngặt, những yêu cầu đó có thể giúp bộc lộ những lỗi mà các lời nhắc điểm chuẩn tĩnh, ngắn gọn bỏ qua. Giá trị thực tế sẽ phụ thuộc vào chất lượng của các nghiên cứu được chọn, tính mở của chúng và liệu các nhà phát triển khác có áp dụng các thử nghiệm kết quả hay không.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
Why can ethical evaluation not be reduced to one model score?
Xem gì tiếp theo
Hạn chót nộp đơn là ngày 21 tháng 9 năm 2026 và những người nộp đơn được mời gửi đề xuất đầy đủ dự kiến sẽ được thông báo trước ngày 5 tháng 10. Các bài kiểm tra chính sẽ là liệu các đánh giá kết quả có sử dụng chuyên môn lâm sàng hay không, phản ánh các cuộc trò chuyện nhiều lượt thực tế, xác thực các công cụ chấm điểm tự động so với các chuyên gia và tạo ra các phương pháp hoạt động ngoài các mô hình của riêng Anthropic.
Cột mốc quan trọng trước mắt là hạn chót nộp đơn vào ngày 21 tháng 9 năm 2026. Anthropic cho biết những người nộp đơn được chọn gửi đề xuất đầy đủ sẽ được thông báo trước ngày 5 tháng 10. Thông báo không cung cấp ngày trao giải cuối cùng, ngày bắt đầu nghiên cứu được tài trợ hoặc công bố kết quả, vì vậy chưa thể đánh giá quy mô và tốc độ trong thời gian ngắn của chương trình.
Quá trình lựa chọn sẽ đảm bảo sự xem xét kỹ lưỡng. Các câu hỏi quan trọng chưa được trả lời bao gồm ai sẽ chọn người được cấp, xung đột lợi ích sẽ được xử lý như thế nào, liệu các nhà nghiên cứu có thể công bố những phát hiện bất lợi mà không cần xem xét hay không, quyền truy cập mô hình sẽ đòi hỏi gì và liệu chương trình có tài trợ cho công việc đánh giá các hệ thống khác ngoài Claude hay không. Tuyên bố độc lập của Anthropic có ý nghĩa nhưng nguồn không mô tả các điều khoản hợp đồng đằng sau nó.
Các kết quả đánh giá cần được đánh giá nhiều hơn điểm chuẩn. Theo dõi bằng chứng cho thấy các kịch bản thể hiện các cuộc trò chuyện dài, rằng các chuyên gia lâm sàng tham gia vào cả quá trình thiết kế và xác nhận, đồng thời người chấm điểm được kiểm tra dựa trên các đánh giá của chuyên gia. Điều quan trọng nữa là liệu các điểm chuẩn có đo lường được tác hại do cả việc tuân thủ quá mức và từ chối quá mức hay không, cũng như liệu các phương pháp của chúng có thể được lặp lại và sử dụng bởi các nhà phát triển bên ngoài Anthropic hay không.
Cuối cùng, tác động rộng hơn của chương trình sẽ phụ thuộc vào việc áp dụng. Anthropic cho biết các dự án sẽ là nguồn mở và có sẵn cho bất kỳ nhà phát triển nào, nhưng nó không xác định các nhà nghiên cứu tham gia, điểm chuẩn đã lên kế hoạch, địa điểm xuất bản hoặc cơ chế tiêu chuẩn hóa toàn ngành. Cho đến khi những chi tiết và kết quả đó xuất hiện, thông báo sẽ thiết lập một cam kết tài trợ và một chương trình đánh giá, chứ không phải bằng chứng cho thấy các rủi ro về sức khỏe của AI đã được giải quyết.