뉴스로 돌아가기
혁신AI Understanding 브리핑

Anthropic, 독립적인 AI 웰빙 평가를 위한 500만 달러 보조금 프로그램 출시

Anthropic는 AI 대화가 정서적으로 민감한 상황이나 정신 건강 상황을 포함하여 사용자의 웰빙에 어떤 영향을 미치는지 조사하는 독립적인 오픈 소스 연구에 자금을 지원할 것이라고 밝혔습니다.

5 min readRead the primary source
Source-page capture accompanying Anthropic launches $5 million grant program for independent AI wellbeing evaluations
기본 소스 문서녹음된 소스
출판사
anthropic.com
소스 링크
anthropic.comhttps://www.anthropic.com/news/wellbeing-research-grants
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
자신을 테스트해 보세요AI 윤리 퀴즈

무슨 일이 일어났나요?

Anthropic는 AI가 사용자 웰빙에 미치는 영향에 대한 독립적인 연구를 위해 500만 달러의 보조금 프로그램을 발표했습니다. 수혜자는 직접적인 자금 조달, Anthropic 모델에 대한 액세스 및 기술 지원을 받는 동시에 완전히 독립적인 상태를 유지하고 평가를 오픈 소스 프로젝트로 게시할 것이라고 말합니다.

8월 25일, Anthropic는 인공 지능 시스템이 사용자의 웰빙에 어떤 영향을 미치는지에 대한 독립적인 연구에 초점을 맞춘 500만 달러의 보조금 프로그램을 발표했습니다. 회사는 이 프로그램이 오픈 소스 평가를 구축하는 연구자들에게 직접적인 자금 지원, 모델에 대한 액세스 및 기술 지원을 제공할 것이라고 말했습니다. Anthropic는 의도된 출력을 Anthropic의 내부 시스템으로 제한된 평가가 아니라 업계 전반의 개발자가 사용할 수 있는 벤치마크 및 평가 프로젝트로 설명했습니다.

Anthropic는 수혜자가 완전히 독립적으로 작업하고 자신의 작업을 오픈 소스 프로젝트로 게시할 것이라고 말했습니다. 이번 발표에서는 보조금 할당 방법, 선정할 프로젝트 수, 개별 보조금 규모, 수혜자가 Anthropic로부터 모델 액세스 및 기술 지원을 받는 동안 연구 독립성을 보호할 공식적인 보호 장치가 무엇인지 명시하지 않았습니다. 이러한 세부 사항은 출처에서 알 수 없는 상태로 남아 있습니다.

회사는 업무, 교육, 문제 해결 및 정서적 지원 대화에서 AI의 역할이 증가함에 따라 필요성을 제시했습니다. 사용자가 모델과의 교제를 구하거나 정신 건강 위기 상황에서 AI를 사용하는 등의 상황에 대한 명확한 업계 표준은 아직 없다고 말했습니다. Anthropic는 또한 대화의 위험은 시간이 지남에 따라 변할 수 있고 이전에 공개된 정보에 따라 달라질 수 있기 때문에 웰빙은 많은 모델 행동보다 평가하기 어렵다고 말했습니다.

예를 들어, Anthropic는 다이어트나 운동에 대한 반응이 개별적으로는 합리적으로 보일 수 있지만 사용자가 섭식 장애의 병력을 보이면 부적절해질 수 있다고 말했습니다. 자체 보호 장치는 이러한 상황을 식별하고 Claude의 대응을 안내하기 위한 것이며, Claude와의 대화에 대한 연구는 보호 장치 개발 및 평가에 정보를 제공합니다. 이 진술은 Anthropic의 접근 방식과 주장을 설명합니다. 이 발표는 보호 조치가 효과적이라는 것을 보여주는 독립적인 결과를 제공하지 않습니다.

소스 세부정보: anthropic.com ↗

왜 중요한가요?

이 프로그램은 AI 평가의 어려운 격차를 목표로 합니다. 웰빙 위험은 긴 대화를 통해 점차적으로 나타날 수 있으며 사용자 상황에 크게 의존할 수 있습니다. Anthropic는 보조금 규모, 수령자 수 또는 독립성이 어떻게 관리되는지 공개하지 않았지만 더 나은 독립적인 벤치마크는 개발자가 유해한 규정 준수와 과도한 거부를 모두 평가하는 데 도움이 될 수 있습니다.

이 제안은 대화형 AI를 평가할 때 중요한 약점을 다룹니다. 단일 답변으로는 시스템이 민감한 상호 작용을 안전하게 처리했는지 여부를 알 수 없습니다. 사용자의 상황은 여러 차례에 걸쳐 더욱 명확해질 수 있으며, 한 상황에서 수용 가능한 응답이 다른 상황에서는 해로울 수 있습니다. 이러한 변화를 포착하는 평가는 개발자와 연구자에게 감정적으로 민감한 사용의 안전성을 판단하기 위한 보다 현실적인 기반을 제공할 수 있습니다.

Anthropic의 지침에서는 평가를 통해 합격 또는 불합격으로 간주되는 사항과 해당 표준이 중요한 이유를 명확하게 정의할 것을 요구합니다. 또한 연구자들에게 설계 및 검증에 임상 및 주제 전문가를 참여시킬 것을 요청합니다. 웰빙 판단에는 정신 건강, 섭식 장애, 위기 대응 및 일반적인 언어 품질 테스트가 중요한 위험을 놓칠 수 있는 기타 영역이 포함될 수 있기 때문에 이러한 강조는 필연적입니다.

회사는 또한 평가를 통해 예방 조치와 피해를 모두 테스트해야 한다고 말합니다. 이는 모델이 위험한 요청을 너무 쉽게 준수하는지 여부뿐 아니라 유용한 응답이 적절할 때 모델이 너무 광범위하게 거부하는지 여부도 조사하는 것을 의미합니다. 이러한 과잉 준수와 과도한 거부의 구별은 실제 사용자에게 평가를 더 유익하게 만들 수 있지만 소스는 최종 피부여자가 채택할 임계값이나 정의를 설정하지 않습니다.

Anthropic는 위험이 확대되고 상황이 바뀌는 다단계 대화를 통해 실제 사용과 유사한 시나리오를 원합니다. 또한 자동화된 채점자는 실제 주제 전문가에 대해 검증되어야 한다고 말합니다. 엄격하게 구현되면 이러한 요구 사항은 짧고 정적 벤치마크 프롬프트에서 간과되는 오류를 노출하는 데 도움이 될 수 있습니다. 실질적인 가치는 선택된 연구의 품질, 개방성 및 다른 개발자가 결과 테스트를 채택하는지 여부에 따라 달라집니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
대화형 개념 확인+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

다음에 무엇을 볼 것인가

신청 마감일은 2026년 9월 21일이며, 전체 제안서를 제출하도록 초대된 신청자는 10월 5일까지 통보를 받을 것으로 예상됩니다. 주요 테스트는 결과 평가가 임상 전문 지식을 사용하는지, 현실적인 다단계 대화를 반영하는지, 전문가에 대해 자동화된 그레이더를 검증하고 Anthropic의 자체 모델 이상으로 작동하는 방법을 생성하는지 여부입니다.

당면한 이정표는 신청 마감일인 2026년 9월 21일이다. Anthropic에 따르면 전체 제안서를 제출하도록 선택된 신청자는 10월 5일까지 통보를 받게 될 것이다. 이 발표에는 최종 수상 날짜, 자금 지원 연구 시작 또는 결과 발표 날짜가 제공되지 않으므로 프로그램의 단기 규모와 속도는 아직 평가할 수 없다.

선정 과정은 면밀한 조사를 거쳐야 합니다. 답변되지 않은 중요한 질문에는 누가 수혜자를 선택할 것인지, 이해 상충을 어떻게 처리할 것인지, 연구자가 검토 없이 불리한 결과를 발표할 수 있는지 여부, 어떤 모델 액세스가 수반되는지, 프로그램이 Claude 이외의 시스템을 평가하는 작업에 자금을 지원하는지 여부 등이 있습니다. Anthropic의 독립 주장은 의미가 있지만 소스는 그 뒤에 있는 계약 조건을 설명하지 않습니다.

결과 평가는 벤치마크 점수 이상으로 평가되어야 합니다. 시나리오는 긴 대화를 나타내고, 임상 전문가가 설계와 검증에 모두 참여하며, 채점자가 전문가 판단에 대해 확인된다는 증거를 살펴보세요. 또한 벤치마크가 과도한 준수와 과도한 거부로 인한 피해를 측정하는지 여부와 해당 방법이 Anthropic 외부의 개발자가 재현 가능하고 사용할 수 있는지 여부도 중요합니다.

마지막으로, 프로그램의 광범위한 영향은 채택에 달려 있습니다. Anthropic는 해당 프로젝트가 오픈 소스로 모든 개발자에게 제공될 것이라고 밝혔지만, 참여 연구원, 계획된 벤치마크, 출판 장소 또는 업계 전반의 표준화를 위한 메커니즘은 식별되지 않았습니다. 이러한 세부 사항과 결과가 나올 때까지 이번 발표는 AI 웰빙 위험이 해결되었다는 증거가 아니라 자금 지원 약속과 평가 의제를 설정하는 것입니다.

관련 가이드 및 퀴즈

AI 윤리ChatGPT와 LLMAI 모델 설명AI의 미래알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?