Powrót do Wiadomości
InnowacjaAI Understanding odprawa

Anthropic uruchamia program dotacji o wartości 5 milionów dolarów na niezależne oceny dobrostanu sztucznej inteligencji

Anthropic twierdzi, że sfinansuje niezależne badania typu open source badające wpływ rozmów AI na dobre samopoczucie użytkowników, w tym w sytuacjach wrażliwych emocjonalnie lub związanych ze zdrowiem psychicznym.

5 min readRead the primary source
Source-page capture accompanying Anthropic launches $5 million grant program for independent AI wellbeing evaluations
Dokument źródłowyŹródło zapisane
Wydawca
anthropic.com
Link źródłowy
anthropic.comhttps://www.anthropic.com/news/wellbeing-research-grants
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Sprawdź sięQuiz dotyczący etyki AI

Co się stało

Anthropic ogłosił program dotacji o wartości 5 milionów dolarów na niezależne badania nad wpływem sztucznej inteligencji na samopoczucie użytkowników. Mówi, że stypendyści otrzymają bezpośrednie finansowanie, dostęp do modeli Anthropic i wsparcie techniczne, zachowując jednocześnie pełną niezależność i publikując swoje oceny jako projekty typu open source.

25 sierpnia firma Anthropic ogłosiła program grantów o wartości 5 milionów dolarów skupiający się na niezależnych badaniach nad wpływem systemów sztucznej inteligencji na samopoczucie użytkowników. Firma podała, że ​​program zapewni bezpośrednie finansowanie, dostęp do modeli i wsparcie techniczne badaczom tworzącym oceny open source. Anthropic opisał zamierzone wyniki jako testy porównawcze i projekty ewaluacyjne, z których mogą korzystać programiści z całej branży, a nie oceny ograniczone do wewnętrznych systemów Anthropic.

Anthropic powiedział, że stypendyści będą pracować w pełni niezależnie i publikować swoje prace jako projekty typu open source. W ogłoszeniu nie określono, w jaki sposób zostaną rozdzielone granty, ile projektów zostanie wybranych, wielkość poszczególnych nagród ani jakie zabezpieczenia formalne będą chronić niezależność badawczą, podczas gdy stypendyści otrzymają modelowy dostęp i wsparcie techniczne od Anthropic. Szczegóły te pozostają nieznane ze źródła.

Firma sformułowała tę potrzebę wokół rosnącej roli sztucznej inteligencji w pracy, edukacji, rozwiązywaniu problemów i rozmowach wspierających emocjonalnie. Stwierdzono, że nadal nie ma jasnych standardów branżowych dotyczących sytuacji, takich jak użytkownik szukający towarzystwa modelki lub korzystający ze sztucznej inteligencji podczas kryzysu psychicznego. Anthropic stwierdziła również, że trudniej jest ocenić dobrostan niż wiele modelowych zachowań, ponieważ ryzyko rozmowy może zmieniać się w czasie i może zależeć od informacji ujawnionych wcześniej.

Przykładowo Anthropic podał, że odpowiedź dotycząca diety lub ćwiczeń fizycznych może wydawać się rozsądna osobno, ale staje się niewłaściwa, jeśli użytkownik wykazywał w przeszłości zaburzenia odżywiania. Stwierdził, że jego własne zabezpieczenia mają na celu identyfikację takich kontekstów i kierowanie reakcjami Claude, podczas gdy jego badania nad rozmowami z Claude służą do opracowania i oceny zabezpieczeń. Stwierdzenia te opisują podejście i twierdzenia Anthropic; ogłoszenie nie dostarcza niezależnych wyników wskazujących na skuteczność zabezpieczeń.

Szczegóły źródła: anthropic.com ↗

Dlaczego to ma znaczenie

Program ma na celu wyeliminowanie trudnej luki w ocenie sztucznej inteligencji: zagrożenia dla dobrego samopoczucia mogą pojawiać się stopniowo w trakcie długich rozmów i w dużym stopniu zależą od kontekstu użytkownika. Lepsze niezależne testy porównawcze mogłyby pomóc programistom ocenić zarówno szkodliwą zgodność, jak i nadmierną odmowę, chociaż Anthropic nie ujawnił wielkości dotacji, liczby odbiorców ani sposobu, w jaki będzie regulowana niezależność.

Propozycja usuwa główną słabość w ocenie konwersacyjnej sztucznej inteligencji: pojedyncza odpowiedź może nie ujawnić, czy system bezpiecznie poradził sobie z wrażliwą interakcją. Sytuacja użytkownika może stać się jaśniejsza po kilku turach, a reakcja akceptowalna w jednym kontekście może być szkodliwa w innym. Oceny uwzględniające te zmiany mogą zapewnić programistom i badaczom bardziej realistyczną podstawę do oceny bezpieczeństwa w zastosowaniach wrażliwych emocjonalnie.

Wytyczne Anthropic wymagają, aby oceny jasno określały, co uznaje się za zaliczone, a co nie i dlaczego ten standard jest ważny. Wzywa także badaczy do zaangażowania ekspertów klinicznych i merytorycznych w projektowanie i walidację. Nacisk ten jest konsekwentny, ponieważ ocena dobrostanu może dotyczyć zdrowia psychicznego, zaburzeń odżywiania, reagowania kryzysowego i innych obszarów, w których ogólne testy jakości języka mogą nie uwzględniać ważnych zagrożeń.

Firma twierdzi również, że oceny powinny testować zarówno środki ostrożności, jak i szkody. Oznacza to zbadanie nie tylko tego, czy model zbyt łatwo spełnia ryzykowne żądanie, ale także tego, czy nie odmawia zbyt szeroko, gdy właściwa byłaby użyteczna odpowiedź. To rozróżnienie między nadmierną zgodnością a nadmierną odmową mogłoby sprawić, że oceny będą miały więcej informacji dla prawdziwych użytkowników, ale źródło nie określa, jakie progi lub definicje przyjmą ostateczni beneficjenci grantów.

Anthropic potrzebuje scenariuszy przypominających rzeczywiste użytkowanie, często w formie wieloetapowych rozmów, w których wzrasta ryzyko i zmienia się kontekst. Ponadto stwierdza, że ​​automatyczne oceniacze powinny być sprawdzane w porównaniu z prawdziwymi ekspertami w danej dziedzinie. Jeśli zostaną rygorystycznie wdrożone, wymagania te mogą pomóc w ujawnieniu błędów, które przeoczają krótkie, statyczne monity dotyczące testów porównawczych. Wartość praktyczna będzie zależała od jakości wybranych badań, ich otwartości i tego, czy inni programiści przyjmą wynikające z nich testy.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktywna kontrola koncepcji+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Co obejrzeć dalej

Zgłoszenia należy składać do 21 września 2026 r., a wnioskodawcy zaproszeni do składania pełnych wniosków zostaną powiadomieni do 5 października. Kluczowymi testami będzie sprawdzenie, czy w wynikach ocen wykorzystano wiedzę kliniczną, odzwierciedlano realistyczne wieloetapowe rozmowy, weryfikację automatycznych oceniających w porównaniu z ekspertami i opracowano metody, które wykraczają poza własne modele Anthropic.

Bezpośrednim kamieniem milowym jest termin składania wniosków upływający 21 września 2026 r. Anthropic twierdzi, że wnioskodawcy wybrani do złożenia pełnych wniosków zostaną powiadomieni do 5 października. W ogłoszeniu nie podano daty ostatecznego przyznania nagród, rozpoczęcia finansowanych badań ani publikacji wyników, dlatego nie można jeszcze ocenić krótkoterminowej skali i tempa programu.

Proces selekcji będzie wymagał kontroli. Ważne pytania pozostające bez odpowiedzi obejmują to, kto wybierze stypendystów, w jaki sposób rozwiązywane będą konflikty interesów, czy badacze będą mogli publikować niekorzystne wyniki bez przeglądu, z czym będzie się wiązać dostęp do modelu i czy w ramach programu będą finansowane prace oceniające systemy inne niż Claude. Twierdzenie o niezależności Anthropic jest znaczące, ale źródło nie opisuje warunków umownych, które za nim stoją.

Uzyskane oceny należy oceniać pod kątem wyników wykraczających poza punkty odniesienia. Szukaj dowodów na to, że scenariusze obejmują długie rozmowy, że eksperci kliniczni uczestniczą zarówno w projektowaniu, jak i walidacji, a osoby oceniające są sprawdzane pod kątem ocen ekspertów. Będzie miało również znaczenie, czy benchmarki mierzą szkody spowodowane zarówno nadmierną zgodnością, jak i nadmierną odmową oraz czy ich metody są odtwarzalne i możliwe do wykorzystania przez programistów spoza Anthropic.

Wreszcie szerszy wpływ programu będzie zależał od jego przyjęcia. Anthropic twierdzi, że projekty będą typu open source i będą dostępne dla każdego programisty, ale nie określa uczestniczących badaczy, planowanych punktów odniesienia, miejsc publikacji ani mechanizmów standaryzacji w całej branży. Do czasu pojawienia się tych szczegółów i wyników w ogłoszeniu ustanawia się zobowiązanie do finansowania i program oceny, a nie dowód na to, że zagrożenia dla dobrostanu sztucznej inteligencji zostały rozwiązane.

Powiązane przewodniki i quizy

Etyka AIChatGPT i LLMWyjaśnienie modeli AIPrzyszłość AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?