Co się stało
Anthropic ogłosił program dotacji o wartości 5 milionów dolarów na niezależne badania nad wpływem sztucznej inteligencji na samopoczucie użytkowników. Mówi, że stypendyści otrzymają bezpośrednie finansowanie, dostęp do modeli Anthropic i wsparcie techniczne, zachowując jednocześnie pełną niezależność i publikując swoje oceny jako projekty typu open source.
25 sierpnia firma Anthropic ogłosiła program grantów o wartości 5 milionów dolarów skupiający się na niezależnych badaniach nad wpływem systemów sztucznej inteligencji na samopoczucie użytkowników. Firma podała, że program zapewni bezpośrednie finansowanie, dostęp do modeli i wsparcie techniczne badaczom tworzącym oceny open source. Anthropic opisał zamierzone wyniki jako testy porównawcze i projekty ewaluacyjne, z których mogą korzystać programiści z całej branży, a nie oceny ograniczone do wewnętrznych systemów Anthropic.
Anthropic powiedział, że stypendyści będą pracować w pełni niezależnie i publikować swoje prace jako projekty typu open source. W ogłoszeniu nie określono, w jaki sposób zostaną rozdzielone granty, ile projektów zostanie wybranych, wielkość poszczególnych nagród ani jakie zabezpieczenia formalne będą chronić niezależność badawczą, podczas gdy stypendyści otrzymają modelowy dostęp i wsparcie techniczne od Anthropic. Szczegóły te pozostają nieznane ze źródła.
Firma sformułowała tę potrzebę wokół rosnącej roli sztucznej inteligencji w pracy, edukacji, rozwiązywaniu problemów i rozmowach wspierających emocjonalnie. Stwierdzono, że nadal nie ma jasnych standardów branżowych dotyczących sytuacji, takich jak użytkownik szukający towarzystwa modelki lub korzystający ze sztucznej inteligencji podczas kryzysu psychicznego. Anthropic stwierdziła również, że trudniej jest ocenić dobrostan niż wiele modelowych zachowań, ponieważ ryzyko rozmowy może zmieniać się w czasie i może zależeć od informacji ujawnionych wcześniej.
Przykładowo Anthropic podał, że odpowiedź dotycząca diety lub ćwiczeń fizycznych może wydawać się rozsądna osobno, ale staje się niewłaściwa, jeśli użytkownik wykazywał w przeszłości zaburzenia odżywiania. Stwierdził, że jego własne zabezpieczenia mają na celu identyfikację takich kontekstów i kierowanie reakcjami Claude, podczas gdy jego badania nad rozmowami z Claude służą do opracowania i oceny zabezpieczeń. Stwierdzenia te opisują podejście i twierdzenia Anthropic; ogłoszenie nie dostarcza niezależnych wyników wskazujących na skuteczność zabezpieczeń.
Szczegóły źródła: anthropic.com ↗
Dlaczego to ma znaczenie
Program ma na celu wyeliminowanie trudnej luki w ocenie sztucznej inteligencji: zagrożenia dla dobrego samopoczucia mogą pojawiać się stopniowo w trakcie długich rozmów i w dużym stopniu zależą od kontekstu użytkownika. Lepsze niezależne testy porównawcze mogłyby pomóc programistom ocenić zarówno szkodliwą zgodność, jak i nadmierną odmowę, chociaż Anthropic nie ujawnił wielkości dotacji, liczby odbiorców ani sposobu, w jaki będzie regulowana niezależność.
Propozycja usuwa główną słabość w ocenie konwersacyjnej sztucznej inteligencji: pojedyncza odpowiedź może nie ujawnić, czy system bezpiecznie poradził sobie z wrażliwą interakcją. Sytuacja użytkownika może stać się jaśniejsza po kilku turach, a reakcja akceptowalna w jednym kontekście może być szkodliwa w innym. Oceny uwzględniające te zmiany mogą zapewnić programistom i badaczom bardziej realistyczną podstawę do oceny bezpieczeństwa w zastosowaniach wrażliwych emocjonalnie.
Wytyczne Anthropic wymagają, aby oceny jasno określały, co uznaje się za zaliczone, a co nie i dlaczego ten standard jest ważny. Wzywa także badaczy do zaangażowania ekspertów klinicznych i merytorycznych w projektowanie i walidację. Nacisk ten jest konsekwentny, ponieważ ocena dobrostanu może dotyczyć zdrowia psychicznego, zaburzeń odżywiania, reagowania kryzysowego i innych obszarów, w których ogólne testy jakości języka mogą nie uwzględniać ważnych zagrożeń.
Firma twierdzi również, że oceny powinny testować zarówno środki ostrożności, jak i szkody. Oznacza to zbadanie nie tylko tego, czy model zbyt łatwo spełnia ryzykowne żądanie, ale także tego, czy nie odmawia zbyt szeroko, gdy właściwa byłaby użyteczna odpowiedź. To rozróżnienie między nadmierną zgodnością a nadmierną odmową mogłoby sprawić, że oceny będą miały więcej informacji dla prawdziwych użytkowników, ale źródło nie określa, jakie progi lub definicje przyjmą ostateczni beneficjenci grantów.
Anthropic potrzebuje scenariuszy przypominających rzeczywiste użytkowanie, często w formie wieloetapowych rozmów, w których wzrasta ryzyko i zmienia się kontekst. Ponadto stwierdza, że automatyczne oceniacze powinny być sprawdzane w porównaniu z prawdziwymi ekspertami w danej dziedzinie. Jeśli zostaną rygorystycznie wdrożone, wymagania te mogą pomóc w ujawnieniu błędów, które przeoczają krótkie, statyczne monity dotyczące testów porównawczych. Wartość praktyczna będzie zależała od jakości wybranych badań, ich otwartości i tego, czy inni programiści przyjmą wynikające z nich testy.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
Why can ethical evaluation not be reduced to one model score?
Co obejrzeć dalej
Zgłoszenia należy składać do 21 września 2026 r., a wnioskodawcy zaproszeni do składania pełnych wniosków zostaną powiadomieni do 5 października. Kluczowymi testami będzie sprawdzenie, czy w wynikach ocen wykorzystano wiedzę kliniczną, odzwierciedlano realistyczne wieloetapowe rozmowy, weryfikację automatycznych oceniających w porównaniu z ekspertami i opracowano metody, które wykraczają poza własne modele Anthropic.
Bezpośrednim kamieniem milowym jest termin składania wniosków upływający 21 września 2026 r. Anthropic twierdzi, że wnioskodawcy wybrani do złożenia pełnych wniosków zostaną powiadomieni do 5 października. W ogłoszeniu nie podano daty ostatecznego przyznania nagród, rozpoczęcia finansowanych badań ani publikacji wyników, dlatego nie można jeszcze ocenić krótkoterminowej skali i tempa programu.
Proces selekcji będzie wymagał kontroli. Ważne pytania pozostające bez odpowiedzi obejmują to, kto wybierze stypendystów, w jaki sposób rozwiązywane będą konflikty interesów, czy badacze będą mogli publikować niekorzystne wyniki bez przeglądu, z czym będzie się wiązać dostęp do modelu i czy w ramach programu będą finansowane prace oceniające systemy inne niż Claude. Twierdzenie o niezależności Anthropic jest znaczące, ale źródło nie opisuje warunków umownych, które za nim stoją.
Uzyskane oceny należy oceniać pod kątem wyników wykraczających poza punkty odniesienia. Szukaj dowodów na to, że scenariusze obejmują długie rozmowy, że eksperci kliniczni uczestniczą zarówno w projektowaniu, jak i walidacji, a osoby oceniające są sprawdzane pod kątem ocen ekspertów. Będzie miało również znaczenie, czy benchmarki mierzą szkody spowodowane zarówno nadmierną zgodnością, jak i nadmierną odmową oraz czy ich metody są odtwarzalne i możliwe do wykorzystania przez programistów spoza Anthropic.
Wreszcie szerszy wpływ programu będzie zależał od jego przyjęcia. Anthropic twierdzi, że projekty będą typu open source i będą dostępne dla każdego programisty, ale nie określa uczestniczących badaczy, planowanych punktów odniesienia, miejsc publikacji ani mechanizmów standaryzacji w całej branży. Do czasu pojawienia się tych szczegółów i wyników w ogłoszeniu ustanawia się zobowiązanie do finansowania i program oceny, a nie dowód na to, że zagrożenia dla dobrostanu sztucznej inteligencji zostały rozwiązane.