Tillbaka till Nyheter
InnovationAI Understanding genomgång

Anthropic lanserar ett bidragsprogram på 5 miljoner dollar för oberoende utvärderingar av AI-välbefinnande

Anthropic säger att de kommer att finansiera oberoende, öppen källkodsforskning som undersöker hur AI-samtal påverkar användarnas välbefinnande, även under känslomässigt känsliga eller psykiskt hälsorelaterade situationer.

5 min readRead the primary source
Source-page capture accompanying Anthropic launches $5 million grant program for independent AI wellbeing evaluations
Primärt källdokumentKälla inspelad
Förläggare
anthropic.com
Källlänk
anthropic.comhttps://www.anthropic.com/news/wellbeing-research-grants
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Referenspunkt
Ett standardiserat test eller datauppsättning som används för att mäta och jämföra modellprestanda.
Testa dig självAI Etik Quiz

Vad hände

Anthropic tillkännagav ett anslagsprogram på 5 miljoner dollar för oberoende forskning om AI:s effekter på användarnas välbefinnande. Det säger att bidragstagare kommer att få direkt finansiering, tillgång till Anthropic-modeller och teknisk support samtidigt som de förblir helt oberoende och publicerar sina utvärderingar som projekt med öppen källkod.

Den 25 augusti tillkännagav Anthropic ett anslagsprogram på 5 miljoner dollar fokuserat på oberoende forskning om hur system med artificiell intelligens påverkar användarnas välbefinnande. Företaget sa att programmet kommer att ge direkt finansiering, tillgång till dess modeller och tekniskt stöd till forskare som bygger utvärderingar med öppen källkod. Anthropic beskrev den avsedda produktionen som riktmärken och utvärderingsprojekt som utvecklare över hela branschen kan använda, snarare än bedömningar begränsade till Anthropic:s interna system.

Anthropic sa att bidragstagare kommer att arbeta helt självständigt och publicera sitt arbete som öppen källkodsprojekt. Tillkännagivandet specificerar inte hur anslag kommer att fördelas, hur många projekt som kommer att väljas ut, storleken på individuella utmärkelser eller vilka formella garantier som kommer att skydda forskningsoberoende medan bidragstagare får tillgång till modell och tekniskt stöd från Anthropic. Dessa detaljer är fortfarande okända från källan.

Företaget inramade behovet kring AI:s växande roll i arbete, utbildning, problemlösning och känslomässigt stödjande samtal. Det sa att det fortfarande inte finns några tydliga branschstandarder för situationer som en användare som söker sällskap från en modell eller använder AI under en kris med mental hälsa. Anthropic sa också att välbefinnande är svårare att utvärdera än många modellbeteenden eftersom en konversations risk kan förändras över tiden och kan bero på information som avslöjas tidigare.

Som exempel sa Anthropic att ett svar om dieter eller motion kan verka rimligt isolerat men bli olämpligt om en användare har visat en historia av ätstörningar. Den sa att dess egna skyddsåtgärder är avsedda att identifiera sådana sammanhang och vägleda Claude:s svar, medan dess forskning om samtal med Claude informerar om skyddsutveckling och utvärdering. Dessa uttalanden beskriver Anthropic:s tillvägagångssätt och påståenden; tillkännagivandet ger inga oberoende resultat som visar att skyddsåtgärderna är effektiva.

Källinformation: anthropic.com ↗

Varför det spelar roll

Programmet riktar sig mot en svår lucka i AI-utvärdering: välbefinnanderisker kan uppstå gradvis under långa samtal och är mycket beroende av användarkontexten. Bättre oberoende riktmärken kan hjälpa utvecklare att bedöma både skadlig efterlevnad och överdriven vägran, även om Anthropic inte har avslöjat bidragsstorlekar, antalet mottagare eller hur oberoende kommer att styras.

Förslaget tar upp en central svaghet i utvärderingen av konversations-AI: ett enda svar kanske inte avslöjar om ett system hanterade en känslig interaktion på ett säkert sätt. En användares situation kan bli tydligare över flera varv, och ett svar som är acceptabelt i ett sammanhang kan vara skadligt i ett annat. Utvärderingar som fångar dessa förändringar kan ge utvecklare och forskare en mer realistisk grund för att bedöma säkerhet vid känslomässigt känslig användning.

Anthropic:s vägledning kräver utvärderingar för att tydligt definiera vad som räknas som godkänt eller underkänt och varför den standarden är viktig. Den uppmanar också forskare att involvera kliniska experter och sakkunniga i design och validering. Den betoningen är konsekvent eftersom välbefinnandebedömningar kan involvera mental hälsa, ätstörningar, krishantering och andra områden där generiska språkkvalitetstester kan missa viktiga risker.

Företaget säger också att utvärderingar bör testa både försiktighetsåtgärder och skador. Det innebär att man inte bara undersöker om en modell för lätt uppfyller en riskfylld begäran, utan också om den vägrar för brett när ett användbart svar skulle vara lämpligt. Denna distinktion mellan överlevnad och övervägran skulle kunna göra utvärderingar mer informativa för verkliga användare, men källan fastställer inte vilka trösklar eller definitioner de eventuella bidragsmottagarna kommer att anta.

Anthropic vill ha scenarier som liknar faktisk användning, ofta genom flervarvskonversationer där risken eskalerar och sammanhanget förändras. Den säger vidare att automatiserade väghyvlar ska valideras mot verkliga ämnesexperter. Om de implementeras rigoröst kan dessa krav hjälpa till att avslöja misslyckanden som korta, statiska -uppmaningar förbiser. Det praktiska värdet kommer att bero på kvaliteten på de valda studierna, deras öppenhet och om andra utvecklare antar de resulterande testerna.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Vad du ska titta på härnäst

Ansökningarna lämnas in den 21 september 2026 och sökande som bjuds in att lämna in fullständiga förslag förväntas få besked senast den 5 oktober. Nyckeltesterna kommer att vara huruvida de resulterande utvärderingarna använder klinisk expertis, återspeglar realistiska samtal med flera svängar, validerar automatiserade väghyvlar mot experter och producerar metoder som fungerar utöver Anthropics egna modeller.

Den omedelbara milstolpen är sista ansökningsdag den 21 september 2026. Anthropic säger att sökande som valts ut för att lämna in fullständiga förslag kommer att meddelas senast den 5 oktober. Tillkännagivandet anger inget datum för slutgiltiga utmärkelser, starten för finansierad forskning eller publicering av resultat, så programmets omfattning och tempo på kort sikt kan ännu inte bedömas.

Urvalsprocessen kommer att motivera granskning. Viktiga obesvarade frågor är vem som ska välja bidragstagare, hur intressekonflikter ska hanteras, om forskare kan publicera ogynnsamma resultat utan granskning, vad modelltillgång kommer att innebära och om programmet kommer att finansiera arbete som utvärderar andra system än Claude. Anthropic:s oberoende anspråk är meningsfullt, men källan beskriver inte de avtalsmässiga villkoren bakom det.

De resulterande utvärderingarna bör bedömas för mer än benchmarkpoäng. Håll utkik efter bevis för att scenarier representerar långa samtal, att kliniska experter deltar i både design och validering, och att betygsättare kontrolleras mot expertbedömningar. Det kommer också att ha betydelse om riktmärkena mäter skador orsakade av både överdriven efterlevnad och överdriven vägran, och om deras metoder är reproducerbara och användbara av utvecklare utanför Anthropic.

Slutligen kommer programmets bredare effekt att bero på antagande. Anthropic säger att projekten kommer att vara öppen källkod och tillgängliga för alla utvecklare, men det identifierar inte deltagande forskare, planerade riktmärken, publikationsplatser eller mekanismer för industriomfattande standardisering. Tills dessa detaljer och resultat framkommer, fastställer tillkännagivandet ett finansieringsåtagande och en utvärderingsagenda, inte bevis på att AI-välbefinnanderisker har lösts.

Relaterade guider och frågesporter

AI-etikChatGPT och LLM:erAI-modeller förklarasAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?