Назад до новин
ІнноваціяAI Understanding брифінг

Anthropic запускає грантову програму на 5 мільйонів доларів для незалежної оцінки добробуту ШІ

Anthropic каже, що фінансуватиме незалежне дослідження з відкритим кодом, яке вивчатиме, як розмови штучного інтелекту впливають на самопочуття користувачів, зокрема під час емоційно чутливих ситуацій або ситуацій із психічним здоров’ям.

5 min readRead the primary source
Source-page capture accompanying Anthropic launches $5 million grant program for independent AI wellbeing evaluations
Першоджерельний документДжерело записано
Видавець
anthropic.com
Посилання на джерело
anthropic.comhttps://www.anthropic.com/news/wellbeing-research-grants
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Перевір себеВікторина з етики ШІ

Що сталося

Anthropic оголосив про грантову програму в розмірі 5 мільйонів доларів США на незалежні дослідження впливу ШІ на добробут користувачів. У ньому йдеться, що отримувачі грантів отримають пряме фінансування, доступ до моделей Anthropic і технічну підтримку, залишаючись при цьому повністю незалежними та публікуючи свої оцінки як проекти з відкритим кодом.

25 серпня Anthropic оголосив про грантову програму в розмірі 5 мільйонів доларів, спрямовану на незалежне дослідження того, як системи штучного інтелекту впливають на добробут користувачів. Компанія заявила, що програма забезпечить пряме фінансування, доступ до своїх моделей і технічну підтримку для дослідників, які створюють оцінки з відкритим кодом. Anthropic описав запланований результат як контрольні показники та проекти оцінки, які можуть використовувати розробники в усій галузі, а не оцінки, обмежені внутрішніми системами Anthropic.

Anthropic сказав, що отримувачі грантів працюватимуть повністю незалежно та публікуватимуть свою роботу як проекти з відкритим кодом. В оголошенні не вказано, як розподілятимуться гранти, скільки проектів буде відібрано, розмір індивідуальних нагород або які формальні гарантії захищатимуть незалежність досліджень, поки грантоотримувачі отримають доступ до моделі та технічну підтримку від Anthropic. Ці подробиці залишаються невідомими з джерела.

Компанія сформулювала потребу навколо зростаючої ролі штучного інтелекту в роботі, освіті, вирішенні проблем і емоційно підтримуючих бесідах. Зазначається, що досі немає чітких галузевих стандартів для таких ситуацій, як користувач шукає спілкування з моделлю або використовує ШІ під час кризи психічного здоров’я. Anthropic також сказав, що самопочуття важче оцінити, ніж багато моделей поведінки, оскільки ризик розмови може змінюватися з часом і може залежати від інформації, розкритої раніше.

Як приклад, Anthropic сказав, що відповідь про дієти чи фізичні вправи може здатися розумною окремо, але стати недоречною, якщо користувач продемонстрував історію невпорядкованого харчування. Він зазначив, що його власні запобіжні заходи призначені для визначення таких контекстів і скерування відповідей Claude, тоді як його дослідження розмов із Claude інформують про розробку та оцінку запобіжних заходів. Ці заяви описують підхід і претензії Anthropic; в повідомленні не надано незалежних результатів, які б свідчили про ефективність запобіжних заходів.

Деталі джерела: anthropic.com ↗

Чому це важливо

Програма націлена на складну прогалину в оцінці штучного інтелекту: ризики для добробуту можуть виникати поступово під час тривалих розмов і значною мірою залежати від контексту користувача. Кращі незалежні тести могли б допомогти розробникам оцінити як шкідливу відповідність, так і надмірну відмову, хоча Anthropic не розкриває розміри грантів, кількість одержувачів або те, як регулюватиметься незалежність.

Пропозиція усуває центральну слабкість в оцінці розмовного ШІ: одна відповідь може не виявити, чи безпечно система обробляла конфіденційну взаємодію. Ситуація користувача може прояснитися за кілька ходів, і відповідь, прийнятна в одному контексті, може бути шкідливою в іншому. Оцінки, які фіксують ці зміни, можуть дати розробникам і дослідникам більш реалістичну основу для оцінки безпеки емоційно чутливого використання.

Рекомендації Anthropic закликають до оцінювання, щоб чітко визначити, що вважається зарахуванням або непроходженням і чому цей стандарт має значення. Він також просить дослідників залучити клінічних і предметних експертів до розробки та валідації. Цей наголос є наслідковим, оскільки судження про благополуччя можуть включати психічне здоров’я, розлади харчування, реагування на кризу та інші сфери, де загальні тести якості мови можуть упустити важливі ризики.

Компанія також каже, що оцінки повинні перевіряти як запобіжні заходи, так і шкоду. Це означає перевірити не тільки те, чи надто легко модель виконує ризикований запит, але й чи не відмовляє вона занадто широко, коли корисна відповідь була б доцільною. Ця відмінність між надмірною відповідністю та надмірною відмовою може зробити оцінки більш інформативними для реальних користувачів, але джерело не встановлює, які порогові значення чи визначення приймуть потенційні отримувачі грантів.

Anthropic хоче сценаріїв, які нагадують реальне використання, часто через багаточергові розмови, під час яких ризик зростає та контекст змінюється. Крім того, у ньому сказано, що автоматичні грейдери повинні бути перевірені реальними експертами з предмету. За умови суворого виконання ці вимоги могли б допомогти виявити помилки, які не помічаються короткими статичними підказками тестування. Практична цінність залежатиме від якості відібраних досліджень, їх відкритості та від того, чи будуть інші розробники використовувати отримані тести.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Що дивитися далі

Заявки повинні бути подані до 21 вересня 2026 року, а заявників, запрошених подати повні пропозиції, очікується, що вони будуть повідомлені до 5 жовтня. Ключові тести полягатимуть у тому, чи будуть отримані оцінки використовувати клінічний досвід, відображати реалістичні багатоступеневі розмови, перевіряти автоматичні оцінювачі проти експертів і створювати методи, які працюють за межами власних моделей Anthropic.

Найближчим етапом є кінцевий термін подання заявок 21 вересня 2026 року. Anthropic повідомляє, що заявники, відібрані для подання повних пропозицій, будуть повідомлені до 5 жовтня. В оголошенні не вказується дата остаточного нагородження, початку фінансованого дослідження чи публікації результатів, тому найближчий масштаб і темпи програми ще не можуть бути оцінені.

Процес відбору вимагатиме ретельної перевірки. Серед важливих запитань, на які немає відповіді, – хто обиратиме грантоотримувачів, як вирішуватимуться конфлікти інтересів, чи можуть дослідники публікувати несприятливі висновки без перевірки, який доступ до моделі спричинить за собою та чи фінансуватиме програма роботу, яка оцінює системи, відмінні від Claude. Заява Anthropic про незалежність має сенс, але джерело не описує договірні умови, що стоять за нею.

Отримані оцінки слід оцінювати на більш ніж контрольні бали. Слідкуйте за доказами того, що сценарії являють собою довгі розмови, що клінічні експерти беруть участь як у проектуванні, так і в перевірці, і що оцінювачі перевіряються на експертні оцінки. Також матиме значення, чи тести вимірюють шкоду, спричинену як надмірною відповідністю, так і надмірною відмовою, і чи є їхні методи відтворюваними та придатними для використання розробниками за межами Anthropic.

Нарешті, ширший вплив програми залежатиме від прийняття. Anthropic каже, що проекти будуть з відкритим вихідним кодом і доступні для будь-якого розробника, але в ньому не вказуються дослідники-учасники, заплановані контрольні показники, місця публікацій або механізми стандартизації в галузі. Поки ці деталі та результати не з’являться, оголошення встановлює зобов’язання щодо фінансування та програму оцінки, а не доказ того, що ризики добробуту штучного інтелекту були усунені.

Пов’язані посібники та вікторини

Етика ШІChatGPT і LLMПояснення моделей AIМайбутнє ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?