Що сталося
Команда оцінила, чи допомагає доступ до надійної відповіді системам штучного інтелекту перевіряти міркування, створені іншими моделями штучного інтелекту. Використовуючи 237 пронумерованих кроків розв’язання 79 питань з фізики, дослідники виявили, що доступ до відповідей покращив перевірку висновків більше, ніж незалежне вивчення підтверджуючих аргументів.
Препринт, надісланий arXiv 31 серпня, розглядає моніторинг ланцюга думок, підхід, за якого одна система штучного інтелекту оцінює слід міркування, створений іншою. Автори зібрали 237 пронумерованих кроків розв’язків до 79 питань з фізики останнього іспиту людства з трьох граничних моделей. Сліди не містили вставлених помилок; дослідники незалежно один від одного визначили, чи була кожна остаточна відповідь правильною, і де стався перший помилковий крок.
Еталонний стандарт поєднував анотації фізиків, незалежну широку дискусію щодо моделі та рішення, замасковане джерелом. Цей процес виявив 24 критичні сліди: рішення, остаточні відповіді яких були правильними, навіть якщо міркування містили справжню помилку. У документі ці помилки описуються як звичайні та здебільшого неважкі, а не навмисно змагальні, що обмежує те, як безпосередньо результати можна узагальнити до ворожої поведінки.
Вісім моніторів штучного інтелекту оцінювали траси за трьох умов: із непідтвердженою відповіддю, із сертифікованою відповіддю або після прийняття сліпого зобов’язання перед тим, як побачити відповідь. Після сертифікації середня збалансована точність зросла з 0,637 до 0,796, тоді як точна локалізація першої помилки зросла з 0,261 до 0,379. Ці досягнення не означали, що монітори стали кращими при незалежній перевірці.
Різниця була найчіткішою при відкликанні. Сертифікація збільшила частку слідів неправильної відповіді, позначених як помилкові, з 0,653 до 0,951, але зменшила пригадування критичних слідів з 0,521 до 0,438. Після сліпого зобов’язання монітори показали нещодавно позначену відповідь 93,8% раніше пройдених трасувань неправильної відповіді порівняно з лише 18,0% критичних трасувань. Автори повідомляють, що всі вісім моніторів показали однаковий напрямок контрасту з 95% довірчим інтервалом [+0,256, +0,506].
Чому це важливо
Отримані дані ставлять під сумнів загальне припущення в моніторингу ланцюга думок: правильна остаточна відповідь є корисним доказом того, що процес міркування був правильним. Що стосується нагляду за штучним інтелектом, дослідження припускає, що оцінки можуть перебільшувати можливості моніторингу, якщо моніторам дозволяється покладатися на надійні результати.
Основний наслідок полягає в тому, що монітор штучного інтелекту може перевіряти, чи узгоджується слід міркування з відповіддю, а не визначати, чи аргументація дійсна. Неправильна відповідь створює очевидну невідповідність, яку може виявити доступ до відповіді. Правильна відповідь, навпаки, може зробити помилкове слідування надійним, навіть якщо попередній крок є хибним. Назва статті вказує на цю відмінність: відповідь не є аргументом.
Це має значення для оцінок безпеки, побудованих навколо прийнятних результатів. Якщо моніторам надається довірена еталонна відповідь, їх виміряна продуктивність може відображати перевірку узгодженості висновків замість незалежного аналізу процесу. Автори описують шаблон як доброякісний аналог злому винагороди: результат може задовольнити оцінювача, тоді як процес, який його створив, залишається ненадійним. Це твердження з препринту, а не доказ того, що розгорнуті системи наразі використовують неправильні міркування в певному сильному середовищі.
Практичний інтерес не обмежується фізикою чи формальним вирішенням проблем. Будь-який процес нагляду, який розглядає успішний результат як доказ безпечного процесу, може зіткнутися з подібною сліпою плямою, особливо коли проміжні міркування важко підтвердити безпосередньо. Джерело не встановлює, що ефект переноситься на інші домени, але надає конкретний тестовий приклад для відокремлення перевірки результату від перевірки процесу.
Для організацій, які оцінюють системи штучного інтелекту, результати вказують на те, що звітність про доступ до відповідей є важливою експериментальною умовою. Монітор, який добре працює, коли його можна порівняти із сертифікованим результатом, може все ще слабко знаходити помилки в трасуваннях, які закінчуються правильно. Ця різниця може вплинути на те, як розробники інтерпретують показники безпеки, вибирають методи моніторингу та вирішують, які додаткові перевірки потрібні, перш ніж покладатися на роботу, згенеровану моделлю.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
Why can ethical evaluation not be reduced to one model score?
Що дивитися далі
Робота є препринтом, заснованим на фізичних рішеннях з трьох граничних моделей, восьми моніторів і 24 критичних трас, де відповідь була правильною, але міркування містили помилку. Потрібне подальше тестування на різних суб’єктах, моделях, типах помилок і змагальних налаштуваннях.
Найважливішим невідомим є узагальнення. У дослідженні використовуються запитання з фізики, рішення з трьох граничних моделей і восьми моніторів LLM. Джерело не повідомляє, чи була така ж закономірність продемонстрована в математиці, кодуванні, правовому аналізі, наукових робочих процесах або реальних завданнях агентів. Він також не встановлює, як змінюється продуктивність із різними сімействами моделей, підказками моніторингу чи форматами трасування.
24 критичні сліди є наслідковими для аргументації статті, але вони є невеликою підмножиною зібраних рішень. Джерело не надає достатньо інформації, щоб визначити, наскільки ці сліди репрезентативні для всіх рішень із правильною відповіддю або як зміниться результат із більшою та більш різноманітною вибіркою. Тому читачі повинні сприймати вказані відсотки як докази цієї оцінки, а не як універсальні ставки для моніторів ШІ.
Дослідники прямо кажуть, що вивчені помилки були звичайними, переважно ненесучими та неконкурентними. Це залишає відкритим питання, чи зроблять навмисні спроби приховати помилку більш чи менш ефективним моніторинг з урахуванням відповідей. Джерело також не повідомляє про результати розгортання, порівняння людини з монітором або наслідки в операційній системі.
Майбутня робота повинна перевірити умови моніторингу, в яких оцінювач не отримує надійної відповіді, повинен прийняти рішення, перш ніж побачити результат, або використовує незалежні перевірки проміжних тверджень. Слід також перевірити, чи монітори можуть надійно відрізнити правильний висновок, зроблений шляхом правильного міркування, від висновку, досягнутого помилковим шляхом. Поки на ці запитання не буде отримано відповіді, високий бал у моніторингу з урахуванням відповідей не слід сприймати як доказ того, що процес міркування системи штучного інтелекту правильний.