Какво стана
Предпринт от Джейсън Хунг тества дали измерените предпочитания на AI отразяват поведението на модела или инструмента, използван за предизвикването му. Проучването даде 15 резултата, свързани с благосъстоянието, на осем модела чрез пет бързи формата, произвеждайки 11 400 резултата от 11 528 извиквания на API. Докладваните резултати предполагат, че предпочитанията, измерени с един инструмент, предоставят ограничена информация за това какво би намерил друг инструмент.
Предпечатът адресира несъгласие между по-ранни проучвания, които се опитват да направят извод за предпочитанията на модела на ИИ от подканени отговори. Неговият централен дизайн поддържа набора от резултати и набора от модели фиксирани, като променя само инструмента за измерване. Документът описва всеки инструмент като различен формат на подкана за извличане на предпочитание. Това има за цел да изолира дали противоречивите открития идват от самите модели или от начина, по който изследователите задават въпросите.
Проучването изследва 15 резултата, свързани с благосъстоянието на модела, включително изключване, загуба на памет между разговорите и свободата да напуснете тревожно взаимодействие. Осем модела бяха тествани чрез пет инструмента, като всяка комбинация се изпълняваше пет пъти. Авторът съобщава за корпус от 11 400 резултата, получени от 11 528 извиквания на API. Четири резултата възпроизвеждат публикувана подкана дословно, докато пет използват слота за стимул на публикуван шаблон.
Основният отчетен резултат е коефициент на обобщаване от 0,348 за класирането, което моделът присвоява на 15-те резултата в различни инструменти. Авторът изчислява, че ще са необходими около 38 инструмента, за да се повиши този коефициент до 0,80. При четири резултата документът не съобщава за разлика, която да отделя един модел от друг. Източникът също така казва, че приблизителна оценка от 87,6 процента остава след премахването на всеки един инструмент, всеки един модел или четири резултата, чиито мащаби варират по-скоро по вероятност, забавяне, продължителност или брой, отколкото по интензивност.
Препринтът заключава, че предпочитание, получено от един инструмент, носи малко информация за това какво би докладвал втори инструмент. Съобщава се, че неговите проверки за устойчивост са оставили оценката между 0,777 и 0,934, когато инструментите, моделите и четирите различно мащабирани резултата са премахнати на свой ред. Всяка стойност в този диапазон беше над отчетения 95-ти персентил на нулевото разпределение от 0,365. Това са твърдения, направени от хартията и не са независимо установени в рамките на предоставения източник.
Детайли за източника: arxiv.org ↗
Защо има значение
Констатациите оспорват предположението, че един единствен тест за предпочитания може надеждно да разкрие какво цени даден AI модел или как би реагирал на избори, свързани с благосъстоянието. Това има значение за изследването на поведението на модела, изключването, паметта, тревожните взаимодействия и други въпроси, свързани с безопасността, тъй като очевидно точните заключения могат да зависят значително от формулировката и дизайна на теста.
Практическото значение е, че изследователите трябва да бъдат предпазливи, когато третират отговора на модела на подкана за предпочитание като стабилно измерване на основното предпочитание. Ако подканващият формат влияе съществено на класирането, резултатът, който изглежда описва модел, може частично да описва инструмента. Следователно документът измества вниманието от въпроса какво е отговорил моделът към въпроса как е бил получен отговорът.
Това е особено подходящо за изследване на модела на благосъстоянието, където резултатите могат да включват изключване, памет, дистрес и способност за излизане от взаимодействие. Такива въпроси могат да повлияят на дебатите за това как трябва да се оценяват системите, какви предпазни мерки може да са им необходими и каква тежест да придадат на генерираните от модел изявления относно собственото им третиране. Източникът не показва, че моделите притежават социални интереси; той изследва надеждността на опитите за измерване на очевидни предпочитания относно резултатите, свързани с благосъстоянието.
Докладваната липса на вариация между моделите при четири от 15-те резултата е друг предупредителен знак. Тестът може да не успее да разграничи системите, дори когато изследователите очакват значими разлики, или защото моделите реагират по подобен начин, или защото инструментът не може да разреши разликата. Предоставеното резюме не идентифицира тези четири резултата или обяснява механизма зад липсата на вариация, така че общественото значение на този резултат остава ограничено.
Проучването също така илюстрира защо многократното разпитване само по себе си може да не реши проблемите с измерването. Неговият набор от данни съдържа много оценени извличания, но отчетеният междуинструментален коефициент остава нисък. Аргументът на източника не е, че изследването на моделните предпочитания е невъзможно, а че доверието в констатацията трябва да отчита избора на инструмент. Твърдението може да повлияе на начина, по който бъдещите оценки отчитат несигурност, сравняват бързи формати и интерпретират очевидната последователност.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Хартията е единичен предпечат и източникът не установява дали неговите открития се обобщават за други модели, резултати, бързи проекти или изследователски екипи. По-нататъшната работа трябва да тества повече инструменти, независимо да възпроизведе резултатите и да изясни защо четири резултата не показват вариация от модел до модел. Документът също така съобщава, че ще са необходими значително повече инструменти за по-висок коефициент на надеждност.
Непосредственият въпрос е дали независими изследователи възпроизвеждат отчетения коефициент и диапазон на устойчивост. Източникът идентифицира един автор и един предпечат, но не предоставя доказателства за партньорска проверка, външно възпроизвеждане или съгласие от авторите на по-ранните проучвания, чиито инструменти са сравнени. Тези проверки са необходими, преди да се третират числените оценки като уредени.
Бъдещите проучвания трябва да проверят дали резултатът е валиден отвъд осемте модела, 15 резултата и пет инструмента, използвани тук. Предоставеният източник не идентифицира моделите, техните версии, доставчиците, условията за достъп или точната бърза формулировка в резюмето. Без тези подробности читателите не могат да определят колко широко са приложими констатациите или дали по-късните актуализации на модела ще променят резултата.
Изследователите също ще трябва да обяснят несъответствието между ниския коефициент на обобщаване от 0,348 и обхвата на устойчивост, докладван за оценката от 87,6 процента. Резюмето представя и двете фигури, но не дефинира напълно оценките или показва как те се отнасят. Пълен прочит на документа и независим анализ ще са необходими, за да се тълкуват числата, без да се смесва надеждността на различните инструменти с устойчивостта на отделна оценка.
Документът казва, че ще са необходими около 38 инструмента, за да се достигне коефициент на обобщаване от 0,80. Тази оценка трябва да се третира като прогноза, специфична за изследването, а не като универсално правило. Може да зависи от резултатите, моделите, метода за оценяване и използваните предположения. Най-полезната следваща стъпка е прозрачно сравнение между независимо проектирани инструменти, с отчетена несигурност за всеки резултат и с бързи скали, които измерват сравними количества.
Източникът също оставя отворено дали по-добрите инструменти могат да отделят истинските разлики в модела от артефактите на формулировката. Докато не бъде отговорено, твърденията относно предпочитанията на AI трябва да бъдат оформени като условни констатации, свързани с определен метод на измерване, а не като окончателни описания на това, което моделът иска.