Назад към Новини
ИновацияAI Understanding брифинг

Preprint сравнява как големите езикови модели извеждат убежденията на опонентите в икономическите игри

Нов препринт съобщава, че големите езикови модели показват измерими признаци на ментализация в две икономически игри, но тяхното представяне и стратегии се различават в зависимост от фамилията и размера на модела. Авторите казват, че агентите GPT-5 са се адаптирали към все по-сложни опоненти и са превъзхождали групата за сравнение при хора в...

5 min readRead the primary source
Primary-source image accompanying Preprint compares how large language models infer opponents’ beliefs in economic games
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.26291
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Калибриране
Колко добре резултатите за увереност на модела съвпадат с реалните вероятности за коректност.
Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
подкана
Инструкциите за въвеждане и контекстът, предоставени на генериращ модел.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователите оцениха дали големите езикови модели могат да използват информация за вярванията и намеренията на други играчи, за да ръководят решенията. Те тестваха 2099 индивидуални агенти от четири фамилии модели – DeepSeek, GPT-4.1, GPT-5 и Gemini 2.0 Flash – в две икономически игри срещу противници с различни нива на сложност, след което сравниха резултатите с 251 човешки участници.

Препринтът, изпратен до arXiv на 26 август, разглежда ментализацията, която авторите определят като извеждане на вярванията и намеренията на други хора, за да ръководят собствените си избори. Изследователският въпрос е по-тесен от това дали моделите притежават човешко съзнание или субективно разбиране: той пита дали техните решения показват поведенчески и изчислителни подписи, съответстващи на използването на представяния на умствените състояния на други агенти.

Изследователите са използвали две икономически игри и когнитивно изчислително моделиране, за да проучат латентните стратегии зад моделните решения. Те тестваха отделни агенти от четири моделни фамилии – DeepSeek, GPT-4.1, GPT-5 и Gemini 2.0 Flash – срещу опоненти, описани в резюмето като имащи различна сложност. Общата моделна извадка беше 2099 агента. Отделно сравнение включва 251 човешки участници.

Проучването също така оценява стратегия за подсказване, предназначена да предизвика по-умишлени стратегически разсъждения. Според резюмето стратегическото подсказване като цяло подобрява производителността, въпреки че размерът на ползата се различава между двете игри. Следователно авторите съобщават за ефект както върху резултатите, така и върху изведената стратегия за разсъждение, вместо еднообразно подобрение във всички настройки.

Най-ясният резултат, специфичен за модела, се отнася до GPT-5. Авторите казват, че агентите на GPT-5 гъвкаво коригират рекурсивната дълбочина на своите разсъждения, тъй като опонентите стават по-сложни и постигат по-добра производителност от човешките участници в тези игри. Резюмето не посочва числените резултати, границата на разликата, идентичностите или версиите на тестваните системи извън изброените етикети или как са били наети и инструктирани човешките участници.

Детайли за източника: arxiv.org ↗

Защо има значение

Проучването разглежда централен въпрос относно системите за изкуствен интелект, които взаимодействат с хората: дали поведение, което прилича на представяне на теорията на ума, може да подкрепи адаптивна стратегия. Резултатите от него предполагат, че моделите могат да показват различни, измерими форми на ментализация, като същевременно показват защо очевидно подобни езикови модели не трябва да се третират като когнитивно взаимозаменяеми.

Ментализацията е от значение за AI системите, които трябва да реагират на хора, конкуренти или други софтуерни агенти. Система, която може да оцени това, което друга страна знае, вярва или възнамерява, може да вземе различни решения от тази, която отговаря само на повърхностни модели в текста. Приносът на изследването е да рамкира тази способност като нещо, което може да бъде измерено чрез избори и изчислителни модели, а не само чрез разговорни отговори на въпроси, свързани с теорията на ума.

Докладваните разлики между доставчиците на модели и размерите са важни, защото оспорват идеята, че силен резултат от един тест за социално разсъждение описва всички големи езикови модели. В резюмето се казва, че системите са показали „ясни поведенчески и изчислителни сигнатури“ на ментализиране, но че тези сигнатури се различават значително при различните доставчици и размери на модела. При практическа оценка това сочи към тестване на специфични модели при специфични условия на взаимодействие, вместо да разчита на един общ етикет за интелигентност.

Подсказващият резултат има по-ограничено, но полезно значение. Искането на модел да участва в стратегически разсъждения може да подобри поведението му в някои настройки, но неравномерните ефекти в двете игри показват, че подканата не е универсално надграждане на способностите. Повишаването на производителността може да зависи от задачата, противника и начина, по който се извлича разсъждението на модела. Източникът не установява, че вътрешните процеси на моделите са станали по-човешки; той отчита промени в поведението и изчислена стратегия.

Докладваният резултат от GPT-5 може да има значение за изследване на преговорите, координацията и многоагентните системи, но не трябва да се чете като доказателство, че GPT-5 като цяло е по-добър от хората в социалните разсъждения. Сравнението беше ограничено до две икономически игри и източникът не дава доказателства за ежедневни взаимоотношения, решения с високи залози, измама, културни различия или взаимодействие в реалния свят. Нито установява, че успехът в тези игри се прехвърля към безопасно или надеждно поведение извън проучването.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Хартията е предпечат на arXiv и страницата източник предоставя резюме, а не резултатите на ниво задача, статистическа несигурност, подкани или пълни методологични подробности, необходими за по-близка оценка на констатациите. Последващата работа трябва да тества дали докладваните стратегии се обобщават отвъд контролираните игри и дали отразяват солидни разсъждения, а не научени модели, които отговарят на определени показатели.

Най-непосредственият въпрос е дали пълният документ предоставя достатъчно методологични подробности за оценка на сравнението. Важната липсваща информация от източника включва правилата на игрите, нивата на сложност, присвоени на опонентите, точните подкани, броя на изпитанията на агент, настройките за вземане на проби от модела, процедурите за точкуване и оценките на несигурността. Тези подробности определят дали резултатът е стабилен или чувствителен към дизайна на бенчмарка.

Репликацията в независими оценки на модела би помогнала да се провери дали констатациите продължават да съществуват при актуализации на модела и различни условия за достъп. Източникът идентифицира GPT-4.1, GPT-5 и Gemini 2.0 Flash, но не посочва настройки за внедряване, системни инструкции или дати на достъп. Тъй като поведението на модела може да се промени с подкани, вземане на проби и конфигурация на продукта, по-късните проучвания трябва да документират тези променливи и да използват предварително регистрирани протоколи за оценка, когато е възможно.

Изследователите трябва също така да проучат дали изведеното рекурсивно разсъждение предвижда поведение при непознати задачи. Един модел може да се представи добре в игра, тъй като неговите данни за обучение или структура на подсказки поддържат позната стратегия, без да притежава широко преносимо представяне на други умове. Полезните разширения биха включвали нови игри, смесени групи от човешки модели, опоненти, които се държат непредвидимо, и настройки, при които социалните сигнали са непълни или подвеждащи.

Практическата граница остава несигурна. Този предварителен печат не тества внедрен продукт, не препоръчва използването на AI система при последващи решения или измерване на вредите. Преди да приложат такива констатации към преговори, образование, подкрепа за психично здраве или други употреби, насочени към човека, оценителите ще се нуждаят от доказателства за надеждност, калибриране, справедливост сред популациите, устойчивост на манипулация и режими на неуспех, когато предположенията на модела за друго лице са погрешни.

Свързани ръководства и викторини

Обяснени модели на AIChatGPT и LLMЕтика на ИИБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?