Назад към Новини
ИновацияAI Understanding брифинг

Preprint предлага Bayesian начин за LLM агентите да разпознаят, когато имат нужда от по-сериозна помощ

Нов предпечат изучава агенти, които могат да прехвърлят контрола към по-силен езиков модел по време на разсъждение, комбинирайки байесово правило за спиране с теоретични гаранции и ограничено валидиране на Qwen2.5-Coder.

5 min readRead the primary source
Source-page capture accompanying Preprint proposes a Bayesian way for LLM agents to recognize when they need stronger help
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.24087
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Калибриране
Колко добре резултатите за увереност на модела съвпадат с реалните вероятности за коректност.
Извод
Фазата на изпълнение, при която обучен модел генерира прогнози или резултати.
Тествайте себе сиAI Агенти Викторина

Какво стана

Препечатка, изпратена до arXiv на 25 август, предлага „самоескалиране“ за йерархични LLM агенти: агент оценява вероятността да реши задача, докато все още разсъждава и предава контрола на по-силен модел, когато очакваната полза оправдава разходите. Хартията контрастира това с маршрутизирането преди генериране и проверката след приключване на отговора.

Документът разглежда специфичен проблем в йерархичните LLM агенти: решаване не само кой модел трябва да се справи със задачата, но и кога по-слабият модел трябва да спре и да помоли по-силен модел за помощ. Предложеният от него режим работи по време на генериране. Агент формира онлайн оценка на евентуалната си вероятност за успех и може да ескалира, преди да завърши отговор, когато тази оценка падне под чувствителен към разходите праг. Това е основният технически принос, описан от източника.

Авторите формулират решението като байесов проблем за оптимално спиране. Оценката на компетентността е научен постериор, чиято достатъчна статистика идва от маркирани траектории, а не само от сурова изходна ентропия. Документът извлича праг на късогледа ескалация в затворена форма и използва динамично програмиране, за да характеризира оптималната политика. Докладва доказателство, че политиката е променяща се във времето прагова политика, без да налага предположение за формата на необработения сигнал.

Източникът съобщава няколко теоретични резултата. В него се казва, че убеждението на оракула се разделя експоненциално при скоростта на информацията на Черноф на сигнала, че съжалението се управлява от последващо калибриране и че политика на приставка, обучена с n етикетирани траектории на калибриране, съжалението намалява със скорост 1/sqrt(n). Съобщава се, че контролирано симулационно проучване потвърждава прогнозите на теорията, включително този процент. Документът също така включва валидиране на реален модел с помощта на Qwen2.5-Coder 1.5B-to-7B каскада на 257 MBPP кодиращи задачи. Това валидиране потвърди две от трите предварително регистрирани прогнози: границата на ескалация превъзхожда post-hoc маршрутизирането при еднаква цена и убеждението за кумулативна компетентност става по-разграничително в хода на генерирането. Източникът не идентифицира третото предсказание или обяснява в резюмето защо не е потвърдено.

Детайли за източника: arxiv.org ↗

Защо има значение

Ако подходът се обобщи, това може да даде на агентните системи по-навременен начин за балансиране на капацитета, латентността и разходите за използване на модела. Доказателствата са все още ранни: тестът за реален модел на хартията използва Qwen2.5-Coder 1.5B-to-7B каскада на 257 MBPP задачи и потвърди две от трите предварително регистрирани прогнози.

Практическият проблем е разпределението на ресурсите вътре в AI агент. Система, която винаги използва по-силен модел, може да подобри възможностите, но да консумира повече ресурси за изводи. Система, която се ангажира с по-слаб модел, докато не завърши, може да загуби време или да доведе до избегнат отказ. Самоескалацията се опитва да постави решението в процеса на разсъждение, като дава възможност на системата да спре, когато нейните собствени доказателства показват, че е малко вероятно продължаването да се изплати.

Акцентът в документа върху калибрирането е важен, тъй като ескалацията зависи от качеството на оценката на компетентността. Сигнал за доверие, който е лошо калибриран, може да накара агент да ескалира твърде често, увеличавайки разходите, или твърде рядко, позволявайки преминаването на слаби отговори. Отчетената гаранция за съжаление свързва производителността с това калибриране, вместо да представя ескалацията като универсално надеждно свойство на езиковите модели.

Сравнението с равни разходи при валидирането на реален модел е потенциално полезно, защото е насочено към конкретен компромис при внедряване, вместо да сравнява системи с неограничени допълнителни извиквания на модела. Отчетената оценка обаче е тясна. Той покрива едно семейство модели, една малка до средна каскадна конфигурация, както е описано в източника, и 257 MBPP задачи. Резюмето не предоставя абсолютните проценти на успех, точното отчитане на разходите, размера на печалбите или доказателства от некодиращи задачи. Следователно подкрепя интереса към метода, а не заключение, че йерархичните агенти обикновено знаят кога да потърсят помощ.

Резултатът също отговаря на по-широка промяна в дизайна на агента към динамично изчисление: системите може да се наложи да решат колко капацитет за разсъждение, проверка или модел да изразходват за всяка задача. Този документ предоставя официална рамка за една версия на това решение. Неговата обществена стойност ще зависи от това дали рамката може да бъде приложена с надежден мониторинг и дали добавените данни за калибриране, разходите за вземане на решения и сложността на прехвърлянето са оправдани от по-добри резултати.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Какво да гледате след това

Ключовият въпрос е дали оценката на научената компетентност остава калибрирана в модели, задачи и среди извън контролираната настройка на хартията. Независимото репликиране трябва да тества по-големи и по-разнообразни работни натоварвания, непотвърдени прогнози, грешки при ескалация и практическите разходи за прехвърляне на контрол по време на генериране.

Репликацията трябва да установи дали докладваното предимство пред post-hoc маршрутизирането оцелява извън MBPP и извън каскадата Qwen2.5-Coder 1.5B-to-7B. Полезни тестове ще променят трудността на задачите, двойките модели, домейните и относителната цена или латентността на ескалацията. Самият източник не съобщава за тези тестове, така че липсата им е значимо неизвестно, а не доказателство за неуспех.

Особено внимание заслужава непотвърдената предварително регистрирана прогноза. Резюмето казва, че две от трите прогнози са потвърдени, но не посочва оставащата прогноза или не описва резултата. Читателите трябва да потърсят пълния документ, издаден код и данни или последваща работа, която изяснява какво е тествано, защо прогнозата е неуспешна и дали неуспехът сочи ограничение в теорията, сигнала или изпълнението.

Бъдещите оценки трябва да измерват вредните форми на грешно калибриране, а не само средния успех на задачата. Един агент може да ескалира ненужно при лесни задачи, да не успее да ескалира при трудни задачи или да прехвърли контрола твърде късно, за да може по-силният модел да помогне. Източникът създава рамка за съжаление, но абстрактно не определя количествено тези типове оперативни грешки или показва как методът се държи при промяна на разпределението.

Документът изброява код и данни, свързани с работата, което може да направи възможна независима проверка, но източникът не предоставя връзките или описва съдържанието на изданието. Проверката трябва да изследва процедурата за калибриране, етикетираните траектории, модела на разходите, предварителната регистрация, настройката на симулацията и статистическата несигурност около валидирането на 257 задачи. Дотогава най-силното подкрепено заключение е, че предпечатът предлага формален, тестван подход към ескалация от средното поколение с обещаващи, но ограничени емпирични доказателства.

Свързани ръководства и викторини

AI агентиОбяснени модели на AIAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?