Назад към Новини
ИновацияAI Understanding брифинг

Документът съобщава, че агентите на LLM могат да намалят мисленето с 43%-65% с калибрирано отлагане

Ревизиран документ на arXiv предлага TSDS, рамка, която спира локалните разсъждения, когато дадено действие се стабилизира и изпраща несигурни действия към облачен модел. Авторите отчитат 43%-65% по-ниски изчисления на мислене за епизод при три от четири тествани задачи, като същевременно поддържат обявените гаранции за очакваното възнаграждение и скоростта на обаждане в облак.

5 min readRead the primary source
Primary-source image accompanying Paper reports edge LLM agents can cut thinking compute by 43%-65% with calibrated deferral
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2607.26865
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Изчислете
Ресурсите за обработка, необходими за обучение и изпълнение на модели, често измервани във FLOPS или GPU часове.
Perplexity
Показател на езиков модел, измерващ колко изненадан е моделът от истинските следващи токени.
Тествайте себе сиAI Агенти Викторина

Какво стана

Изследователите Amirmohammad Farzaneh и Osvaldo Simeone преработиха документ, описващ Think Short, Defer Smart или TSDS, рамка за управление на разсъждения и ескалация в крайно разгърнати LLM агенти.

Документът, преработен до версия 2 на 26 август, предлага TSDS за LLM агенти, работещи на ръба. Неговият централен дизайн съчетава два механизма. Лека сонда за конвергенция спира разсъжденията на устройството, когато предвиденото действие на агента се стабилизира. Отделно, базирано на объркване правило за отлагане изпраща действия към облачен модел, когато локалната несигурност е твърде висока. Целта е да се позволи на агента да помисли накратко, когато решението му се урежда, като същевременно се запази пътят към по-силни външни разсъждения, когато местната система е по-малко сигурна.

Авторите казват, че двата механизма са калибрирани съвместно върху траектории на пълни епизоди, като се използва многоцелева процедура „Научете след това тествайте“. Според източника тази процедура предоставя гаранции за ограничена извадка за очаквана награда за епизод и процент на обаждане. Документът сравнява TSDS с два самостоятелни подхода: единият е фокусиран само върху калибриране на мисълта, а другият е фокусиран само върху калибрирано отлагане. Източникът не предоставя основните нива на доверие, размери на извадката, идентичности на модели, хардуерни спецификации или подробни настройки за внедряване на целевата страница arXiv.

TSDS се оценява на четири задачи в стил ReAct, обхващащи различни форми на многоетапно поведение: аритметично разсъждение на GSM8K, многократно отговаряне на въпроси на HotpotQA, генериране на код на MBPP и многоетапно въплътено планиране в задача на домакински робот. Авторите съобщават, че TSDS намалява изчисленията за мислене на епизод с 43% до 65% по отношение на базовите линии само за отлагане в HotpotQA, MBPP и задачата на домакинския робот, като същевременно поддържа заявените гаранции за възнаграждение и облачни разговори. Източникът не дава сравнима цифра на намаление за GSM8K, така че този резултат не трябва да се извежда от общия диапазон.

Детайли за източника: arxiv.org ↗

Защо има значение

Работата е насочена към практическо напрежение в агентите на AI: местните разсъждения могат да намалят зависимостта от облачните системи, но трябва да останат надеждни, докато облачната ескалация може да увеличи използването на ресурси и оперативните разходи. Документът докладва метод, предназначен да управлява двете ограничения заедно.

Edge внедряването прави проблема с хартията пряко свързан с начина, по който работят AI агентите. Агент, който разсъждава локално, може да избегне изпращането на всяко междинно решение до облачна услуга, но локална система, която продължава да мисли ненужно, може да консумира ограничени изчислителни ресурси. Предложената сонда за конвергенция е насочена към тази неефективност, като спира, след като планираното действие се стабилизира. Правилото за отлагане адресира обратния риск, като ескалира несигурни действия, вместо да изисква всеки случай да се обработва на местно ниво.

Отчетеният принос не е просто по-кратък процес на разсъждение. TSDS се опитва да свърже изчислителния контрол с оценката на несигурността и резултатите на ниво епизод. Като калибрират механизмите заедно, авторите се стремят да запазят очакваното възнаграждение и да контролират скоростта на облачните повиквания, като същевременно намаляват изчисленията на местно мислене. Тази комбинация може да бъде полезна за агентни системи, които трябва да балансират отзивчивостта, наличните крайни ресурси и зависимостта от отдалечени модели. Доказателствата в статията обаче остават доклад от сравнителната оценка на авторите, а не независимо установен производствен резултат.

Оценката на домашния робот дава на изследването практическо измерение, тъй като източникът рамкира ReAct агентите като подходящи за физическия контрол на ИИ. Все пак докладваната гаранция е описана от гледна точка на очакваната награда за епизод и скорост на повикване в облак, а не обща гаранция за безопасност за физически действия. Източникът не казва, че TSDS е внедрен в реален дом, че е тестван срещу физически опасности или че предотвратява опасни действия. Следователно обществената му значимост се крие в потенциално полезна стратегия за контрол за управление на ресурсите на AI-агент, като силата на доказателствата е ограничена от информацията, налична в предпечатния запис.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Какво да гледате след това

Докладваните резултати са от arXiv preprint и четири настройки за сравнение. Ще са необходими независима репликация, по-пълни методологични подробности и доказателства от реални внедрявания, за да се определи колко широко се прилагат докладваните намаления на изчисленията и гаранции.

Репликацията трябва да изясни дали намалението от 43%-65% е стабилно при различни локални и облачни модели, хардуерни конфигурации, структури на подкани, дължини на епизоди и разпределения на задачи. Източникът назовава четири настройки за оценка, но не посочва колко епизода са използвани, кои модели на агенти са тествани, как са измерени изчисленията или как са избрани сондата за конвергенция и прагът на объркване. Тези подробности имат значение, защото метод, който се представя добре при един модел или конфигурация на бенчмарк, може да не се прехвърли директно към други периферни агенти.

Гаранциите на документа заслужават внимателно тълкуване. Източникът казва, че процедурата Learn-Then-Test предоставя гаранции за ограничена извадка за очакваната награда за епизод и процент на обаждане в облак. Той не уточнява числените нива на достоверност или толерантност на целевата страница и не претендира за гаранция за всяко отделно решение, всяка траектория или безопасност във физическия свят. Последващата работа трябва да тества дали отлагането, съобразено с несигурността, разпознава случаи, при които локално стабилно действие все пак е погрешно, особено когато разсъжденията на агента се сближават бързо с подвеждащи доказателства.

Оперативните компромиси също не са решени. Облачната ескалация може да доведе до забавяне, зависимост от свързаността, въпроси относно управлението на данни или разходи, които не са количествено определени в източника. Резюмето на доклада съобщава за намалени изчисления за мислене и контролирани скорости на повиквания в облак, но не и за абсолютно забавяне, потребление на енергия, финансови разходи или въздействие върху поверителността. Източникът също така не идентифицира публична версия на софтуер или производствено внедряване. Тези измервания и подробности за внедряването ще определят дали TSDS е готов за практически гранични системи или остава предимно изследователско предложение на етап от сравнението.

Читателите трябва също така да разграничават докладвания резултат от бенчмарка на хартията от по-широките заключения относно крайните агенти. Описаната оценка се отнася до четири именувани настройки на задачи в стил ReAct и отчетеното намаление се отнася за три от тях. Посочените гаранции се отнасят до очаквана награда за епизод и процент на обаждане в облак. Поради това въпросите относно прехвърлянето, безопасността, забавянето, енергията, разходите, поверителността и внедряването остават отворени в рамките на изходния запис.

Свързани ръководства и викторини

AI агентиОбяснени модели на AIAI обучениеБъдещето на ИИТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?