Назад към Новини
ИновацияAI Understanding брифинг

Preprint предлага непрекъснати оценки на трудност, за да се намалят разходите за самосъгласуваност на LLM

Нов предпечат на arXiv предлага гъвкава самосъгласуваност, метод, който оценява колко несигурен е даден езиков модел по отношение на даден въпрос и коригира броя на избраните пътища за разсъждение. Авторите отчитат икономии на жетони до 76%, като същевременно поддържат точност, сравнима със стандартната самосъгласуваност в различни...

5 min readRead the primary source
Primary-source image accompanying Preprint proposes continuous difficulty estimates to reduce LLM self-consistency costs
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.24590
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Класификация
Задача, при която модел присвоява вход към една или повече предварително дефинирани категории.
Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Тествайте себе сиТест за обяснение на AI модели

Какво стана

Изследователите предлагат гъвкава самосъгласуваност, или FSC, метод за декодиране на големи езикови модели, който използва непрекъсната оценка на трудността на проблема, за да реши колко пътища за разсъждение да генерира. Документът казва, че FSC може да спести до 76% от токените, като същевременно поддържа точност, сравнима със стандартната самосъгласуваност.

Документът arXiv, представен на 25 август 2026 г., се занимава с потреблението на токени на самосъгласуваност, стратегия за декодиране на големи езикови модели. В подхода, описан от авторите, моделът генерира множество различни пътища за разсъждение за един и същ въпрос и избира отговора, който изглежда най-последователен в тези пътища. Документът представя това като полезно за сложни проблеми с разсъжденията, но идентифицира повторното генериране като основно изчислително ограничение. Това рамкиране запазва фокуса на статията върху изчисляването на времето за извод и върху броя на генерираните пътища, използвани за всеки отделен въпрос.

Авторите казват, че по-ранните методи за ефективност често разпределят ресурси, използвайки малък брой фиксирани категории на трудност. Техният централен аргумент е, че трудността на разсъжденията варира непрекъснато, така че една двоична или многостепенна класификация може да разпредели твърде много пътища за някои въпроси и твърде малко за други. FSC е проектиран да отговори на тази вариация, като променя своя бюджет за вземане на проби по-гъвкаво от един вход към следващия.

FSC използва предварително обучена сонда, за да предвиди изходната ентропия на входен въпрос. Хартията третира тази прогнозирана ентропия като индикатор за несигурност на модела и я използва, за да определи колко разсъждаващи пътища да се вземат проби. От практическа гледна точка, предложеният метод има за цел да изразходва повече усилия за вземане на проби по въпроси, при които моделът изглежда по-малко сигурен, и по-малко усилия, когато неговата прогнозирана несигурност е по-ниска.

Според резюмето, експерименти в различни модели и бенчмаркове установиха, че FSC поддържа точност, сравнима със стандартната самосъгласуваност, като същевременно постига символични спестявания до 76%. Източникът не предоставя имената на моделите или бенчмарковете, данните за пълна точност, разпределението на спестяванията или условията, при които е наблюдавано максималното спестяване. Това са съществени подробности за оценка на резултата.

Детайли за източника: arxiv.org ↗

Защо има значение

Стандартната самосъгласуваност може да подобри отговорите чрез вземане на проби от множество разсъждаващи пътища, но използва значително повече токени. Ако докладваните резултати се обобщават извън експериментите в статията, разпределянето на повече изчисления само когато моделът изглежда несигурен може да направи тази стратегия за разсъждение по-ефективна.

Документът е насочен към конкретна неефективност в широко обсъждан начин за подобряване на разсъжденията на езиковия модел: генериране на няколко кандидат-пътеки за всеки проблем, независимо колко труден изглежда входът. Метод, който може да прави разлика между въпроси, които се нуждаят от обширна извадка, и въпроси, които се нуждаят от по-малко, може да намали ненужното генериране, като същевременно запази ползата от сравняването на множество пътища.

Отчетеният резултат е потенциално последователен, тъй като се отнася до количеството генериран текст, необходимо за стратегия за разсъждение, а не само до малка промяна в резултата за оценка. Резюмето твърди спестявания до 76%, въпреки че тази цифра е докладван от автора експериментален резултат от предпечат и не трябва да се третира като независимо установена гаранция за изпълнение.

FSC също така илюстрира по-широк избор на дизайн в системите с езикови модели: дали да се използва един и същ бюджет за изводи за всяка заявка или да се адаптира изчислението към изчислената несигурност. Ако методът работи надеждно, адаптивното разпределение може да помогне на системните дизайнери да балансират качеството на отговора и изчислителната ефективност. Източникът не установява ефекти върху латентността, финансовите разходи, потреблението на енергия или наличността, обърната към потребителя, така че тези последици остават по-скоро условни, отколкото демонстрирани.

Предложението може да бъде особено уместно, когато пътищата на разсъждение са дълги или когато вече се генерират множество извадки. В същото време оценката на несигурността сама по себе си може да бъде несъвършена. Един модел може да е уверен по труден въпрос или несигурен по лесен, а резюмето не показва как се справя FSC в тези случаи. Следователно претендираната сравнима точност трябва да се тълкува в рамките на конкретните експерименти, докладвани в пълния документ.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Източникът е новоизпратен предпечат и неговото резюме не идентифицира тестваните модели, бенчмаркове, процедура за обучение на сонда или подробни резултати от сравнение. Необходими са независима репликация и проверка на цялата хартия, за да се определи колко последователни са отчетените спестявания и дали точността остава стабилна при различните задачи.

Първият приоритет е да се изследва пълната експериментална настройка. Резюмето не идентифицира езиковите модели, типовете задачи, бенчмарковете, настройките за вземане на проби или базовите конфигурации, използвани при сравнението със стандартна самосъгласуваност. Без тези подробности не е възможно да се каже дали резултатът се прилага широко или е концентриран в определен набор от задачи за разсъждение.

Предварително обучената сонда е друга важна неизвестна. Източникът казва, че прогнозира изходящата ентропия, но не обяснява как е бил обучен, какви данни е използвал, колко допълнителни изчисления изисква или дали се обобщава за модели и задачи извън условията за обучение. Тези фактори ще определят дали символичните спестявания от адаптивното вземане на проби надвишават разходите за изготвяне на оценка на трудността.

Независимото репликиране трябва да тества повече от най-доброто отчетено спестяване. Полезните последващи резултати биха включвали средни спестявания на жетони, точност при фиксирани бюджети, ефективност по въпроси с подвеждащи сигнали за несигурност и резултати в различни семейства модели и типове бенчмаркове. Фразата на резюмето „до 76%“ описва максимален, а не непременно типичен резултат.

И накрая, читателите трябва да следят за доказателства от внедряване или по-широка оценка. Източникът установява новоподадено предложение за изследване и докладва експериментални констатации, но не установява производствена наличност, приемане от доставчик на модел или подобрения в приложение в реалния свят. Докато не се отговори на тези въпроси, FSC се разбира най-добре като потенциално полезна техника за ефективност на извода, която остава обект на валидиране.

Свързани ръководства и викторини

Обяснени модели на AIAI обучениеТрансформърсТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?