Назад към Новини
ИновацияAI Understanding брифинг

Хартията аргументира еволюционните стратегии, които надминават RL при поддържането на различни набори от отговори на LLM

Нов препринт на arXiv твърди, че LLM след обучение със стратегии за еволюция – базиран на населението метод без градиенти, който директно смущава теглата – побеждава обучението с подсилване на pass@k и покритието на решението. Резюмето цитира по-добри резултати от математически бенчмаркове, но не назовава модели, бенчмаркове или числа.

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.12679
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Изкуствен интелект (AI)
Широкото поле за изграждане на системи, които изпълняват задачи, изискващи разпознаване на модели, разсъждения, език или вземане на решения.
Обучение с подсилване
Обучение чрез сигнали за възнаграждение, при което агент научава действия, които максимизират дългосрочната възвръщаемост.
Тествайте себе сиВикторина за обучение по изкуствен интелект

Какво стана

Седем изследователи публикуваха препринт в arXiv, като твърдят, че обучението с подсилване след обучението срива разнообразието от отговорите на езиковия модел и че еволюционните стратегии – оптимизиране директно в тегловното пространство чрез произволни смущения – запазват това разнообразие и повишават pass@k. Документът е изпратен на 13 август 2026 г. и не е рецензиран. Публично видимото резюме не съдържа имена на бенчмаркове, размери на модели или измерени стойности.

Предпринт, озаглавен „Отвъд най-доброто предположение: Подобряване на покритието на LLM решение със стратегии за еволюция“ беше изпратен до arXiv на 13 август 2026 г. и каталогизиран под изкуствен интелект (cs.AI) с вторичен списък в невронни и еволюционни изчисления (cs.NE). Приписва се на седем автори — Конър Ф. Хейс, Елиът Майерсън, Каетан Швайгофер, Роберто Дейли, Бабак Ходжат, Ристо Миикулайнен и Син Киу. Записът arXiv не изброява институционални връзки и този доклад не приписва работата на никоя организация.

Рамката на статията започва от това как езиковите модели обикновено се използват в настройки за откриване като математика и наука: представя се проблем и единственият отговор на модела се приема като предложено решение. Авторите твърдят, че този режим на „най-добро предположение“ оставя стойност на масата, тъй като допълнително време за тестване може да се изразходва за генериране на много кандидат решения вместо едно. Този режим обикновено се измерва с pass@k, метрика, която отчита проблем като решен, ако поне един от k пробни опита е правилен.

Основното твърдение е диагнозата на страничен ефект в настоящата практика. Пост-обучението на модел с подсилващо обучение, пишат авторите, стеснява разпределението на изхода на модела около изходите с висока награда - и това стесняване причинява колапс на покритието на решението. С други думи, RL може да направи първия отговор по-добър, като същевременно прави набора от отделни отговори по-малък, което конкретно наказва режима pass@k, за който се интересуват авторите.

Като алтернатива, документът предлага еволюционни стратегии: базиран на популацията, без градиент метод след обучение, който оптимизира директно в тегловното пространство чрез прилагане на произволни смущения към параметрите на модела и избиране на резултатите, вместо обратно разпространение на сигнал за награда. В резюмето се посочва, че ES постига постоянно по-висок pass@k от RL, произвежда по-широко разпределение на изхода с по-голямо покритие на решението и че това покритие на свой ред се превръща в по-добри резултати при стандартни математически показатели.

Това, което резюмето не предлага, са повечето доказателства. Той не посочва фамилии модели или брой параметри, няма специфични бенчмаркове, няма стойности на k, няма основен RL алгоритъм и никакви числени резултати — думите „постоянно по-високи“ и „по-добри резултати“ са единствените предлагани характеристики. Изпращането е 449 KB и пълният текст е достъпен като PDF и експериментален HTML, така че тези подробности може да са в документа; те просто отсъстват от записа, оценен тук. Това е предварителна версия на първа версия без индикация за партньорска проверка, без видим код или връзка към данни и без независима репликация.

Детайли за източника: arxiv.org

Защо има значение

В домейни, където може да се провери кандидат отговор – доказателства, код, научни хипотези – полезният таван не е дали първото предположение на модела е правилно, а дали правилният отговор се появява някъде в група от опити. Ако RL след обучението систематично свива този пул, доминиращата рецепта за подравняване в индустрията може да е размяна на точно собствеността, от която зависят откриването и агентното търсене.

Разграничението, което документът прави - между най-добрия единичен отговор на модела и обхвата на това, което може да произведе в много проби - не е академично. Все по-голям дял от работата на AI с висока стойност се изпълнява в цикъл генериране след това проверка: предлагане на много кандидат-програми и стартиране на тестовия пакет, предлагане на много стъпки за доказване и проверката им механично, предлагане на много хипотези и проверката им. Във всички тези настройки верификаторът решава кой кандидат е правилният, така че обвързващото ограничение е дали някога е бил генериран правилен кандидат. Покритието е таванът, а точността при първия опит е само една точка под него.

Това прави диагнозата потенциално значима за доминиращата рецепта след тренировка. Подсилващото учене от сигнали за възнаграждение е начинът, по който повечето настоящи гранични модели се оформят след предварително обучение, а изострянето на разпределението на изхода е близо до точката на упражнението. Ако това заточване надеждно струва покритие, тогава стандартният тръбопровод може да оптимизира за сравнителни резултати, измерени при k=1, докато тихо влошава производителността в режима, в който моделите се разгръщат все повече. Загрижеността, че RL стеснява моделното разнообразие, е била повдигана преди в изследователската литература; заявеният тук принос е по-скоро конкретна алтернатива, отколкото нова диагноза.

Предложеното средство за защита носи своите добре известни компромиси. Стратегиите за еволюция избягват изцяло градиентите, което заобикаля част от нестабилността на фината настройка на RL, но исторически плащат за това с ефективност на извадката: оценяването на полезна посока на актуализиране от случайни смущения на теглото обикновено изисква много преминавания напред през популация, което паралелизира добре, но изразходва изчисления. Дали тази аритметика работи в мащаба на съвременните езикови модели е точно въпросът, който читателят би искал да получи отговор, а резюмето изобщо не разглежда цената.

За обществеността и за практикуващите днес нищо не се променя. Това е изследователско твърдение относно методологията на обучение, а не продукт, издание на модел или констатация за безопасност. Неговото практическо значение би пристигнало косвено – чрез модели, настроени да изследват, а не да се ангажират, или чрез доставчици, които излагат бутони, които разменят точността на първия отговор за широчина. В източника няма доказателства, че която и да е внедрена система използва този метод и нито един доставчик не е описан като го приема.

Също така си струва да се посочат границите на това, което може да се заключи от резюмето за предпечат. Твърдението, че ES побеждава RL на pass@k, е доклад на авторите за техните собствени експерименти, а не независимо установен факт. Известно е, че сравненията между методите за оптимизация са чувствителни към усилията за настройка, изчислителния бюджет и избора на базова линия, а резултатът, който се отнася за един мащаб на модела или едно семейство от бенчмаркове, често не се обобщава.

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
AI Training Quiz

Which question best defines a clear goal for using AI Training?

Какво да гледате след това

Подробностите за натоварването са в пълния PDF файл, а не в резюмето: кои модели са обучени, кои бенчмаркове са използвани, какви стойности на k и най-важното дали ES и RL са сравнени при съвпадащи изчисления. Също така си струва да се следи дали кодът е пуснат, дали резултатът възпроизвежда извън математиката и дали някоя гранична лаборатория приема метода.

Първото нещо, което трябва да проверите, е пълната експериментална настройка на хартията и по-специално дали ES и RL изпълненията са били изчислено съвпадащи. Метод без градиенти, който консумира значително повече изчисления за обучение от базовата линия на RL, може да изглежда по-добре по причини, които не са свързани с механизма, предложен от авторите. Читателите трябва да търсят обучените размери на модела, RL алгоритъма, използван за сравнение, броя на смущенията за поколение и стойностите на k, при които е измерен pass@k - кривите на покритие често се пресичат и метод, който печели при голямо k, може да загуби при k=1.

Второ, следете за обхват. Конкретното твърдение на резюмето за печалбите надолу по веригата е ограничено до „стандартни математически показатели“, домейн с евтина автоматична проверка и тежка предварителна оптимизация. Дали предимството на покритието се прехвърля към генериране на код, генериране на научни хипотези или отворени агентски задачи - където проверката е по-шумна и коректността не е двоична - не е установено от наличния материал.

Трето, следете за артефакти и репликация. Списъкът на arXiv не показва свързан код или освобождаване на данни. Пуснато изпълнение или възпроизвеждане от група, която не е свързана с авторите, ще премести това от претенция към резултат. Ако това липсва, подходящата поза е по-скоро интерес, отколкото увереност, и всеки сигнал за осиновяване трябва да идва със собствени числа.

Четвърто, въпросът за верификатор ограничава колко струва всяка печалба от покритие. По-високият pass@k се преобразува в полезен изход само когато нещо може да идентифицира правилния кандидат сред много. В математиката и софтуера съществуват пулове; в повечето комерсиални приложения те не го правят и избирането на правилния отговор от по-широка група се превръща в собствен нерешен проблем. Последващата работа, съчетаваща обучени в ES модели с механизми за подбор, би била естествената следваща стъпка.

И накрая, гледайте песента на публикацията. Хартията е предпечатна версия v1 без посочено място или статус на преглед. Ревизии, представяне на конференция или публична критика от други изследователи, работещи върху разнообразието след обучение на RL, всичко това би изяснило колко сериозно трябва да се приема централното твърдение.

Свързани ръководства и викторини

AI обучениеОбяснени модели на AIБъдещето на ИИChatGPT и LLMТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речник
Намирате ли това за полезно?