Какво стана
Изследователите Yucheng Du и Xiyang Hu проучиха защо настроените с инструкции езикови модели понякога отговарят на въпроси, които нямат валиден отговор, като например изчисляване на cot(-540°) или оценяване (1).startswith("1"). В модели, вариращи от 1,7 милиарда до 70 милиарда параметри, те съобщават за намиране на посока на скрито състояние, която разделя отговорните подкани от структурно невъзможните. Документът твърди, че това показва, че признаването е налице, но не е надеждно свързано с въздържането.
Документът се фокусира върху конкретен провал в надеждността: големите езикови модели отговарят на подкани, които са структурно невъзможни, вместо да отказват да отговорят. Неговите примери включват тригонометричния израз cot(-540°) и кодовия израз (1).startswith("1"). Авторите разграничават този пропуск от обикновената фактическа грешка: въпросът е дали изобщо съществува валиден отговор под структурата на въпроса.
Ду и Ху съобщават за експерименти в настроени с инструкции модели, обхващащи 1,7 милиарда до 70 милиарда параметри. Те казват, че една линейна посока в скритите състояния на моделите разделя отговорните подкани от структурно невъзможните математически и кодови подкани. В интерпретацията на авторите това разделение показва, че моделите представляват невъзможност, преди да генерират отговор.
Докладваната посока на разпознаване е почти ортогонална на това, което документът нарича канонична посока на отказ за безопасност, която авторите свързват с обучен отказ от вредно съдържание. Посоката, съзнаваща невалидността, дефинирана от поведението в домейна, беше по-близо до посоката на разпознаване, но само частично съобразена с нея и остана почти ортогонална на посоката на отказ за безопасност.
Авторите също така съобщават, че управлението на времето за генериране по посока на разпознаване промени поведението, осъзнато за невалидност, и в двете посоки и по начин, реагиращ на дозата, върху структурната математика и кодовите клетки. Случайните посоки не са довели до същия отчетен ефект. Сравненията между базовите и настроените с инструкции модели допълнително предполагат, че геометрията с нисък косинус вече присъства в крайната точка преди обучението. Документът заключава, че грешката е по-добре обяснена като грешка при маршрутизиране, отколкото грешка при кодиране: моделът има използваем сигнал, че няма допустим отговор, но пътят му на отказ не е подравнен, за да го използва.
Детайли за източника: arxiv.org ↗
Защо има значение
Резултатът оспорва простото обяснение, че моделите отговарят на невъзможни въпроси, защото не могат да разпознаят проблема. Ако тълкуването на документа е валидно, подобряването на надеждността може да изисква маршрутизиране или механизми за вземане на решения, които преобразуват вътрешен сигнал за невъзможност в изричен отказ или пояснение. Проучването обаче е изследователски доклад на ниво предпечат и неговото резюме не установява доколко констатациите се обобщават отвъд тестваните математически и кодови указания или модели.
Практическото значение на твърдението на статията е предложената диагноза. Ако даден модел не може да представи, че подкана е невъзможна, разработчиците може да се нуждаят от по-добри данни за обучение или представяния. Но ако моделът вече носи този сигнал и не успява да действа спрямо него, точката на намеса може вместо това да бъде връзката между вътрешно разпознаване, избор на отговор и въздържание.
Това разграничение има значение, тъй като плавният отговор на невъзможен въпрос може да изглежда по-полезен от отказ, като същевременно е фундаментално невалиден. Система, която разпознава структурна невъзможност, може вместо това да заяви, че подканата няма допустим отговор, да обясни съответното ограничение или да помоли потребителя да коригира въведеното. Източникът не съобщава за внедрен продукт или демонстрирано подобрение на резултатите от потребителите, така че тези приложения остават последствия, а не установени резултати.
Сравнението с отказ за безопасност също е последователно. Документът съобщава, че вътрешната посока, свързана с разпознаването на невъзможни подкани, е почти ортогонална на посоката, свързана с отказ на вредно съдържание. Това предполага, че третирането на всички откази като една обща способност може да пропусне важни разлики между отказ, защото съдържанието не е безопасно, и въздържане, защото въпросът е неправилно формулиран или няма валидно решение.
Констатациите трябва да се четат с ясни граници. Източникът не предоставя имена на модели, размери на бенчмаркове, таблици за точност, нива на грешки, разходи за управление или независима репликация. Това не показва, че всеки модел има една и съща геометрия, че докладваните посоки са стабилни в различните езици или модалности или че управлението избягва нежелани промени в полезността. Документът е идентифициран като приет от EMNLP 2026, но предоставеният материал остава arXiv абстракт и сам по себе си не установява пълната сила на претенциите.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Ключовото проследяване е дали докладваният сигнал за разпознаване преживява по-широко тестване и може да се използва в разгърнати системи, без да се потискат легитимните отговори. Документът съобщава, че управлението по посока променя поведението и в двете посоки и по начин, реагиращ на дозата, докато произволните посоки не го правят. По-нататъшна работа ще трябва да тества дали тази намеса подобрява калибрирането в реалния свят, колко често води до ненужни откази и дали геометрията се променя след по-късно обучение.
Централен въпрос е обхватът. Докладваните експерименти обхващат подкани за структурна математика и код, но резюмето не казва дали същият модел за разпознаване и маршрутизиране се появява в ежедневни фактически въпроси, двусмислени инструкции, използване на инструменти или мултимодални системи. Тестването на тези настройки ще покаже дали предложената диагноза е тясно свойство на избрани подкани или поведение на по-широк модел.
Резултатът от управлението заслужава внимателно копиране. Авторите съобщават за двупосочно, реагиращо на дозата поведение при насочване по посока на разпознаване и липса на сравним ефект от произволни посоки. Последващите проучвания трябва да измерват дали такова управление подобрява въздържанието в полезна работна точка или създава фалшиви откази, променя стила на отговорите или става крехко във версиите на модела и настройките за декодиране.
Разработчиците и оценителите също трябва да следят за по-добри показатели, които отделят разпознаването от действието. Моделът може вътрешно да открие невъзможна подкана, но въпреки това да отговори или да откаже, без да идентифицира правилно защо. Оценките, които записват както сигнала за разпознаване на модела, така и крайното му поведение, биха могли да тестват по-директно хипотезата за неуспешно маршрутизиране на хартията.
Остават важни неизвестни относно обучението и внедряването. Източникът не установява дали след обучението може надеждно да съгласува пътищата за разпознаване и отказ, дали интервенцията изисква достъп до скрити състояния, недостъпни чрез API, или как подходът ще взаимодейства с предпазните мерки за безопасност. Тези въпроси ще определят дали резултатът ще се превърне в практическа техника за надеждност или ще остане обяснителна находка за вътрешните елементи на модела.