Назад до новин
ІнноваціяAI Understanding брифінг

Дослідження показує, що магістратури можуть розпізнавати неможливі запитання, але часто не можуть утриматися

У статті, прийнятій на EMNLP 2026, повідомляється, що мовні моделі показують, чи можна структурно відповісти на деякі математичні та кодові запитання, але не скеровують цей сигнал у поведінку відмови.

5 min readRead the primary source
Source-provided image accompanying Study finds LLMs can recognize impossible questions but often fail to abstain
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.29109
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

API (інтерфейс прикладного програмування)
Структурований спосіб для однієї програмної системи надсилати запити до іншої системи та отримувати відповіді від неї.
Посттренінг
Етапи навчання, які застосовуються після попереднього навчання, наприклад налаштування інструкцій, оптимізація параметрів і налаштування безпеки.
Калібрування
Наскільки показники надійності моделі відповідають фактичним імовірностям правильності.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Дослідники Yucheng Du і Xiyang Hu досліджували, чому мовні моделі, налаштовані на інструкції, іноді відповідають на запитання, на які немає правильної відповіді, наприклад, computing cot(-540°) або evaluating (1).startswith("1"). У моделях із діапазоном від 1,7 мільярда до 70 мільярдів параметрів вони повідомляють про знаходження напрямку прихованого стану, який відокремлює прийнятні підказки від структурно неможливих. У документі стверджується, що це вказує на наявність визнання, але не пов’язане надійно з утриманням.

Стаття зосереджена на конкретному недоліку надійності: великі мовні моделі відповідають на підказки, на які структурно неможливо відповісти, замість того, щоб відмовлятися відповідати. Його приклади включають тригонометричний вираз cot(-540°) і кодовий вираз (1).startswith("1"). Автори відрізняють цю помилку від звичайної фактичної помилки: питання полягає в тому, чи існує взагалі дійсна відповідь у структурі питання.

Ду та Ху повідомляють про експерименти з налаштованими інструкціями моделями, що охоплюють від 1,7 мільярда до 70 мільярдів параметрів. Вони кажуть, що єдиний лінійний напрямок у прихованих станах моделей відокремлює відповідні підказки від структурно неможливих математичних і кодових підказок. У інтерпретації авторів, це розділення показує, що моделі представляють неможливість до того, як вони породять відповідь.

Повідомлений напрямок розпізнавання був майже ортогональним тому, що в статті називають канонічним напрямком безпечної відмови, який автори пов’язують із навченою відмовою від шкідливого контенту. Напрямок усвідомлення недійсності, визначений поведінкою в домені, був ближчим до напрямку розпізнавання, але лише частково узгоджувався з ним і залишався майже ортогональним до напрямку безпеки-відмови.

Автори також повідомляють, що керування часом генерації в напрямку розпізнавання змінило поведінку, що усвідомлює недійсність, в обох напрямках і залежно від дози у структурній математиці та кодових комірках. Випадкові напрямки не дали такого ж ефекту. Порівняння між базовою моделлю та моделлю, налаштованою на інструкції, також показало, що геометрія низького косинуса вже була присутня в кінцевій точці перед навчанням. У статті робиться висновок, що збій краще пояснити як збій маршрутизації, ніж збій кодування: модель має корисний сигнал про те, що прийнятної відповіді немає, але її шлях відмови не вирівняний для його використання.

Деталі джерела: arxiv.org ↗

Чому це важливо

Результат ставить під сумнів просте пояснення того, що моделі відповідають на неможливі запитання, тому що вони не можуть розпізнати проблему. Якщо інтерпретація документу вірна, підвищення надійності може вимагати механізмів маршрутизації або прийняття рішень, які перетворюють внутрішній сигнал неможливості на явну відмову чи роз’яснення. Однак дослідження є дослідницьким звітом на рівні препринтів, і його анотація не встановлює, наскільки широко результати узагальнюються за межами перевірених математичних і кодових підказок або моделей.

Практичне значення твердження статті полягає в запропонованому діагнозі. Якщо модель не може показати, що підказка неможлива, розробникам можуть знадобитися кращі навчальні дані або представлення. Але якщо модель вже несе цей сигнал і не діє на нього, точкою втручання може стати зв’язок між внутрішнім визнанням, вибором відповіді та утриманням.

Ця різниця має значення, тому що вільна відповідь на неможливе запитання може здатися більш корисною, ніж відмова, хоча й є принципово недійсною. Система, яка розпізнає структурну неможливість, може натомість заявити, що підказка не має прийнятної відповіді, пояснити відповідне обмеження або попросити користувача виправити введені дані. Джерело не повідомляє про розгорнутий продукт або продемонстроване покращення результатів для користувачів, тому ці програми залишаються наслідками, а не встановленими результатами.

Порівняння з відмовою безпеки також є наслідковим. У статті повідомляється, що внутрішній напрямок, пов’язаний із розпізнаванням неможливих підказок, майже ортогональний напрямку, пов’язаному з відмовою від шкідливого вмісту. Це свідчить про те, що розгляд усіх відмов як однієї загальної можливості може упустити важливі відмінності між відмовою через те, що вміст є небезпечним, і утриманням через те, що запитання неправильно сформульоване або не має правильного рішення.

Висновки слід читати з чіткими обмеженнями. Джерело не надає назви моделей, еталонних розмірів, таблиць точності, частоти помилок, витрат на керування чи незалежного відтворення. Це не показує, що кожна модель має однакову геометрію, що повідомлені напрямки є стабільними різними мовами чи модальностями, або що керування дозволяє уникнути небажаних змін у корисності. Стаття визначена як прийнята до EMNLP 2026, але наданий матеріал залишається анотацією arXiv і сам по собі не підтверджує повної сили претензій.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Що дивитися далі

Ключовий контроль полягає в тому, чи повідомлений сигнал розпізнавання витримає ширше тестування та чи зможе він використовуватися в розгорнутих системах без придушення законних відповідей. У документі повідомляється, що кермування вздовж напрямку змінювало поведінку в обох напрямках залежно від дози, тоді як випадкові напрямки – ні. Подальша робота повинна перевірити, чи покращує це втручання калібрування в реальному світі, як часто воно викликає непотрібні відмови та чи змінюється геометрія після подальшого навчання.

Центральним питанням є обсяг. Повідомлені експерименти охоплюють структурну математику та кодові підказки, але анотація не говорить, чи з’являється однаковий шаблон розпізнавання та маршрутизації в повсякденних фактичних питаннях, неоднозначних інструкціях, використанні інструментів або мультимодальних системах. Перевірка цих налаштувань покаже, чи є запропонована діагностика вузькою властивістю вибраних підказок чи ширшою поведінкою моделі.

Результат керування заслуговує ретельного повторення. Автори повідомляють про двонаправлену поведінку, що залежить від дози, під час руху вздовж напрямку розпізнавання та відсутність порівнянного ефекту від випадкових напрямків. Подальші дослідження повинні вимірювати, чи таке керування покращує утримання в корисній робочій точці, чи воно створює помилкові відмови, змінює стиль відповідей або стає крихким у версіях моделі та налаштуваннях декодування.

Розробники та оцінювачі також повинні стежити за кращими показниками, які відокремлюють визнання від дії. Модель може внутрішньо виявити неможливе підказку, але все одно відповісти на нього або відмовитися, не правильно визначивши причину. Оцінки, які фіксують як сигнал розпізнавання моделі, так і її остаточну поведінку, могли б більш безпосередньо перевірити гіпотезу маршрутизації паперу.

Залишаються важливі невідомі питання щодо навчання та розгортання. Джерело не встановлює, чи може постнавчання надійно узгодити шляхи розпізнавання та відмови, чи вимагає втручання доступ до прихованих станів, недоступних через API, або як підхід взаємодіятиме з гарантіями безпеки. Ці запитання визначатимуть, чи стане результат практичним методом перевірки надійності чи залишиться пояснювальним висновком щодо внутрішніх елементів моделі.

Пов’язані посібники та вікторини

Пояснення моделей AIChatGPT і LLMЕтика ШІНавчання ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?