Назад до новин
ІнноваціяAI Understanding брифінг

У статті пропонується локалізоване навчання з підкріпленням для створених ШІ веб-додатків

Новий препринт arXiv пропонує навчання системам кодування штучного інтелекту із зворотним зв’язком на основі рубрик, прив’язаним до конкретних регіонів коду, повідомляючи про значні переваги в тестах для створення інтерактивних веб-додатків.

5 min readRead the primary source
Source-provided image accompanying Paper proposes localized reinforcement learning for AI-generated web applications
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.27906
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Навчання з підкріпленням
Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.
Точне налаштування
Постійне навчання на предметних даних для адаптації попередньо навченої моделі до конкретного завдання.
Алгоритм
Визначений набір правил або кроків, яких дотримується комп’ютер для вирішення проблеми або виконання завдання.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Дослідники представили Rubric-to-Code Credit Assignment, або RCCA, структуру навчання з підкріпленням, призначену для вдосконалення систем штучного інтелекту, які створюють інтерактивні програми HTML, CSS і JavaScript із запитів природною мовою. У статті повідомляється, що її модель Ling-RCCA-Flash перевершила системи порівняння авторів у двох тестах веб-додатків, але твердження походять із препринтів і не були незалежно перевірені у наданому джерелі.

Стаття, надіслана до arXiv 28 серпня 2026 року, стосується систем штучного інтелекту, які створюють зручні веб-додатки з інструкцій природною мовою. Це відрізняє це завдання від звичайного завершення коду, оскільки програмі може знадобитися задовольнити кілька функціональних вимог одночасно. Ці вимоги можуть залежати від окремих частин згенерованої програми, включаючи обробники подій, оновлення стану, фрагменти DOM і селектори CSS. Автори стверджують, що стандартна оптимізація відносної політики групи, або GRPO, зводить ці структуровані результати до однієї винагороди на рівні послідовності, а потім рівномірно застосовує отриману перевагу до згенерованих токенів. За словами газети, це послаблює зв’язок між конкретним збоєм і кодом, який його спричинив.

RCCA розроблено для перетворення функціонального зворотного зв’язку на рівні рубрик у більш локалізовані навчальні сигнали. Фреймворк створює завдання навколо явних функціональних рубрик і використовує ієрархічну винагороду, яка розділяє помилки формату, помилки вихідного коду, помилки виконання та функціональні помилки. Потім він вирівнює текстові атрибуції, створені оцінювачем, із відповідальними діапазонами коду та токенами, які їх створили. Надане джерело не пояснює точного дизайну оцінювача, алгоритму атрибуції, даних навчання, вартості обчислень або того, чи є система та пов’язаний код загальнодоступними. Ці пропуски мають значення, оскільки практична цінність локалізованого призначення кредитів залежить від того, чи атрибуції є точними та достатньо стабільними, щоб керувати навчанням.

Повідомляється, що отримана модель, яку автори назвали Ling-RCCA-Flash, отримала 41,25 на MiniAppBench. У документі сказано, що це на 32,20 бала вище, ніж Ling-3.0-Flash, і трохи вище Claude Opus 4.5. Повідомляється, що на ArtifactsBench модель отримала 76,19 балів, що на 4,48 балів більше, ніж модель точного налаштування під наглядом авторів. У статті також стверджується, що це встановило новий найвищий результат за офіційною таблицею лідерів ArtifactsBench і перевищило зареєстрований результат GPT-5 на 3,64 бали. Це твердження, зроблені в рефераті препринту; надане джерело не забезпечує незалежного повторення, детальних таблиць балів або оцінок невизначеності.

Деталі джерела: arxiv.org ↗

Чому це важливо

Цей підхід спрямований на вирішення центральної проблеми програмного забезпечення, створеного штучним інтелектом: одна програма може задовольнити одні вимоги, а інші — у локалізованих обробниках подій, оновленнях стану, елементах сторінки чи правилах стилю — не відповідати іншим. Більш точний зворотний зв’язок міг би допомогти навчанню зосередитися на коді, пов’язаному з кожною помилкою, замість того, щоб призначати одну винагороду для всієї згенерованої послідовності.

Програми, створені штучним інтелектом, часто виходять з ладу вужчими способами, ніж повний збій програми. Згенерований інтерфейс може відтворюватися правильно, але мати несправну кнопку, втрачати стан після взаємодії, пропускати необхідний елемент сторінки або застосовувати неправильний стиль до одного компонента. Основна ідея статті полягає в тому, що система навчання повинна мати можливість розрізняти ці випадки та спрямовувати навчання на код, пов’язаний із невиконаною вимогою. Якщо метод працює, як описано, це може зробити навчання підкріплення більш корисним для завдань програмного забезпечення, де правильність розподіляється між багатьма взаємозалежними місцями коду.

Повідомлені результати є потенційно важливими, оскільки в статті оцінюється метод за двома тестами створення додатків, а не представлено лише техніку навчання без результатів на рівні завдання. Автори описують переваги як передавані покращення на рівні реалізації, причому в одному звіті про порівняння з Ling-3.0-Flash на MiniAppBench, а в іншому – з моделлю SFT на ArtifactsBench. Ця комбінація передбачає, що запропонована структура зворотного зв’язку може впливати як на продуктивність моделі, так і на здатність узагальнювати параметри оцінювання. Однак самі по собі результати порівняльного тесту не вказують на те, що створені програми є надійними для користувачів, придатними для обслуговування розробниками чи безпечними для розгортання.

Робота також ілюструє ширший напрям у навчанні ШІ: заміна грубих сигналів успіху чи невдачі зворотним зв’язком, який відображає структуру завдання. Для систем кодування, які могли б підтримувати більш цілеспрямоване виправлення функціональних дефектів. Джерело, однак, підтримує лише більш вузький висновок: автори пропонують RCCA та повідомляють про покращення тестів для своєї моделі. Це не показує, що метод покращує кожну модель кодування, зменшує витрати на навчання, працює з людським відгуком або переносить у більші проекти програмного забезпечення. Той факт, що робота є препринтом arXiv, також означає, що її заяви слід розглядати як тимчасові, доки її методи та результати не отримають подальшого вивчення.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Що дивитися далі

Ключовими невідомими є те, як було реалізовано RCCA, як оцінювачі приписували помилки коду, наскільки великими та репрезентативними були контрольні показники та чи залишаються заявлені переваги поза налаштуваннями тестування авторів. Джерело не встановлює виробничу надійність, доступність, відтворюваність або продуктивність у реальних програмах.

Першочерговим є методологічні деталі. Надана сторінка arXiv містить анотацію, але не докази, необхідні для повної оцінки порівнянь. Читачам знадобиться повний протокол оцінювання, контрольна кількість завдань, визначення балів, базові версії, побудова підказок або завдань, повторні варіації та дослідження абляції. Зокрема, важливо знати, яка частина повідомленого покращення походить від самого методу присвоєння кредитів, яка — від дизайну рубрики або оцінювача, і чи той самий процес оцінки справедливо застосовувався до всіх моделей порівняння.

Відтворюваність залежатиме від наявності моделі, навчального коду, специфікацій рубрик, впровадження оцінювача та матеріалів для порівняння. Джерело не повідомляє, чи можна отримати доступ до Ling-RCCA-Flash, чи загальнодоступні тестові завдання, чи модель оцінювалася за тих самих умов, що й Claude Opus 4.5 і GPT-5. Він також не визначає статистичну значущість відмінностей у балах. Повідомлена перевага в 3,64 бала над GPT-5 і заявлена ​​найкраща позиція в ArtifactsBench, отже, залишаються результатами, повідомленими автором, а не незалежно встановленими висновками.

Практичний тест полягає в тому, чи збережуться переваги в програмах із неоднозначними вимогами, довшими послідовностями взаємодії та залежностями між кількома файлами. Надане джерело не повідомляє про результати розгортання робочої версії, сумісності з браузером, доступності, безпеки, зручності обслуговування, затримки або стійкості до помилок оцінювача. Ці сфери особливо актуальні, якщо додатки, створені штучним інтелектом, використовуються безпосередньо людьми або включені у великі програмні системи. Подальша робота має з’ясувати, чи покращують локалізовані сигнали винагороди реальні результати користувачів і чи вводять вони нові режими помилок, коли оцінювач призначає кредит неправильному діапазону коду.

Пов’язані посібники та вікторини

Пояснення моделей AIНавчання ШІАгенти ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?