PROVE-RT Paper отчита 44,7% успех, генерирайки проверени от машината доказателства в реално време
Предварителен печат на arXiv представя PROVE-RT, който използва извличане и поетапно подсказване, за да накара големите езикови модели да пишат PROSA/ROCQ тестови скриптове за анализ на планируемостта в реално време. Авторите съобщават за 44,7% успеваемост на куриран набор за оценка, където директното подсказване не успява да произведе надеждно валидни механизации.