Powrót do wszystkich quizówQuiz połączony z przewodnikiemŚredni Poziom6 Pytania

Iteracyjny inspektor ochrony danych i quiz dotyczący dostrajania preferencji online

Sprawdź, jak rozumiesz, w jaki sposób iteracyjna optymalizacja preferencji online poprawia modele językowe.

Powiązane ścieżki prowadząceIteracyjne dostrajanie preferencji DPO i online
Pytanie 1 z 6

Czego DPO unika, czego wymaga tradycyjny RLHF (PPO)?