Das Data-DPO-Papier schlägt eine zielmodellbewusste Auswahl von Feinabstimmungsdaten vor
In einem arXiv-Artikel wird Data-DPO vorgestellt, das überwachte Feinabstimmungsbeispiele anhand der Antworten eines Zielmodells während kurzer Trainingssonden auswählt. Die Autoren berichten von besseren Ergebnissen als bestehende Auswahlmethoden und umfassende Datenschulungen zu Vision-Flan und LLaVA-CoT, aber den Aufzeichnungen fehlen Effektgrößen oder unabhängige Validierung.