コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
← すべてのクイズに戻る
ガイド連動クイズ • 中 レベル • 6 質問
直接プリファレンス最適化クイズ
Direct Preference Optimization がどのように機能し、なぜ調整が簡素化されるのかについての理解をテストします。
関連するガイドパス
直接的なプリファレンスの最適化
質問 1 の 6
従来の RLHF と比較して、DPO は何を排除しますか?
ヒントが必要ですか?
A
人間の好みに関するデータの必要性
B
個別の報酬モデルと強化学習ループ
C
基本の事前トレーニング済み言語モデル
D
対数確率の使用