コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
← すべてのクイズに戻る
ガイド連動クイズ • 中 レベル • 6 質問
反復的な DPO およびオンライン設定チューニング クイズ
反復的なオンライン設定の最適化によって言語モデルがどのように改善されるかを理解していることを確認してください。
関連するガイドパス
反復的な DPO とオンライン設定チューニング
質問 1 の 6
従来の RLHF (PPO) が必要とするものを DPO が回避しているのは何ですか?
ヒントが必要ですか?
A
あらゆるトレーニングデータ
B
別の明示的な報酬モデルをトレーニングする
C
ニューラルネットワークの使用
D
完全に人間の好み