コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
← すべてのクイズに戻る
ガイド連動クイズ • 中 レベル • 6 質問
近接ポリシー最適化クイズ
PPO が強化学習をどのように安定化させるか、および RLHF におけるその役割についての理解をテストします。
関連するガイドパス
近接ポリシーの最適化
質問 1 の 6
PPO の「クリッピング」は主にどのような問題に対処しますか?
ヒントが必要ですか?
A
データの読み込みが遅い
B
トレーニングを不安定にする大規模すぎるポリシーの更新
C
語彙サイズの制限
D
推論中のメモリ使用量