コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
← すべてのクイズに戻る
ガイド連動クイズ • ハード レベル • 6 質問
グループ相対ポリシー最適化クイズ
GRPO が強化学習を使用して言語モデルをトレーニングする方法についての理解をテストします。
関連するガイドパス
グループ相対ポリシーの最適化
質問 1 の 6
GRPO が排除する PPO の主なコンポーネントは何ですか?
ヒントが必要ですか?
A
報酬モデル
B
個別の学習値 (クリティカル) ネットワーク
C
トレーニング中のポリシー ネットワーク
D
KL ダイバージェンス ペナルティ