コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
ホーム
/
用語集
/
報酬モデル
AI用語集の用語
とは何ですか
報酬モデル
?
定義
RLHF パイプラインでよく使用される、優先信号に基づいて出力をスコアリングするモデル。
関連用語
ヒューマンフィードバックからの強化学習 (RLHF)
人間の好みの信号を使用してモデルの動作を形成するトレーニング方法。
強化学習
報酬によるトレーニングは、エージェントが長期的な利益を最大化するアクションを学習することを示します。
グラウンドトゥルース
モデル出力のトレーニングまたは評価に使用される信頼できる参照ラベル。
DPO (直接優先最適化)
別の報酬モデルを必要とせずに、好みのペアに基づいてモデルを直接微調整するトレーニング方法。
トレーニング中期
トレーニング前とトレーニング後の中間トレーニング段階。能力やドメインの調整によく使用されます。
AIエージェント
目標を達成するために観察、推論、行動を起こすことができるソフトウェア システム。多くの場合ツールやメモリを使用します。
無料ガイドで詳細をご覧ください
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
See also
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
AI 用語集の全文を閲覧する
すべての無料 AI ガイドを確認する