コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
ホーム
/
用語集
/
ヒューマンフィードバックからの強化学習 (RLHF)
AI用語集の用語
とは何ですか
ヒューマンフィードバックからの強化学習 (RLHF)
?
定義
人間の好みの信号を使用してモデルの動作を形成するトレーニング方法。
関連用語
強化学習
報酬によるトレーニングは、エージェントが長期的な利益を最大化するアクションを学習することを示します。
報酬モデル
RLHF パイプラインでよく使用される、優先信号に基づいて出力をスコアリングするモデル。
DPO (直接優先最適化)
別の報酬モデルを必要とせずに、好みのペアに基づいてモデルを直接微調整するトレーニング方法。
継続的な学習
モデルが事前の知識を忘れることなく新しいデータから学習し続けることができるトレーニング アプローチ。
数回の学習
ほんの少数の例から行動を学習または適応すること。
モデルドリフト
現実世界の状況がトレーニングの想定と異なるため、時間の経過とともにパフォーマンスが低下します。
無料ガイドで詳細をご覧ください
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
AI 用語集の全文を閲覧する
すべての無料 AI ガイドを確認する