コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
ホーム
/
用語集
/
強化学習
AI用語集の用語
とは何ですか
強化学習
?
定義
報酬によるトレーニングは、エージェントが長期的な利益を最大化するアクションを学習することを示します。
関連用語
ヒューマンフィードバックからの強化学習 (RLHF)
人間の好みの信号を使用してモデルの動作を形成するトレーニング方法。
報酬モデル
RLHF パイプラインでよく使用される、優先信号に基づいて出力をスコアリングするモデル。
AIエージェント
目標を達成するために観察、推論、行動を起こすことができるソフトウェア システム。多くの場合ツールやメモリを使用します。
憲法AI
モデルの出力が、文書化された一連の固定された原則によって導かれる、トレーニングおよび行動形成のアプローチ。
エージェントループ
AI エージェントが目標を完了するか停止条件に達するまで、観察、計画、行動、反映する反復サイクル。
DPO (直接優先最適化)
別の報酬モデルを必要とせずに、好みのペアに基づいてモデルを直接微調整するトレーニング方法。
無料ガイドで詳細をご覧ください
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
See also
Red Teaming
Recommendation System
Retrieval
Recall
RAG (Retrieval-Augmented Generation)
Robustness
Quantization
Safety Filter
Previous
Red Teaming
Next
Reinforcement Learning from Human Feedback (RLHF)
AI 用語集の全文を閲覧する
すべての無料 AI ガイドを確認する