コンテンツにスキップ
学ぶ
ニュース
ツール
求人
使命
検索
⌘K
English
寄付
メニュー
ここから始めましょう
学習を開始する
学ぶ
に行く 学ぶ
コース
ガイド
AIチューター
プロンプトライブラリ
クイズ
認定
用語集
ニュース
に行く ニュース
最新の AI ニュース
トピックトラッカー
研究とデータセット
ブログ
編集方針
訂正情報
ツール
に行く ツール
ツールディレクトリ
ベストオブリスト
ツールの比較
コスト計算機
プロンプトリファイナー
AIツール投稿
求人
に行く 求人
AI の求人を閲覧する
求人を投稿する
スポンサーAIU
使命
に行く 使命
使命
影響と統計
著者
ヘルプセンター
新機能
サポート
寄付
ホーム
/
用語集
/
HumanEval
AI用語集の用語
とは何ですか
HumanEval
?
定義
単体テストを通じてコード生成の正確さを測定するために使用される Python プログラミング問題のベンチマーク。
関連用語
ベンチマーク
モデルのパフォーマンスを測定および比較するために使用される標準化されたテストまたはデータセット。
GSM8K
言語モデルにおける段階的な推論を評価するために使用される、小学校の算数の文章題のベンチマーク。
評価セット
トレーニング後にモデルの品質を測定するために使用される保持されたデータセット。
テスト時のコンピューティング
品質または推論を向上させるために応答生成中に使用される追加の推論計算。
Pass@k
生成された k 個のサンプルのうち少なくとも 1 つがテストに合格する可能性を測定するコード評価メトリクス。
AI ガバナンス
AI が社会でどのように開発および使用されるかをガイドするポリシー、標準、および監視メカニズム。
See also
MMLU
Factuality
LLM-as-Judge
Citations
Bi-Encoder
Watermarking
Cross-Encoder
Mid-training
Previous
MMLU
Next
GSM8K
AI 用語集の全文を閲覧する
すべての無料 AI ガイドを確認する