跳至內容
學習
新聞
工具
職缺
使命
搜尋
⌘K
English
捐款
選單
從這裡開始
開始學習
學習
前往 學習
課程
指南
AI 導師
提示庫
測驗
認證
術語表
新聞
前往 新聞
最新人工智慧新聞
主題追蹤器
研究和數據集
部落格
編輯準則
更正說明
工具
前往 工具
工具目錄
最佳名單
比較工具
成本計算器
快速精煉機
提交工具
職缺
前往 職缺
瀏覽人工智慧職位
發布職缺
贊助美亞保險
使命
前往 使命
使命
影響和統計
作者
幫助中心
有什麼新消息
支援
捐款
首頁
/
詞彙表
/
人類評估
人工智慧術語
什麼是
人類評估
?
定義
Python 程式設計問題的基準,用於透過單元測試衡量程式碼產生的正確性。
相關術語
基準測試
用於測量和比較模型性能的標準化測試或資料集。
GSM8K
小學數學應用題的基準,用於評估語言模型中的逐步推理。
評估集
用於測量訓練後模型品質的保留資料集。
測試時計算
在回應生成期間使用額外的推理計算來提高品質或推理。
透過@k
一種程式碼評估指標,用於衡量 k 個產生的樣本中至少有一個通過測試的機會。
人工智慧治理
指導人工智慧如何在社會中發展和使用的政策、標準和監督機制。
參見
MMLU
Factuality
LLM-as-Judge
Citations
Bi-Encoder
Watermarking
Cross-Encoder
Mid-training
Previous
MMLU
Next
GSM8K
瀏覽完整的人工智慧術語表
探索所有免費的人工智慧指南