跳至内容
学习
新闻
工具
职位
使命
搜索
⌘K
English
捐赠
菜单
从这里开始
开始学习
学习
前往 学习
课程
指南
AI 导师
提示库
测验
认证
术语表
新闻
前往 新闻
最新人工智能新闻
主题跟踪器
研究和数据集
博客
编辑准则
更正说明
工具
前往 工具
工具目录
最佳名单
比较工具
成本计算器
快速精炼机
提交工具
职位
前往 职位
浏览人工智能职位
发布职位
赞助美亚保险
使命
前往 使命
使命
影响和统计
作者
帮助中心
有什么新消息
支持
捐赠
首页
/
词汇表
/
人类评估
人工智能术语
什么是
人类评估
?
定义
Python 编程问题的基准,用于通过单元测试衡量代码生成的正确性。
相关术语
基准测试
用于测量和比较模型性能的标准化测试或数据集。
GSM8K
小学数学应用题的基准,用于评估语言模型中的逐步推理。
评估集
用于测量训练后模型质量的保留数据集。
测试时计算
在响应生成期间使用额外的推理计算来提高质量或推理。
通过@k
一种代码评估指标,用于衡量 k 个生成的样本中至少有一个通过测试的机会。
人工智能治理
指导人工智能如何在社会中开发和使用的政策、标准和监督机制。
参见
MMLU
Factuality
LLM-as-Judge
Citations
Bi-Encoder
Watermarking
Cross-Encoder
Mid-training
Previous
MMLU
Next
GSM8K
浏览完整的人工智能术语表
探索所有免费的人工智能指南