基础知识指南

损失函数

损失函数是告诉模型其预测有多么错误的单个数字,将模糊的目标转变为数学可以优化的目标。

阅读时间:2分钟最后更新

概述

Choosing the right loss shapes what the model actually learns.

深入探讨

每个经过训练的模型都需要对失败进行精确的定义,而这正是损失函数所提供的。它将模型的预测与真实答案进行比较并输出一个数字:越高意味着越差。训练就是最小化这个数字的过程。损失的选择不是表面的。对于回归任务,均方误差通过对差值进行平方来严重惩罚大误差,而平均绝对误差则更均匀地处理所有误差并抵制异常值。对于分类,交叉熵损失衡量预测的概率分布与真实标签的距离,严重惩罚自信的错误答案。选择与你的目标不匹配的损失可能会使模型在技术上优化错误的东西,因此损失函数有效地编码了你关心的东西。

技术洞察

交叉熵是分类的主力,源自信息论:它使用模型的预测概率来测量编码真实标签所需的额外位。因为当自信的预测被证明是错误时,它会急剧增长,因此它的梯度会促使模型很难纠正过度自信的错误。损失函数必须是可微的(或接近可微的),因为反向传播需要它们的梯度。这一要求正是使用平滑代理而不是原始的、不可微分的指标(如准确性)的原因。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

损失函数的未来

损失函数设计越来越成为塑造现代人工智能行为的地方。除了标准的交叉熵之外,标签平滑、不平衡数据的焦点损失以及表示学习的对比损失等技术现在已成为常规。在大型语言模型中,训练目标和反馈强化学习奖励模型本质上是精心设计的损失,可以引导语气、帮助性和安全性。预计混合多个目标的定制和综合损失将持续增长,因为它们是控制模型价值的最直接杠杆之一。

现实世界的实施

使用交叉熵损失来训练电子邮件垃圾邮件分类器,以惩罚有信心的错误分类

选择房价预测的平均绝对误差,这样一些极端的豪宅就不会主导训练

应用对比损失,以便面部识别模型将同一个人的图像组合在一起

设计奖励模型损失以引导聊天机器人做出更有帮助和诚实的回应

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录损失函数在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Loss Functions quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

三元组损失和度量学习

常见问题

What is Loss Functions?

损失函数是告诉模型其预测有多么错误的单个数字,将模糊的目标转变为数学可以优化的目标。选择正确的损失会影响模型实际学习的内容。

损失函数衡量什么?

损失函数输出一个数字,量化预测与真实答案之间的差距;越低越好。

哪种损失函数最常用于分类任务?

交叉熵将预测概率分布与真实标签进行比较,是分类的标准选择。

与均方误差相比,为什么您会选择平均绝对误差?

平均绝对误差按比例处理所有误差,而不是对它们进行平方,因此一些极端异常值的影响较小。

为什么损失函数通常必须是可微的?

反向传播需要损失的梯度来更新权重,因此损失必须是可微的或具有可用的代理。

交叉熵如何处理自信但错误的预测?

当模型确信错误时,交叉熵会急剧增长,产生强大的梯度来纠正错误。