技术指南

Gumbel-Softmax 和重新参数化

Gumbel-Softmax 是一种让神经网络从离散类别中“采样”的技巧,同时仍然可以通过梯度下降进行训练。

阅读时间:2分钟最后更新

概述

这很重要,因为反向传播通常不能通过随机、离散的选择。

深入探讨

神经网络通过每次操作向后发送梯度来学习。但是对离散类别进行采样(例如选择 50,000 个单词中的#7)是一个艰难的、不可微分的跳跃,因此梯度会在那里消失。重新参数化技巧重写了随机采样,因此随机性来自固定的外部噪声源,为梯度留下平滑、可微的路径。 Gumbel-Softmax 将此应用于分类变量:它将 Gumbel 分布噪声添加到 logits,然后用温度控制的 softmax 替换硬 argmax。在高温下,输出是类别上的平滑斑点;当温度降至零时,它会锐化为接近单热向量,恢复真实采样,同时始终保持可微分。

技术洞察

Gumbel-Max 技巧是这样说的:向每个 logit 添加独立的 Gumbel(0,1) 噪声并采用 argmax 从 softmax 分布中产生精确的样本。 Gumbel-Softmax 将hard argmax 替换为softmax((log p + g)/tau)。温度 tau 在平滑的高熵分布(大 tau)和近乎离散的单热分布(小 tau)之间插值。由于噪声 g 是在网络外部采样的,因此从 logits 到输出的路径保持可微。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

Gumbel-Softmax 和重新参数化的未来

Gumbel-Softmax 仍然是离散潜在变量、可微架构搜索、矢量量化模型和混合专家系统中学习路由的默认工具。低方差、低偏差松弛(例如 Rao-Blackwellized 和控制变量估计量)以及平衡暖温度偏差与冷温度高梯度方差的退火方案的研究仍在继续。随着模型越来越多地做出明确的离散决策,预计这些连续的放松将成为使此类选择端到端可学习的核心。

现实世界的实施

使用分类(离散)潜在代码而不是仅连续高斯代码训练变分自动编码器。

可微分神经架构搜索(例如 DARTS 风格的方法)选择在每一层放置哪个操作。

学习 VQ 风格和离散表示模型中的离散码本选择。

专家混合网络和条件计算网络中的可微路由或门控决策。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gumbel-Softmax and Reparameterization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

双向循环网络

常见问题

什么是 Gumbel-Softmax 和重新参数化?

Gumbel-Softmax 是一种让神经网络从离散类别中“采样”的技巧,同时仍然可以通过梯度下降进行训练。这很重要,因为反向传播通常不能通过随机、离散的选择。

Gumbel-Softmax解决什么核心问题?

通过 argmax 进行的离散采样是不可微的、阻塞梯度。 Gumbel-Softmax 提供了可微的松弛,因此网络仍然可以进行端到端的训练。

在重新参数化技巧中,随机性从何而来?

重新参数化将随机性转移到独立的噪声变量,留下网络参数的确定性、可微分函数。

根据 Gumbel-Max 技巧,如何从 softmax 分布中提取精确的样本?

Gumbel-Max 技巧:(logits + i.i.d. Gumbel 噪声)上的 argmax 完全按照这些 logits 的 softmax 中的分类样本进行分布。

Gumbel-Softmax 中温度参数 (tau) 的作用是什么?

低tau将softmax推向接近one-hot向量(接近真实采样);高 tau 使其光滑且高熵。它权衡了偏差和梯度方差。

当 tau 接近零时,Gumbel-Softmax 输出接近什么?

将温度冷却到零会使 softmax 锐化,直到它几乎选择单个类别,从而恢复离散采样行为。