Техническое РУКОВОДСТВО

КЛ Дивергенция

Дивергенция Кульбака-Лейблера (KL) измеряет ожидаемую дополнительную информационную стоимость использования одного распределения вероятностей для представления другого.

  • 3 минуты чтения
  • Последнее обновление
На этой странице3 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее дивергенции КЛ
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Оно неотрицательно, но асимметрично, поэтому замена опорного и сравнительного распределений обычно меняет результат и может повлиять на то, какой выбор моделирования окажется предпочтительным.

Глубокое погружение

Для дискретных распределений p и q по одним и тем же результатам расхождение KL равно D_KL(p||q) = сумма по результатам p(x) log(p(x)/q(x)). Он сравнивает q с эталонным p, взвешивая каждое логарифмическое соотношение по тому, как часто результат возникает при p. В теории информации это можно интерпретировать как ожидаемые дополнительные затраты на кодирование, когда код оптимизирован для q, но истинное распределение равно p. База журнала устанавливает единицу измерения: натуральные логарифмы дают числовые значения, а основание два — биты. Дивергенция KL неотрицательна и равна нулю, когда распределения совпадают по результатам с положительной вероятностью при p, с учетом соображений поддержки. Он асимметричен: D_KL(p||q) обычно не является D_KL(q||p). Это делает его непригодным в качестве обычного геометрического расстояния. Направление имеет значение в таких приложениях, как вариационный вывод, где одно распределение рассматривается как целевое, а другое — как приближение. В примере монеты с честностью и предвзятостью p=(0,5,0,5) и q=(0,9,0,1). Побитовые вклады составляют 0,5 log2(0,5/0,9), около -0,424, и 0,5 log2(0,5/0,1), около 1,161. Их сумма составляет около 0,737 бит. Отрицательные отдельные члены допускаются, даже если общая дивергенция неотрицательна. Изменение местами p и q дает другое значение, поскольку веса также меняются. Несоответствия поддержки имеют значение. Если p присваивает положительную вероятность результату, где q присваивает ноль, соответствующая прямая дивергенция бесконечна. Если оба присваивают ноль, этот результат по соглашению вносит ноль в дискретную сумму. Для непрерывных распределений KL записывается как интеграл от логарифмического отношения плотности под P; конечность требует, чтобы P было абсолютно непрерывным относительно Q. Функция энтропии SciPy вычисляет энтропию Шеннона с одним распределением и относительной энтропией, когда задано q; проверьте нормализацию и направление ввода. KL полезен для сравнения распределений, но сам по себе он не говорит о том, полезна ли модель для принятия последующих решений.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее дивергенции КЛ

Сравнение распределений будет более понятным, если в отчетах будет указано, какое распределение является эталонным, базой журнала и как обрабатываются события с нулевой вероятностью. При обучении модели команды должны связать направление KL с желаемым поведением: охват всех целевых режимов отличается от концентрации аппроксимации вблизи доминирующего режима. Оценивайте последующие решения, а также значения расхождений, поскольку низкое несоответствие распределения само по себе не является гарантией практической полезности. Будущие конвейеры могут включать в себя проверки поддержки и чувствительность к сглаживанию, что позволит сделать числовые крайние случаи видимыми, а не незаметно изменять вероятности.

Реальная реализация

Гипотетическое честное распределение монет p=(0,5,0,5) сравнивается с q=(0,9,0,1). В битах D_KL(p||q)=0,5 log2(0,5/0,9)+0,5 log2(0,5/0,1), около 0,737 бит.

Языковая модель обучена минимизировать KL от целевого распределения токена до его прогнозируемого распределения. Если прогнозируемая вероятность целевого события равна нулю, прямая стоимость KL может стать бесконечной, что потребует тщательного сглаживания или поддержки модели.

Исследователь сравнивает D_KL(p||q) с D_KL(q||p) для двух распределений и находит разные значения. Асимметрия означает, что метрика не является обычным расстоянием и не имеет общего неравенства треугольника.

Аналитик использует scipy.stats.entropy(pk, qk) и подтверждает, какой аргумент представляет целевое распределение, поскольку направление относительной энтропии API следует за pk относительно qk.

Риски и ограничения

  • Оптимизация одного теста может скрыть более широкие недостатки системы.

  • Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

  • Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

  1. Определите целевые показатели задержки, качества и стоимости перед внедрением.

  2. Тестирование при реалистичной нагрузке и условиях данных.

  3. Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

  4. Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KL Divergence quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое KL-дивергенция?

Дивергенция Кульбака-Лейблера (KL) измеряет ожидаемую дополнительную информационную стоимость использования одного распределения вероятностей для представления другого. Оно неотрицательно, но асимметрично, поэтому замена опорного и сравнительного распределений обычно меняет результат и может повлиять на то, какой выбор моделирования окажется предпочтительным.

В D_KL(p||q) какое распределение взвешивает члены логарифмического отношения?

Сумма взвешивается по p(x), эталонному распределению в этом направлении.

Почему КЛ-дивергенция не является обычным симметричным расстоянием?

Веса и соотношение изменяются при обмене распределениями.

Что происходит с соответствующим прямым вкладом KL при p(x)>0 и q(x)=0?

Логарифмическое соотношение имеет положительный числитель и нулевой знаменатель, что дает бесконечную дивергенцию.

Почему в примере с монетой «справедливо против предвзятости» одно слагаемое может быть отрицательным, в то время как общий KL остается неотрицательным?

Некоторые вероятности q превышают p, что дает отрицательные логарифмические члены, тогда как полная дивергенция подчиняется неотрицательности.

Какая единица получается в результате использования логарифмов с основанием двойки?

База два измеряет информацию в битах; из натуральных бревен производят нац.