РУКОВОДСТВО ПО ОСНОВАМ

Особенности проектирования

Разработка функций — это искусство превращения необработанных данных в информативные входные данные (функции), которые помогают модели учиться.

2 минуты чтенияПоследнее обновление

Обзор

In classic machine learning it is often the single biggest driver of accuracy, more than the choice of algorithm.

Глубокое погружение

Модель может учиться только на тех входных данных, которые вы ей предоставляете, а необработанные данные редко поступают в полезной форме. Разработка функций меняет его: извлечение дня недели из временной метки, вычисление средней покупки клиента, кодирование категорий в виде чисел, масштабирование значений до общего диапазона или объединение столбцов в соотношения. Если все сделано правильно, он раскрывает закономерности, необходимые алгоритму, поэтому простая модель с отличными функциями часто превосходит сложную модель на необработанных данных. Это также требует знания предметной области, поскольку знание того, что, скажем, «транзакции в минуту» сигнализирует о мошенничестве, создает мощную функцию. Классический риск — это утечка данных, случайное создание функции на основе информации, которая не будет доступна во время прогнозирования, что приводит к завышению результатов тестов, но терпит неудачу в работе. Глубокое обучение автоматизирует некоторые из этих операций, но структурированные/табличные задачи по-прежнему во многом зависят от него.

Техническая информация

Общие методы включают нормализацию или стандартизацию (масштабирование чисел, чтобы ни один признак не доминировал), горячее или целевое кодирование для категориальных переменных, объединение непрерывных значений и создание взаимодействующих или агрегированных признаков. Важнейшей дисциплиной является подгонка преобразований (таких как среднее и стандартное отклонение масштабатора) только к обучающим данным, а затем их применение к проверочным и тестовым наборам. Их вычисление на основе полного набора данных приводит к утечке информации и дает слишком оптимистичные результаты, которые не сохранятся при развертывании.

Стратегическое воздействие

Более четкие решения

Это поможет вам отделить четкие технические заявления от маркетингового языка.

Стоимость и бюджет

Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.

Команда и рабочий процесс

Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.

Будущее разработки функций

Глубокое обучение позволяет автоматически извлекать признаки из изображений, аудио и текста, при этом сети изучают представления непосредственно из необработанных входных данных. Но для табличных и бизнес-данных, а именно для большинства корпоративных данных, решающее значение остается продуманная разработка функций. Эта область смещается в сторону автоматизации (AutoML, автоматическое создание функций) и многоразовых «хранилищ функций», которые позволяют командам совместно использовать согласованные, хорошо протестированные функции в разных моделях. Ожидайте больше инструментов, которые предлагают функции и защищают от утечек, в то время как человеческий опыт остается важным для наиболее ценных функций.

Реальная реализация

Обнаружение мошенничества: получение таких характеристик, как частота транзакций, время с момента последней покупки и расстояние от обычного местоположения.

Прогнозирование спроса: извлечение дней недели, флагов праздников и скользящих средних значений из необработанных временных меток продаж.

Кредитный скоринг: превращение необработанной истории в соотношения, такие как соотношение долга к доходу и подсчет недавних просроченных платежей.

Отток клиентов: агрегирование активности в такие функции, как количество входов в систему в месяц и дней с момента последнего взаимодействия.

Риски и ограничения

Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.

Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.

Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.

Дорожная карта реализации

1

Начните с простого определения желаемого результата.

2

Перед тестированием выберите один показатель успеха и одно условие отказа.

3

Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.

4

Документируйте, где помогает разработка функций и где более простые методы лучше.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Feature Engineering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Конвейеры разработки функций и управление версиями данных

Часто задаваемые вопросы

What is Feature Engineering?

Разработка функций — это искусство превращения необработанных данных в информативные входные данные (функции), которые помогают модели учиться. В классическом машинном обучении это часто является самым важным фактором точности, а не выбором алгоритма.

Что такое проектирование функций?

Разработка функций заключается в создании входных данных (функций) на основе необработанных данных, чтобы модель могла находить полезные шаблоны.

Почему проектирование признаков часто называют решающим в классическом машинном обучении?

В структурированных данных хорошо продуманные функции часто имеют большее значение, чем конкретная модель, поэтому простая модель с отличными функциями может победить.

Что такое утечка данных в разработке функций?

Утечка означает, что функция крадет информацию, которой у вас на самом деле нет при прогнозировании, завышая результаты тестов, но терпит неудачу в работе.

При масштабировании функций (например, стандартизации), где следует вычислять среднее и стандартное отклонение?

Установка масштабатора только на обучающих данных, а затем применение его в другом месте предотвращает утечку и дает реалистичные оценки производительности.

Что из этого является типичным методом проектирования признаков для категориальных данных?

Категориальные переменные обычно преобразуются в числа с помощью горячего или целевого кодирования, чтобы модели могли их использовать.