Инженеринг на характеристиките
Инженерингът на функции е занаятът за превръщане на необработените данни в информативни входове (характеристики), които помагат на модела да се учи.
Преглед
In classic machine learning it is often the single biggest driver of accuracy, more than the choice of algorithm.
Дълбоко гмуркане
Един модел може да се учи само от входните данни, които му давате, а суровите данни рядко пристигат в полезна форма. Инженерингът на функции го преоформя: извличане на деня от седмицата от клеймо за време, изчисляване на средната покупка на клиента, кодиране на категории като числа, мащабиране на стойности до общ диапазон или комбиниране на колони в съотношения. Направено добре, то разкрива моделите, от които се нуждае алгоритъмът, така че прост модел на страхотни функции често бие сложен модел на необработени данни. Това също изисква познаване на домейна, тъй като знанието, че, да речем, „транзакции в минута“ сигнализира за измама е това, което създава мощна функция. Класическият риск е изтичане на данни, случайно изграждане на функция от информация, която не би била налична в момента на прогнозиране, което увеличава резултатите от теста, но се проваля в производството. Дълбокото обучение автоматизира част от това, но структурираните/таблични проблеми все още разчитат в голяма степен на него.
Техническа информация
Общите техники включват нормализация или стандартизация (мащабиране на числа, така че нито една функция да не доминира), еднократно или целево кодиране за категорични променливи, групиране на непрекъснати стойности и създаване на взаимодействие или агрегатни характеристики. Критична дисциплина е монтиране на трансформации (като средна стойност и стандартно отклонение на скалер) само върху данните за обучение, след което прилагането им към набори за валидиране и тестване. Изчисляването им върху пълния набор от данни води до изтичане на информация и дава прекалено оптимистични резултати, които няма да се задържат при внедряване.
Стратегическо въздействие
Clearer decisions
Помага ви да отделите ясните технически твърдения от маркетинговия език.
Cost and budget
Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.
Team and workflow
Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.
Бъдещето на инженерството на характеристиките
Дълбокото обучение има автоматизирано извличане на функции за изображения, аудио и текст, където мрежите научават представяния директно от необработени входове. Но за таблични и бизнес данни, които са повечето корпоративни данни, обмисленото проектиране на функции остава решаващо. Полето се измества към автоматизация (AutoML, автоматизирано генериране на функции) и повторно използваеми „хранилища за функции“, които позволяват на екипите да споделят последователни, добре тествани функции в различните модели. Очаквайте повече инструменти, които предлагат функции и предпазват от изтичане, докато експертизата в човешкия домейн остава от съществено значение за характеристиките с най-висока стойност.
Внедряване в реалния свят
Откриване на измами: извличане на функции като честота на транзакция, време от последната покупка и разстояние от обичайното местоположение.
Прогнозиране на търсенето: извличане на знамена за ден от седмицата, празници и пълзящи средни стойности от необработени времеви клейма на продажбите.
Кредитен скоринг: превръщане на необработената история в съотношения като дълг към доход и брой скорошни закъснели плащания.
Изтичане на клиенти: обобщаване на активността в функции като влизания на месец и дни от последното ангажиране.
Рискове и предпазни огради
Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.
Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.
Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.
Пътна карта за изпълнение
Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.
Изберете един показател за успех и едно условие за неуспех преди тестване.
Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.
Документирайте къде Feature Engineering помага и къде по-простите методи са по-добри.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Feature Engineering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Функционални инженерни тръбопроводи и версии на данни
Frequently asked questions
What is Feature Engineering?
Инженерингът на функции е занаятът за превръщане на необработените данни в информативни входове (характеристики), които помагат на модела да се учи. В класическото машинно обучение това често е най-големият двигател на точността, повече от избора на алгоритъм.
Какво е инженерство на функции?
Инженерингът на функции е свързан с изработването на входни данни (характеристики) от необработени данни, така че моделът да може да намери полезни модели.
Защо инженерството на функции често се описва като решаващо в класическото машинно обучение?
При структурираните данни добре проектираните функции често имат по-голямо значение от конкретния модел, така че прост модел със страхотни функции може да спечели.
Какво е изтичане на данни в инженеринга на функции?
Изтичане означава, че дадена функция се промъква в информация, която всъщност не бихте имали, когато прогнозирате, завишавайки резултатите от теста, но се проваля в производството.
Когато мащабирате функции (напр. стандартизация), къде трябва да изчислите средната стойност и стандартното отклонение?
Монтирането на скейлера само върху тренировъчни данни и след това прилагането му другаде предотвратява изтичане и дава реалистични оценки на ефективността.
Кое от тези е типична техника за инженеринг на характеристики за категорични данни?
Категориалните променливи обикновено се преобразуват в числа чрез еднократно или целево кодиране, така че моделите да могат да ги използват.