Загрузка урока...
Иногда, когда у специалиста по МО есть знания предметной области, позволяющие предположить, что одна переменная связана с квадратом, кубом или другой степенью другой переменной, полезно создать синтетический признак на основе одного из существующих числовых признаков .
Рассмотрим следующий набор точек данных, где розовые кружки представляют один класс или категорию (например, породу дерева), а зеленые треугольники — другой класс (или породу дерева):

Рисунок 17. Два класса, которые нельзя разделить линией.
Невозможно провести прямую линию, которая четко разделяет два класса, но можно нарисовать кривую, которая делает это:

Рисунок 18. Разделение классов с y = x^2 .
Как обсуждалось в модуле «Линейная регрессия» , линейная модель с одним признаком x1 описывается линейным уравнением:

Это по-прежнему можно рассматривать как задачу линейной регрессии , а веса, как обычно, определяются с помощью градиентного спуска, несмотря на то, что они содержат скрытый квадратичный член, полиномиальное преобразование. Не изменяя способ обучения линейной модели, добавление полиномиального преобразования позволяет модели разделять точки данных с помощью кривой вида .
Обычно интересующий числовой признак умножается сам на себя, то есть возводится в некоторую степень. Иногда специалист по МО может сделать обоснованное предположение о соответствующем показателе. Например, многие отношения в физическом мире связаны с квадратами, включая ускорение силы тяжести, затухание света или звука на расстоянии и упругую потенциальную энергию.
Если вы преобразуете объект таким образом, что изменяется его масштаб, вам также следует подумать о том, чтобы поэкспериментировать с его нормализацией. Нормализация после преобразования может улучшить производительность модели.
Родственное понятие в категориальных данных — это перекрестный признак , который чаще всего синтезирует два разных признака.
В этом материале нет файлов для просмотра.