Загрузка
Специалисты по машинному обучению тратят больше времени на обработку данных, чем на построение моделей. Этот урок познакомит вас с работой с числовыми данными: вы узнаете, что такое векторы признаков, научитесь визуально и математически исследовать датасеты, выявлять выбросы и применять четыре метода нормализации. Также будут рассмотрены стратегии объединения числовых данных и характеристики хороших непрерывных признаков.

Цели обучения
После изучения этого урока вы сможете:
Понимать векторы признаков.
Исследовать потенциальные возможности вашего набора данных визуально и математически.
Определять выбросы.
Понимать четыре различных метода нормализации числовых данных.
Понимать объединение (binning) и разрабатывать стратегии объединения числовых данных.
Понимать характеристики хороших непрерывных числовых признаков.
Предпосылки
В этом модуле предполагается, что вы знакомы с концепциями, изложенными в следующем модуле:
Введение в машинное обучение
Введение
Специалисты по машинному обучению тратят гораздо больше времени на оценку, очистку и преобразование данных, чем на построение моделей. Данные настолько важны, что в этом курсе этой теме посвящено целых три раздела:
Работа с числовыми данными (данный модуль)
Работа с категориальными данными
Наборы данных, обобщение и переобучение
В этом модуле основное внимание уделяется числовым данным — то есть целым числам или значениям с плавающей запятой, которые ведут себя как числа. То есть они аддитивны, счетны, упорядочены и так далее. Следующий модуль посвящен категориальным данным, которые могут включать числа, ведущие себя как категории. Третий блок посвящен тому, как подготовить данные, чтобы обеспечить высококачественные результаты при обучении и оценке вашей модели.
Примеры числовых данных включают в себя:
Температура
Масса
Численность оленей, зимующих в заповеднике
Важное различие
Напротив, почтовые индексы США, несмотря на то, что они состоят из пяти или девяти цифр, не ведут себя как числа и не представляют собой математические отношения. Почтовый индекс 40004 (в округе Нельсон, штат Кентукки) не в два раза превышает почтовый индекс 20002 (в Вашингтоне, округ Колумбия). Эти числа представляют категории, в частности географические области, и считаются категориальными данными.
Векторы признаков
Вектор признаков — это упорядоченный набор числовых признаков, описывающих объект. Каждый объект в датасете представляется в виде вектора, где каждая координата соответствует значению определенного признака. Например, объект «квартира» может быть представлен вектором: [площадь, этаж, количество комнат, год постройки]. Понимание структуры векторов признаков — основа для работы с любыми ML-моделями.
Исследование набора данных
Перед построением модели важно исследовать данные двумя способами:
Визуальное исследование:
Гистограммы распределения каждого признака
Диаграммы разброса (scatter plots) для пар признаков
Ящики с усами (box plots) для выявления выбросов
Математическое исследование:
Среднее значение (mean)
Медиана (median)
Стандартное отклонение (standard deviation)
Квартили (quartiles)
Минимум и максимум
Определение выбросов
Выбросы — это значения, которые значительно отличаются от остальных данных. Они могут возникать из-за ошибок сбора данных, ошибок измерения или действительно редких событий. Методы выявления выбросов:
Метод Z-оценки: значения, отклоняющиеся от среднего более чем на 3 стандартных отклонения
Метод межквартильного размаха (IQR): значения за пределами [Q1 - 1.5*IQR, Q3 + 1.5*IQR]
Визуальные методы: ящики с усами, диаграммы рассеяния
Методы нормализации числовых данных
Нормализация приводит данные к сопоставимому масштабу. Четыре основных метода:
Масштабирование min-max: приводит значения к диапазону [0, 1] или [-1, 1]
Формула: (x - min) / (max - min)
Стандартизация (Z-оценка): приводит к среднему 0 и стандартному отклонению 1
Формула: (x - μ) / σ
Масштабирование по квартилям: устойчиво к выбросам
Использует медиану и межквартильный размах
Масштабирование по максимуму: деление на максимальное абсолютное значение
Полезно для данных, уже центрированных около нуля
Объединение (binning) числовых данных
Объединение — это процесс группировки непрерывных числовых значений в дискретные интервалы (корзины). Стратегии объединения:
Равноширокие интервалы: все корзины имеют одинаковую ширину
Равночастотные интервалы: в каждой корзине одинаковое количество наблюдений
Адаптивное объединение: интервалы определяются на основе распределения данных
Объединение полезно для:
Уменьшения влияния шума и выбросов
Преобразования непрерывных признаков для моделей, работающих с категориями
Улучшения интерпретируемости
Характеристики хороших непрерывных числовых признаков
Хорошие числовые признаки обладают следующими свойствами:
Релевантность: признак действительно связан с целевой переменной
Полнота: минимальное количество пропущенных значений
Информативность: признаки имеют достаточную дисперсию (почти постоянные признаки бесполезны)
Масштабируемость: признаки могут быть нормализованы
Устойчивость к выбросам: распределение не слишком зашумлено
Заключение
Качество данных напрямую влияет на качество модели. Понимание того, как работать с числовыми данными — от векторов признаков до нормализации и объединения — является критически важным навыком для специалиста по машинному обучению. Освоив эти концепции, вы будете готовы перейти к работе с категориальными данными и подготовке наборов данных для обучения и оценки моделей.
В этом материале нет файлов для просмотра.