Загрузка
МоделиДатасетыАкселераторЖурналыФорумОбучение
Модели
AI-решения
Разработчикам
Обучение
Сообщество
Заказать решение
Мероприятия
Другое

Войти
Модели
AI-решения
Разработчикам
ДатасетыНоутбуки
Обучение
Сообщество
ЖурналыQubu HubФорум
Заказать решение
ИнтеграторыСоревнованияРазместить задачу
Мероприятия
Другое
РейтингПриватные клубы
Войти
  1. Главная
  2. Обучение
  3. rabota-s-chislovymi-dannymi

Работа с числовыми данными

Специалисты по машинному обучению тратят больше времени на обработку данных, чем на построение моделей. Этот урок познакомит вас с работой с числовыми данными: вы узнаете, что такое векторы признаков, научитесь визуально и математически исследовать датасеты, выявлять выбросы и применять четыре метода нормализации. Также будут рассмотрены стратегии объединения числовых данных и характеристики хороших непрерывных признаков.

0/5
0 студентов
0 отзывов
85 минут
Работа с числовыми данными

Описание

Цели обучения

После изучения этого урока вы сможете:

  • Понимать векторы признаков.

  • Исследовать потенциальные возможности вашего набора данных визуально и математически.

  • Определять выбросы.

  • Понимать четыре различных метода нормализации числовых данных.

  • Понимать объединение (binning) и разрабатывать стратегии объединения числовых данных.

  • Понимать характеристики хороших непрерывных числовых признаков.

Предпосылки

В этом модуле предполагается, что вы знакомы с концепциями, изложенными в следующем модуле:

  • Введение в машинное обучение


Введение

Специалисты по машинному обучению тратят гораздо больше времени на оценку, очистку и преобразование данных, чем на построение моделей. Данные настолько важны, что в этом курсе этой теме посвящено целых три раздела:

  1. Работа с числовыми данными (данный модуль)

  2. Работа с категориальными данными

  3. Наборы данных, обобщение и переобучение

В этом модуле основное внимание уделяется числовым данным — то есть целым числам или значениям с плавающей запятой, которые ведут себя как числа. То есть они аддитивны, счетны, упорядочены и так далее. Следующий модуль посвящен категориальным данным, которые могут включать числа, ведущие себя как категории. Третий блок посвящен тому, как подготовить данные, чтобы обеспечить высококачественные результаты при обучении и оценке вашей модели.

Примеры числовых данных включают в себя:

  • Температура

  • Масса

  • Численность оленей, зимующих в заповеднике

Важное различие

Напротив, почтовые индексы США, несмотря на то, что они состоят из пяти или девяти цифр, не ведут себя как числа и не представляют собой математические отношения. Почтовый индекс 40004 (в округе Нельсон, штат Кентукки) не в два раза превышает почтовый индекс 20002 (в Вашингтоне, округ Колумбия). Эти числа представляют категории, в частности географические области, и считаются категориальными данными.


Векторы признаков

Вектор признаков — это упорядоченный набор числовых признаков, описывающих объект. Каждый объект в датасете представляется в виде вектора, где каждая координата соответствует значению определенного признака. Например, объект «квартира» может быть представлен вектором: [площадь, этаж, количество комнат, год постройки]. Понимание структуры векторов признаков — основа для работы с любыми ML-моделями.


Исследование набора данных

Перед построением модели важно исследовать данные двумя способами:

Визуальное исследование:

  • Гистограммы распределения каждого признака

  • Диаграммы разброса (scatter plots) для пар признаков

  • Ящики с усами (box plots) для выявления выбросов

Математическое исследование:

  • Среднее значение (mean)

  • Медиана (median)

  • Стандартное отклонение (standard deviation)

  • Квартили (quartiles)

  • Минимум и максимум


Определение выбросов

Выбросы — это значения, которые значительно отличаются от остальных данных. Они могут возникать из-за ошибок сбора данных, ошибок измерения или действительно редких событий. Методы выявления выбросов:

  • Метод Z-оценки: значения, отклоняющиеся от среднего более чем на 3 стандартных отклонения

  • Метод межквартильного размаха (IQR): значения за пределами [Q1 - 1.5*IQR, Q3 + 1.5*IQR]

  • Визуальные методы: ящики с усами, диаграммы рассеяния


Методы нормализации числовых данных

Нормализация приводит данные к сопоставимому масштабу. Четыре основных метода:

  1. Масштабирование min-max: приводит значения к диапазону [0, 1] или [-1, 1]

    • Формула: (x - min) / (max - min)

  2. Стандартизация (Z-оценка): приводит к среднему 0 и стандартному отклонению 1

    • Формула: (x - μ) / σ

  3. Масштабирование по квартилям: устойчиво к выбросам

    • Использует медиану и межквартильный размах

  4. Масштабирование по максимуму: деление на максимальное абсолютное значение

    • Полезно для данных, уже центрированных около нуля


Объединение (binning) числовых данных

Объединение — это процесс группировки непрерывных числовых значений в дискретные интервалы (корзины). Стратегии объединения:

  • Равноширокие интервалы: все корзины имеют одинаковую ширину

  • Равночастотные интервалы: в каждой корзине одинаковое количество наблюдений

  • Адаптивное объединение: интервалы определяются на основе распределения данных

Объединение полезно для:

  • Уменьшения влияния шума и выбросов

  • Преобразования непрерывных признаков для моделей, работающих с категориями

  • Улучшения интерпретируемости


Характеристики хороших непрерывных числовых признаков

Хорошие числовые признаки обладают следующими свойствами:

  1. Релевантность: признак действительно связан с целевой переменной

  2. Полнота: минимальное количество пропущенных значений

  3. Информативность: признаки имеют достаточную дисперсию (почти постоянные признаки бесполезны)

  4. Масштабируемость: признаки могут быть нормализованы

  5. Устойчивость к выбросам: распределение не слишком зашумлено


Заключение

Качество данных напрямую влияет на качество модели. Понимание того, как работать с числовыми данными — от векторов признаков до нормализации и объединения — является критически важным навыком для специалиста по машинному обучению. Освоив эти концепции, вы будете готовы перейти к работе с категориальными данными и подготовке наборов данных для обучения и оценки моделей.

Перейти к уроку
  • Иногда, когда у специалиста по МО есть знания предметной области, позволяющие предположить, что одна переменная связана с квадратом, кубом или другой степенью другой переменной, полезно создать синтетический признак на основе одного из существующих числовых признаков .
Перейти к уроку
  • Биннинг (также называемый группировкой ) — это метод проектирования функций , который группирует различные числовые поддиапазоны в интервалы или сегменты .
Перейти к уроку
  • До сих пор у нас создавалось впечатление, что модель действует непосредственно на строки набора данных; однако модели на самом деле принимают данные несколько по-другому.
Перейти к уроку
  • Яблони дают смесь великолепных фруктов и червивых гадостей. Тем не менее, яблоки в дорогих продуктовых магазинах представляют собой 100% идеальные плоды. Между садом и продуктовым магазином кто-то тратит много времени на удаление испорченных яблок или распыление небольшого количества воска на те, которые можно спасти. Как инженер ML, вы потратите огромное количество времени, отбрасывая плохие примеры и исправляя те, которые можно спасти.
Перейти к уроку
  • В этом модуле были изучены способы преобразования необработанных данных в подходящие векторы признаков . Хорошие числовые характеристики обладают теми же качествами, которые описаны в этом разделе.
Перейти к уроку
  • После изучения данных с помощью статистических и визуализирующих методов, вам следует преобразовать данные способами, которые помогут вашей модели обучаться более эффективно. Цель нормализации — преобразовать признаки так, чтобы они находились в схожем масштабе
Перейти к уроку
  • Прежде чем создавать векторы признаков, необходимо изучить числовые данные двумя способами: визуальным и статистическим. Этот урок покажет, как использовать графики (диаграммы рассеяния, гистограммы) для поиска аномалий и закономерностей, а также как собирать базовую статистику (среднее, медиану, стандартное отклонение, квартили). Вы научитесь находить выбросы, отличать ошибки от достоверных аномалий и принимать решения: удалять их, сохранять или применять обрезку.

Предпросмотр файлов

В этом материале нет файлов для просмотра.

Просмотры

Похожие курсы

Загрузка...
Загрузка комментариев...

Оценка

Детали курса

Автор: Гера
Комментарии: 0
Просмотры: 13
Дата добавления: 2 апреля 2026
Язык: Русский
Направления: Основы работы с ИИ, Оптимизация
Длительность: 85 минут
Всего студентов: 0 студентов

Автор

Г

Гера

Админ

Специалист по внедрению ИИ в бизнес-процессы. Мост между бизнесом и технологией.

Профиль автора