Загрузка урока...
В этом уроке мы начнем погружение в обработку естественного языка (NLP). Вы узнаете, как развивались алгоритмы: от очистки текста и «мешка слов» до дистрибутивной семантики и подходов вроде Word2Vec. Мы разберем основы информационного поиска, алгоритм PageRank и поймем, как машины научились улавливать смысл слов.

Добро пожаловать на первую лекцию нашего продвинутого курса по NLP! Сегодня мы с вами заложим надежный фундамент для дальнейшего изучения архитектуры современных нейросетей и больших языковых моделей. Поскольку многие из вас уже знакомы с базовыми концепциями машинного обучения, в этом уроке мы сделаем шаг назад и посмотрим на эволюцию подходов к тексту глобально: от классических инженерных эвристик до современного глубокого обучения.
Наша главная цель — показать, как исторически менялась логика работы с естественным языком. Мы подробно разберем, почему старые методы очистки данных (вроде удаления пунктуации) больше не применяются при обучении современных моделей, как алгоритмы научились понимать контекст без составленных вручную словарей, и как такие технологии, как PageRank и Word2Vec, изменили индустрию. Этот урок поможет систематизировать знания перед переходом к механизмам внимания (Attention) и Трансформерам.
Основные темы и рассматриваемые вопросы:
Организационные моменты курса: как мы будем оценивать ваши успехи, правила выполнения практических заданий и альтернативные форматы получения баллов.
Классическая предобработка текста: почему раньше было обязательно удалять пунктуацию и невидимые символы, и почему мы отказались от этого сегодня. Зачем нужны токенизация, стемминг и лемматизация.
Частотные модели представления текста: как перевести слова в числа с помощью подходов «мешок слов» (Bag of Words), TF-IDF и метрики BM25 с ее параметрами насыщения.
Меры близости документов: почему мы чаще всего используем косинусную меру вместо евклидова расстояния, и в каких случаях применяется дивергенция Йенсена-Шеннона.
Информационный поиск и алгоритм PageRank: как поисковые системы научились находить самые важные страницы в интернете с помощью графов ссылок и концепции «случайного пользователя» с телепортацией.
Дистрибутивная семантика и Word2Vec: как понимание контекста заменило ручные правила. Мы разберем два подхода (CBOW и Skip-gram), функцию потерь и особенности векторной арифметики (на примере «Король» - «Мужчина» + «Женщина» = «Королева»).
Развитие векторных представлений: чем алгоритм GloVe, использующий глобальную статистику совстречаемости, отличается от Word2Vec, и как разбиение на триграммы в FastText помогает моделям понимать неизвестные слова.
Переход к современности: краткий обзор Трансформеров и архитектуры BERT (как модель учится угадывать спрятанные слова и предсказывать связи между предложениями).
В этом материале нет файлов для просмотра.