Tourists dataset / fluorescent

Набор данных с постами, комментариями и отзывами о туризме, преимущественно на русском языке, включая обработанные тексты, метаданные о источниках, тональности и геолокации.

Обновлено 29.05.2026
1 файлов
0 комментариев
Подходит для задач:
NLP
Text Classification
Форматы файлов:
CSV
Типы данных:
Текст

Описание

Датасет "tourists_dataset" содержит информацию о туристических публикациях, собранных из различных источников, таких как социальные сети (VK, Telegram), видео (YouTube), отзывы (tophotels.ru) и новости. Он фокусируется на контенте, связанном с туризмом в России и за рубежом (например, Крым, Азовское море, Черное море, Египет), включая описания путешествий, отзывы об отелях, маршрутах, пляжах и культурных событиях. Данные включают оригинальные тексты, их обработанные версии (с удалением эмодзи, нежелательных символов, приведением к нижнему регистру, лемматизацией и удалением стоп-слов), а также метаданные о вовлеченности (лайки, репосты, просмотры), тональности (positive, neutral, speech и т.д.), геолокации (страна, регион, город) и источниках.

Датасет подходит для анализа туристических трендов, sentiment analysis, кластеризации тем и обработки естественного языка. Точное количество строк не указано (preview показывает несколько примеров), размер — небольшой (5 загрузок за последний месяц). Карточка датасета отсутствует, поэтому описание основано на preview и метаданных. Поиск моделей, использующих этот датасет, не выявил результатов — вероятно, из-за новизны датасета, он не применяется в публичных моделях на Hugging Face или в литературе.

Колонки датасета:

  • Дата: Дата публикации (строка, длина 15-16).

  • Заголовок: Заголовок поста (строка, длина 1-300, может быть null).

  • Текст: Оригинальный текст (строка, длина 1-32k).

  • Обработанный текст (удалены эмодзи, удалены разные нежелательные знаки, приведено к нижнему регистру): Обработанный текст (строка, длина 1-32k).

  • Обработанный текст + лемматизация и удаление стоп-слов: Лемматизированный текст без стоп-слов (строка, длина 2-29.2k).

  • Источник: Источник (строка, длина 4-40, например, vk.com, youtube.com).

  • Тип источника: Тип источника (строка, 9 значений, например, Соцсети, Видео, Отзывы).

  • Тип сообщения: Тип сообщения (строка, 5 значений, например, Пост, Комментарий).

  • Тип автора: Тип автора (строка, 3 значения, например, Личный профиль, Сообщество).

  • Место публикации: Место публикации (строка, длина 1-243, может быть null).

  • Пол: Пол автора (строка, 2 значения, мужской/женский, может быть null).

  • Возраст: Возраст автора (float64, 1-122, может быть null).

  • Аудитория: Размер аудитории (int64, 0-44M).

  • Комментариев: Количество комментариев (int64, 0-7.37k).

  • Цитируемость СМИ: Цитируемость в СМИ (float64, 1-497k, может быть null).

  • Репостов: Количество репостов (int64, 0-4.94k).

  • Лайков: Количество лайков (int64, 0-224k).

  • Вовлеченность: Уровень вовлеченности (int64, 0-224k).

  • Просмотров: Количество просмотров (float64, 1-4.62M, может быть null).

  • Дублей: Количество дубликатов (int64, 1-11.4k).

  • Тональность: Тональность текста (строка, 5 значений, например, positive, neutral).

  • Страна: Страна (строка, длина 3-40, может быть null, например, Россия, Египет).

  • Регион: Регион (строка, длина 3-40, может быть null, например, Краснодарский край).

  • Город: Город (строка, длина 1-29, может быть null, например, Ижевск, Хургада).

  • Язык: Язык (строка, 25 значений, преимущественно Русский).

  • Место: Место (строка, длина 3-92, может быть null).

  • Номер тематического кластера: Номер кластера (int64, 0-14).

sample.csv - пример датасета (первые 200 строк)

Предпросмотр файлов

В этом датасете нет файлов для предпросмотра.

Просмотры

Скачивания

Похожие датасеты

Оценка

Детали датасета

Автор: Andrew
Дата добавления: 15.08.2025
Объем: 173.13 КБ
Комментарии: 0
Просмотры: 19
Скачивания: 0
Лицензия: MIT

Автор

Andrew

Andrew

Админ

Профиль автора
Загрузка...
Загрузка комментариев...