Yandex-Q
Набор данных с вопросами и ответами с платформы Яндекс.Кью, содержащий разнообразные пользовательские вопросы и ответы на русском языке.
URL источника данных: https://huggingface.co/datasets/its5Q/yandex-q
Описание
Датасет Yandex-Q представляет собой коллекцию вопросов и ответов, извлеченных с платформы Яндекс.Кью (сервис, аналогичный Quora, ныне закрытый). Он содержит 836810 отвеченных вопросов из общего числа 1,297,670 вопросов, доступных через API платформы. Данные включают широкий спектр тем: от бытовых и юридических вопросов до научных, философских и религиозных. Датасет подходит для задач обработки естественного языка, таких как обучение моделей для систем вопросно-ответов, классификации текста, семантического поиска, анализа тональности или извлечения признаков.
Датасет состоит из двух файлов:
answers.jsonl: Содержит упрощенные записи с вопросами и ответами. Каждая запись включает три поля: question (заголовок вопроса, строка), description (описание вопроса, строка или null, часто пустое) и answer (текст ответа, строка). Примеры вопросов варьируются от практических («Как фотографировать свадьбы?») до теоретических («Что будет, если прибавить 1 см к толщине квантовой струны?»). Ответы могут быть краткими или развернутыми, иногда содержащими субъективные мнения или орфографические ошибки, что отражает природу пользовательского контента.
full.jsonl: Содержит полные данные, включая метаданные для каждого вопроса: идентификаторы, теги (например, «физика», «религия», «обувь»), временные метки создания и обновления, количество просмотров, голосов, комментариев, информацию об авторе, рейтинг качества и форматирование текста (HTML). Этот файл также включает вопросы без ответов и массив ответов (answers) для каждого вопроса, где каждый ответ содержит собственные метаданные (например, идентификатор автора, количество голосов, временная метка).
Данные были собраны с использованием «скрытых» API Яндекс.Кью через скрипты, доступные в репозитории GitHub автора датасета. Язык датасета преимущественно русский, хотя могут встречаться фрагменты на других языках. Все 836810 примеров находятся в тренировочном наборе (train split), валидационная или тестовая выборки отсутствуют.
Применение:
Обучение моделей для систем вопросно-ответов.
Анализ пользовательского контента и социальных паттернов.
Разработка алгоритмов семантического поиска или классификации текста.
Исследование лингвистических особенностей текстов на русском языке.
Предпросмотр файлов
В этом датасете нет файлов для предпросмотра.