Yandex-Q

Набор данных с вопросами и ответами с платформы Яндекс.Кью, содержащий разнообразные пользовательские вопросы и ответы на русском языке.

Обновлено 21.07.2026
0 файлов
0 комментариев
Подходит для задач:
Question Answering
Text Classification
Форматы файлов:
JSON
Типы данных:
Текст

URL источника данных: https://huggingface.co/datasets/its5Q/yandex-q

Описание

Датасет Yandex-Q представляет собой коллекцию вопросов и ответов, извлеченных с платформы Яндекс.Кью (сервис, аналогичный Quora, ныне закрытый). Он содержит 836810 отвеченных вопросов из общего числа 1,297,670 вопросов, доступных через API платформы. Данные включают широкий спектр тем: от бытовых и юридических вопросов до научных, философских и религиозных. Датасет подходит для задач обработки естественного языка, таких как обучение моделей для систем вопросно-ответов, классификации текста, семантического поиска, анализа тональности или извлечения признаков.

Датасет состоит из двух файлов:

  • answers.jsonl: Содержит упрощенные записи с вопросами и ответами. Каждая запись включает три поля: question (заголовок вопроса, строка), description (описание вопроса, строка или null, часто пустое) и answer (текст ответа, строка). Примеры вопросов варьируются от практических («Как фотографировать свадьбы?») до теоретических («Что будет, если прибавить 1 см к толщине квантовой струны?»). Ответы могут быть краткими или развернутыми, иногда содержащими субъективные мнения или орфографические ошибки, что отражает природу пользовательского контента.

  • full.jsonl: Содержит полные данные, включая метаданные для каждого вопроса: идентификаторы, теги (например, «физика», «религия», «обувь»), временные метки создания и обновления, количество просмотров, голосов, комментариев, информацию об авторе, рейтинг качества и форматирование текста (HTML). Этот файл также включает вопросы без ответов и массив ответов (answers) для каждого вопроса, где каждый ответ содержит собственные метаданные (например, идентификатор автора, количество голосов, временная метка).

Данные были собраны с использованием «скрытых» API Яндекс.Кью через скрипты, доступные в репозитории GitHub автора датасета. Язык датасета преимущественно русский, хотя могут встречаться фрагменты на других языках. Все 836810 примеров находятся в тренировочном наборе (train split), валидационная или тестовая выборки отсутствуют.

Применение:

  • Обучение моделей для систем вопросно-ответов.

  • Анализ пользовательского контента и социальных паттернов.

  • Разработка алгоритмов семантического поиска или классификации текста.

  • Исследование лингвистических особенностей текстов на русском языке.

Предпросмотр файлов

В этом датасете нет файлов для предпросмотра.

Просмотры

Скачивания

Похожие датасеты

Оценка

Детали датасета

Автор: Andrew
Дата добавления: 11.07.2025
Объем: Неизвестно
Комментарии: 0
Просмотры: 65
Скачивания: 0
Лицензия: MIT

Автор

Andrew

Andrew

Админ

Профиль автора
Загрузка...
Загрузка комментариев...