Otvet Mail.ru Dataset
Набор данных с около 130 миллионами вопросов и ответов с платформы otvet.mail.ru, собранных до 3 мая 2022 года, преимущественно на русском языке.
URL источника данных: https://huggingface.co/datasets/its5Q/otvetmailru
Источник данных:Otvet Mail.ru (автор: its5Q)
Описание
Датасет Otvet Mail.ru включает около 130 миллионов вопросов с соответствующими ответами и метаданными, собранных с платформы otvet.mail.ru до 3 мая 2022 года. Это перезалив датасета, ранее опубликованного на Kaggle. Данные охватывают широкий спектр тем, включая бытовые, юридические, научные и личные вопросы, и предназначены для задач обработки естественного языка, таких как обучение систем вопросно-ответов, классификация текста, семантический поиск или анализ тональности.
Содержимое файлов
Формат: JSONL (сжатый в ZSTD, разделен на части по 2,500,000 записей).
Пример структуры:
{ "id": "<идентификатор вопроса>", "question": "<текст вопроса>", "answers": [ { "text": "<текст ответа>", "author": "<идентификатор или имя автора>", "created": "<временная метка>", "rating": <число>, ... } ], "tags": ["<тег1>", "<тег2>"], "created": "<временная метка>", ... }Содержимое:
Вопросы и ответы по различным темам, с метаданными, такими как идентификаторы, теги, рейтинги и временные метки.
Особенности
Все примеры находятся в тренировочном наборе (train split), валидационная или тестовая выборки отсутствуют.
Данные собраны с использованием AJAX API с автоинкрементными идентификаторами вопросов.
Язык: преимущественно русский, возможны фрагменты на других языках.
Применение
Обучение моделей для систем вопросно-ответов.
Анализ пользовательского контента и социальных паттернов.
Исследование языковых особенностей текстов на русском языке.
Ограничения
Несоответствие типов данных между записями может затруднять обработку. Пользовательский контент может содержать ошибки или субъективные мнения.
Предпросмотр файлов
В этом датасете нет файлов для предпросмотра.