Habr QnA Dataset
Набор данных с вопросами и ответами, собранными с платформы Habr QnA, преимущественно на русском языке, включающий 723430 вопросов с ответами, комментариями и метаданными.
URL источника данных: https://huggingface.co/datasets/its5Q/habr_qna
Источник данных:Habr QnA (автор: its5Q)
Описание
Датасет Habr QnA содержит 723430 вопросов с ответами, комментариями и метаданными, собранными с платформы Habr QnA — сервиса, ориентированного на технические, IT и научные темы. Данные предназначены для задач обработки естественного языка, таких как разработка систем вопросно-ответов, классификация текста, анализ тональности, семантический поиск или извлечение признаков. Датасет включает вопросы, ответы, а также исходный код на различных языках программирования, что делает его особенно полезным для анализа технического контента.
Содержимое файлов
Формат: JSONL (сжатый в .gz).
Пример структуры:
{ "question": "<текст вопроса>", "answer": "<текст ответа>", "comments": ["<комментарий1>", "<комментарий2>"], "author": "<идентификатор или имя автора>", "created": "<временная метка>", "tags": ["<тег1>", "<тег2>"], "code": "<исходный код, если присутствует>", ... }Содержимое
Вопросы и ответы по программированию, IT, науке, а также фрагменты кода на языках, таких как Python, JavaScript, C++ и др.
Особенности
Все 723430 примеров находятся в тренировочном наборе (train split), валидационная или тестовая выборки отсутствуют.
Данные собраны с помощью скрипта, доступного в репозитории GitHub автора (its5Q).
Язык: преимущественно русский, с фрагментами кода на различных языках программирования.
Применение
Обучение моделей для систем вопросно-ответов в технической сфере.
Анализ технического контента и кода.
Исследование лингвистических и социальных паттернов в IT-сообществе.
Предпросмотр файлов
В этом датасете нет файлов для предпросмотра.