Multilingual Toxicity Dataset/textdetox
Набор данных для бинарной классификации токсичности текстов на нескольких языках, включая английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский, подготовленный для задач TextDetox 2024 и 2025.

Описание
Датасет: multilingual_toxicity_dataset
Название: multilingual_toxicity_dataset
Краткое описание: Набор данных для бинарной классификации токсичности текстов на нескольких языках, включая английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский, подготовленный для задач TextDetox 2024 и 2025.
Полное описание:
Датасет "multilingual_toxicity_dataset" создан для задач выявления токсичности в текстах на нескольких языках в рамках инициатив TextDetox 2024 и 2025. Он включает текстовые записи с метками, указывающими, является ли текст токсичным (1) или нетоксичным (0). Каждая запись содержит:text: Текст сообщения (строка, длина 3–1770 символов), например, твиты, посты или комментарии, на языках, таких как английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский.
toxic: Метка токсичности (int64, 0 — нетоксичный, 1 — токсичный).
Для TextDetox 2024 датасет включает по 5 тысяч записей для каждого языка (2.5 тысячи токсичных и 2.5 тысячи нетоксичных образцов). В 2025 году он расширен дополнительными языками (итальянский, французский, иврит, хинглиш, японский, татарский). Данные собраны из различных источников (оригинальные корпуса указаны в карточке датасета), включая переводы английских корпусов, фильтрацию по ключевым словам и аннотацию с помощью краудсорсинга (например, для украинского языка).
Датасет предназначен для задач классификации токсичности, анализа тональности и разработки безопасных языковых моделей. Примеры текстов охватывают темы ЛГБТ (запрещенная в россии организация), религиозных и этнических групп, женских прав и других социальных вопросов, с акцентом на позитивные или нейтральные сообщения в preview (все помечены как токсичные или нетоксичные). Общий объем датасета не указан, но он активно используется (434 загрузки за последний месяц).
Источники:
Датасет основан на нескольких оригинальных корпусах, кредиты принадлежат их авторам.
Использованы методы перевода, фильтрации и краудсорсинга для создания данных, особенно для украинского языка (см. статью Dementieva et al., 2024).
Примеры использования:
Обучение моделей для фильтрации токсичного контента в мессенджерах и соцсетях.
Исследование кросс-лингвистического переноса знаний для классификации токсичности.
Разработка безопасных и справедливых языковых моделей.
Предпросмотр файлов
В этом датасете нет файлов для предпросмотра.