Multilingual Toxicity Dataset/textdetox

Набор данных для бинарной классификации токсичности текстов на нескольких языках, включая английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский, подготовленный для задач TextDetox 2024 и 2025.

Обновлено 24.07.2026
16 файлов
0 комментариев
Multilingual Toxicity Dataset/textdetox
Подходит для задач:
Text Classification
NLP
Форматы файлов:
Другое
Типы данных:
Текст
Таблицы
Ключевые слова:
#фильтрация
#обработка языка
#определение тональности

Описание

Датасет: multilingual_toxicity_dataset

  1. Название: multilingual_toxicity_dataset

  2. Краткое описание: Набор данных для бинарной классификации токсичности текстов на нескольких языках, включая английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский, подготовленный для задач TextDetox 2024 и 2025.

  3. Полное описание:
    Датасет "multilingual_toxicity_dataset" создан для задач выявления токсичности в текстах на нескольких языках в рамках инициатив TextDetox 2024 и 2025. Он включает текстовые записи с метками, указывающими, является ли текст токсичным (1) или нетоксичным (0). Каждая запись содержит:

    • text: Текст сообщения (строка, длина 3–1770 символов), например, твиты, посты или комментарии, на языках, таких как английский, итальянский, французский, иврит, хинглиш, японский, татарский и украинский.

    • toxic: Метка токсичности (int64, 0 — нетоксичный, 1 — токсичный).

    Для TextDetox 2024 датасет включает по 5 тысяч записей для каждого языка (2.5 тысячи токсичных и 2.5 тысячи нетоксичных образцов). В 2025 году он расширен дополнительными языками (итальянский, французский, иврит, хинглиш, японский, татарский). Данные собраны из различных источников (оригинальные корпуса указаны в карточке датасета), включая переводы английских корпусов, фильтрацию по ключевым словам и аннотацию с помощью краудсорсинга (например, для украинского языка).

    Датасет предназначен для задач классификации токсичности, анализа тональности и разработки безопасных языковых моделей. Примеры текстов охватывают темы ЛГБТ (запрещенная в россии организация), религиозных и этнических групп, женских прав и других социальных вопросов, с акцентом на позитивные или нейтральные сообщения в preview (все помечены как токсичные или нетоксичные). Общий объем датасета не указан, но он активно используется (434 загрузки за последний месяц).

    Источники:

    • Датасет основан на нескольких оригинальных корпусах, кредиты принадлежат их авторам.

    • Использованы методы перевода, фильтрации и краудсорсинга для создания данных, особенно для украинского языка (см. статью Dementieva et al., 2024).

    Примеры использования:

    • Обучение моделей для фильтрации токсичного контента в мессенджерах и соцсетях.

    • Исследование кросс-лингвистического переноса знаний для классификации токсичности.

    • Разработка безопасных и справедливых языковых моделей.

Предпросмотр файлов

В этом датасете нет файлов для предпросмотра.

Просмотры

Скачивания

Похожие датасеты

Оценка

Детали датасета

Автор: Andrew
Дата добавления: 15.08.2025
Объем: 6.5 МБ
Комментарии: 0
Просмотры: 51
Скачивания: 0
Лицензия: MIT

Автор

Andrew

Andrew

Админ

Профиль автора
Загрузка...
Загрузка комментариев...