Текстовые датасеты используются для обучения моделей обработки естественного языка (NLP): классификация текстов, распознавание сущностей, машинный перевод, суммаризация и анализ тональности. В каталоге представлены корпуса на различных языках и для различных предметных областей.