Фильтры
- Popular
- MIT
- Apache 2.0
- Creative Commons
- CC0: Public Domain
- CC BY-NC-SA 4.0
- CC BY-SA 4.0
- CC BY-SA 3.0
- Attribution 4.0 International (CC BY 4.0)
- Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)
- Attribution 3.0 Unported (CC BY 3.0)
- Attribution 3.0 IGO (CC BY 3.0 IGO)
- Attribution-NonCommercial-ShareAlike 3.0 IGO (CC BY-NC-SA 3.0 IGO)
- Attribution-NoDerivatives 4.0 International (CC BY-ND 4.0)
- Attribution-NonCommercial-NoDerivatives 4.0 International (CC BY-NC-ND 4.0)
- GPL
- GPL 2
- GPL 3
- GNU Lesser General Public License 3.0
- GNU Affero General Public License 3.0
- GNU Free Documentation License 1.3
- Open Data Commons
- ODC Open Database License (ODbL)
- ODC Attribution License (ODC-By)
- Database: Open Database, Contents: Database Contents
- Database: Open Database, Contents: © Original Authors
- ODC Public Domain Dedication and Licence (PDDL)
- Community Data License
- Community Data License Agreement - Permissive - Version 1.0
- Community Data License Agreement - Sharing - Version 1.0
- Special
- World Bank Dataset Terms of Use
- Reddit API Terms
- U.S. Government Works
- EU ODP Legal Notice
- Responsible AI License
- Responsible AI License (RAIL)
- Other
- BSD License
- Other (specified in description)
- Unknown
Сентябрь 2026
- Не важно
- С источником
- Без источника
- Абхазский
- Аварский
- Авестийский
- Азербайджанский
- Аймара
- Акан
- Албанский
- Амхарский
- Английский
- Арабский
- Арагонский
- Армянский
- Ассамский
- Афарский
- Африкаанс
- Бамбара
- Баскский
- Башкирский
- Белорусский
- Бенгальский
- Бирманский
- Бислама
- Болгарский
- Боснийский
- Бретонский
- Валлийский
- Валлонский
- Венгерский
- Венда
- Волапюк
- Волоф
- Вьетнамский
- Гаитянский
- Галисийский
- Ганда
- Гереро
- Гренландский
- Греческий
- Грузинский
- Гуарани
- Гуджарати
- Гэльский
- Датский
- Дзонг-кэ
- Дивехи
- Зулу
- Иврит
- Игбо
- Идиш
- Идо
- Индонезийский
- Интерлингва
- Интерлингве
- Инуктитут
- Инупиак
- Ирландский
- Исландский
- Испанский
- Итальянский
- Йоруба
- Казахский
- Каннада
- Канури
- Каталанский
- Кашмири
- Кечуа
- Кикуйю
- Киньяма
- Киргизский
- Китайский
- Коми
- Конго
- Корейский
- Корнский
- Корсиканский
- Коса
- Кри
- Курдский
- Кхмерский
- Лаосский
- Латинский
- Латышский
- Лимбургский
- Лингала
- Литовский
- Луба-катанга
- Люксембургский
- Македонский
- Малагасийский
- Малайский
- Малаялам
- Мальтийский
- Маори
- Маратхи
- Маршалльский
- Монгольский
- Мэнский
- Навахо
- Науру
- Ндебеле северный
- Ндебеле южный
- Ндунга
- Немецкий
- Непальский
- Нидерландский
- Норвежский
- Норвежский букмол
- Ньянджа
- Нюнорск
- Оджибве
- Окситанский
- Ория
- Оромо
- Осетинский
- Пали
- Пенджабский
- Персидский
- Польский
- Португальский
- Пушту
- Ретороманский
- Руанда
- Румынский
- Рунди
- Русский
- Самоанский
- Санго
- Санскрит
- Сардинский
- Свази
- Северный саамский
- Сербский
- Сингальский
- Синдхи
- Словацкий
- Словенский
- Сомали
- Сото южный
- Суахили
- Сунданский
- Сычуаньский и
- Тагальский
- Таджикский
- Таитянский
- Тайский
- Тамильский
- Татарский
- Тви
- Телугу
- Тибетский
- Тигринья
- Тонганский
- Тсвана
- Тсонга
- Турецкий
- Туркменский
- Узбекский
- Уйгурский
- Украинский
- Урду
- Фарерский
- Фиджи
- Финский
- Французский
- Фризский
- Фулах
- Хауса
- Хинди
- Хиримоту
- Хорватский
- Церковнославянский
- Чаморро
- Чеченский
- Чешский
- Чжуан
- Чувашский
- Шведский
- Шона
- Эве
- Эсперанто
- Эстонский
- Яванский
- Японский
Датасеты и наборы данных

Готовые датасеты
для обучения моделей
Готовые наборы данных для обучения моделей. Скачивайте проверенные датасеты или загружайте свои, чтобы монетизировать уникальные данные
Наборы данных для обучения моделей, тестирования гипотез и практических исследований. Фильтруйте по сфере, типу данных и формату — находите нужное быстро.
Новые датасеты

Интеллектуальный AI-тьютор для СПО
Обучающий датасет для дообучения LLM (Mistral Small 24B, QLoRA 4-bit) в роли AI-тьютора для СПО. Специальность 15.02.14 «Оснащение средств автоматизации». 771 пример в JSONL: конспекты, тесты, объяснения, диалоги по измерительным системам и промышленной автоматизации. Разбиение: 80% train / 10% val / 10% test.

YeniseiGovReports-TD
Сканы страниц с аннотациями в формате COCO для детекции текстовых блоков, строк, таблиц, заголовков и других элементов макета исторических документов.

VertebraeKeypoints50
Датасет рентгеновских снимков позвоночника в сагиттальной проекции с разметкой замыкательных линий позвонков.

Датасет типов лесного покрова
Картографические и топографические данные ~581 000 участков леса заповедника Рузвельт (Колорадо, США) для классификации типа древесного покрова. Содержит данные дистанционного зондирования, геодезии и почвенных карт без полевых измерений.
Только для приватного клуба
Пока нет датасетов этой категории
Самые популярные

🛒 E-commerce датасет заказов (Olist)
Комплексный датасет онлайн-магазина с данными о заказах, клиентах, оплатах, доставке и отзывах. Подходит для анализа полного цикла e-commerce.

🏠 Датасет цен на недвижимость (House Prices)
Датасет с характеристиками жилых домов, используемый для прогнозирования их стоимости на основе множества факторов.

Психологические_профили_Instagram_аудитории_v1
Датасет для анализа целевой аудитории психологических курсов.
RUSentiment
Коллекция русскоязычных текстов из отзывов и социальных сетей с размеченной тональностью (positive/negative). 25 000 размеченных примеров.
Самые обсуждаемые

События, продажи и признаки в ритейле
Гибридная нейросетевая архитектура для прогнозирования продаж в ритейле, объединяющая временные ряды, табличные признаки и промо-события в единую модель.

Швейцарские квартиры: геометрия и симуляции
Детализированный набор данных по более 42 000 квартирам в Швейцарии — включает геометрию, характеристики помещений и результаты симуляций по инсоляции, шуму, видам, центральности и другим качествам.

Психологические_профили_Instagram_аудитории_v1
Датасет для анализа целевой аудитории психологических курсов.
RUSentiment
Коллекция русскоязычных текстов из отзывов и социальных сетей с размеченной тональностью (positive/negative). 25 000 размеченных примеров.