Наборы данных для ИИ с наибольшим числом лайков на Hugging Face 2026
Об этих данных
Наборы данных для ИИ с наибольшим числом лайков на Hugging Face 2026Как собраны данные. Лайки работают для наборов данных так же, как для моделей: один вошедший аккаунт, один репозиторий и публичный счетчик в поле likes API, а список это сортировка самого Hub по этому полю. Загрузки наборов данных, которые приводятся ниже для сравнения, считаются иначе, чем загрузки моделей. С сентября 2024 года Hub считает все файлы, которые пользователь скачивает из одного репозитория в течение пятиминутного окна и которые определяются по его IP-адресу, одной загрузкой, подсчитанной на сервере при отдаче файлов. До этой даты он считал вызовы функции load_dataset из библиотеки datasets, а ручные загрузки через веб-интерфейс или с помощью инструментов вроде wget вообще не учитывались.
Контекст. Список это портрет того, из чего собран открытый стек обучения моделей. Рядом с prompts.chat стоят корпуса предобучения веб-масштаба fineweb, fineweb-edu, dolma, RedPajama-Data-1T и Wikipedia; наборы с обратной связью от людей и инструкциями hh-rlhf, oasst1, alpaca, databricks-dolly-15k, OpenOrca и medical-o1-reasoning-SFT; математический бенчмарк gsm8k, который Hub помечает как официальный бенчмарк; небольшой синтетический корпус TinyStories; и EasyNegative, файлы которого представляют собой эмбеддинг и два образца изображений, а не текст. Двенадцать из пятнадцати репозиториев созданы до 2024 года, и ни один не создан в 2025 году или позже.
Ограничения. Лайк это закладка одного аккаунта, а не мера использования, и здесь они расходятся так же сильно, как у моделей: у набора с наибольшим числом лайков 22 609 загрузки за последние тридцать дней, тогда как у gsm8k от OpenAI, четвертого по лайкам, их 1 221 924. Поскольку лайки не сгорают, возраст помогает, и отчасти поэтому в списке нет ничего опубликованного за последний год. Загрузки наборов данных к тому же считаются по IP-адресу внутри пятиминутного окна, а не по людям, так что общие сети и облачные задачи не разделяются.
На prompts.chat приходится 31,7 процента лайков этой группы, и это единственная строка выше 5 000. Падение с первого места на второе составляет 6 482 лайков, больше, чем весь итог пятнадцатой строки, dolma, с 1 087. Дважды встречается только один издатель, HuggingFaceFW, с fineweb и fineweb-edu. Самый старый репозиторий группы это выгрузка Wikipedia от wikimedia, перенесенная при миграции Hub в марте 2022 года, а самый новый это medical-o1-reasoning-SFT от декабря 2024 года. Загрузки рассказывают другую историю: gsm8k от OpenAI лидирует в группе с 1 221 924 загрузками за тридцать дней, в 54,05 раза больше, чем у лидера по лайкам.
Главное
Разбор данных
Цифры, динамика и источники этого графика
Методика и источник
- Источник данных
- Hugging Face Hub API
- Охват
- 15 позиций · 2026 · 15 значений
- Показатель
- Лайки на Hugging Face
- Обновлено
- 21 сентября 2026
- Составитель
- Команда ANYSTAT по данным указанного источника
- Значения приведены так, как их публикует источник. Ничего не пересчитывается и не переводится в другие единицы — добавлены только разделители разрядов и не более двух знаков после запятой.
- Позиции упорядочены по убыванию значения за 2026 год.
Статья с этими данными
Источники и ссылки
Все внешние источники этих данных
Похожие графики
Другая статистика на похожие темы