Conjuntos de datos de IA con más me gusta en Hugging Face 2026
Sobre estos datos
Conjuntos de datos de IA con más me gusta en Hugging Face 2026Cómo se recogen los datos. Los me gusta funcionan igual para los conjuntos de datos que para los modelos: una cuenta registrada, un repositorio y un recuento público expuesto en el campo likes de la API, y la lista es la ordenación del propio Hub por ese campo. Las descargas de conjuntos de datos, citadas más abajo como comparación, se cuentan de otra manera que las de los modelos. Desde septiembre de 2024 el Hub trata todos los archivos que un usuario descarga de un mismo repositorio dentro de una ventana de cinco minutos, identificado por su dirección IP, como una sola descarga, contada en el servidor mientras se sirven los archivos. Antes de esa fecha contaba las llamadas a la función load_dataset de la biblioteca datasets, y las descargas manuales por la interfaz web o con herramientas como wget no se contaban.
Contexto. La lista es un retrato de aquello con lo que se construye el ecosistema abierto de modelos. Junto a prompts.chat están los corpus de preentrenamiento a escala web como fineweb, fineweb-edu, dolma, RedPajama-Data-1T y Wikipedia; los conjuntos de retroalimentación humana e instrucciones hh-rlhf, oasst1, alpaca, databricks-dolly-15k, OpenOrca y medical-o1-reasoning-SFT; el banco de pruebas de matemáticas gsm8k, que el Hub etiqueta como banco de pruebas oficial; el pequeño corpus sintético TinyStories; y EasyNegative, cuyos archivos son un embedding y dos imágenes de muestra en lugar de texto. Doce de los quince repositorios se crearon antes de 2024 y ninguno se creó en 2025 o después.
Límites. Un me gusta es un marcador de una cuenta, no una medida de uso, y los dos divergen aquí tanto como en los modelos: el conjunto de datos con más me gusta registró 22.609 descargas en los últimos treinta días, mientras que gsm8k de OpenAI, cuarto por me gusta, registró 1.221.924. Como los me gusta no caducan, la antigüedad ayuda, y eso explica en parte que no aparezca nada publicado en el último año. Las cifras de descargas de conjuntos de datos se cuentan además por dirección IP dentro de una ventana de cinco minutos y no por persona, así que las redes compartidas y los trabajos en la nube no se distinguen.
prompts.chat concentra el 31,7 por ciento de los me gusta de este grupo y es la única entrada por encima de 5000. La caída del primero al segundo puesto es de 6482 me gusta, más que el total entero del decimoquinto puesto, dolma, con 1087. Solo un editor aparece dos veces, HuggingFaceFW, con fineweb y fineweb-edu. El repositorio más antiguo del grupo es el volcado de Wikipedia de wikimedia, arrastrado en la migración del Hub de marzo de 2022, y el más reciente es medical-o1-reasoning-SFT, de diciembre de 2024. Las descargas cuentan otra historia: gsm8k de OpenAI lidera el grupo con 1.221.924 descargas en treinta días, 54,05 veces las del líder por me gusta.
Datos clave
Análisis de los datos
Cifras, tendencias y fuentes de este gráfico
Metodología y fuente
- Fuente de datos
- Hugging Face Hub API
- Cobertura
- 15 elementos · 2026 · 15 observaciones
- Medida
- Me gusta en Hugging Face
- Última actualización
- 21 de septiembre de 2026
- Elaborado por
- El equipo de ANYSTAT, a partir de la fuente indicada
- Los valores se muestran tal como los publica la fuente. No se reescalan, rebasan ni convierten — solo se añaden separadores de miles y se muestran hasta dos decimales.
- Los elementos se ordenan de mayor a menor según su valor en 2026.
Un artículo que usa estos datos
Fuentes y referencias
Todas las fuentes externas citadas en estos datos
Gráficos relacionados
Más estadísticas sobre temas similares