Conjuntos de datos (Hugging Face)

Traducido del inglés

Datasets (Hugging Face) es una biblioteca y centro de código abierto para acceder y compartir conjuntos de datos de aprendizaje automático, que proporciona herramientas para cargar, procesar y evaluar datos en diversos dominios de IA. Sirve como un repositorio central para investigadores y desarrolladores en la comunidad de inteligencia artificial.

La biblioteca Datasets de Hugging Face y su centro de datos constituyen una plataforma central para que los profesionales del aprendizaje automático descubran, descarguen y compartan colecciones de datos utilizados para entrenar y evaluar modelos de inteligencia artificial. Lanzada inicialmente en 2019, la biblioteca simplifica el proceso de trabajar con conjuntos de datos, integrándose sin problemas con el ecosistema más amplio de herramientas para el desarrollo y la investigación de modelos de lenguaje de gran escala. Como parte de la plataforma Hugging Face, Datasets proporciona una interfaz estandarizada para más de 100.000 conjuntos de datos disponibles públicamente, que abarcan desde datos de texto e imagen hasta audio y vídeo.

El proyecto se originó a partir del objetivo de Hugging Face de hacer que el procesamiento del lenguaje natural sea más accesible y reproducible. Al proporcionar una API unificada y única que abstrae las diferencias en los formatos de archivo (incluidos CSV, JSON, Parquet y otros), la biblioteca Datasets permite a los usuarios gestionar colecciones de datos masivas con un código de configuración mínimo. El centro subyacente, accesible tanto a través de una interfaz web como mediante programación a través de la biblioteca, aloja conjuntos de datos seleccionados, así como los aportados por la comunidad. Hugging Face también ofrece un visor de conjuntos de datos complementario en el centro web, que permite a los usuarios inspeccionar muestras, metadatos y documentación directamente en el navegador.

Características principales

La biblioteca Datasets ofrece una gama de funciones diseñadas para la eficiencia y la facilidad de uso. Incluye mapeo de memoria automático, que permite transmitir grandes conjuntos de datos desde el disco o el centro remoto, de modo que los usuarios puedan iterar a través de miles de millones de filas sin cargar todo en la memoria de acceso aleatorio. La biblioteca también se integra con marcos de aprendizaje profundo como PyTorch, TensorFlow y JAX a través de métodos de conversión integrados, lo que permite la integración directa en los flujos de trabajo de entrenamiento de modelos.

Una faceta importante es la capacidad de combinar conjuntos de datos mediante operaciones comunes como división, fragmentación e intercalado. También proporciona almacenamiento en caché integrado, de modo que las transformaciones y los pasos de carga repetidos se guardan automáticamente en el disco, lo que reduce el trabajo duplicado. El visor de conjuntos de datos proporciona un visor de estadísticas y esquemas detallado, que muestra nombres de columnas, tipos y distribución de datos, mientras que la biblioteca en sí incluye utilidades para controles de calidad de datos, como la detección de ejemplos duplicados o valores faltantes.

Centro de datos y contribuciones de la comunidad

El centro de datos de Hugging Face es un servicio en línea que aloja decenas de miles de conjuntos de datos. Las contribuciones provienen de investigadores individuales, instituciones académicas y empresas, lo que refleja una amplia gama de dominios: procesamiento del lenguaje natural, visión por computadora, procesamiento de audio y campos especializados como medicina, finanzas y ciencia climática. Los conjuntos de datos a menudo incluyen tanto los datos brutos como el código de aumento de datos y preprocesamiento, ya que la biblioteca trata las transformaciones como objetos de primera clase. Un sistema de versionado permite a los usuarios rastrear los cambios a lo largo del tiempo, y el centro admite conjuntos de datos privados para datos con licencia o propietarios.

Muchos conjuntos de datos de referencia populares están disponibles directamente a través del centro, como GLUE, SQuAD, ImageNet y Common Crawl, junto con derivados creados por la comunidad que limpian o filtran estas fuentes. Este centro funciona así como un punto de distribución canónico para los contribuyentes de conjuntos de datos, que pueden cargar archivos Parquet o enviar actualizaciones a través de las herramientas de línea de comandos del centro. Además, el visor de datos del centro indexa automáticamente los metadatos y permite el muestreo de filas a través de una API web.

Integración con el ecosistema Hugging Face

Datasets funciona en conjunto con otras herramientas de Hugging Face, principalmente la biblioteca transformers y la biblioteca tokenizers. En un flujo de trabajo típico, un usuario carga un conjunto de datos desde el centro, aplica un proceso de tokenización utilizando el tokenizador que coincida con su modelo elegido y luego alimenta las salidas directamente en un bucle de entrenamiento. Esta interoperabilidad es una razón clave por la que Datasets se usa ampliamente en la comunidad de aprendizaje automático, ya que elimina la necesidad de múltiples flujos de trabajo de carga de datos incompatibles.

También se combina con el sistema de tarjetas de modelo del centro: cada página de conjunto de datos puede incluir metadatos y documentación, incluidas tareas de evaluación de modelos sugeridas, etiquetas de tema y sesgos conocidos. Esto se alinea con iniciativas industriales más amplias hacia el poda de modelos, el monitoreo de modelos y una mejor reproducibilidad, ya que los conjuntos de datos se rastrean como componentes clave en los experimentos de modelos. Los usuarios también pueden aprovechar la biblioteca evaluate creada por Hugging Face, que proporciona métricas que se ejecutan directamente en el formato Datasets, lo que permite una puntuación rápida contra puntos de referencia.

Subproyectos y API importantes

La biblioteca Datasets también incluye subproyectos especializados. Por ejemplo, se agregó el modo streaming para permitir a los usuarios iterar un conjunto de datos completo sin descargarlo todo, algo crucial para corpus muy grandes. DatasetDict gestiona agrupaciones de divisiones (train, validation, test) en un solo objeto, y la función load_dataset() sirve como punto de entrada principal, aceptando tanto un nombre de un conjunto de datos en el centro como una ruta local. Los usuarios también pueden definir funciones personalizadas y modificar metadatos a través de la API Features, que especifica los tipos de columna (int, text, image, etc.) y garantiza la corrección de tipos. Además, datasets admite el útil IterableDataset para una iteración rápida, particularmente adecuado para la transmisión.

Otra utilidad notable es el formato datasets.arrow_dataset, basado en Apache Arrow, que sustenta el rendimiento de la biblioteca mediante almacenes de datos columnares, lo que permite un acceso rápido a los datos y la interoperabilidad con herramientas de ciencia de datos como pandas y NumPy. Esto se basa a veces en hardware muy moderno para lograr velocidad, y un iterador serial, que evita picos de RAM.

Uso y adopción industrial

Hugging Face Datasets se ha convertido en una herramienta estándar en la investigación y la industria. Los equipos de preimpresión de las principales empresas de IA, el mundo académico, las empresas emergentes y los desarrolladores individuales incorporan conjuntos de datos para tareas. El trabajo colectivo a gran escala, como el entrenamiento de modelos de lenguaje de gran escala y modelos de generación de imágenes, a menudo tutoriza la carga de conjuntos de datos para corpus enormes. La biblioteca también ha sido adoptada por proveedores de servicios en la nube, incluidos Amazon Web Services, Azure y Google Cloud, que la alojan u ofrecen en su pila de herramientas de IA gestionada, lo que permite su integración con su almacenamiento de datos e instancias de GPU.

Cabe destacar que AWS Trainium y otras plataformas en la nube centradas en IA entrenan modelos que recuperan datos de la biblioteca de conjuntos de datos. El enfoque heterogéneo de la biblioteca se alinea con el crecimiento de las cargas de trabajo de alto rendimiento, y su soporte de computación distribuida (a través de multiprocesamiento o integración con Ray) es de uso central en los sistemas de entrenamiento. Además, Apple ha utilizado el centro en comunidades de investigación para su procesamiento de datos para modelos. Mientras tanto, las empresas emergentes de hardware como Groq o motores de grano como también admiten conjuntos de datos de Hugging Face dentro de sus SDK para inferencia y ajuste fino.

Consideraciones éticas y sociales

La dependencia de un centro de datos central como parte clave plantea problemas válidos de gobernanza de modelos y privacidad. Hugging Face incluye funciones para proteger a la comunidad: las etiquetas de control de acceso a conjuntos de datos, como "inseguro", requieren acceso restringido, o los usuarios pueden tener permitido el acceso al centro pero con autenticación requerida. Incluyendo licencias generales y tokens - significa que los conjuntos de datos están ocultos detrás de términos. Sin embargo, un conjunto de datos público ilimitado puede ser mal utilizado, porque los datos también pueden extraerse a menudo de la web sin el consentimiento de los contribuyentes; se pueden observar leyes de derechos de autor o licencias.

Hugging Face ha respondido creando indicadores éticos, como la "tarjeta" de conjunto de datos, cuyos metadatos centrales incluyen notas impuras, sesgadas o sensibles. El centro también permite discusiones y la notificación de problemas. Pero debido a que los conjuntos de datos son cargados por cualquier comunidad, el escrutinio en la comunidad de IA en general, sin embargo, la gobernanza permanece en su lugar.

Comunidad y gobernanza

Hugging Face dirige un equipo considerable detrás de Datasets, publicando el software bajo la Licencia Apache 2.0. El proyecto se desarrolla activamente, con lanzamientos frecuentes y cientos de contribuyentes en todo el mundo. Las ideas de la hoja de ruta se habilitan públicamente, y cualquier usuario puede bifurcar el repositorio de GitHub y sugerir un cambio de par. Hugging Face también proporciona un libro de recetas de conjuntos de datos y tutoriales de cuadernos Jupyter que enseñan cómo usar la biblioteca.

Desde una perspectiva de organización y mantenimiento, las correcciones de errores se gestionan mediante rastreadores de problemas, y las pautas de la comunidad priorizan el respeto de los participantes y la ética en el intercambio. La adopción es amplia y el centro interactivo siempre está abierto a nuevos registros; este ecosistema amplio ha mantenido el proyecto esencial para la práctica de la IA después de varios años.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning-library·dataset-huggingface·open-source-ai·data-format-tools
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial