Traducido del inglés

Falcon es una familia de modelos de lenguaje grandes de código abierto desarrollados por el Instituto de Innovación Tecnológica (TII) en Abu Dabi, conocidos por su eficiencia y su sólido rendimiento en puntos de referencia de razonamiento y codificación.

Falcon es una familia de modelos de lenguaje de gran tamaño de código abierto desarrollada por el Instituto de Innovación Tecnológica (TII) en Abu Dabi. Publicados por primera vez en marzo de 2023, los modelos Falcon se basan en una arquitectura de solo decodificador y se entrenan con datos web de alta calidad, haciendo hincapié en la eficiencia y el rendimiento. La serie Falcon incluye modelos de diversos tamaños, desde 1B hasta 180B de parámetros, y los modelos más grandes logran resultados competitivos en puntos de referencia estándar, a la vez que requieren menos recursos computacionales durante la inferencia en comparación con algunos contemporáneos.

Los modelos Falcon son notables por su uso de atención multi-consulta (MQA) y atención flash, que reducen el ancho de banda de memoria y aceleran la decodificación. Se entrenan con el conjunto de datos Falcon RefinedWeb, un corpus filtrado a gran escala de texto web público. Los modelos Falcon se han publicado bajo licencias permisivas, con los modelos más pequeños bajo la licencia Apache 2.0 y los más grandes bajo una licencia personalizada que restringe el uso comercial. Los modelos han sido ampliamente adoptados en la comunidad de código abierto y han servido como base para diversas variantes ajustadas.

Arquitectura y entrenamiento

Los modelos Falcon emplean una arquitectura de decodificador transformer estándar, pero con varias optimizaciones. Utilizan incrustaciones posicionales rotatorias y una combinación de atención multi-consulta para los modelos más grandes, que comparte cabezas de clave y valor en todas las cabezas de consulta, reduciendo el uso de memoria y mejorando la velocidad de inferencia. Los datos de entrenamiento provienen del conjunto de datos Falcon RefinedWeb, que comprende miles de millones de tokens filtrados de Common Crawl, con fuentes curadas adicionales para algunos modelos. El proceso de entrenamiento utiliza el optimizador AdamW y un programa de tasa de aprendizaje coseno, con una longitud máxima de secuencia de 2048 tokens para la mayoría de los modelos.

El modelo Falcon más grande, Falcon-180B, se entrenó con 3,5 billones de tokens utilizando 384 GPU, y demuestra un rendimiento sólido en tareas de razonamiento, codificación y conocimiento general. A pesar de su tamaño, Falcon-180B está diseñado para ser eficiente, con un enfoque en reducir el número de parámetros utilizados durante la inferencia mediante atención multi-consulta.

Variantes y publicaciones de modelos

Los modelos Falcon se han publicado en varios tamaños y configuraciones. La publicación inicial en marzo de 2023 incluyó Falcon-1B y Falcon-7B, ambos bajo la licencia Apache 2.0. En mayo de 2023, se publicó Falcon-40B, que encabezó el Open LLM Leaderboard en ese momento. Más tarde, en septiembre de 2023, Falcon-180B estuvo disponible con una licencia personalizada que permite el uso gratuito para fines de investigación y no comerciales, pero restringe el despliegue comercial. También se han publicado variantes más pequeñas, como Falcon-3B y Falcon-11B, y el modelo de 11B utiliza un mecanismo de atención diferente (atención multi-consulta) y logra una eficiencia notable.

Todos los modelos Falcon están disponibles en el Hugging Face Hub y se han integrado en varios marcos de inferencia, incluidos vLLM y TensorRT-LLM. Los modelos también se han ajustado para el seguimiento de instrucciones y aplicaciones de chat, con variantes oficiales como Falcon-7B-Instruct y Falcon-40B-Instruct.

Rendimiento y puntos de referencia

Los modelos Falcon han demostrado un rendimiento competitivo en una variedad de puntos de referencia. Falcon-40B, por ejemplo, superó a muchos modelos de código abierto existentes en el punto de referencia MMLU (comprensión de lenguaje multitarea masiva), logrando una puntuación del 60,4%. Falcon-180B mejoró aún más estos resultados, con una puntuación del 70,4% en MMLU y del 68,2% en HellaSwag, y se desempeñó de manera comparable a modelos propietarios como PaLM-2 Large en varias tareas. En puntos de referencia de codificación, Falcon-180B logró una puntuación pass@1 del 19,3% en HumanEval, lo que es competitivo con otros modelos grandes.

La eficiencia de los modelos Falcon es un punto de venta clave. El uso de atención multi-consulta reduce la huella de memoria y acelera la inferencia, lo que los hace adecuados para el despliegue en GPU individuales. Por ejemplo, Falcon-40B se puede ejecutar en una sola GPU A100 con cuantización, y Falcon-180B requiere múltiples GPU, pero aún ofrece una relación favorable entre rendimiento y recursos.

Impacto y ecosistema

Los modelos Falcon han tenido un impacto significativo en el panorama de la IA de código abierto. Se han utilizado como modelos base para numerosas variantes ajustadas, incluidos modelos ajustados para instrucciones y chat, y se han integrado en plataformas como Hugging Face, Replicate y AWS SageMaker. La publicación de Falcon-40B y Falcon-180B ayudó a impulsar una mayor innovación en el diseño eficiente de modelos grandes, influyendo en modelos posteriores como Llama 2 y Mistral. Los modelos Falcon también forman parte de los esfuerzos de investigación más amplios de TII en IA, que incluyen trabajo en procesamiento de lenguaje natural y visión por computadora.

La licencia permisiva de los modelos Falcon más pequeños ha fomentado una adopción generalizada en aplicaciones de investigación y comerciales, mientras que los modelos más grandes se han utilizado en estudios académicos y proyectos piloto de la industria. La familia Falcon sigue siendo un punto de referencia importante en el desarrollo de modelos de lenguaje de gran tamaño de código abierto.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·open-source-ai·natural-language-processing·artificial-intelligence
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial