Meta-Llama-3-Veröffentlichung

Aus dem Englischen übersetzt

Meta veröffentlichte am 18. April 2024 Llama 3, eine Familie von Open-Weight-[[large language model|Large Language Models]], mit Versionen mit 8B- und 70B-Parametern, die später auf ein 405B-Modell erweitert wurde.

Meta Llama 3 ist eine Familie großer Sprachmodelle, die von Meta AI am 18. April 2024 veröffentlicht wurde. Die erste Veröffentlichung umfasste zwei Modellgrößen: 8 Milliarden und 70 Milliarden Parameter, beide verfügbar als Basis- und instruktionsabgestimmte Varianten. Llama 3 war bemerkenswert für sein umfangreiches Vortraining auf etwa 15 Billionen Token öffentlich verfügbaren Textes und für seine wettbewerbsfähige Leistung gegenüber zeitgenössischen proprietären Modellen. Eine spätere Version, Llama 3.1, erweiterte die Familie um ein Modell mit 405 Milliarden Parametern, das am 23. Juli 2024 veröffentlicht wurde. Die Llama-3-Serie stellte einen bedeutenden Schritt in Metas Strategie der Entwicklung offener KI-Modelle dar und baute auf den früheren Veröffentlichungen Llama 1 und Llama 2 auf.

Die Llama-3-Modelle wurden entwickelt, um breit zugänglich zu sein, wobei die Gewichte unter einer Community-Lizenz veröffentlicht wurden, die kommerzielle Nutzung erlaubte, eine Abkehr von der restriktiveren Lizenzierung des ursprünglichen Llama. Die Veröffentlichung begleitete auch den Start von Meta AI, einem Assistenten, der in Facebook und WhatsApp integriert wurde, und demonstrierte die praktische Anwendung der Modelle. Die Modelle wurden auf einem vielfältigen Datensatz trainiert und zeigten starke Leistungen über Benchmarks in den Bereichen Reasoning, Programmierung und allgemeinem Wissen, was sie als wettbewerbsfähige Alternative zu Modellen von OpenAI, Anthropic und Google DeepMind positionierte.

Hintergrund und Kontext

Die Entwicklung von Llama 3 erfolgte vor dem Hintergrund rascher Fortschritte in der Forschung zu großen Sprachmodellen, die durch den Erfolg von ChatGPT Ende 2022 katalysiert wurde. Nach der Veröffentlichung von OpenAIs GPT-3 und der anschließenden Popularität von ChatGPT erlebte das Feld einen Anstieg von Bemühungen, Modelle zu skalieren, wobei einige emergente Fähigkeiten im Reasoning und in der Befolgung von Anweisungen zeigten. Metas erste Reaktion, Llama 1, wurde im Februar 2023 als forschungsorientiertes Modell veröffentlicht, wobei die Gewichte nur für genehmigte akademische Forscher verfügbar waren. Der Leak des Modells im März 2023, der sich über BitTorrent verbreitete, unterstrich die Nachfrage nach offenem Zugang und führte zu einer breiteren Diskussion über die Rolle offener Modelle in der KI-Entwicklung.

Llama 2, veröffentlicht im Juli 2023 in Partnerschaft mit Microsoft, markierte einen Wandel hin zu offenerem Zugang, indem es kommerzielle Nutzung unter einer permissiven Lizenz erlaubte. Dies bereitete den Boden für Llama 3, das darauf abzielte, die Grenzen offener Gewichtsmodelle in Bezug auf Umfang und Fähigkeiten zu erweitern. Die Veröffentlichung von Llama 3 kam auch zu einer Zeit, in der generative KI zu einem Mainstream-Fokus wurde, mit erheblichen Investitionen von Cloud-Anbietern und Hardware-Unternehmen.

Modellarchitektur und Training

Llama-3-Modelle basieren auf der Transformer-Architektur, dem dominierenden Design für moderne große Sprachmodelle. Die Architektur enthält Verbesserungen gegenüber früheren Llama-Versionen, einschließlich einer größeren Vokabulargröße (128.256 Token) und einer erhöhten Kontextlänge von 8.192 Token, die später in nachfolgenden Updates erweitert wurde. Die Modelle verwenden ein standardmäßiges Decoder-only-Design mit Multi-Head-Attention und positionaler Kodierung und wurden mit einem Ziel der Vorhersage des nächsten Tokens trainiert.

Ein Schlüsselmerkmal des Llama-3-Trainings war der Umfang der Daten. Die Modelle wurden auf etwa 15 Billionen Token Text aus öffentlich verfügbaren Quellen vortrainiert, eine erhebliche Steigerung gegenüber den 2 Billionen Token, die für Llama 2 verwendet wurden. Die Trainingsdaten wurden kuratiert, um hochwertige Quellen zu betonen, einschließlich Webseiten, Büchern und wissenschaftlichen Artikeln, mit einem Fokus auf mehrsprachige und Code-Inhalte. Die instruktionsabgestimmten Versionen wurden weiter auf öffentlich verfügbaren Instruktionsdatensätzen und über 10 Millionen menschlich annotierten Beispielen feinabgestimmt, unter Verwendung von Techniken wie RLHF (Verstärkungslernen aus KI-Feedback) und überwachter Feinabstimmung.

In Bezug auf Skalierungsgesetze beobachtete das Llama-3-Team, dass die Leistung weiterhin log-linear verbessert wurde, selbst wenn weit über die Chinchilla-optimale Anzahl von Token trainiert wurde. Für das 8B-Modell wurde die Chinchilla-optimale Datensatzgröße auf 200 Milliarden Token geschätzt, aber das Modell profitierte weiterhin vom Training auf den vollen 15 Billionen Token, was darauf hindeutet, dass größere Datensätze Gewinne über konventionelle Empfehlungen hinaus erzielen können.

Leistung und Benchmarks

In Metas internen Bewertungen, die im April 2024 durchgeführt wurden, übertraf das Llama-3-70B-Modell mehrere führende proprietäre Modelle in einer Reihe von Benchmarks. Insbesondere übertraf es Gemini Pro 1.5 von Google DeepMind und Claude 3 Sonnet von Anthropic in den meisten standardmäßigen NLP-Aufgaben, einschließlich Reasoning, Programmierung und allgemeinem Wissen. Das 8B-Modell, obwohl kleiner, wurde von Metas CEO Mark Zuckerberg als fast so leistungsfähig wie das größte Llama-2-Modell (70B) beschrieben, was die Effizienzgewinne aus dem größeren Trainingsdatensatz demonstriert.

Die Modelle zeigten besonders starke Leistungen in der Codegenerierung und im mathematischen Reasoning, Bereiche, die für praktische Anwendungen entscheidend sind. Das 405B-Modell, das später als Teil von Llama 3.1 veröffentlicht wurde, verbesserte diese Ergebnisse weiter und erreichte auf vielen Benchmarks modernste Leistungen, die mit Modellen wie GPT-4 und Claude 3.5 Sonnet konkurrierten.

Veröffentlichung und Verfügbarkeit

Die erste Llama-3-Veröffentlichung am 18. April 2024 umfasste die 8B- und 70B-Modelle, sowohl in Basis- als auch in instruktionsabgestimmten Versionen. Die Modelle wurden zum Download über Metas Website und über Partnerplattformen wie Hugging Face verfügbar gemacht. Die Gewichte wurden unter der Llama-3-Community-Lizenz veröffentlicht, die kommerzielle Nutzung erlaubt, aber eine akzeptable Nutzungsrichtlinie enthält, die bestimmte Anwendungen wie militärische Nutzung oder die Erzeugung schädlicher Inhalte einschränkt. Diese Lizenz wird von der Open Source Initiative nicht als Open Source betrachtet, ist aber im Vergleich zu vielen proprietären Modellen permissiv.

Meta integrierte Llama 3 auch in seinen KI-Assistenten Meta AI, der auf Facebook, WhatsApp und einer eigenen Website verfügbar wurde. Diese Integration ermöglichte es Nutzern, direkt mit den Modellen zu interagieren und ihre Fähigkeiten in Chat, Schreiben und Programmieraufgaben zu demonstrieren. Die Veröffentlichung wurde von Partnerschaften mit Cloud-Anbietern begleitet, einschließlich Amazon Web Services, Azure, Google Cloud und Oracle Cloud, wodurch die Modelle über verwaltete Dienste zugänglich wurden.

Ökosystem und Hardware-Unterstützung

Die offene Gewichtsnatur von Llama 3 erleichterte die schnelle Adoption im gesamten KI-Ökosystem. Hardware-Anbieter optimierten ihre Plattformen für Llama-3-Inferenz, einschließlich AMD, Intel und Nvidia. Spezialisierte KI-Chip-Unternehmen wie Groq und SambaNova boten Hochgeschwindigkeits-Inferenzlösungen, während Qualcomm und Arm Holdings sich auf Edge-Bereitstellung konzentrierten. Cloud-Anbieter boten vorkonfigurierte Umgebungen an, und AWS Trainium und andere kundenspezifische Siliziumlösungen wurden für Feinabstimmung und Training verwendet.

Die Modelle wurden auch in verschiedene Software-Frameworks und Tools integriert, was es Entwicklern ermöglichte, Anwendungen mit minimalem Aufwand zu erstellen. Die Verfügbarkeit mehrerer Modellgrößen erlaubte die Bereitstellung auf einer Reihe von Hardware, von Edge-Geräten bis zu Rechenzentren, was Llama 3 zu einer vielseitigen Wahl für Forschung und Produktion machte.

Auswirkungen und Rezeption

Die Veröffentlichung von Llama 3 stieß auf erhebliches Interesse in der KI-Gemeinschaft, wobei viele die Leistung der Modelle und die Offenheit der Gewichte lobten. Es wurde als Gegenpunkt zu den geschlossenen Ansätzen von OpenAI und Anthropic gesehen und bot eine Alternative für Forscher und Entwickler, die Transparenz und Kontrolle bevorzugten. Die starke Leistung der Modelle in Benchmarks setzte auch die Messlatte für offene Gewichtsmodelle höher und veranlasste andere Organisationen, ihre eigenen Entwicklungsbemühungen zu beschleunigen.

Die Veröffentlichung löste jedoch auch Diskussionen über den potenziellen Missbrauch offener Modelle aus, einschließlich Bedenken hinsichtlich Desinformation, Spam und anderer böswilliger Verwendungen. Metas Entscheidung, eine akzeptable Nutzungsrichtlinie aufzunehmen, war ein Versuch, diese Risiken zu mindern, aber Kritiker argumentierten, dass solche Richtlinien schwer durchzusetzen sind, sobald Gewichte öffentlich verfügbar sind. Die Debatte spiegelte frühere Diskussionen nach dem Leak von Llama 1 wider.

Zukünftige Entwicklungen

Nach der ersten Veröffentlichung iterierte Meta weiter an der Llama-3-Familie. Llama 3.1, veröffentlicht am 23. Juli 2024, führte das 405B-Modell ein und erweiterte die Kontextlänge auf 128.000 Token, was längeres Reasoning und Dokumentverarbeitung ermöglichte. Das 405B-Modell wurde unter Verwendung einer Kombination aus Datenbereinigung und Modellbereinigung-Techniken trainiert, um die Effizienz zu verbessern. Meta kündigte auch Pläne an, Llama 3 mehrsprachig und multimodal zu machen, mit Unterstützung für Bild- und Video-Verständnis sowie verbesserte Programmier- und Reasoning-Fähigkeiten.

Im April 2025 veröffentlichte Meta Llama 4, die nächste Generation der Familie, die die Modellgrößen weiter erweiterte und Mixture-of-Experts-Architekturen einführte. Mit Blick auf die Zukunft veröffentlichte Meta Superintelligence Labs im April 2026 Muse Spark als Ersatz für Llama, was einen Wandel in der KI-Strategie des Unternehmens signalisierte. Trotzdem bleibt Llama 3 ein bedeutender Meilenstein in der Entwicklung offener großer Sprachmodelle und beeinflusste nachfolgende Forschung und Entwicklung im gesamten Feld.

Fazit

Meta Llama 3 stellte einen großen Fortschritt bei offenen großen Sprachmodellen dar, indem es groß angelegtes Training mit wettbewerbsfähiger Leistung und breiter Zugänglichkeit kombinierte. Seine Veröffentlichung katalysierte die Adoption offener Modelle sowohl in der Forschung als auch in der Industrie, und seine Auswirkungen sind weiterhin in der laufenden Entwicklung von Technologien der künstlichen Intelligenz spürbar. Der Erfolg der Modelle unterstrich die Lebensfähigkeit offener Ansätze in einem Feld, das oft von proprietären Systemen dominiert wird, und setzte einen Präzedenzfall für zukünftige Veröffentlichungen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-model·meta-ai·open-weight·ai-release
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte