LLaMA (Large Language Model Meta AI, als Backronym dienend) ist eine Familie großer Sprachmodelle (LLMs), die von Meta AI ab Februar 2023 veröffentlicht wurde. Die Modelle sind in verschiedenen Größen erhältlich, die von 1 Milliarde bis zu 2 Billionen Parametern reichen. Ursprünglich als Basismodell veröffentlicht, begann Meta AI ab Llama 2 zusätzlich zu den Basismodellen auch instruktionsfeinabgestimmte Versionen herauszubringen. Die neueste Version ist Llama 4, veröffentlicht im April 2025. Im April 2026 veröffentlichte Meta Superintelligence Labs Muse Spark als Ersatz für Llama.
Hintergrund
Nach der Veröffentlichung großer Sprachmodelle wie GPT-3 lag ein Forschungsschwerpunkt auf der Skalierung von Modellen, was in einigen Fällen erhebliche Zuwächse bei emergenten Fähigkeiten zeigte. Die Veröffentlichung von ChatGPT und sein überraschender Erfolg führten zu einer erhöhten Aufmerksamkeit für große Sprachmodelle. Im Vergleich zu anderen Reaktionen auf ChatGPT erklärte Metas Chef-KI-Wissenschaftler Yann LeCun, dass große Sprachmodelle am besten geeignet seien, um beim Schreiben zu helfen.
Versionen
Erstveröffentlichung
Die erste Version von Llama (stilisiert als LLaMA und manchmal als Llama 1 bezeichnet) wurde am 24. Februar 2023 über einen Blogbeitrag und ein Papier angekündigt, das das Training, die Architektur und die Leistung des Modells beschreibt. Der Inferenzcode, der zum Ausführen des Modells verwendet wurde, wurde öffentlich unter der Open-Source-Lizenz GPLv3 veröffentlicht. Der Zugriff auf die Gewichte des Modells wurde über ein Bewerbungsverfahren verwaltet, wobei der Zugriff „auf Einzelfallbasis an akademische Forscher; an Personen, die mit Organisationen in Regierung, Zivilgesellschaft und Wissenschaft verbunden sind; und an industrielle Forschungslabore weltweit" gewährt werden sollte.
Llama wurde nur mit öffentlich verfügbaren Informationen trainiert und in verschiedenen Modellgrößen trainiert, mit der Absicht, es für verschiedene Hardware zugänglicher zu machen. Das Modell war ausschließlich ein Basismodell, obwohl das Papier Beispiele für instruktionsfeinabgestimmte Versionen des Modells enthielt. Meta AI berichtete, dass die Leistung des 13B-Parameter-Modells bei den meisten NLP-Benchmarks die des viel größeren GPT-3 (mit 175B Parametern) übertraf, und das größte 65B-Modell war wettbewerbsfähig mit modernsten Modellen wie PaLM und Chinchilla.
#### Leak
Am 3. März 2023 wurde ein Torrent mit den Gewichten von Llama hochgeladen, wobei ein Link zum Torrent auf dem 4chan-Imageboard geteilt und anschließend in Online-KI-Gemeinschaften verbreitet wurde. Am selben Tag wurde ein Pull-Request im Haupt-Llama-Repository eröffnet, der darum bat, den Magnet-Link zur offiziellen Dokumentation hinzuzufügen. Am 4. März wurde ein Pull-Request eröffnet, um Links zu HuggingFace-Repositories mit dem Modell hinzuzufügen. Am 6. März reichte Meta Löschungsanträge ein, um die im Pull-Request verlinkten HuggingFace-Repositories zu entfernen, und charakterisierte dies als „unbefugte Verbreitung" des Modells. HuggingFace kam den Anträgen nach. Am 20. März reichte Meta einen DMCA-Löschungsantrag wegen Urheberrechtsverletzung gegen ein Repository ein, das ein Skript enthielt, das Llama von einem Spiegel herunterlud, und GitHub kam am nächsten Tag nach.
Die Reaktionen auf den Leak waren unterschiedlich. Einige spekulierten, dass das Modell für böswillige Zwecke verwendet würde, wie etwa für ausgefeilteren Spam. Einige feierten die Zugänglichkeit des Modells sowie die Tatsache, dass kleinere Versionen des Modells relativ kostengünstig ausgeführt werden können, und deuteten an, dass dies das Aufblühen zusätzlicher Forschungsentwicklungen fördern würde. Mehrere Kommentatoren, wie Simon Willison, verglichen Llama mit Stable Diffusion, einem Text-zu-Bild-Modell, das im Gegensatz zu vergleichbar anspruchsvollen Vorgängermodellen offen verteilt wurde, was zu einer schnellen Verbreitung zugehöriger Werkzeuge, Techniken und Software führte.
Llama 2
Am 18. Juli 2023 kündigte Meta in Partnerschaft mit Microsoft Llama 2 (stilisiert als LLaMa 2) an, die nächste Generation von Llama. Meta trainierte und veröffentlichte Llama 2 in drei Modellgrößen: 7, 13 und 70 Milliarden Parameter. Die Modellarchitektur bleibt weitgehend unverändert gegenüber der von Llama-1-Modellen, aber es wurden 40% mehr Daten verwendet, um die Basismodelle zu trainieren.
Llama 2 umfasst Basismodelle und für den Chat feinabgestimmte Modelle. In einer weiteren Abweichung von der ursprünglichen Version von Llama werden alle Modelle mit Gewichten veröffentlicht und können für viele kommerzielle Anwendungsfälle verwendet werden. Da die Lizenz von Llama eine Richtlinie zur akzeptablen Nutzung durchsetzt, die die Verwendung von Llama für einige Zwecke verbietet, ist es nicht Open Source. Metas Verwendung des Begriffs Open Source zur Beschreibung von Llama wurde von der Open Source Initiative (die die Open Source Definition pflegt) und anderen bestritten.
Code Llama ist eine Feinabstimmung von Llama 2 mit codespezifischen Datensätzen. Versionen mit 7B, 13B und 34B wurden am 24. August 2023 veröffentlicht, eine 70B-Version am 29. Januar 2024. Ausgehend von den Basismodellen von Llama 2 trainierte Meta AI zusätzliche 500B Tokens an Codedatensätzen, bevor weitere 20B Tokens an Langkontextdaten hinzugefügt wurden, wodurch die Code-Llama-Basismodelle entstanden. Dieses Basismodell wurde weiter mit 5B Tokens zur Befolgung von Anweisungen trainiert, um die Instruktions-Feinabstimmung zu erstellen. Ein weiteres Basismodell wurde für Python-Code erstellt, das mit 100B Tokens an reinem Python-Code trainiert wurde, bevor die Langkontextdaten hinzugefügt wurden.
Llama 3
Am 18. April 2024 veröffentlichte Meta Llama 3 mit zwei Größen: 8B und 70B Parameter. Die Modelle wurden mit etwa 15 Billionen Tokens an Text vortrainiert, die aus „öffentlich verfügbaren Quellen" gesammelt wurden, wobei die Instruktionsmodelle mit „öffentlich verfügbaren Instruktionsdatensätzen sowie über 10 Millionen menschlich annotierten Beispielen" feinabgestimmt wurden. Metas KI-Tests zeigten im April 2024, dass Llama 3 70B Gemini Pro 1.5 und Claude 3 Sonnet bei den meisten Benchmarks übertraf. Meta kündigte auch Pläne an, Llama 3 mehrsprachig und multimodal zu machen, besser beim Programmieren und Denken zu sein und seinen Kontextfenster zu vergrößern.
In Bezug auf Skalierungsgesetze zeigten Llama-3-Modelle empirisch, dass die Leistung weiterhin log-linear skaliert, wenn ein Modell mit Daten trainiert wird, die über der „Chinchilla-optimalen" Menge liegen. Beispielsweise beträgt der Chinchilla-optimale Datensatz für Llama 3 8B 200 Milliarden Tokens, aber die Leistung skalierte weiterhin log-linear auf den 75-mal größeren Datensatz von 15 Billionen Tokens. In einem Interview mit Dwarkesh Patel sagte Mark Zuckerberg, dass die 8B-Version von Llama 3 fast so leistungsfähig war wie das größte Llama 2. Im Vergleich zu früheren Modellen erklärte Zuckerberg, dass das Team überrascht war, dass das 70B-Modell selbst am Ende des Trainings mit 15T Tokens noch lernte. Die Entscheidung wurde getroffen, das Training zu beenden, um die GPU-Leistung anderweitig zu fokussieren.
Llama 3.1 wurde am 23. Juli 2024 mit den Größen 8B, 70B und 405B Parametern veröffentlicht. Das 405B-Modell war das erste Llama, das ein Mixture-of-Experts-Modell war, und es wurde unter einer Lizenz veröffentlicht, die Weiterverbreitung und Modifikation erlaubt, jedoch mit Einschränkungen bei der Verwendung zur Verbesserung anderer großer Sprachmodelle. Llama 3.2 wurde am 25. September 2024 mit den Größen 1B und 3B für Edge-Geräte sowie 11B und 90B für Bildverarbeitungsaufgaben veröffentlicht. Llama 3.3 wurde am 6. Dezember 2024 mit einem 70B-Modell veröffentlicht, das für Effizienz optimiert war.
Llama 4
Llama 4 wurde im April 2025 veröffentlicht. Die erste Veröffentlichung umfasste Llama 4 Scout, Maverick und Behemoth. Scout und Maverick wurden als Open-Weight-Modelle veröffentlicht, während Behemoth als Vorschau veröffentlicht wurde. Scout ist ein 17B-Parameter-Modell mit einem Kontextfenster von 10 Millionen Tokens, und Maverick ist ein 400B-Parameter-Mixture-of-Experts-Modell mit einem Kontextfenster von 1 Million Tokens. Behemoth ist ein 2-Billionen-Parameter-Mixture-of-Experts-Modell, das zum Zeitpunkt der Veröffentlichung noch im Training war.
Rezeption und Auswirkungen
Die erste Veröffentlichung von Llama, insbesondere der Leak, hatte einen erheblichen Einfluss auf die KI-Gemeinschaft. Die Zugänglichkeit kleinerer Modelle ermöglichte Forschung und Entwicklung auf Consumer-Hardware und förderte eine Verbreitung von feinabgestimmten Varianten und Werkzeugen. Llama-Modelle wurden in der akademischen Forschung und in kommerziellen Anwendungen weit verbreitet eingesetzt und haben nachfolgende Open-Weight-Veröffentlichungen anderer Organisationen beeinflusst. Die Veröffentlichung von Llama 3 und Llama 4 setzte diesen Trend fort, wobei Meta Llama als führende Open-Weight-Alternative zu proprietären Modellen von OpenAI, Anthropic und Google DeepMind positionierte.