Aus dem Englischen übersetzt

Llama 3.2 ist eine Familie großer Sprachmodelle, die von Meta AI entwickelt und im September 2024 veröffentlicht wurde, einschließlich sowohl dichter als auch leichter Varianten, die für Edge-Geräte optimiert sind.

Llama 3.2 ist eine Familie von großen Sprachmodellen, die von Meta AI entwickelt und am 25. September 2024 veröffentlicht wurde. Die Familie umfasst sowohl dichte Modelle (1B- und 3B-Parameter), die für On-Device-Anwendungen entwickelt wurden, als auch größere Modelle (11B- und 90B-Parameter) mit multimodalen Fähigkeiten, die Text- und Bildeingaben unterstützen. Die Modelle sind unter einer freizügigen Lizenz sowohl für Forschung als auch für kommerzielle Nutzung verfügbar, wobei die kleineren Varianten für Edge-Geräte wie Smartphones und Laptops optimiert sind.

Die Veröffentlichung von Llama 3.2 markierte eine bedeutende Erweiterung der Llama-Serie, die auf den früheren Llama-3.1-Modellen aufbaut. Die 11B- und 90B-Varianten integrieren Bildverständnis, sodass sie Bilder zusammen mit Text verarbeiten können, eine Funktion, die in früheren Llama-Versionen nicht vorhanden war. Die 1B- und 3B-Modelle sind insbesondere darauf ausgelegt, effizient auf Consumer-Hardware zu laufen, wobei das 3B-Modell bei bestimmten Benchmarks eine mit größeren Modellen vergleichbare Leistung erzielt.

Architektur und Training

Llama-3.2-Modelle basieren auf der Transformer-Architektur und verwenden ein Decoder-only-Design mit Grouped-Query-Attention (GQA) für eine verbesserte Inferenzeffizienz. Die Vision-Language-Modelle (11B und 90B) integrieren einen Vision-Encoder, der Bilder in Tokens verarbeitet, die dann mit Text-Embeddings fusioniert werden. Das Training umfasste eine Kombination aus reinen Text- und multimodalen Daten, mit einem Fokus auf hochwertigem Instruction Tuning und Alignment-Techniken wie RLHF und überwachtes Fine-Tuning.

Die kleineren Modelle (1B und 3B) wurden mit einer Kontextlänge von 128.000 Tokens trainiert, während die größeren Modelle bis zu 128.000 Tokens für Text und einen separaten Vision-Turm für Bildeingaben unterstützen. Die Modelle verwenden eine Vokabulargröße von 128.000 Tokens und nutzen Layer-Normalisierung und Dropout für Stabilität.

Leistung und Benchmarks

Llama-3.2-Modelle wurden anhand einer Reihe öffentlicher Benchmarks evaluiert, darunter MMLU, GSM8K und HumanEval. Das 90B-Modell erzielt wettbewerbsfähige Ergebnisse gegenüber führenden Modellen wie OpenAIs GPT-4 und Anthropics Claude 3.5 Sonnet bei Aufgaben wie Allgemeinwissen, Reasoning und Codierung. Das 3B-Modell übertrifft trotz seiner geringen Größe viele größere Modelle bei Aufgaben zur Befolgung von Anweisungen und zur Zusammenfassung, was es für On-Device-Anwendungen geeignet macht.

In internen Evaluierungen erreichte das 90B-Modell 86,0 bei MMLU, 94,1 bei GSM8K und 89,1 bei HumanEval, während das 11B-Modell 83,0 bei MMLU, 88,4 bei GSM8K und 84,9 bei HumanEval erzielte. Diese Ergebnisse unterstreichen die Effizienz der Architektur, wobei das 90B-Modell für einige Aufgaben ein Mixture-of-Experts-Design (MoE) verwendet, obwohl auch die standardmäßigen dichten Versionen verfügbar sind.

Bereitstellung und Ökosystem

Llama-3.2-Modelle sind in wichtige Cloud-Plattformen integriert, darunter AWS, Microsoft Azure, Google Cloud und Oracle Cloud. Sie werden auch von Hardware-Anbietern wie Groq, SambaNova und Intel unterstützt, was eine Inferenz mit geringer Latenz ermöglicht. Die kleineren Modelle sind für die Edge-Bereitstellung optimiert, mit Unterstützung für Quantisierung und Pruning-Techniken zur Reduzierung des Speicherbedarfs.

Meta AI hat Partnerschaften mit Qualcomm und Samsung geschlossen, um On-Device-AI-Funktionen in Smartphones zu ermöglichen, wobei die 1B- und 3B-Modelle für Aufgaben wie Zusammenfassung und Textgenerierung genutzt werden. Die Modelle sind über den Hugging-Face-Hub verfügbar und können mit Standard-Frameworks wie PyTorch und TensorFlow feinabgestimmt werden.

Rezeption und Auswirkungen

Llama 3.2 wurde in der generativen KI-Community weitgehend übernommen, wobei viele Entwickler die kleineren Modelle für Prototyping und Edge-Anwendungen nutzen. Die Veröffentlichung des 90B-Vision-Modells wurde für seine Fähigkeit zur Bewältigung komplexer multimodaler Aufgaben wie Dokumentverständnis und visuelle Fragenbeantwortung hervorgehoben. Einige Kritiker haben jedoch darauf hingewiesen, dass die Modelle weiterhin Herausforderungen bei faktischer Genauigkeit und Verzerrungen aufweisen, ähnlich wie andere große Sprachmodelle.

Der Open-Weights-Ansatz von Llama 3.2 wurde für die Demokratisierung des Zugangs zu fortschrittlicher KI gelobt, hat aber auch Bedenken hinsichtlich möglichen Missbrauchs aufgeworfen. Meta hat Sicherheitsmaßnahmen implementiert, darunter Red-Teaming und Inhaltsfilterung, um Risiken zu mindern.

Zukünftige Richtungen

Meta hat angedeutet, dass Llama 3.2 Teil eines kontinuierlichen Entwicklungszyklus ist, mit Plänen für weitere Verbesserungen bei Reasoning, mehrsprachiger Unterstützung und Effizienz. Das Unternehmen erforscht auch die Integration mit neuronalen Netzwerk-Forschung von akademischen Einrichtungen wie Stanford AI Lab und Berkeley AI Research. Ab 2025 bleiben die Modelle ein Maßstab für Open-Weights-KI und beeinflussen nachfolgende Veröffentlichungen anderer Organisationen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-models·meta-ai·open-source-ai·multimodal-ai
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte