Aus dem Englischen übersetzt

PaLM 2 ist ein großes Sprachmodell, das von Google entwickelt und im Mai 2023 auf der Google I/O angekündigt wurde. Es soll über 340 Milliarden Parameter verfügen und wurde mit 3,6 Billionen Tokens trainiert, wobei es das ursprüngliche PaLM-Modell ablöst.

PaLM 2 ist ein großes Sprachmodell (Large Language Model, LLM), das von Google entwickelt und auf der jährlichen Google-I/O-Keynote im Mai 2023 angekündigt wurde. Es ist der Nachfolger des Pathways Language Model (PaLM), einem auf Transformer basierenden LLM mit 540 Milliarden Parametern, das von Google AI entwickelt wurde. PaLM 2 wird als Modell mit 340 Milliarden Parametern beschrieben, das mit 3,6 Billionen Tokens trainiert wurde und einen bedeutenden Fortschritt in Umfang und Leistungsfähigkeit gegenüber seinem Vorgänger darstellt.

Das Modell ist Teil der umfassenderen Bemühungen von Google in der Forschung zu generativer KI und großen Sprachmodellen und baut auf der Transformer-Architektur auf, die modernen Deep Learning-Systemen zugrunde liegt. PaLM 2 wurde zusammen mit Google DeepMind entwickelt, was die Integration der KI-Forschungsabteilungen von Google widerspiegelt.

Architektur und Fähigkeiten

PaLM 2 folgt dem reinen Decoder-Transformer-Design, das sein Vorgänger etabliert hat, und verwendet Multi-Head-Attention-Mechanismen sowie positionale Kodierung, um sequenzielle Daten zu verarbeiten. Das Modell ist in der Lage, eine Vielzahl von Aufgaben zu bewältigen, darunter Alltagslogik, rechnerisches Denken, Erklärungen von Witzen, Codegenerierung und Übersetzung. In Kombination mit Chain-of-Thought-Prompting erreicht PaLM 2 auf Datensätzen, die mehrstufiges Denken erfordern, deutlich bessere Leistungen, wie etwa bei Textaufgaben und logikbasierten Fragen.

Das Training des Modells mit 3,6 Billionen Tokens - ein erheblicher Anstieg gegenüber den 780 Milliarden Tokens des ursprünglichen PaLM - ermöglicht eine verbesserte Leistung in verschiedenen Bereichen. Dieses Trainingskorpus umfasst gefilterte Webseiten, Bücher, Wikipedia-Artikel, Nachrichtenartikel, Quellpfad aus Open-Source-Repositorys und Social-Media-Konversationen, wobei der Anteil der Social-Media-Daten 50 % des Korpus ausmacht, um die Gesprächsfähigkeiten zu unterstützen.

Trainingsinfrastruktur

Das ursprüngliche PaLM 540B wurde über zwei TPU-v4-Pods mit 3.072 TPU-v4-Chips pro Pod trainiert, angehängt an 768 Hosts, und nutzte eine Kombination aus Modell- und Datenparallelität. Mit insgesamt 6.144 Chips markierte diese Konfiguration einen Rekord für die bisher höchste Trainingseffizienz bei LLMs dieses Umfangs, mit einer Hardware-FLOPs-Auslastung von 57,8 %. Die Trainingsinfrastruktur von PaLM 2 folgt ähnlichen Prinzipien, obwohl spezifische Einzelheiten zur Hardwarekonfiguration nicht vollständig veröffentlicht wurden.

Verwandte Modelle und Anwendungen

Google hat der PaLM-Architektur erweiterte spezialisierte Varianten entwickelt. Med-PaLM, eine Version, die auf medizinischen Daten weiter fine-tuned wurde, übertrifft frühere Modelle bei medizinischen Frage-Antwort-Benchmarks und war das erste Modell, das eine bestandene Leistung bei den US-amerikanischen medizinischen Lizenzen erreichte. Es bietet den Abzug noch ansonsten an Möglichkeiten zur Bewertung seiner eigenen Antworten, zusätzlich zur korrekten Beantwortung von Multiple-Choice- und offenen Fragen.

PaLM-E, eine weitere Erweiterung, die einen Vision-Transformer verwendet, dient als Vision-Language-Modell für die Roboterprogramm und erfordert kein Retraining oder Fine-tuning. Im Juni 2023 kündigte Google AudioPaLM für die Sprach-zu-Sprach-Übersetzung an, das auf der PaLM-2-Architektur und Initialisierung basiert.

Verfügbarkeit und Auswirkungen

Das ursprüngliche PaLM wurde im April 2022 zum ersten Mal angekündigt und blieb bis März 2023 privat, als Google eine API startete, die zunächst über eine geschlossene Warteliste einer begrenzten Anzahl von Entwicklern zur Verfügung stand. Die Ankündigung von PaLM 2 auf der Google-I/O-Konferenz im Mai 2023 signalisierte das Engagement von Google, in der sich schnell entwickelnden Landschaft der Künstlichen Intelligenz zu konkurrieren, zusammen mit anderen großen Akteuren wie OpenAI und Anthropic. Die Fähigkeiten des Modells haben Auswirkungen auf Google Cloud-Services und eine breitere Unternehmensakzeptanz, damit Google als bedeutende Relevanz in der Entwicklung fortschrittlicher Machine-Learning-Systeme positioniert wird.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-model·google-ai·artificial-intelligence·deep-learning
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte