Gato 1.2B ist ein neuronales Netzwerk-Modell, das von Google DeepMind mit 1,2 Milliarden Parametern entwickelt wurde. Es ist ein Transformer (architecture)-basiertes Sprachmodell, das darauf ausgelegt ist, eine breite Palette von Aufgaben zu bewältigen, darunter Textgenerierung, Bildbeschriftung und Robotersteuerung, unter Verwendung eines einzigen Gewichtssatzes. Das Modell wurde 2022 als Teil von DeepMinds Bemühungen eingeführt, einen Allzweck-Agenten zu schaffen, der in der Lage ist, in verschiedenen Umgebungen zu lernen und zu handeln.
Die Architektur von Gato 1.2B folgt dem Encoder-Decoder Architecture-Design, obwohl es hauptsächlich als Sequenz-zu-Sequenz-Modell arbeitet. Es verarbeitet Eingaben als Token-Sequenzen, wobei Text, Bilder und Aktionen in diskrete Token umgewandelt werden. Diese einheitliche Darstellung ermöglicht es dem Modell, zwischen Modalitäten zu wechseln, ohne aufgabenspezifische Modifikationen. Das Modell verwendet Multi-Head-Attention-Mechanismen und positionale Kodierungen, um Eingaben variabler Länge zu verarbeiten.
Training und Daten
Gato 1.2B wurde auf einem vielfältigen Datensatz trainiert, der Text aus Büchern und Webseiten, Bilder aus öffentlichen Datensätzen und Demonstrationsdaten aus simulierten und realen Roboterumgebungen umfasst. Das Training verwendete eine Kreuzentropie-Verlustfunktion für Text- und Bild-Token sowie eine separate Verlustfunktion für Aktions-Token. Das Modell wurde mit dem Adam-Optimierer und einem Lernratenplan optimiert, der Aufwärmphase und Kosinus-Abklingen umfasste. Das Training wurde auf Google Cloud-TPUs durchgeführt, mit einem Gesamtrechenbudget von etwa 1,1e21 FLOPs.
Fähigkeiten und Leistung
Gato 1.2B zeigt Kompetenz bei über 600 Aufgaben, darunter das Spielen von Atari-Spielen, das Generieren von Bildunterschriften, das Beantworten von Fragen und das Steuern eines Roboterarms. In Bewertungen erreichte es einen Medianwert von 50 % bei der Atari-Suite und übertraf frühere Generalisten-Modelle, blieb jedoch hinter spezialisierten Agenten zurück. Für die Robotersteuerung wurde das Modell bei realen Aufgaben wie dem Stapeln von Blöcken und dem Platzieren von Objekten getestet und erreichte in einigen Fällen Erfolgsraten, die mit spezialisierten Richtlinien vergleichbar sind. Die Fähigkeit des Modells, über Aufgaben hinweg zu generalisieren, wird auf sein umfangreiches Vortraining und das gemeinsame Token-Vokabular zurückgeführt.
Vergleich mit anderen Modellen
Gato 1.2B wird oft mit anderen Generalisten-Modellen wie OpenAIs GPT-3 und Anthropics Claude verglichen, unterscheidet sich jedoch durch seinen Fokus auf multimodale und verkörperte Aufgaben. Im Gegensatz zu reinen Sprachmodellen integriert Gato visuelle und Aktionsdaten, was es zu einem Schritt in Richtung künstlicher allgemeiner Intelligenz macht. Seine Parameteranzahl ist kleiner als die vieler zeitgenössischer Modelle, wie GPT-3 mit 175 Milliarden Parametern, aber es erzielt aufgrund seines spezialisierten Trainings wettbewerbsfähige Leistungen bei einer engeren Palette von Aufgaben.
Einschränkungen und zukünftige Richtungen
Trotz seiner Vielseitigkeit hat Gato 1.2B Einschränkungen. Es hat Schwierigkeiten mit langfristigen Aufgaben und erfordert eine sorgfältige Tokenisierung von Bildern und Aktionen. Seine Leistung verschlechtert sich bei Aufgaben außerhalb seiner Trainingsverteilung. Forscher bei DeepMind haben untersucht, das Modell zu skalieren und vielfältigere Daten einzubeziehen, um die Generalisierung zu verbessern. Das Modell wirft auch Fragen zu Sicherheit und Kontrolle auf, da es sowohl für nützliche als auch für schädliche Anwendungen verwendet werden kann. Zukünftige Arbeiten umfassen die Integration von Verstärkungslernen aus menschlichem Feedback und Lehrplan-Lernen, um seine Fähigkeiten zu verbessern.
Rezeption und Auswirkungen
Gato 1.2B wurde in der Maschinenlern-Gemeinschaft für sein ehrgeiziges Ziel eines einzelnen Agenten für mehrere Bereiche gut aufgenommen. Es löste Diskussionen über den Weg zu Allzweck-KI und die Bedeutung multimodalen Trainings aus. Der Code und die Gewichte des Modells wurden nicht vollständig als Open Source veröffentlicht, aber seine Architektur und Trainingsdetails wurden in einem technischen Bericht veröffentlicht. Es hat nachfolgende Forschung zu Generalisten-Agenten beeinflusst, einschließlich späterer Modelle von DeepMind wie RT-2 und SIMA.