Amba Research एक निजी कृत्रिम बुद्धिमत्ता अनुसंधान प्रयोगशाला है, जिसकी स्थापना Google DeepMind के पूर्व शोधकर्ताओं के एक समूह द्वारा की गई थी। यह संगठन मल्टीमॉडल मॉडलों को आगे बढ़ाने पर केंद्रित है जो पाठ, छवि, ऑडियो और वीडियो इनपुट को संसाधित और एकीकृत करते हैं, साथ ही प्रशिक्षण दक्षता और मॉडल मजबूती में सुधार के लिए सिंथेटिक डेटा निर्माण तकनीक विकसित करता है। 2025 तक, प्रयोगशाला वरिष्ठ शोधकर्ताओं और इंजीनियरों की अपेक्षाकृत छोटी टीम के साथ काम करती है, जो वाणिज्यिक उत्पाद तैनाती पर मौलिक अनुसंधान को प्राथमिकता देती है।
संस्थापक टीम, जिसमें वे लोग शामिल हैं जिन्होंने DeepMind में प्रारंभिक ट्रांसफॉर्मर-आधारित आर्किटेक्चर में योगदान दिया था, ने स्वतंत्र अनुसंधान दिशाओं को आगे बढ़ाने के लिए 2023 में मूल कंपनी छोड़ दी। Amba Research में उनके कार्य को सहकर्मी-समीक्षित सम्मेलन पत्रों और प्रीप्रिंट्स के माध्यम से प्रसारित किया गया है, हालांकि प्रयोगशाला बड़े उद्योग अनुसंधान समूहों की तुलना में कम सार्वजनिक प्रोफ़ाइल बनाए रखती है। समूह ने बाहरी वित्तपोषण स्रोतों का खुलासा नहीं किया है, जो स्व-वित्तपोषण या अज्ञात निवेशकों से निजी समर्थन का सुझाव देता है।
संस्थापना और नेतृत्व
Amba Research को 2023 की शुरुआत में लंदन, यूनाइटेड किंगडम में शामिल किया गया था। संस्थापक सदस्यों में तीन पूर्व DeepMind शोधकर्ता शामिल हैं: डॉ. एलेना वास्केज़ (पूर्व में मल्टीमॉडल लर्निंग टीम में वरिष्ठ शोध वैज्ञानिक), डॉ. राजेश मेनन (सुदृढीकरण सीखने और सिंथेटिक वातावरण में विशेषज्ञ), और डॉ. सोफी लिंडक्विस्ट (बड़े पैमाने पर डेटा क्यूरेशन में विशेषज्ञ)। तीनों ने पहले विज़न-भाषा प्रीट्रेनिंग से जुड़ी परियोजनाओं पर सहयोग किया था और डेटा-कुशल प्रशिक्षण विधियों पर कई पत्र सह-लेखन किए थे।
वास्केज़ मुख्य कार्यकारी अधिकारी के रूप में कार्य करती हैं, जबकि मेनन सिंथेटिक डेटा प्रभाग का नेतृत्व करते हैं और लिंडक्विस्ट मल्टीमॉडल आर्किटेक्चर समूह की प्रमुख हैं। प्रयोगशाला ने शुरू में 15 शोधकर्ताओं को नियोजित किया, जो 2025 के अंत तक लगभग 40 कर्मचारियों तक विस्तारित हुआ। कई AI स्टार्टअप के विपरीत, Amba Research ने तेजी से भर्ती से परहेज किया है, टीम के आकार पर गहरी विशेषज्ञता पर जोर दिया है।
अनुसंधान फोकस: मल्टीमॉडल मॉडल
एक प्राथमिक अनुसंधान क्षेत्र एकीकृत मल्टीमॉडल आर्किटेक्चर का विकास है जो मोडैलिटी-विशिष्ट एन्कोडर के बिना विभिन्न डेटा मोडैलिटी में प्रक्रिया और तर्क कर सकता है। प्रयोगशाला के 2024 के पेपर, "क्रॉस-मोडल टोकन फ्यूज़न फॉर एफिशिएंट विज़न-लैंग्वेज अंडरस्टैंडिंग," ने एक नया ध्यान तंत्र पेश किया जो मानक क्रॉस-अटेंशन दृष्टिकोण की तुलना में कम्प्यूटेशनल ओवरहेड को 30% कम करता है। इस कार्य को MIT CSAIL और Stanford AI Lab सहित शैक्षणिक संस्थानों के बाद के शोध में उद्धृत किया गया है।
2025 में, Amba Research ने "ऑडियो-विज़ुअल-टैक्टाइल रिप्रेजेंटेशन लर्निंग फॉर रोबोटिक मैनिपुलेशन" शीर्षक से एक प्रीप्रिंट जारी किया, जिसने प्रदर्शित किया कि सिंथेटिक टैक्टाइल डेटा और वास्तविक ऑडियो-विज़ुअल इनपुट पर संयुक्त प्रशिक्षण ने एकल-मोडैलिटी बेसलाइन पर रोबोटिक ग्रासपिंग सटीकता में 18% सुधार किया। प्रयोगशाला ने वीडियो निर्माण के लिए एन्कोडर-डिकोडर फ्रेमवर्क भी खोजा है, जो अस्थायी स्थिरता मेट्रिक्स के साथ नियंत्रणीय वीडियो संश्लेषण पर परिणाम प्रकाशित करता है।
टीम ने मल्टीमॉडल तर्क के लिए ओपन-सोर्स मूल्यांकन बेंचमार्क जारी करके व्यापक बड़े भाषा मॉडल पारिस्थितिकी तंत्र में योगदान दिया है। जून 2025 में पेश किया गया उनका "M3Bench" डेटासेट, दृश्य, श्रवण और पाठ्य तर्क कार्यों में फैले 50,000 प्रश्न-उत्तर जोड़े शामिल करता है, और मॉडल तुलना के लिए कई शैक्षणिक समूहों द्वारा अपनाया गया है।
सिंथेटिक डेटा निर्माण
सिंथेटिक डेटा Amba Research की पद्धति की आधारशिला बनाता है। प्रयोगशाला ने "SynthForge" नामक एक फ्रेमवर्क विकसित किया, जो नियंत्रणीय कठिनाई स्तरों के साथ विविध प्रशिक्षण उदाहरण बनाने के लिए जनरेटिव मॉडल का उपयोग करता है। एक 2024 तकनीकी रिपोर्ट ने वर्णन किया कि कैसे SynthForge ने विज़न-भाषा मॉडल को फाइन-ट्यून करने के लिए 2 मिलियन सिंथेटिक छवि-पाठ जोड़े उत्पन्न किए, जिसके परिणामस्वरूप अकेले जैविक डेटा पर प्रशिक्षित मॉडल की तुलना में डाउनस्ट्रीम वर्गीकरण कार्यों में 12% सुधार हुआ।
मेनन की टीम ने सुदृढीकरण सीखने के लिए सिंथेटिक वातावरण उत्पन्न करने के लिए जनरेटिव AI का उपयोग करने पर ध्यान केंद्रित किया है। उनके 2025 के पेपर, "प्रोसीजरल वर्ल्ड जेनरेशन फॉर जनरलिस्ट एजेंट्स," ने प्रदर्शित किया कि अलग-अलग भौतिकी मापदंडों के साथ प्रक्रियात्मक रूप से उत्पन्न वातावरण में प्रशिक्षित एजेंटों ने अनदेखे कार्यों पर 25% उच्च शून्य-शॉट स्थानांतरण सफलता हासिल की। प्रयोगशाला ने दुर्लभ-घटना पहचान के लिए सिंथेटिक डेटा की भी जांच की है, जो वास्तविक दुनिया के डेटासेट में कम प्रतिनिधित्व वाले किनारे के मामलों को उत्पन्न करता है।
Amba Research ने सिंथेटिक डेटा गुणवत्ता मूल्यांकन पर दिशानिर्देश प्रकाशित किए हैं, जो विविधता, यथार्थवाद और कार्य-प्रासंगिकता के लिए मेट्रिक्स प्रस्तावित करते हैं। इन सिफारिशों को Samsung Research और Nokia Bell Labs जैसी कंपनियों की उद्योग रिपोर्टों में संदर्भित किया गया है।
सहयोग और शैक्षणिक संबंध
अपनी स्वतंत्र स्थिति के बावजूद, Amba Research शैक्षणिक संस्थानों के साथ अनौपचारिक सहयोग बनाए रखता है। Berkeley AI Research के शोधकर्ताओं ने मल्टीमॉडल मॉडल में अनिश्चितता अनुमान पर Amba वैज्ञानिकों के साथ पत्र सह-लेखन किए हैं। 2024 में शुरू की गई University of Toronto शोधकर्ताओं के साथ एक संयुक्त परियोजना, चिकित्सा इमेजिंग विश्लेषण के लिए सिंथेटिक डेटा की खोज करती है, हालांकि परिणाम अभी तक प्रकाशित नहीं हुए हैं।
प्रयोगशाला ने रोबोटिक्स से संबंधित सिंथेटिक डेटा पर Carnegie Mellon University के साथ भी जुड़ाव किया है, जो 2025 में सिमुलेशन-से-वास्तविक स्थानांतरण पर एक कार्यशाला में योगदान देता है। ये सहयोग आम तौर पर परियोजना-आधारित होते हैं और औपचारिक वित्तपोषण समझौते शामिल नहीं करते हैं, जो खुले वैज्ञानिक आदान-प्रदान के लिए प्रयोगशाला की प्राथमिकता को दर्शाता है।
Amba Research ने कंप्यूट संसाधनों के लिए Amazon Web Services या Google Cloud जैसे प्रमुख क्लाउड प्रदाताओं के साथ साझेदारी नहीं की है, इसके बजाय GPU सर्वरों का अपना छोटा क्लस्टर संचालित करता है। यह स्वतंत्रता प्रयोगों के पैमाने को सीमित करती है लेकिन अनुसंधान दिशाओं में अधिक लचीलापन की अनुमति देती है।
उल्लेखनीय प्रकाशन और प्रभाव
Amba Research के प्रमुख प्रकाशनों में शामिल हैं:
- "क्रॉस-मोडल टोकन फ्यूज़न फॉर एफिशिएंट विज़न-लैंग्वेज अंडरस्टैंडिंग" (2024, इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन) - एक पैरामीटर-कुशल फ्यूज़न विधि पेश की।
- "SynthForge: स्केलेबल सिंथेटिक डेटा जेनरेशन फॉर मल्टीमॉडल ट्रेनिंग" (2024, arXiv प्रीप्रिंट) - सिंथेटिक डेटा पाइपलाइन का विवरण दिया।
- "प्रोसीजरल वर्ल्ड जेनरेशन फॉर जनरलिस्ट एजेंट्स" (2025, कॉन्फ्रेंस ऑन न्यूरल इंफॉर्मेशन प्रोसेसिंग सिस्टम्स) - पर्यावरण निर्माण तकनीक प्रस्तुत की।
- "M3Bench: ए मल्टीमॉडल रीजनिंग बेंचमार्क" (2025, arXiv प्रीप्रिंट) - एक सार्वजनिक मूल्यांकन सूट जारी किया।
Google Scholar के अनुसार, इन कार्यों ने 2025 के अंत तक सामूहिक रूप से 1,500 से अधिक उद्धरण जमा किए हैं। प्रयोगशाला के पत्रों पर AI अनुसंधान समुदायों में अक्सर चर्चा की जाती है, विशेष रूप से डेटा दक्षता के लिए उनके व्यावहारिक दृष्टिकोण के लिए।
पूर्व नियोक्ता के साथ संबंध
Amba Research Google DeepMind के साथ सौहार्दपूर्ण लेकिन दूर का संबंध बनाए रखता है। कई संस्थापक सदस्य अपने पूर्व संस्थान के साथ एमेरिटस संबद्धता बनाए रखते हैं, और सामयिक संयुक्त सेमिनार होते हैं। हालांकि, प्रयोगशाला को DeepMind से वित्तपोषण या कंप्यूट संसाधन प्राप्त नहीं होते हैं, और इसकी अनुसंधान दिशाएं स्वतंत्र हैं। 2024 में, DeepMind शोधकर्ताओं ने एक आंतरिक तकनीकी समीक्षा में सिंथेटिक डेटा पर Amba के कार्य का उद्धरण दिया, जो विचारों के पार-परागण का संकेत देता है।
प्रयोगशाला ने अपनी मुख्य तकनीकों पर पेटेंट दायर नहीं किया है, खुले तौर पर प्रकाशित करना चुनता है। यह दृष्टिकोण संस्थापकों के प्रतिलिपि-योग्य अनुसंधान में व्यक्त विश्वास के अनुरूप है, हालांकि यह संभावित वाणिज्यिक अनुप्रयोगों को सीमित करता है।
भविष्य की दिशाएं
2025 तक, Amba Research ऊर्जा-कुशल मॉडल प्रशिक्षण में विस्तार कर रहा है, बड़े पैमाने पर प्रयोगों के कार्बन पदचिह्न को कम करने के तरीकों की खोज कर रहा है। एक प्रारंभिक अध्ययन से पता चलता है कि उनकी सिंथेटिक डेटा तकनीक कुछ विज़न कार्यों के लिए प्रशिक्षण कंप्यूट को 40% तक कम कर सकती है। प्रयोगशाला निरंतर सीखने के लिए डेटा संवर्धन रणनीतियों की भी जांच कर रही है, जिसका उद्देश्य मॉडल को विनाशकारी भूलने के बिना नए कार्यों के अनुकूल होने में सक्षम बनाना है।
नेतृत्व ने एज डिवाइसों के लिए मल्टीमॉडल मॉडल को अनुकूलित करने पर AMD और Intel जैसे हार्डवेयर निर्माताओं के साथ सहयोग में रुचि व्यक्त की है, हालांकि कोई औपचारिक समझौता घोषित नहीं किया गया है। प्रयोगशाला की दीर्घकालिक दृष्टि सामान्यवादी AI प्रणाली विकसित करना है जो न्यूनतम वास्तविक दुनिया के डेटा से सीख सकें, सिंथेटिक वातावरण पर भारी निर्भर रहें।
Amba Research AI परिदृश्य में एक विशिष्ट खिलाड़ी बना हुआ है, जो अपने केंद्रित अनुसंधान एजेंडा और अनुभवी टीम द्वारा प्रतिष्ठित है। जबकि इसमें उद्योग दिग्गजों का पैमाना नहीं है, सिंथेटिक डेटा और मल्टीमॉडल आर्किटेक्चर में इसके योगदान ने शैक्षणिक और अनुप्रयुक्त अनुसंधान समुदायों दोनों को प्रभावित किया है।