AssemblyAI एक निजी तौर पर स्वामित्व वाली प्रौद्योगिकी कंपनी है जो स्पीच-टू-टेक्स्ट और ऑडियो इंटेलिजेंस API में विशेषज्ञता रखती है। 2017 में डायलन फॉक्स और योनातन बिस्क द्वारा स्थापित, यह कंपनी सैन फ्रांसिस्को, कैलिफोर्निया में मुख्यालय रखती है। AssemblyAI डेवलपर-केंद्रित उपकरणों का एक सूट प्रदान करती है जो ऑडियो और वीडियो को संरचित डेटा में परिवर्तित करता है, जिससे कॉल एनालिटिक्स, वॉयस असिस्टेंट और मीडिया कैप्शनिंग जैसे अनुप्रयोग सक्षम होते हैं।
कंपनी का मुख्य उत्पाद एक क्लाउड-आधारित API प्लेटफॉर्म है जो Neural network आर्किटेक्चर और डीप लर्निंग का लाभ उठाता है। AssemblyAI के मॉडल बड़े पैमाने के डेटासेट पर प्रशिक्षित हैं और विविध उच्चारणों, भाषाओं और ध्वनिक स्थितियों को संभालने के लिए डिज़ाइन किए गए हैं। प्लेटफॉर्म रीयल-टाइम ट्रांसक्रिप्शन, स्पीकर डायराइजेशन, सेंटिमेंट विश्लेषण, एंटिटी डिटेक्शन और टॉपिक एक्सट्रैक्शन सहित सुविधाएँ प्रदान करता है। 2023 में, AssemblyAI ने Universal-1 जारी किया, जो 12.5 मिलियन घंटे के ऑडियो डेटा पर प्रशिक्षित एक बड़ा Machine learning मॉडल है, जिसने कई बेंचमार्क पर अत्याधुनिक सटीकता हासिल की। कंपनी ने Conformer-2 भी पेश किया, जो लंबे-रूप ट्रांसक्रिप्शन और स्पीकर लेबलिंग के लिए अनुकूलित एक मॉडल है।
इतिहास और फंडिंग
AssemblyAI की स्थापना 2017 में डेवलपर्स के लिए स्पीच AI को सुलभ बनाने के लक्ष्य के साथ की गई थी। कंपनी शुरू में एक शोध-केंद्रित स्टार्टअप के रूप में संचालित हुई, जो स्पीच रिकग्निशन पर शैक्षणिक पेपर प्रकाशित करती थी। 2018 में, इसने $2.5 मिलियन का सीड राउंड जुटाया, इसके बाद 2020 में Google Cloud (Google के AI-केंद्रित वेंचर आर्म के हिस्से के रूप में) के नेतृत्व में $10 मिलियन की सीरीज़ A जुटाई। 2021 में, AssemblyAI ने $50 मिलियन की सीरीज़ B हासिल की, और 2022 में इसने Amazon Web Services के Alexa Fund के नेतृत्व में $100 मिलियन की सीरीज़ C बंद की। 2024 तक, कंपनी ने कुल $160 मिलियन से अधिक फंडिंग जुटाई है और इसका मूल्यांकन लगभग $1 बिलियन है, जिससे यह वॉयस AI क्षेत्र में एक यूनिकॉर्न बन गई है।
प्रौद्योगिकी और मॉडल
AssemblyAI का प्लेटफॉर्म मालिकाना Deep learning फ्रेमवर्क और Transformer (architecture) आर्किटेक्चर पर बनाया गया है। 2023 में जारी Universal-1 मॉडल, एक Large language model-शैली का ऑडियो एनकोडर है जो कच्चे तरंगरूपों को संसाधित करता है और विराम चिह्न और कैपिटलाइज़ेशन के साथ टेक्स्ट आउटपुट करता है। यह 15 भाषाओं का समर्थन करता है और अंग्रेजी बेंचमार्क पर 5% से नीचे शब्द त्रुटि दर प्राप्त करता है। 2024 में पेश किया गया Conformer-2 मॉडल, स्पीकर डायराइजेशन और लंबे-रूप ट्रांसक्रिप्शन में सुधार के लिए Multi-Head Attention तंत्र और Encoder-Decoder Architecture संरचनाओं को शामिल करता है। कंपनी एक LeMUR (Large Language Model for Understanding and Reasoning) फ्रेमवर्क भी प्रदान करती है जो ट्रांसक्राइब किए गए ऑडियो पर प्रश्न-उत्तर और सारांशीकरण सक्षम करने के लिए बाहरी Generative AI प्रणालियों के साथ एकीकृत होता है।
उत्पाद और उपयोग के मामले
AssemblyAI Python, JavaScript और अन्य भाषाओं के लिए SDK के साथ एक RESTful API प्रदान करती है। मुख्य उत्पादों में शामिल हैं:
- स्पीच-टू-टेक्स्ट API: शब्द-स्तरीय टाइमस्टैम्प के साथ रीयल-टाइम और अतुल्यकालिक ट्रांसक्रिप्शन।
- ऑडियो इंटेलिजेंस मॉडल: सेंटिमेंट विश्लेषण, सामग्री मॉडरेशन और PII रिडक्शन के लिए पूर्व-निर्मित मॉडल।
- LeMUR: ट्रांसक्राइब किए गए डेटा पर प्राकृतिक भाषा क्वेरी बनाने के लिए एक फ्रेमवर्क।
प्लेटफॉर्म का उपयोग Intuitive Surgical जैसी कंपनियों द्वारा चिकित्सा दस्तावेज़ीकरण के लिए, Commure द्वारा स्वास्थ्य देखभाल एनालिटिक्स के लिए, और TomTom द्वारा वॉयस-सक्षम नेविगेशन के लिए किया जाता है। डेवलपर्स कॉल सेंटर एनालिटिक्स, पॉडकास्ट खोज और मीटिंग ट्रांसक्रिप्शन उपकरण बनाने के लिए भी AssemblyAI का उपयोग करते हैं।
उद्योग प्रभाव और तुलना
AssemblyAI OpenAI के Whisper, Microsoft Azure की स्पीच सेवा और Amazon Web Services Transcribe जैसे अन्य स्पीच AI प्रदाताओं के साथ प्रतिस्पर्धा करती है। इन हाइपरस्केलर पेशकशों के विपरीत, AssemblyAI विशेष रूप से ऑडियो इंटेलिजेंस पर ध्यान केंद्रित करती है और अधिक सूक्ष्म अनुकूलन विकल्प प्रदान करती है। कंपनी को उद्योग रिपोर्टों में उच्च सटीकता और कम विलंबता के लिए मान्यता दी गई है। 2023 में, AssemblyAI को Omdia स्पीच AI मैट्रिक्स में एक नेता नामित किया गया और सर्वश्रेष्ठ स्पीच रिकग्निशन प्लेटफॉर्म के लिए AI ब्रेकथ्रू अवार्ड प्राप्त हुआ।
भविष्य की दिशाएँ
AssemblyAI अनुसंधान और विकास में निवेश जारी रखती है, विशेष रूप से बहुभाषी मॉडल और रीयल-टाइम स्ट्रीमिंग में। कंपनी का लक्ष्य क्लाउड प्रदाताओं के साथ साझेदारी करके और Amazon AI और Google DeepMind प्रौद्योगिकियों के साथ एकीकृत करके Artificial intelligence पारिस्थितिकी तंत्र में अपनी उपस्थिति का विस्तार करना है। 2025 तक, AssemblyAI एज अनुप्रयोगों के लिए विलंबता कम करने और गोपनीयता में सुधार करने के लिए ऑन-डिवाइस इन्फ्रेंस की खोज कर रही है।