Deepgram एक भाषण प्रौद्योगिकी कंपनी है जो स्वचालित भाषण पहचान (ASR) और ऑडियो इंटेलिजेंस समाधान विकसित करती है। कंपनी भाषण-से-पाठ प्रतिलेखन, वॉयस AI, और ऑडियो विश्लेषण के लिए क्लाउड-आधारित API प्रदान करती है, जो डेवलपर्स और उद्यमों को लक्षित करती है। Deepgram की स्थापना 2015 में स्कॉट स्टीफेंसन द्वारा की गई थी, जो पूर्व ब्रिजवाटर एसोसिएट्स इंजीनियर थे, और इसका मुख्यालय सैन फ्रांसिस्को, कैलिफोर्निया में है।
इतिहास
Deepgram की स्थापना 2015 में भाषण पहचान के लिए गहन शिक्षण लागू करने के लक्ष्य के साथ की गई थी। कंपनी ने शुरू में ऑडियो प्रोसेसिंग के लिए बड़े पैमाने पर तंत्रिका नेटवर्क बनाने पर ध्यान केंद्रित किया। 2018 में, Deepgram ने Nvidia के नेतृत्व में $12 मिलियन की सीरीज A फंडिंग जुटाई, जिसमें अन्य निवेशकों ने भाग लिया। फंडिंग का उपयोग अपने अनुसंधान और विकास प्रयासों का विस्तार करने के लिए किया गया था। 2020 में, कंपनी ने अपना क्लाउड-आधारित भाषण पहचान API लॉन्च किया, जिससे इसकी तकनीक व्यापक दर्शकों के लिए सुलभ हो गई। 2021 तक, Deepgram ने Tiger Global Management के नेतृत्व में अतिरिक्त $47 मिलियन की सीरीज B फंडिंग जुटाई, जिससे इसकी कुल फंडिंग $60 मिलियन से अधिक हो गई।
प्रौद्योगिकी
Deepgram की मुख्य तकनीक गहन शिक्षण मॉडल, विशेष रूप से गहन शिक्षण और तंत्रिका नेटवर्क आर्किटेक्चर पर आधारित है। कंपनी ऑडियो सिग्नल प्रोसेस करने के लिए ट्रांसफॉर्मर मॉडल और अनुक्रम-से-अनुक्रम फ्रेमवर्क का उपयोग करती है। पारंपरिक ASR सिस्टम के विपरीत जो फोनीम-आधारित मॉडल पर निर्भर करते हैं, Deepgram का दृष्टिकोण एंड-टू-एंड लर्निंग का उपयोग करता है, जो सिस्टम को सीधे ऑडियो को पाठ में मैप करने की अनुमति देता है। यह विधि विविध उच्चारण, पृष्ठभूमि शोर, और डोमेन-विशिष्ट शब्दावली को संभालने के लिए डिज़ाइन की गई है। Deepgram स्पीकर डायराइज़ेशन, भावना विश्लेषण, और कीवर्ड स्पॉटिंग जैसी सुविधाएँ भी प्रदान करता है। प्लेटफ़ॉर्म कई भाषाओं का समर्थन करता है और इसे क्लाउड या ऑन-प्रिमाइसेस तैनात किया जा सकता है।
उत्पाद और सेवाएँ
Deepgram कई उत्पाद प्रदान करता है, जिनमें शामिल हैं:
- स्पीच-टू-टेक्स्ट API: वास्तविक समय या बैच मोड में ऑडियो को पाठ में परिवर्तित करता है।
- वॉयस AI: वॉयस असिस्टेंट और इंटरैक्टिव वॉयस रिस्पॉन्स सिस्टम सक्षम करता है।
- ऑडियो इंटेलिजेंस: भावना, विषयों और संस्थाओं के लिए ऑडियो का विश्लेषण प्रदान करता है।
- Nova: वास्तविक समय अनुप्रयोगों के लिए अनुकूलित एक तेज़ और सटीक भाषण पहचान मॉडल।
- Aurora: शोर वातावरण में उच्च-सटीकता प्रतिलेखन के लिए डिज़ाइन किया गया एक मॉडल।
ये सेवाएँ REST API और विभिन्न प्रोग्रामिंग भाषाओं के लिए SDK के माध्यम से उपलब्ध हैं। Deepgram की मूल्य निर्धारण उपयोग-आधारित है, जिसमें मुफ्त स्तर और उद्यम योजनाओं के विकल्प शामिल हैं।
उपयोग के मामले
Deepgram की तकनीक का उपयोग कॉल सेंटर, स्वास्थ्य सेवा, मीडिया और वित्त सहित विभिन्न उद्योगों में किया जाता है। उदाहरण के लिए, कॉल सेंटर गुणवत्ता आश्वासन के लिए ग्राहक इंटरैक्शन को प्रतिलेखित और विश्लेषण करने के लिए Deepgram का उपयोग करते हैं। मीडिया कंपनियाँ कैप्शनिंग और सामग्री अनुक्रमण के लिए इसका उपयोग करती हैं। स्वास्थ्य सेवा में, यह नैदानिक दस्तावेज़ीकरण में सहायता करता है। कंपनी वॉयस-सक्षम अनुप्रयोग बनाने वाले डेवलपर्स की भी सेवा करती है।
फंडिंग और विकास
Deepgram ने उल्लेखनीय निवेशकों से महत्वपूर्ण फंडिंग जुटाई है। 2023 तक, कंपनी ने कुल $100 मिलियन से अधिक की फंडिंग जुटाई है। इसके निवेशकों में Nvidia, Tiger Global Management, और अन्य उद्यम पूंजी फर्म शामिल हैं। कंपनी ने अपनी टीम और ग्राहक आधार का विस्तार किया है, जिसमें इंट्यूटिव सर्जिकल और टॉमटॉम जैसे ग्राहक कथित रूप से इसकी सेवाओं का उपयोग कर रहे हैं।
यह भी देखें
संदर्भ
- Deepgram आधिकारिक वेबसाइट (deepgram.com)
- Deepgram फंडिंग राउंड पर TechCrunch लेख
- कंपनी प्रेस विज्ञप्तियाँ
नोट: 2023 तक, Deepgram अपने उत्पाद पेशकशों को विकसित करना और अपनी बाजार उपस्थिति का विस्तार करना जारी रखे हुए है।