AI Technology में नई पहल
अमेरिकी Technology कंपनी Meta ने अपना पहला Real-Time Audio Perception Model Muse Voice Transcribe लॉन्च किया है। यह नया AI मॉडल पांच प्रमुख भारतीय भाषाओं के लिए Native Support प्रदान करता है और Advanced Streaming Features के साथ पेश किया गया है। कंपनी ने बताया कि इसे Meta Superintelligence Labs ने विकसित किया है।
एक ही Model में कई Advanced Features
Meta के अनुसार, Muse Voice Transcribe Streaming Transcription, Speaker Separation और Diarisation जैसी सुविधाएं एक ही Model के जरिए उपलब्ध कराता है। यह 20 से अधिक Speakers वाली एक घंटे से ज्यादा लंबी Audio Recordings को भी प्रोसेस कर सकता है। इसके लिए किसी अतिरिक्त Post-Processing की जरूरत नहीं पड़ती।
70 से अधिक भाषाओं पर किया गया Training
कंपनी ने बताया कि Muse Voice Transcribe को दुनियाभर में बोली जाने वाली 70 से अधिक भाषाओं पर Train किया गया है। लॉन्च के समय इसमें 25 भाषाओं को Validate किया गया है। Meta के अनुसार, यह Model 1 सितंबर 2026 तक Artificial Analysis Streaming Speech-to-Text Leaderboard पर पहले स्थान पर रहा है।
Meta AI और Muse Code में पहले से उपयोग
Muse Voice Transcribe को Meta Model API के माध्यम से उपलब्ध कराया गया है। यह पहले से Meta AI for Mac और Muse Code में Dictation Feature के रूप में इस्तेमाल हो रहा है। यह Real-Time Automatic Speech Recognition, 20 से अधिक Speakers की पहचान और बेहतर Accuracy के लिए Language, Keyword और Context Biasing जैसी सुविधाएं देता है।
Adaptive Delay से बढ़ेगी Accuracy
Meta ने बताया कि इस Model में Adaptive Delay Technology का इस्तेमाल किया गया है। यह Technology Word की कठिनाई के अनुसार Delay को अपने आप Adjust करती है, जिससे Speed और Accuracy के बीच बेहतर संतुलन बनाया जा सके। इसके लिए Reinforcement Learning (RL) का उपयोग किया गया है।
AI Processing का नया Approach
Meta के अनुसार, Muse Voice Transcribe एक Autoregressive Multimodal Model है, जो Muse Spark Family का हिस्सा है। यह Audio को 80 Millisecond के छोटे हिस्सों में Process करता है और हर Chunk को एक Soft Token में बदलता है। कंपनी का दावा है कि Adaptive Delay के कारण यह Model तेज Transcription और बेहतर Accuracy के बीच बेहतर Performance देता है।

