Wednesday, September 2, 2026 |
Home Tech WorldMeta ने लॉन्च किया Muse Voice Transcribe, पांच भारतीय भाषाओं को मिलेगा Native Support

Meta ने लॉन्च किया Muse Voice Transcribe, पांच भारतीय भाषाओं को मिलेगा Native Support

Meta का नया AI मॉडल देगा Real-Time Audio Transcription, Speaker Separation और Multilingual Features

by Business Remedies
0 comments
Meta Muse Voice Transcribe AI model with multilingual speech recognition technology

AI Technology में नई पहल
अमेरिकी Technology कंपनी Meta ने अपना पहला Real-Time Audio Perception Model Muse Voice Transcribe लॉन्च किया है। यह नया AI मॉडल पांच प्रमुख भारतीय भाषाओं के लिए Native Support प्रदान करता है और Advanced Streaming Features के साथ पेश किया गया है। कंपनी ने बताया कि इसे Meta Superintelligence Labs ने विकसित किया है।

एक ही Model में कई Advanced Features
Meta के अनुसार, Muse Voice Transcribe Streaming Transcription, Speaker Separation और Diarisation जैसी सुविधाएं एक ही Model के जरिए उपलब्ध कराता है। यह 20 से अधिक Speakers वाली एक घंटे से ज्यादा लंबी Audio Recordings को भी प्रोसेस कर सकता है। इसके लिए किसी अतिरिक्त Post-Processing की जरूरत नहीं पड़ती।

70 से अधिक भाषाओं पर किया गया Training
कंपनी ने बताया कि Muse Voice Transcribe को दुनियाभर में बोली जाने वाली 70 से अधिक भाषाओं पर Train किया गया है। लॉन्च के समय इसमें 25 भाषाओं को Validate किया गया है। Meta के अनुसार, यह Model 1 सितंबर 2026 तक Artificial Analysis Streaming Speech-to-Text Leaderboard पर पहले स्थान पर रहा है।

Meta AI और Muse Code में पहले से उपयोग
Muse Voice Transcribe को Meta Model API के माध्यम से उपलब्ध कराया गया है। यह पहले से Meta AI for Mac और Muse Code में Dictation Feature के रूप में इस्तेमाल हो रहा है। यह Real-Time Automatic Speech Recognition, 20 से अधिक Speakers की पहचान और बेहतर Accuracy के लिए Language, Keyword और Context Biasing जैसी सुविधाएं देता है।

Adaptive Delay से बढ़ेगी Accuracy
Meta ने बताया कि इस Model में Adaptive Delay Technology का इस्तेमाल किया गया है। यह Technology Word की कठिनाई के अनुसार Delay को अपने आप Adjust करती है, जिससे Speed और Accuracy के बीच बेहतर संतुलन बनाया जा सके। इसके लिए Reinforcement Learning (RL) का उपयोग किया गया है।

AI Processing का नया Approach
Meta के अनुसार, Muse Voice Transcribe एक Autoregressive Multimodal Model है, जो Muse Spark Family का हिस्सा है। यह Audio को 80 Millisecond के छोटे हिस्सों में Process करता है और हर Chunk को एक Soft Token में बदलता है। कंपनी का दावा है कि Adaptive Delay के कारण यह Model तेज Transcription और बेहतर Accuracy के बीच बेहतर Performance देता है।



You may also like

Leave a Comment