Meta ka prezantuar Muse Voice Transcribe, modelin e saj të parë të inteligjencës artificiale për përpunimin dhe transkriptimin e audios në kohë reale. Teknologjia mund të transkriptojë diktim dhe biseda me më shumë se 20 persona, të dallojë se kush po flet dhe të përpunojë disa gjuhë brenda së njëjtës bisedë.
Modeli është tashmë i disponueshëm përmes Meta Model API, në Muse Code dhe në aplikacionin Meta AI për Mac. Mark Zuckerberg demonstroi funksionimin e teknologjisë, duke treguar se si sistemi arrin të identifikojë folës të ndryshëm në kohë reale dhe të kuptojë kalimin nga një gjuhë në tjetrën gjatë së njëjtës bisedë. Një nga veçoritë më interesante është aftësia për të kuptuar edhe të ashtuquajturin “code-switching”, pra momentet kur një person përdor fjalë ose shprehje nga disa gjuhë brenda së njëjtës fjali. Kjo është veçanërisht e rëndësishme për bisedat reale, ku njerëzit shpesh kalojnë natyrshëm nga një gjuhë në tjetrën.
Sipas Zuckerberg, modeli përshtat në mënyrë dinamike edhe kohën që i nevojitet për të përpunuar të folurin. Për fjalët më të vështira mund të presë pak më gjatë përpara se të vendosë transkriptimin përfundimtar, ndërsa fjalët më të thjeshta i përpunon më shpejt. Qëllimi është të ruhet ekuilibri mes shpejtësisë së transkriptimit dhe saktësisë. Muse Voice Transcribe është trajnuar me më shumë se 70 gjuhë, ndërsa 25 prej tyre janë validuar zyrtarisht në momentin e lançimit. Meta thotë se modeli është ndërtuar për të funksionuar jo vetëm me regjistrime të pastra në studio, por edhe me audion reale të përditshme, ku mund të ketë zhurmë, ndërprerje, njerëz që flasin njëkohësisht apo ndryshime të vazhdueshme të folësve. Ai mund të përballojë gjithashtu sesione që zgjasin deri në një orë dhe ku marrin pjesë më shumë se 20 persona.
Kompania e përshkruan Muse Voice Transcribe si modelin e parë të perceptimit audio në kohë reale të zhvilluar nga Meta Superintelligence Lab. Teknologjia integron në një model të vetëm edhe identifikimin e folësve, të njohur si speaker diarization, si dhe përcaktimin automatik të momentit kur një person ka përfunduar së foluri. Lançimi vjen më pak se një javë pasi Google prezantoi Gemini 3.5 Transcribe, një model audio me funksionalitete të ngjashme, duke sinjalizuar një tjetër front të konkurrencës mes kompanive të mëdha të inteligjencës artificiale. Meta ende nuk ka bërë të ditur nëse Muse Voice Transcribe do të integrohet në shërbimet e saj kryesore për konsumatorët. Megjithatë, aplikacioni Meta AI për Mac mund të përdorë funksionet e diktimit të modelit edhe gjatë punës me aplikacione të tjera.
Alexandr Wang bëri të ditur se teknologjia tashmë po përdoret për funksionin e diktimit në aplikacionin desktop të Meta-s dhe në Muse Code. Edhe çmimi është bërë publik. Meta e ofron Muse Voice Transcribe me 3 dollarë për 1,000 minuta audio, ndërsa kompania ka publikuar edhe një version demonstrues të teknologjisë. Muse Voice Transcribe është pjesë e një serie produktesh të reja që po dalin nga Meta Superintelligence Lab. Gjatë javëve të fundit, laboratori ka prezantuar gjithashtu një agjent të dedikuar për programim, një model open-weight dhe aplikacionin Meta AI për Mac. Zhvillimi tregon se beteja e radhës mes kompanive të AI nuk po zhvillohet vetëm te chatbot-et apo gjenerimi i imazheve. Zëri dhe aftësia e AI-së për të kuptuar bisedat reale, shumëgjuhëshe dhe me shumë pjesëmarrës po shndërrohen në një tjetër fushë të rëndësishme konkurrence.