Mi történt
A Microsoft kibővítette MAI modellcsomagját a MAI-Transcribe-2-Streaming kiadásával, egy új, valós idejű hangátírásra optimalizált modellel. A cég emellett két hanggenerációs modellt is bemutatott: a MAI-Voice-2.1-et és egy nagy teljesítményű változatát, a MAI-Voice-2.1-Flash-t. Ezek a modellek építőkövei a társalgási hangügynököket létrehozó fejlesztőknek.
A Microsoft bejelentette a MAI-Transcribe-2-Streaming azonnali elérhetőségét, amelyet úgy terveztek, hogy valós időben kezelje a hangbevitelt. Ennek a modellnek az a célja, hogy javítsa a hangalapú alkalmazások válaszkészségét azáltal, hogy csökkenti a beszélt nyelv szöveggé alakításához szükséges időt.
A vállalat emellett frissítette hanggeneráló portfólióját a MAI-Voice-2.1 és a MAI-Voice-2.1-Flash segítségével. A „Flash” megjelölés sebességre optimalizált modellt jelöl, valószínűleg az építészeti hatékonyság révén, amely gyorsabb tokengenerálást tesz lehetővé a hangminőség jelentős romlása nélkül.
Ezeket a modelleket összefüggő eszközkészletként forgalmazzák a párbeszédes ügynököket építő fejlesztők számára, amelyek célja a nagy pontosság, az alacsony késleltetés és a működési költségek versengő követelményei közötti egyensúly megteremtése.
Forrás részletei: microsoft.ai ↗
Miért számít
Ezek a kiadások a Microsoft stratégiai erőfeszítését jelentik annak érdekében, hogy a fejlesztők számára speciális, nagy teljesítményű összetevőket biztosítson a hangalapú AI-alkalmazásokhoz. A „Flash” változat kínálatával a Microsoft az alacsonyabb késleltetésű, költséghatékony következtetések iparági keresletét elégíti ki a valós idejű társalgási rendszerekben. A „streaming” képességekre való összpontosítás azt sugallja, hogy a mesterséges intelligencia által vezérelt ügyfélszolgálati és asszisztensi technológiákban a folyékonyabb, emberszerű interakciós sebességek felé tolódnak el, ahol a késleltetés kritikus akadályt jelent az elfogadásban.
A kiadás rávilágít arra a folyamatban lévő iparági trendre, amely szerint az AI-modelleket optimalizálják bizonyos módozatokhoz – jelen esetben a hanghoz – ahelyett, hogy kizárólag általános célú, nagy nyelvi modellekre hagyatkoznánk. A speciális modellek gyakran jobb teljesítmény-költség arányt biztosítanak bizonyos feladatokhoz, például az átíráshoz.
A vállalkozások számára a gyorsabb, pontosabb átírás és hanggenerálás elérhetősége jelentősen javíthatja az automatizált ügyfélszolgálat és az interaktív hangválasz (IVR) rendszerek minőségét. A transzkripciós modell „streaming” jellege különösen fontos az AI-emberi beszélgetésekben gyakran előforduló „holt levegő” csökkentésében.
E modellek biztosításával a Microsoft úgy pozicionálja magát, hogy a hang-első AI-alkalmazásokra összpontosító fejlesztői ökoszisztéma nagyobb részét megragadja, potenciálisan versenyezve a beszéd-szöveg és szöveg-beszéd API-k más szolgáltatóival.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
A fejlesztőknek figyelemmel kell kísérniük ezeknek a modelleknek a tényleges késleltetési és pontossági referenciaértékeit éles környezetben, mivel a vállalat „diagram-csúcs” teljesítményre vonatkozó állításait saját maguk jelentik. Továbbra is látni kell, hogy ezek a modellek hogyan integrálódnak a meglévő Microsoft Azure AI-szolgáltatásokkal, és hogy elérhetők lesznek-e API-n keresztül, vagy letölthető súlyozásként a privát telepítéshez. Az új modellek árait és konkrét hozzáférési feltételeit nem hozták nyilvánosságra.
Az elsődleges ismeretlen az árstruktúra és a hozzáférési modell. A Microsoft nem határozta meg, hogy ezek a modellek elérhetők-e az Azure AI platformon keresztül, vagy önálló szolgáltatásként lesznek elérhetők.
A „legfelsőbb szintű” teljesítményre vonatkozó állítások független ellenőrzése szükséges. A fejlesztőknek keresniük kell harmadik féltől származó referenciaértékeket vagy közösségi teszteket, hogy megbizonyosodjanak arról, hogy ezek a modellek hogyan teljesítenek a bevált nyílt forráskódú és szabadalmaztatott alternatívákkal szemben különböző akusztikai körülmények között.
A jövőbeli frissítések tisztázhatják a modellek futtatásához szükséges hardverkövetelményeket, különösen azon szervezetek számára, amelyek helyszíni vagy privát felhőkörnyezetben kívánják telepíteni őket.