ЭйАй

Google выпусціў Gemini 3.8 Live і 3.5 Transcribe для галасавых агентаў

Deni Vasilkou · 16.09

Google выпусціў Gemini 3.8 Live і Gemini 3.5 Transcribe — новыя мадэлі для галасавых прадуктаў у Gemini API і Google AI Studio.

Gemini 3.8 Live умее падтрымліваць жывую размову і паралельна выконваць задачы: выклікаць інструменты і API ў фоне, працаваць з візуальным кантэкстам, дакладна распазнаваць коды і тэхнічныя даныя, а таксама падтрымліваць больш за 97 моў.

Асобна Google паказала Gemini 3.8 Live Extended Thinking. Гэта версія для складаных шматкрокавых запытаў: мадэль можа разважаць у фоне, не перарываючы размову з чалавекам. Практычны сцэнар — галасавы агент для службы падтрымкі, навучання або складанай працоўнай задачы, дзе мала проста прыгожа адказваць: трэба праверыць кантэкст, выканаць некалькі дзеянняў і растлумачыць вынік.

Gemini 3.5 Transcribe — асобная мадэль для расшыфроўкі маўлення. Google заяўляе падтрымку больш як 85 моў, распазнаванне змены мовы пасярод фразы, слоўнік кампаніі да тысячы тэрмінаў і рэжым чыстага транскрыпту без «э-э», паўтораў і слоў-паразітаў.

Для рэдакцый і медыя тут найбольш цікавая не толькі хуткая расшыфроўка. Можна рабіць субтытры амаль у рэальным часе, разбіраць доўгія інтэрв’ю з таймкодамі і пазнакамі спікераў, а таксама будаваць галасавыя інструменты, якія не проста слухаюць, але і дзейнічаюць.