Google förbättrar transkription med nya funktioner
Google har uppdaterat Gemini Audio med nya modeller som ger förbättrade transkriberingsmöjligheter, inklusive automatisk detektering av specialiserad terminologi och stöd för över 85 språk. De nya modellerna är utformade för att öka precisionen i Googles röststyrda funktioner.
Google har lanserat en uppdatering av Gemini Audio som inkluderar nya Gemini 3.5-modeller med förbättrade transkriberingsfunktioner. Uppgraderingen syftar till att ge mer exakta och pålitliga resultat, särskilt i situationer där bakgrundsbrus eller otydlig tal kan vara problematiskt.
De nya funktionerna inkluderar automatisk detektering av specialiserad terminologi, vilket innebär att systemet nu bättre förstår och transkriberar branschspecifika termer. Dessutom har stödet för språk utökats till att omfatta över 85 olika språk. Detta breddar användningsområdena och gör tekniken mer tillgänglig för en global publik.
De specifika modellerna som ingår i uppdateringen är Gemini 3.5 Live, 3.5 Live Experimental och 3.5 Transcribe. Dessa modeller är utformade för att optimera precisionen i Googles röststyrda funktioner. Tidigare har sådana system ibland haft svårigheter med bakgrundsbrus eller när talet inte är tydligt artikulerat, men de nya modellerna syftar till att åtgärda dessa problem.
Uppdateringen representerar ett steg framåt i Googles strävan efter att förbättra användarupplevelsen för röststyrda tjänster och applikationer. Den ökade precisionen och det bredare språkliga stödet kan potentiellt öppna upp nya möjligheter för interaktion med teknik och information.
Fakta
- Google har uppdaterat Gemini Audio med nya Gemini 3.5-modeller.
- De nya modellerna kan automatiskt detektera specialiserad terminologi.
- Stöd finns för över 85 olika språk.
- Modellerna är utformade för att förbättra precisionen i röststyrda funktioner.
- De inkluderar Gemini 3.5 Live, 3.5 Live Experimental och 3.5 Transcribe.
Originalartikel: https://www.theverge.com/tech/985186/google-gemini-3-5-transcribe-audio-ai

