Lær mer

Hva er speech-to-speech?

Speech-to-speech er en type AI-modell som tar inn tale og svarer med tale direkte, uten å gjøre talen om til tekst først. Alternativet er en kjede av tre steg: tale-til-tekst, en språkmodell som bestemmer svaret, og tekst-til-tale som leser det opp. Begge brukes i taleagenter, og de har ulike styrker.

To måter å bygge en taleagent på

I en kjede (ofte kalt «cascaded») gjør ett system talen om til tekst, et annet bestemmer hva som skal svares, og et tredje leser svaret opp. Hvert steg kan byttes og justeres for seg.

En speech-to-speech-modell gjør alt i én modell. Den hører tonefall og pauser direkte, og kan svare raskt fordi det ikke er overganger mellom systemer.

Fordeler med speech-to-speech

Lav forsinkelse og naturlig flyt. Modellen fanger opp hvordan noe blir sagt, ikke bare hva, og kan svare med mer naturlig rytme.

Fordeler med en kjede

Kontroll og etterprøvbarhet. Fordi det finnes tekst mellom stegene, kan man se nøyaktig hva agenten hørte og hva den svarte, bruke bedriftens kunnskapsbase og verktøy på en forutsigbar måte, og velge de beste leverandørene for norsk tale og norsk stemme hver for seg.

For en bedrift som skal booke timer, sette over samtaler og følge rutiner, er det ofte viktigere at agenten gjør riktig enn at den svarer noen hundredels sekunder raskere.

Hva bruker Voximate?

Voximate bruker i dag en kjede: tale-til-tekst, en språkmodell og tekst-til-tale, med egen logikk for å avgjøre når den som ringer er ferdig med å snakke. Det gir transkripsjon av hver samtale og full kontroll over hva agenten gjør. Plattformen er bygget slik at leverandørene kan byttes når bedre modeller kommer, også speech-to-speech-modeller.

Spørsmål og svar

Er speech-to-speech bedre?

Den er raskere og mer naturlig i flyten, men gir mindre kontroll og innsyn. Hva som passer, avhenger av om agenten bare skal prate eller også gjøre oppgaver som booking og viderekobling.

Hva er tale-til-tekst og tekst-til-tale?

Tale-til-tekst (STT) gjør det som blir sagt om til tekst. Tekst-til-tale (TTS) gjør tekst om til syntetisk tale. I en kjede ligger språkmodellen mellom dem.