Talesamtaler med ChatGPT har hittil føltes omtrent som å bruke en walkie-talkie: Snakk, vent, svar. Med de nye stemmemodellene ChatGPT Voice skal samtalen bli smidigere og responsiv. Ambisjonen er at en samtale med AI skal føles akkurat som en samtale med et annet menneske.
Hvordan fungerer det?
Tidligere måtte ChatGPT-modellene vente til brukeren sluttet å snakke før de kunne svare, noe som førte til en stiv replikkveksling. En kort pause eller bakgrunnsstøy kunne dessuten feilaktig tolkes som slutten på en setning, noe som medførte at modellen avbrøt på feil tidspunkter.
GPT-Live/ChatGPT Voice kan lytte og snakke samtidig, og under samtaler kan modellen vise at den lytter, ved raskt å skyte inn for eksempel et «ja» eller «mm» eller bare være stille når du trenger en stund til å tenke før du fortsetter setningen.
Denne kontinuerlige interaksjonen muliggjøres med en full dupleks-arkitektur. I stedet for å behandle en sekvens av separate meldinger, behandler GPT-Live kontinuerlig inndata samtidig som den genererer utdata, noe som betyr at den kan ta interaksjonsbeslutninger mange ganger per sekund: Skal den snakke, fortsette å lytte, pause, avbryte eller kalle på et verktøy.
Smartere enn tidligere
OpenAI oppgir at GPT-Live også er selskapets smarteste stemmemodell hittil. For spørsmål som krever nettsøk, dypere resonnement eller mer komplekse oppgaver, delegerer den til GPT-5.5 i bakgrunnen og bringer resultatet tilbake inn i samtalen når det er klart. Når OpenAI slipper nye modeller, vil modellen som GPT-Live bruker, oppdateres. Den vil altså bli smartere med tiden.
Man kan også velge resonnementsnivået som passer ens behov: Instant for raske svar, eller Medium og High når man vil at ChatGPT skal bruke mer tid på å tenke.
GPT-Live inneholder dessuten flere sikkerhetstiltak, som for eksempel beskyttelse for yngre brukere og systemer som kan gripe inn i sanntid hvis en samtale beveger seg i en uheldig retning. Modellen kan styre mot sikrere svar, vise sikkerhetsmeldinger eller varsle en forelder via Foreldreinnstillinger i situasjoner med høyere risiko.
Tilgjengelighet og begrensninger
OpenAI har begynt å rulle ut to versjoner av GPT-Live – GPT-Live-1 og GPT-Live-1 mini – på iOS, Android og ChatGPT.com til sine over 150 millioner ChatGPT-brukere globalt. GPT-Live-1 blir standardmodellen som driver ChatGPT Voice for Go-, Plus- og Pro-brukere, og GPT-Live-1 mini blir standard for gratis-brukere.
OpenAI meddeler at de har optimalisert GPT-Live for noen av de mest populære språkene i ChatGPT, men hvilke språk det gjelder fremgår ikke. Hvor bra det vil fungere for norsk er altså i skrivende stund ikke helt klart, og selskapet oppgir at for enkelte språk kan modellen ha en ikke-innfødt aksent eller mangler i flyten.
En begrensning er at ved lanseringen har GPT-Live ikke støtte for tale med video eller skjermdeling i ChatGPT, men OpenAI arbeider med å innføre disse funksjonene innen kort tid. Man kan fortsatt få tilgang til eldre versjoner av ChatGPT Voice, inkludert Standard og Avansert talemodus, der disse funksjonene er tilgjengelige.
