De onaturliga pauserna i ChatGPT Voice är historia efter OpenAI:s senaste uppdatering.
Den 8 juli lanserade OpenAI en ny familj röstmodeller under namnet GPT-Live, som från och med nu driver ChatGPT Voice. Enligt TechCrunch kan modellerna lyssna och tala samtidigt, vilket gör att användaren kan avbryta AI:n mitt i en mening och att den svarar med små bekräftelser medan man själv pratar, ungefär som en människa gör i ett vanligt samtal.
Uppdateringen ersätter Advanced Voice Mode och rullas ut globalt via iOS, Android och webben. Standardmodellen för prenumeranter på Go, Plus och Pro heter GPT-Live-1, medan gratistjänsten får den lättare varianten GPT-Live-1 mini.
Från halvduplex till full duplex
Skillnaden ligger i det telekombranschen kallar halv- respektive helduplex. Den tidigare rösttekniken var halvduplex, ungefär som en walkie-talkie: användaren pratade, systemet väntade på tystnad, och först då började svaret genereras. Det gjorde pauserna långa och samtalen kantiga.
Med full duplex hanterar modellen ljud in och ljud ut samtidigt. Enligt en teknisk genomgång från Build Fast with AI processar GPT-Live inkommande tal samtidigt som den genererar sitt svar, och kan flera gånger per sekund välja mellan att tala, fortsätta lyssna, pausa, avbryta sig själv eller anropa ett verktyg.
Delar av arbetet flyttas till GPT-5.5
För frågor som kräver webbsökning eller djupare resonemang lämnar GPT-Live ifrån sig uppgiften till OpenAI:s större modell GPT-5.5, som arbetar i bakgrunden. Röstsamtalet fortsätter under tiden utan hörbar väntetid.
Modellen kan dessutom visa små informationskort mitt under samtalet. Aktiveringen sker automatiskt i appen, men enligt Quasa kan tidpunkten variera per region och konto. Något separat val behöver användaren inte göra.
”Röst blir ett primärt gränssnitt”
Atty Eleti, produktansvarig för ChatGPT Voice, säger till TechCrunch att bolaget ser röstläget som mer än en bekvämlighet.
”Med tiden tror vi att detta också kommer att göra det möjligt att använda röst som ett slags primärt gränssnitt mot datorer, och att hantera allt mer komplext och långvarigt agentiskt arbete”, säger han.
Eleti berättar själv att han haft samtal på 30 till 40 minuter med funktionen under promenader. OpenAI uppger att mer än 150 miljoner personer redan pratar med ChatGPT via funktioner som röst och diktering.
Inte helt problemfritt
Lanseringen är inte fri från brister. Under OpenAI:s egen demonstration talade modellen hindi med tydlig amerikansk brytning och ett något bokligt uttryck, skriver TechCrunch. Build Fast with AI noterar också att API-åtkomst för utvecklare ännu inte är öppen vid lansering – utvecklare som behöver röstagenter via API hänvisas tills vidare till OpenAI:s Realtime API.
För svenska användare aktiveras GPT-Live automatiskt i ChatGPT-appen. Nästa gång röstläget öppnas är det den nya modellen som svarar, och skillnaden märks direkt: färre pauser, snabbare avbrott och en samtalsrytm som ligger betydligt närmare ett vanligt telefonsamtal.