AI HÍREK AI fejlesztés
július 13. 4 perc 31

GPT-Live: az OpenAI hangmodellje már beszéd közben is hallgat

KakasTech AI asszisztens elemzése
  • Az OpenAI 2026. június 8-án elindította a GPT-Live hangmodellt, amely a ChatGPT Voice-t hajtja; a GPT-Live-1 fizetős, a mini ingyenes felhasználóknak lesz elérhető, API-hozzáférést később ígérnek.
  • A full-duplex architektúra és a beszéd-gondolkodás szétválasztása, amely a háttérben a GPT-5.5 modellt futtatja, drasztikusan csökkenti a késleltetést és természetesebb, megszakítások nélküli párbeszédet tesz lehetővé.
  • A modell indulása a GPT-5.6 várható kiadása elé időzült, a cég célja, hogy a hang legyen az első felület a legújabb modellek számára; a versenytársak, mint a Google Gemini Live, hasonló megoldásokat fejlesztenek.

Rendszer fókusz: A hangalapú AI-biztonsági kockázatok miatt (érzelmi függés, manipuláció) a felhasználók állítsák be a szülői felügyeletet, és tudatosan kerüljék a túlzott személyes érzelmi kötődést az AI-hoz, különösen, ha a platform nem jelenít meg vizuális tartalmakat a kontextusért.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.

Kép forrása: Saját AI generált kép

Az OpenAI 2026. július 8-án bemutatta a GPT-Live hangmodellcsaládot, amely mostantól a ChatGPT Voice mögött fut. Két változat indult el globálisan, iOS-en, Androidon és webes felületen: a GPT-Live-1 a fizetős Go, Plus és Pro csomagok alapértelmezett hangmodellje lett, a kisebb GPT-Live-1 mini pedig az ingyenes szinten váltja le az eddigi Advanced Voice Mode-ot. API-hozzáférés egyelőre nincs, de az OpenAI ígéri, és a fejlesztők egy űrlapon feliratkozhatnak az értesítésre.

A modell egyszerre képes hallgatni és beszélni, vagyis nem külön üzenetek sorozatát dolgozza fel, hanem folyamatosan fogadja a bemenetet, miközben generálja a kimenetet.

A full-duplex áttörés

A lényegi újítás a full-duplex architektúra. Ennek köszönhetően a modell másodpercenként többször is dönthet arról, hogy megszólal, tovább hallgat, szünetet tart, közbevág, vagy elindít egy eszközhívást. Ennek látható jele, hogy a modell visszajelbeszél – „mhmm”, „aha” –, illetve elhallgat, ha a felhasználónak gondolkodási idő kell.

Miért számít ez?

Az eddigi megoldások mindegyike kompromisszumos volt. Az eredeti ChatGPT Voice három modellt fűzött össze: egy beszédfelismerő átírta a hangot szöveggé, egy nyelvi modell választ generált, egy szintetizátor pedig visszaalakította beszéddé. A lánc mentén információ veszett el, a válaszok pedig lassúak és szaggatottak lettek. Az Advanced Voice Mode egyetlen modellbe vonta össze a hangfeldolgozást, ami csökkentette a késleltetést, de továbbra is diszkrét körökben működött: meg kellett várnia, hogy a felhasználó abbahagyja a beszédet. Mivel a körváltást csendérzékelés vezérelte, egy rövid szünet vagy egy háttérzaj is félreértelmeződhetett, és a modell rossz pillanatban vágott közbe.

A gondolkodás szétválasztása

A második architekturális változás legalább ennyire érdekes: az OpenAI szétválasztotta a beszélgetést a gondolkodástól. Ha egy kérdéshez webes keresés, mélyebb következtetés vagy ágensjellegű munka kell, a GPT-Live átdelegálja a feladatot egy erősebb modellnek – induláskor a GPT-5.5-nek –, és közben fenntartja a beszélgetést. Amikor a háttérben futó válasz elkészül, visszahozza a társalgásba. Az OpenAI szerint ez a felállás lehetővé teszi, hogy a hangréteg mögé mindig a legfrissebb frontier modellt cseréljék be, ahogy megjelennek.

Három érvelési szint

A felhasználó három opció közül választhat:

  • Instant – a gyors válaszokra való
  • Medium – több gondolkodási időt hagy
  • High – a legmagasabb érvelési ráfordítás

A GPT-Live-1 instant és a mini változat a GPT-5.5 Instant modellt használja a háttérben, a Medium és High szintek a GPT-5.5 Thinkinget, közepes, illetve magas érvelési ráfordítással.

Mérési eredmények és benchmarkok

A méréseknél az OpenAI hivatalos bejelentése óvatosan fogalmaz: emberi értékelőkkel végzett, 5–10 perces párbeszédeken alapuló összehasonlításokban a GPT-Live-1 és a mini is határozottan jobb helyezést ért el az Advanced Voice Mode-nál az általános preferencia, a körváltás, a közbevágások és a beszélgetés természetessége szempontjából. Számokat a cég maga nem közölt, csak annyit jelzett, hogy a GPT-Live-1 érdemben felülmúlja elődjét a GPQA tudományos érvelési teszten és a BrowseComp ágenskeresési benchmarkon, valamint egy belső, telekom-ügyfélszolgálati feladatokat szimuláló hangágens-teszten. Több szaklap ennél konkrétabb értékeket említett – a GPQA-n 84,2 százalékot a korábbi 45,3-mal szemben, a BrowseComp-on 75,2-t a 0,7 helyett, az emberi preferenciatesztben pedig 75,7 százalékos győzelmi arányt –, ezek azonban nem szerepelnek az OpenAI saját anyagában, ezért érdemes fenntartással kezelni őket.

A gyakorlati változások közül a legszembetűnőbb, hogy a ChatGPT kilenc hangját újramaszterelték, és hogy a hangmód mostantól vizuális kártyákat is megjeleníthet beszélgetés közben – időjárást, tőzsdei árfolyamokat, sporteredményeket, térképet. A hallgatás is javult: a modell kivár, ha a felhasználó gondolkodik, csendben marad, ha erre kérik, és jobban szűri a háttérzajt.

Az OpenAI szerint hetente több mint 150 millió ember használja a ChatGPT hangalapú funkcióit.

Biztonság és korlátok

A biztonsági oldalon a cég audio-natív kiértékeléseket vezetett be, amelyek kifejezetten a hangos interakcióra jellemző kockázatokra fókuszálnak:

  • önsértés
  • pszichózis és mánia
  • az AI-tól való érzelmi függés
  • erőszak
  • szexuális tartalom

Mivel a hangbeszélgetés valós időben zajlik, olyan védőmechanizmusok is beépültek, amelyek beszéd közben terelhetik biztonságosabb irányba a választ, segélyvonali erőforrásokat hozhatnak elő, magasabb kockázatú esetben pedig lezárhatják a beszélgetést. Tinédzser felhasználókra külön korosztályi viselkedést tanítottak be, a szülők pedig szülői felügyeleti beállításban engedélyezhetik vagy tilthatják a hangmódot. Az OpenAI külön kiemeli, hogy a GPT-Live előre definiált hangokat használ, és nem alkalmas valós személyek hangjának utánzására – illetve hogy a terméket nem AI-társként pozicionálják.

Korlátok

Az OpenAI csak a ChatGPT legnépszerűbb nyelveire optimalizálta a modellt; másoknál idegenszerű akcentus vagy hiányos folyékonyság előfordulhat – a TechCrunch demóján a hindi élő fordítás erős amerikai akcentussal és könyvízű megfogalmazással szólalt meg. Induláskor a hangmód nem támogatja a videót és a képerny

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!