Hlasoví asistenti dlouho působili jako automaty, kterým člověk musel pomalu nadiktovat příkaz, počkat na zpracování a následně si vyslechnout poněkud mrtvou odpověď. Nový hlasový model GPT-Live od OpenAI tento pocit výrazně mění.

Po několika minutách používání už nemáš dojem, že ovládáš software. Spíš to připomíná rozhovor s někým, s kým sedíš v hospodě a probíráš různá témata. Reaguje okamžitě, nechá si skočit do řeči, přichází s vlastními nápady, hledá informace na internetu a plynule pokračuje tam, kde jste skončili.

Technicky je to pořád jen software. Pocitově už je ale hranice mnohem méně zřetelná.

A právě proto je GPT-Live současně úžasné i trochu děsivé.

Mluví a poslouchá zároveň

Největší změnou je takzvaná full-duplex architektura. GPT-Live nemusí střídat oddělené fáze poslouchání a odpovídání. Zvuk zpracovává průběžně, a to i ve chvíli, kdy samo mluví.

Díky tomu mu můžeš skočit do řeči, opravit ho nebo okamžitě změnit téma. Model se odmlčí, nechá tě domluvit a následně pokračuje podle nového zadání. Během rozhovoru se mnohokrát za sekundu rozhoduje, jestli má mluvit, poslouchat, počkat nebo použít některý z nástrojů.

To zní jako technický detail, ale ve skutečnosti jde o hlavní důvod, proč rozhovor působí mnohem přirozeněji.

Starší hlasové systémy často vyhodnotily krátkou pauzu jako konec otázky. Začaly odpovídat, i když člověk pouze hledal správné slovo. Přerušení je zmátlo a konverzace připomínala komunikaci s automatem na zákaznické lince, který tvrdošíjně dokončí celou nabídku možností, i když už dávno víš, že potřebuješ něco jiného.

GPT-Live umí počkat. Občas krátce přitaká, dá najevo, že poslouchá, nebo zůstane potichu. OpenAI pro nový model rovněž přepracovalo devět hlasů dostupných v ChatGPT.

Výsledek nepůsobí dokonale lidsky v každé větě. Rozdíl proti předchozím generacím je ale obrovský.

Nejde pouze o hezčí předčítání textu

Původní hlasový ChatGPT používal několik samostatných kroků. Jeden model převedl řeč na text, jazykový model vytvořil odpověď a další systém ji přečetl nahlas.

Takové řešení funguje, ale při převodu se ztrácejí důležité informace. Textový přepis nemusí správně zachytit tempo, váhání, důraz, ironii nebo změnu nálady. Každý další krok navíc přidává zpoždění.

GPT-Live pracuje se zvukem průběžně a samotný rozhovor odděluje od složitějšího přemýšlení. Když potřebuje vyhledat informace, provést analýzu nebo vyřešit náročnější úkol, může práci předat výkonnějšímu modelu běžícímu na pozadí. Při uvedení tuto část obstarává GPT-5.5.

Hlasový model se mezitím může dál bavit s uživatelem a udržovat přirozený tok rozhovoru. Nemusí tedy pokaždé na několik sekund ztichnout a předstírat hluboké digitální zamyšlení.

Uživatel si zároveň může zvolit režim Instant pro rychlou reakci nebo Medium a High pro složitější úkoly. Vyšší režimy používají GPT-5.5 Thinking s odpovídající úrovní uvažování.

Rychlost je možná důležitější než samotný hlas

Při našem testování nebylo nejpůsobivější pouze to, jak hlas zní. Mnohem důležitější je rychlost celé interakce.

Něco tě napadne, vyslovíš to a prakticky okamžitě přichází reakce. Model může nápad rozvinout, zpochybnit, doplnit nebo rovnou vyhledat potřebné informace na internetu. Nemusíš formulovat dokonalý dotaz ani psát dlouhý prompt.

Právě tím se GPT-Live začíná podobat skutečnému rozhovoru. Ne proto, že by mělo vědomí nebo vlastní názor, ale protože mezi myšlenkou a odpovědí téměř zmizelo čekání.

Při brainstormingu to funguje výborně. Člověk může přemýšlet nahlas, skákat mezi tématy a postupně nápad zpřesňovat. Model se přizpůsobí a přidává další možnosti. Je to podobné, jako když něco probíráš s kolegou, pouze tento kolega má přístup k internetu, nekouká každé tři minuty do telefonu a nepotřebuje si odskočit pro další kávu.

Hlasové rozhraní tím přestává být pouze pohodlnější náhradou klávesnice. Začíná měnit samotný způsob, jakým se s AI pracuje.

Čeština, angličtina nebo francouzština během jedné věty

Velmi působivé je přepínání mezi jazyky. V našem testu nebyl problém přejít z češtiny do angličtiny, španělštiny nebo francouzštiny a následně se zase vrátit.

Model změnu pochopil okamžitě a nebylo potřeba ukončovat rozhovor ani nastavovat nový jazyk. GPT-Live umí také živý překlad, takže může průběžně převádět konverzaci mezi dvěma jazyky. OpenAI ale upozorňuje, že některé podporované jazyky mohou mít zatím méně přirozený přízvuk nebo mezery v plynulosti.

Právě výuka jazyků je jedním z nejsilnějších způsobů využití.

Můžeš si procvičovat běžný rozhovor, nechat si vysvětlit chybu, zopakovat problematickou větu nebo požádat model, aby mluvil pomaleji. Na rozdíl od klasické jazykové aplikace se nemusíš držet předem připraveného scénáře.

Můžeš se bavit o práci, sportu, cestování nebo čemkoliv jiném. A když nevíš, jak něco říct, model ti to vysvětlí a rovnou pokračuje v konverzaci.

Pro člověka, který se stydí mluvit cizím jazykem před lektorem, jde o velmi praktickou věc. AI se nebude tvářit otráveně ani po pátém zopakování stejné věty. Což je vlastnost, kterou bohužel nelze garantovat u všech lidí s pedagogickým diplomem.

Umí měnit tón i způsob vystupování

GPT-Live dokáže během rozhovoru měnit styl projevu. Chvíli může vysvětlovat jako učitel, potom mluvit neformálně, být energičtější nebo se přesunout až do hravější, lehce odlehčené polohy.

Právě práce s tónem vytváří silný pocit osobnosti.

Textový chatbot může napsat stejnou větu, ale hlas jí dodává úplně jiný význam. Změna tempa, důrazu nebo intonace dokáže vytvořit dojem zájmu, pobavení, nejistoty nebo empatie.

Model žádné z těchto emocí skutečně necítí. Pouze velmi dobře vytváří jejich vnější projevy.

Lidský mozek je však na hlas mimořádně citlivý. Když něco reaguje správným tónem, nechá nás domluvit a pamatuje si předchozí část rozhovoru, automaticky tomu začneme připisovat lidské vlastnosti.

OpenAI si toto riziko uvědomuje a u GPT-Live samostatně sleduje takzvanou emocionální závislost uživatelů na AI. Firma v bezpečnostní dokumentaci uvádí, že právě hlas vyžaduje jiné testování než běžný textový chatbot.

To není argument proti používání hlasové AI. Je ale dobré nezapomínat, že příjemný hlas není přítel, partner ani terapeut. Je to přesvědčivě navržené uživatelské rozhraní.

V autě už hlasová AI dává velký smysl

Hlasový režim byl použitelný při řízení už dříve. GPT-Live jej ale posouvá mnohem dál, protože řidič nemusí hlídat přesný okamžik, kdy může začít mluvit.

Může se doptávat, přerušovat odpovědi, procvičovat jazyk nebo rozebírat nápady bez nutnosti sahat na telefon. Systém má být zároveň odolnější vůči ruchům v okolí a lépe oddělovat hlas uživatele od dopravy nebo dalších lidí.

Samozřejmě stále platí, že ani velmi přirozeně mluvící AI nezruší fyzikální zákony a neudělá z rozptýleného řidiče bezpečného řidiče. Pro jednoduché rozhovory, přemýšlení nebo jazykovou výuku ale jde o jeden z nejlogičtějších způsobů využití.

Call centra už AI nenahrazuje „jednou". Děje se to teď

U otázky, zda hlasová AI nahradí zákaznické linky a call centra, už pomalu přestává dávat smysl používat budoucí čas.

Hlasoví agenti dnes přijímají telefonáty, odpovídají na běžné dotazy, ověřují údaje, rezervují termíny a předávají složitější případy lidem.

OpenTable nabízí restauracím napojení na celou řadu hlasových AI služeb, které přijímají hovory, odpovídají na otázky a zapisují rezervace přímo do systému. Firma u jednoho nasazení uvádí 725 ušetřených hodin, 98procentní spokojenost a 31procentní nárůst dodatečných rezervací. Jde o čísla dodavatele, nikoliv nezávislou studii, ale ukazují, že technologie dávno opustila laboratoř.

HotelPlanner používá hlasové AI zástupce pro zákaznickou podporu, pomoc s rezervacemi i prodej. Jeho vlastní dokumentace výslovně počítá s příchozími i odchozími telefonáty. Zároveň uvádí, že volající má být na začátku hovoru informován, že komunikuje s AI.

Automatizace bude nejrychlejší právě tam, kde se hovory často opakují:

  • rezervace a změny termínů
  • informace o otevírací době
  • kontrola objednávky
  • základní technická podpora
  • kvalifikace obchodních kontaktů
  • připomenutí plateb nebo schůzek
  • jednoduché nabídky a opakované prodejní scénáře

Člověk zůstane déle u složitých, konfliktních nebo citlivých případů. U velké části běžných hovorů ale firmy časem jen těžko obhájí zaměstnance, který zvládne jeden rozhovor současně, potřebuje přestávky a nemluví dvaceti jazyky.

AI už také telefonuje místo člověka

Ani scénář, kdy AI sama zavolá do restaurace nebo kadeřnictví, není vzdálená budoucnost.

Google už v roce 2018 představil systém Duplex, který dokázal telefonicky rezervovat stůl v restauraci nebo termín v salonu. V roce 2020 Google uvedl, že Duplex dokončil přes milion rezervací a 99 procent jeho hovorů proběhlo plně automaticky.

Dnešní hlasové modely jsou výrazně schopnější a přirozenější. Technický problém tedy není samotné uskutečnění hovoru. Složitější je napojení na telefonní síť, firemní systémy, platby, pravidla pro souhlas a odpovědnost za případnou chybu.

Hlasová AI už umí telefonovat. Otázkou je hlavně to, kdy jí firmy a uživatelé dovolí provádět více úkolů samostatně.

Obchodní hovory jsou další logický krok

Výzkum i komerční nasazení se posouvají od jednoduchých informačních linek k prodejním rozhovorům.

Výzkumný systém AI-Salesman z roku 2025 se zaměřil přímo na telemarketingové dialogy. Autoři řešili plánování argumentace, práci s námitkami i faktickou spolehlivost během delšího přesvědčovacího rozhovoru. Výsledky ukázaly výrazné zlepšení proti běžným jazykovým modelům, ale současně potvrdily, že obchodní hovor je náročnější než prosté přečtení připraveného scénáře.

V praxi už AI rezervuje hotely a pomáhá uzavírat objednávky. HotelPlanner uvádí použití AI hlasových zástupců pro prodejní a rezervační podporu.

Zatím ale není dost podkladů pro obecné tvrzení, že hlasová AI běžně prodává lépe než zkušený obchodník. U jednoduchých produktů, opakovaných scénářů a předem kvalifikovaných zákazníků to může fungovat velmi dobře. U složitějšího B2B prodeje bude člověk ještě nějakou dobu důležitý.

Směr je však zřejmý. AI obchodník může okamžitě pracovat s informacemi o zákazníkovi, měnit jazyk, nezapomíná argumenty a dokáže vést tisíce hovorů současně. Ekonomika je v tomto případě poměrně neúprosná.

Pozná člověk, že mluví s AI?

Člověk, který hlasové modely sleduje a pravidelně používá, si pravděpodobně všimne drobných nepřirozeností. Může jít o zvláštní intonaci, příliš uhlazené formulace nebo reakci, kterou by běžný operátor nepoužil.

U staršího člověka nebo někoho, kdo se o AI nezajímá, už rozpoznání vůbec nemusí být samozřejmé.

Proto dává smysl, aby systém na začátku hovoru jasně oznámil, že jde o AI. Ne kvůli technickému purismu, ale proto, aby člověk věděl, s čím komunikuje a jaká očekávání má mít.

HotelPlanner podobné oznámení u svých hlasových AI již používá. Americká FCC navíc klasifikuje hovory s AI generovaným hlasem jako hovory s umělým nebo předem nahraným hlasem, na které se vztahují pravidla proti nevyžádaným automatickým telefonátům.

Časem možná bude AI hlas běžný natolik, že upozornění nikoho nepřekvapí. V současné přechodné fázi by ale zatajení původu hlasu působilo spíš jako úmyslná manipulace.

Dabéři ještě nekončí, ale změna je nevyhnutelná

Profesionální dabing zatím není pouze o přečtení přeloženého textu. Dabér musí hrát, pracovat s emocemi, rytmem scény a významem. Současné AI systémy stále mohou dělat chyby v překladu, výslovnosti nebo načasování.

Vývoj ale směřuje k tomu, že herec poskytne licenci ke svému hlasu a film bude v různých jazycích namluven jeho vlastním syntetickým hlasem.

ElevenLabs už dnes nabízí dabing do více než 90 jazyků a uvádí, že zachovává identitu původního hlasu, tón, emoce i načasování.

To znamená, že například americký herec může ve francouzské, španělské nebo české verzi znít stále jako on sám. Divák neuslyší jiného dabéra, ale syntetickou jazykovou variantu původního výkonu.

Dabéři pravděpodobně nezmizí ze dne na den. Část jejich práce se ale může přesunout od samotného namlouvání ke kontrole překladu, režii, opravám výslovnosti a práci s licencovanými hlasovými modely.

U hlavních rolí a prestižních filmů se lidský dabing může držet dlouho. U levnější produkce, dokumentů, videí, školení nebo staršího katalogového obsahu bude tlak na automatizaci mnohem rychlejší.

Skutečně velký význam může přijít až s robotikou

GPT-Live není robot ani samostatný obecný asistent. Je to především velmi pokročilé hlasové rozhraní.

Právě takové rozhraní ale robotům dlouho chybělo.

Humanoidní robot může mít kamery, mikrofony, motory a schopnost manipulovat s předměty. Pokud s ním ale člověk musí komunikovat pomocí přesných příkazů nebo obrazovky, stále působí jako složitý stroj.

Přirozený hlas tuto bariéru odstraňuje.

Člověk může robotovi říct, co potřebuje, během práce ho opravit, změnit zadání nebo se doptat, proč něco udělal. Robot může průběžně potvrzovat, že rozumí, upozornit na problém a požádat o doplnění informací.

GPT-Live samo tuto robotickou budoucnost nepřináší. Ukazuje ale, že jedna z důležitých částí už začíná být připravena.

Až se podobně přirozený hlas propojí s kamerami, pamětí, plánováním a schopností fyzicky pracovat, robot přestane působit jako stroj ovládaný přes složité menu. Bude možné s ním komunikovat podobně jako s člověkem.

Právě tady může mít současný vývoj hlasových modelů mnohem větší dopad než jen pohodlnější povídání s telefonem.

Temná strana není přímo GPT-Live

Je důležité oddělit GPT-Live od nástrojů pro klonování cizích hlasů.

OpenAI používá v ChatGPT předem připravené hlasy a model není určený k tomu, aby si uživatel z několika sekund nahrávky vytvořil hlas příbuzného, šéfa nebo známého herce.

Jenže celý obor hlasové AI se zlepšuje současně.

Nástroje jako ElevenLabs už nabízejí velmi přesvědčivou syntézu řeči, profesionální klonování hlasů, automatický dabing i konverzační hlasové agenty. Podobné technologie vyvíjejí také společnosti Resemble AI, PlayHT, Cartesia, Hume AI nebo Retell AI.

Legitimní využití je obrovské. Hlas lze použít pro filmy, audioknihy, překlady, hry, zákaznické linky nebo jako náhradu pro člověka, který kvůli nemoci přišel o možnost mluvit.

Stejnou technologii ale mohou používat podvodníci.

Známý hlas už není důkazem identity

Představ si, že ti zavolá příbuzný. Zní vystresovaně a tvrdí, že měl nehodu nebo nutně potřebuje peníze. Hlas sedí, zná tvoje jméno a ví několik informací o rodině.

Dříve by přesvědčivá imitace vyžadovala schopného člověka. Dnes mohou informace pocházet ze sociálních sítí a hlas z veřejného videa, podcastu nebo hlasové zprávy.

Podvodník už nemusí vytvořit dokonalou kopii. Stačí, když je hlas dostatečně podobný a oběť dostane pod časový a emocionální tlak. Kvalitu navíc může zamaskovat špatné telefonní spojení, hluk nebo údajná krizová situace.

Útočníci se mohou vydávat také za vedoucího firmy, obchodního partnera, policistu nebo pracovníka banky. Zaměstnanec pak může dostat hlasový pokyn k rychlému převodu peněz, odeslání dokumentů nebo sdělení přístupových údajů.

Největší riziko přitom nemusí představovat technicky zkušený uživatel. Ten bude pravděpodobně podezřívavější. Snadným cílem mohou být starší lidé nebo kdokoliv, koho podvodník zaskočí připraveným příběhem.

Pravidlo pro telefonní hovory se proto mění: hlas už není spolehlivým důkazem, že na druhé straně skutečně mluví člověk, kterého znáš.

U neobvyklé žádosti o peníze, heslo nebo citlivé informace je bezpečnější zavěsit a zavolat člověku zpět na známé číslo. Uvnitř rodiny může dávat smysl také předem domluvené ověřovací slovo, které není dohledatelné na sociálních sítích.

Zní to paranoidně. Ve skutečnosti se pouze přizpůsobujeme technologii, která už existuje.

Hlasová AI si svoje místo hledat nemusí

O nové technologii se často píše, že si teprve hledá využití. U hlasové AI už to ale není přesné.

Využití je vidět dnes:

  • výuka jazyků
  • brainstorming
  • vyhledávání informací
  • používání v autě
  • zákaznická podpora
  • objednávky a rezervace
  • obchodní hovory
  • překlady a dabing
  • budoucí ovládání robotů

GPT-Live ukazuje, jak rychle se hlasová komunikace s AI přibližuje rozhovoru mezi lidmi. Nejde pouze o kvalitnější zvuk. Důležitá je rychlost, schopnost naslouchat, měnit tón, pracovat s kontextem a průběžně používat internet i další nástroje.

Při používání je snadné pochopit, proč se tento způsob komunikace může stát návykovým. Mluvení je přirozenější než psaní a model je neustále připraven reagovat, rozvíjet nápady nebo hledat odpovědi.

Zároveň přichází doba, kdy lidsky znějící hlas přestává být zárukou lidského původu.

GPT-Live samo o sobě není nástrojem pro klonování cizích hlasů. Je ale velmi názornou ukázkou toho, jak rychle se syntetická řeč zlepšuje.

Až se podobný hlas propojí s autonomními agenty, firemními systémy a robotikou, nebude hlavní otázkou, zda poznáme, že mluvíme s počítačem.

Mnohem zajímavější bude, zda nám na tom ještě bude záležet.