Zeptáte se kolegy, co je to AI avatar, a dostanete čtyři různé odpovědi – a všechny budou správně. Pod stejným názvem se totiž skrývají technologie, které mají společného málo, kromě toho, že na konci je obličej, co mluví. Jedna potřebuje jedinou fotku, druhá pár minut natáčení, třetí je motor pro videohry a čtvrtá se ani nehýbe. Než se do toho pustíte, stojí za to vědět, kterou variantu vlastně hledáte, protože vstup, výstup i cena práce s tím spojené se liší o řád.
Čtyři typy, čtyři vstupy
Mluvící fotka je nejjednodušší varianta: stačí jeden čelní snímek s oběma viditelnýma očima a text nebo audio nahrávka. D-ID tuhle variantu nabízí jako vstupní úroveň „Standard“. Technicky jde o animaci řízenou řečí – lip-sync a mimika se generují ze samotného obsahu promluvy, tělesný jazyk zůstává neutrální. Je to levná a rychlá cesta. Pohyb hlavy je ale omezený a gesta chybí úplně.
Klon vlastní osoby je druhý, náročnější typ. Tady nahráváte sami sebe – Synthesia vyžaduje jeden nepřerušovaný záběr dlouhý jednu až pět minut, sestříhané ani jinak upravené video nepřijme, a zpracování zabere přibližně pracovní den. HeyGen donedávna potřeboval podobně dlouhý záznam v rozlišení 1080p, nejnovější verze Avatar 5 ale zvládne fotorealistický avatar natrénovat i z patnáctisekundového klipu, který pak vypadá, pohybuje se a mluví hlasem uživatele v desítkách jazyků. Hlas se klonuje automaticky ze stejné nahrávky, zachovává se i původní pozadí.

D-ID má svoje úrovně odstupňované podle délky vstupu: Express s minutovým videem, Premium se třemi minutami, Studio s pěti. Čím delší záznam, tím déle trvá i zpracování – od necelé půlhodiny po klidně dva týdny.
3D postava neboli digitální člověk je úplně jiná liga. Zatímco 2D avatar odrecituje předem daný scénář, 3D avatar reaguje na vstupy v reálném čase: otáčí se, gestikuluje, zůstává konzistentní napříč úhly kamery a dá se zapojit přímo do herních enginů jako Unity nebo Unreal Engine. Po vytvoření se taková postava „riguje“ a oživuje animačními systémy poháněnými AI nebo motion capture. Typicky se používá ve VR, AR a hrách, ne v obyčejném firemním videu.
Stylizovaný portrét je poslední kategorie a vlastně nejméně „AI“ ze všech. Jde o statický, ilustrovaný obrázek bez synchronizace rtů nebo videa. Teprve nástroje jako HeyGen ho dokážou „oživit“ a proměnit v mluvící postavu.
Čeština, synchronizace rtů a přízvuk
Hlavní nástroje češtinu podporují – přehledy uvádějí avatary komunikující ve více než 100 jazycích včetně češtiny, s možností vytvořit si vlastní avatar s vlastním obličejem a hlasem. Fliki zase podporuje přes 75 jazyků včetně češtiny, i když některé hlasy znějí trochu uměle. To je slabina, na kterou narazíte u mnoha generických hlasů – intonace je plochá tam, kde by čeština čekala důraz nebo otázku.
Pro lokalizaci hotového videa existuje samostatná kategorie nástrojů. Rask.ai automaticky překládá, dabuje a synchronizuje rty ve videích do více než 130 jazyků a umožňuje přizpůsobit přízvuk i hlas konkrétnímu jazyku. Specializovaný lip-sync nástroj LatentSync uvádí, že je dostupný i v češtině. Pokud tedy chcete natočit video jednou a pustit ho do deseti jazykových mutací, řešíte jiný problém než člověk, který chce jen svůj vlastní mluvící avatar pro interní školení.
Co podepisujete: práva k obličeji a hlasu
Vytvořit digitální dvojník sebe sama není otázka pár kliknutí bez závazků. Synthesia vyžaduje explicitní souhlas – odesláním záběrů uživatel potvrzuje, že osoba na záznamu plně chápe, že její podoba bude použita k vytvoření AI avatara, a souhlasí s etickými pravidly firmy. Studio Avatar navíc smí vytvořit jen osoba starší 18 let. Důležitý detail: souhlasné video nelze nahrát předem natočené, musí vzniknout živě, i když samotný avatar se trénuje z existujícího záznamu.
HeyGen postupuje podobně, ale technicky jinak – při nahrávání obsahu musí uživatel poskytnout ústní souhlas spolu s mluveným heslem, kterým se ověřuje identita. Firma zároveň tvrdí, že sto procent dat zůstává soukromých a nepoužívá je k trénování vlastních modelů. Jde o tvrzení výrobce, ne o nezávislý audit, ale ukazuje to, kam se tlak trhu ubírá – uživatelé se ptají, kde skončí jejich tvář a hlas, a dodavatelé na to musí mít odpověď.
Povinné označení: co přináší AI Act
Evropská legislativa do tématu vstupuje konkrétním datem. Povinnosti podle článku 50 AI Actu nabývají účinnosti 2. srpna 2026. Poskytovatelé generativních AI systémů musí zajistit, že vygenerovaný obsah je označen strojově čitelným a detekovatelným způsobem. Firmy a agentury, které takový obsah nasazují, mají povinnost navíc – deepfake musí zveřejnit vůči divákovi jasně a rozlišitelně, nejpozději při prvním vystavení obsahu, a nelze se spoléhat jen na skryté strojové značení.
Výjimka platí pro zjevně umělecká, satirická nebo fiktivní díla – tam stačí označení, které nebrání samotnému vnímání díla. Systémy, které byly na trhu už před srpnem 2026, mají na strojově čitelné značení čas navíc, do 2. prosince 2026. Kdo si myslí, že se ho to netýká, měl by si spočítat riziko: maximální pokuty činí 15 milionů eur nebo tři procenta celosvětového ročního obratu, podle toho, co je vyšší.
Kdy avatar dává smysl a kdy působí lacině
Nejsilnější případ použití je lokalizace a firemní obsah. Synthesia dabuje do více než 140 jazyků, přičemž zachovává podání avatara, aniž by bylo nutné znovu natáčet nebo přepisovat scénář pro každou verzi. Tvorba standardního školicího videa tradičně trvala dny až týdny; uživatelé AI nástrojů hlásí zkrácení doby produkce o 75 až 90 procent. Pro interní školení, produktová videa nebo vysvětlivky do deseti jazykových mutací je to rozumná směna – diváka nezajímá herecký výkon, zajímá ho informace.
Jinak to vypadá u osobní značky nebo prodeje. Tam diváci očekávají autentičnost, mikrovýrazy a reakci na okamžik, a mluvící avatar z fotky nebo krátkého klipu tohle neumí nahradit – neutrální tělesný jazyk a lehce kovový tón hlasu je v obchodním rozhovoru nebo v osobním příběhu slyšet okamžitě. Použít avatar tam, kde má zafungovat důvěra v konkrétního člověka, je nejčastější chyba, kterou firmy s touhle technologií dělají.
Jak si vybrat podle toho, co vlastně potřebujete
Pokud chcete rychle otestovat koncept a stačí vám statický obrázek s hlasem, sáhněte po mluvící fotce – je to nejlevnější vstup na vyzkoušení. Pokud plánujete sérii školicích videí a chcete, aby mluvčí byl opravdu „vy“, počítejte s natáčením v řádu minut a s jedním nepřerušovaným záběrem. Pro interaktivní prostředí jako veletržní stánek nebo hru je na místě 3D postava, a tam se bez technického týmu většinou neobejdete. Přehled dostupných nástrojů najdete v kategorii Prevod text na řeč nebo Titulky, kde si vstupy i výstupy můžete porovnat přímo vedle sebe.
Stačí na AI avatar jedna fotka?
Ano, u variant jako mluvící fotka od D-ID nebo osobní avatar z fotky u Synthesia stačí jeden čelní snímek s oběma viditelnýma očima. Výsledkem je ale animace s neutrálním tělesným jazykem, ne plnohodnotný klon pohybu.
Kolik minut záznamu potřebuji na klon vlastní osoby?
Liší se to podle nástroje – HeyGen Avatar 5 zvládne natrénovat avatar z patnáctisekundového klipu, Synthesia vyžaduje jeden až pět minut nepřerušovaného záběru a D-ID nabízí úrovně od jedné do pěti minut podle zvolené kvality.
Můžu poslat souhlasné video, které mám už natočené?
Ne. Synthesia i HeyGen vyžadují, aby souhlas vznikl živě v okamžiku nahrávání, včetně vyřčeného hesla u HeyGen. Předtočené svolení systém neakceptuje, i když samotný materiál pro avatara může být starší záznam.
Bude muset být moje AI video označené jako umělé?
Od srpna 2026 ano, pokud jde o obsah určený veřejnosti a připomínající skutečnou osobu nebo událost. Firma, která video nasazuje, musí označení zajistit sama a nemůže se spoléhat jen na skryté značení od výrobce nástroje.
Kdy je lepší avatar nepoužívat?
Tam, kde má video stavět na osobní důvěře nebo prodejním vztahu k divákovi – mikrovýrazy a reakce na okamžik AI avatar zatím nenahradí a rozdíl je slyšet i vidět.
