Vytvořeno: 27.8.2026 | Aktualizováno: 27.08.2026 13:42
Video Naklonoval jsem se 10x | AI mastermind 36 obsahuje praktické porovnání lokálních modelů pro syntézu a klonování hlasu. Test probíhal na NVIDIA RTX 3090 s 24 GB VRAM; navazující dokument TTS souboj na RTX 3090 slouží jako doprovodný podklad.
Poznámka: Jde o zkušenost a subjektivní srovnání autora videa, nikoli o reprodukovatelný benchmark. Bez stejné verze modelu, konfigurace a vstupních nahrávek nelze výsledky brát jako obecné pořadí modelů.
| Model | Závěr z testu | Pozorované limity |
|---|---|---|
| Higgs TTS 3 (4B) | Autor jej označil jako celkového vítěze a produkční volbu. Kvalitou jej hodnotil podobně jako předchozí verzi, ale podstatně rychlejší. | Pro 1 sekundu audia zazněl čas přibližně 1/3 sekundy; hodina audia by tak trvala zhruba 20 minut. Vyžaduje více než 15 GB VRAM pro váhy a KV cache. |
| Higgs Audio V2 | Kvalitativně srovnatelný s verzí 3, ale pomalejší. | Ve videu zaznělo licenční omezení s nutností individuálního schválení při překročení 100 000 uživatelů nebo zhlédnutí za rok. |
| Chatterbox Multilingual | V kvalitě se podle autora umístil na druhém místě. | Výstup mu nepřipadal dost podobný vlastnímu hlasu a model chyboval ve výslovnosti českého jména. Varianta Turbo měla podle testu slabší zvuk. |
| Cozy Voice | V testu nepřesvědčil kvalitou výstupu. | Autor jej popsal jako model s nepříjemným zvukem; nejsou uvedeny přesné parametry ani reprodukovatelné metriky. |
| Qwen | Vkládala se do něj velká očekávání, ale v konkrétním testu nepřesvědčil. | Byl označen jako pomalý, výstup občas zadrhával a chyboval ve výslovnosti jména i ve větě kombinující češtinu a angličtinu. Verze modelu nebyla ve videu jednoznačně upřesněna. |
| Kokoro | Dokázal vytvořit bezchybnou angličtinu. | Workflow vyžadovalo další krok pro modulaci hlasu. Výstup měl stále syntetický nádech a další krok zpomaloval zpracování. |
Délka referenční nahrávky není jediný parametr. Problémová místa je vhodné vložit přímo do vzorku: v testu se tímto způsobem ověřovala výslovnost vlastního jména. Zkoušela se také diakritika, různé zápisy zkratky AI a fonetický přepis českých slov pro modely orientované na angličtinu.
RTX 3090 se 24 GB VRAM umožnila spustit Higgs TTS 3 s uvedenými nároky na váhy a KV cache. Na RTX 3070 se podle autora videa tento model nevešel. Pro ostatní testované TTS modely video neuvádí přesné nároky na VRAM, proto z něj nelze odvodit obecné minimální hardwarové požadavky.
Pro překlad videí se nejprve použijí titulky, ty se přeloží do cílového jazyka a jednotlivé věty se posílají do hlasového modelu. Náročná část je synchronizace výsledného audia s děním na obrazovce. Ve videu zaznělo, že zpracování tří videí do deseti jazyků zabralo přibližně 20 hodin orchestrace.
Pro testovanou konfiguraci vyšel Higgs TTS 3 jako nejpraktičtější volba: vešel se do 24 GB VRAM, byl rychlý a autor jej hodnotil nejlépe pro produkční použití. Při výběru modelu je ale potřeba ověřit kvalitu na vlastním hlasu, cílových jazycích a konkrétních větách, které mají být namluveny.