====== Hodnocení lokálních TTS modelů na RTX 3090 ====== //Vytvořeno: **27.8.2026** | Aktualizováno: **~~LASTMOD~~**// [[https://www.youtube.com/watch?v=496XG8y-EjU|Video Naklonoval jsem se 10x | AI mastermind 36]] obsahuje praktické porovnání lokálních modelů pro syntézu a klonování hlasu. Test probíhal na NVIDIA RTX 3090 s **24 GB VRAM**; navazující [[https://claude.ai/code/artifact/60183234-be1f-4db6-a804-fddcd33f72fb|dokument TTS souboj na RTX 3090]] slouží jako doprovodný podklad. {{youtube>496XG8y-EjU?}} > **Poznámka:** Jde o zkušenost a subjektivní srovnání autora videa, nikoli o reprodukovatelný benchmark. Bez stejné verze modelu, konfigurace a vstupních nahrávek nelze výsledky brát jako obecné pořadí modelů. ===== Testovací konfigurace ===== * Testovací GPU byla NVIDIA RTX 3090 s **24 GB VRAM**. * U modelu Higgs TTS 3 (4B) zabíraly váhy přibližně 7,6 GB VRAM a KV cache dalších 7,8 GB. Model se proto do 24 GB VRAM vešel. * Jako referenční nahrávky se zkoušely vzorky dlouhé 15, 30 a 60 sekund. Jeden krátký vzorek obsahoval také výslovnost autorova jména. * Posuzovala se kvalita hlasu, podobnost s referenčním hlasem, rychlost, česká výslovnost a chování při kombinaci češtiny s angličtinou. ===== Výsledky srovnání ===== ^ Model ^ Závěr z testu ^ Pozorované limity ^ | Higgs TTS 3 (4B) | Autor jej označil jako celkového vítěze a produkční volbu. Kvalitou jej hodnotil podobně jako předchozí verzi, ale podstatně rychlejší. | Pro 1 sekundu audia zazněl čas přibližně 1/3 sekundy; hodina audia by tak trvala zhruba 20 minut. Vyžaduje více než 15 GB VRAM pro váhy a KV cache. | | Higgs Audio V2 | Kvalitativně srovnatelný s verzí 3, ale pomalejší. | Ve videu zaznělo licenční omezení s nutností individuálního schválení při překročení 100 000 uživatelů nebo zhlédnutí za rok. | | Chatterbox Multilingual | V kvalitě se podle autora umístil na druhém místě. | Výstup mu nepřipadal dost podobný vlastnímu hlasu a model chyboval ve výslovnosti českého jména. Varianta Turbo měla podle testu slabší zvuk. | | Cozy Voice | V testu nepřesvědčil kvalitou výstupu. | Autor jej popsal jako model s nepříjemným zvukem; nejsou uvedeny přesné parametry ani reprodukovatelné metriky. | | Qwen | Vkládala se do něj velká očekávání, ale v konkrétním testu nepřesvědčil. | Byl označen jako pomalý, výstup občas zadrhával a chyboval ve výslovnosti jména i ve větě kombinující češtinu a angličtinu. Verze modelu nebyla ve videu jednoznačně upřesněna. | | Kokoro | Dokázal vytvořit bezchybnou angličtinu. | Workflow vyžadovalo další krok pro modulaci hlasu. Výstup měl stále syntetický nádech a další krok zpomaloval zpracování. | ===== Praktické poznatky ===== ==== Reference pro klonování hlasu ==== Délka referenční nahrávky není jediný parametr. Problémová místa je vhodné vložit přímo do vzorku: v testu se tímto způsobem ověřovala výslovnost vlastního jména. Zkoušela se také diakritika, různé zápisy zkratky AI a fonetický přepis českých slov pro modely orientované na angličtinu. ==== Hardware ==== RTX 3090 se 24 GB VRAM umožnila spustit Higgs TTS 3 s uvedenými nároky na váhy a KV cache. Na RTX 3070 se podle autora videa tento model nevešel. Pro ostatní testované TTS modely video neuvádí přesné nároky na VRAM, proto z něj nelze odvodit obecné minimální hardwarové požadavky. ==== Dubbing workflow ==== Pro překlad videí se nejprve použijí titulky, ty se přeloží do cílového jazyka a jednotlivé věty se posílají do hlasového modelu. Náročná část je synchronizace výsledného audia s děním na obrazovce. Ve videu zaznělo, že zpracování tří videí do deseti jazyků zabralo přibližně 20 hodin orchestrace. ===== Omezení a problémy ===== * Hlasové modely mohou halucinovat obsah. Ve videu se objevuje například samovolné vložení fráze „thanks for watching“, zejména při dlouhých pomlkách ve zdrojovém zvuku. * Výslovnost českých jmen a přepínání mezi češtinou a angličtinou byly slabými místy části testovaných modelů. * U Kokoro je potřeba počítat s vícekrokovým workflow, které zvyšuje dobu zpracování. * Video neobsahuje přesné rychlostní metriky, nastavení ani hardwarové nároky pro všechny modely. Závěry proto nelze přenášet na jiné konfigurace bez vlastního testu. ===== Závěr ===== Pro testovanou konfiguraci vyšel Higgs TTS 3 jako nejpraktičtější volba: vešel se do 24 GB VRAM, byl rychlý a autor jej hodnotil nejlépe pro produkční použití. Při výběru modelu je ale potřeba ověřit kvalitu na vlastním hlasu, cílových jazycích a konkrétních větách, které mají být namluveny. ===== Zdroje ===== * [[https://www.youtube.com/watch?v=496XG8y-EjU|Naklonoval jsem se 10x | AI mastermind 36 – YouTube]] * [[https://claude.ai/code/artifact/60183234-be1f-4db6-a804-fddcd33f72fb|TTS souboj na RTX 3090 – doprovodný dokument]]