Obsah

Hodnocení lokálních TTS modelů na RTX 3090

Vytvořeno: 27.8.2026 | Aktualizováno: 27.08.2026 13:42

Video Naklonoval jsem se 10x | AI mastermind 36 obsahuje praktické porovnání lokálních modelů pro syntézu a klonování hlasu. Test probíhal na NVIDIA RTX 3090 s 24 GB VRAM; navazující dokument TTS souboj na RTX 3090 slouží jako doprovodný podklad.

Poznámka: Jde o zkušenost a subjektivní srovnání autora videa, nikoli o reprodukovatelný benchmark. Bez stejné verze modelu, konfigurace a vstupních nahrávek nelze výsledky brát jako obecné pořadí modelů.

Testovací konfigurace

Výsledky srovnání

Model Závěr z testu Pozorované limity
Higgs TTS 3 (4B) Autor jej označil jako celkového vítěze a produkční volbu. Kvalitou jej hodnotil podobně jako předchozí verzi, ale podstatně rychlejší. Pro 1 sekundu audia zazněl čas přibližně 1/3 sekundy; hodina audia by tak trvala zhruba 20 minut. Vyžaduje více než 15 GB VRAM pro váhy a KV cache.
Higgs Audio V2 Kvalitativně srovnatelný s verzí 3, ale pomalejší. Ve videu zaznělo licenční omezení s nutností individuálního schválení při překročení 100 000 uživatelů nebo zhlédnutí za rok.
Chatterbox Multilingual V kvalitě se podle autora umístil na druhém místě. Výstup mu nepřipadal dost podobný vlastnímu hlasu a model chyboval ve výslovnosti českého jména. Varianta Turbo měla podle testu slabší zvuk.
Cozy Voice V testu nepřesvědčil kvalitou výstupu. Autor jej popsal jako model s nepříjemným zvukem; nejsou uvedeny přesné parametry ani reprodukovatelné metriky.
Qwen Vkládala se do něj velká očekávání, ale v konkrétním testu nepřesvědčil. Byl označen jako pomalý, výstup občas zadrhával a chyboval ve výslovnosti jména i ve větě kombinující češtinu a angličtinu. Verze modelu nebyla ve videu jednoznačně upřesněna.
Kokoro Dokázal vytvořit bezchybnou angličtinu. Workflow vyžadovalo další krok pro modulaci hlasu. Výstup měl stále syntetický nádech a další krok zpomaloval zpracování.

Praktické poznatky

Reference pro klonování hlasu

Délka referenční nahrávky není jediný parametr. Problémová místa je vhodné vložit přímo do vzorku: v testu se tímto způsobem ověřovala výslovnost vlastního jména. Zkoušela se také diakritika, různé zápisy zkratky AI a fonetický přepis českých slov pro modely orientované na angličtinu.

Hardware

RTX 3090 se 24 GB VRAM umožnila spustit Higgs TTS 3 s uvedenými nároky na váhy a KV cache. Na RTX 3070 se podle autora videa tento model nevešel. Pro ostatní testované TTS modely video neuvádí přesné nároky na VRAM, proto z něj nelze odvodit obecné minimální hardwarové požadavky.

Dubbing workflow

Pro překlad videí se nejprve použijí titulky, ty se přeloží do cílového jazyka a jednotlivé věty se posílají do hlasového modelu. Náročná část je synchronizace výsledného audia s děním na obrazovce. Ve videu zaznělo, že zpracování tří videí do deseti jazyků zabralo přibližně 20 hodin orchestrace.

Omezení a problémy

Závěr

Pro testovanou konfiguraci vyšel Higgs TTS 3 jako nejpraktičtější volba: vešel se do 24 GB VRAM, byl rychlý a autor jej hodnotil nejlépe pro produkční použití. Při výběru modelu je ale potřeba ověřit kvalitu na vlastním hlasu, cílových jazycích a konkrétních větách, které mají být namluveny.

Zdroje