Hodnocení lokálních TTS modelů na RTX 3090

Vytvořeno: 27.8.2026 | Aktualizováno: 27.08.2026 13:42

Video Naklonoval jsem se 10x | AI mastermind 36 obsahuje praktické porovnání lokálních modelů pro syntézu a klonování hlasu. Test probíhal na NVIDIA RTX 3090 s 24 GB VRAM; navazující dokument TTS souboj na RTX 3090 slouží jako doprovodný podklad.

Poznámka: Jde o zkušenost a subjektivní srovnání autora videa, nikoli o reprodukovatelný benchmark. Bez stejné verze modelu, konfigurace a vstupních nahrávek nelze výsledky brát jako obecné pořadí modelů.
  • Testovací GPU byla NVIDIA RTX 3090 s 24 GB VRAM.
  • U modelu Higgs TTS 3 (4B) zabíraly váhy přibližně 7,6 GB VRAM a KV cache dalších 7,8 GB. Model se proto do 24 GB VRAM vešel.
  • Jako referenční nahrávky se zkoušely vzorky dlouhé 15, 30 a 60 sekund. Jeden krátký vzorek obsahoval také výslovnost autorova jména.
  • Posuzovala se kvalita hlasu, podobnost s referenčním hlasem, rychlost, česká výslovnost a chování při kombinaci češtiny s angličtinou.
Model Závěr z testu Pozorované limity
Higgs TTS 3 (4B) Autor jej označil jako celkového vítěze a produkční volbu. Kvalitou jej hodnotil podobně jako předchozí verzi, ale podstatně rychlejší. Pro 1 sekundu audia zazněl čas přibližně 1/3 sekundy; hodina audia by tak trvala zhruba 20 minut. Vyžaduje více než 15 GB VRAM pro váhy a KV cache.
Higgs Audio V2 Kvalitativně srovnatelný s verzí 3, ale pomalejší. Ve videu zaznělo licenční omezení s nutností individuálního schválení při překročení 100 000 uživatelů nebo zhlédnutí za rok.
Chatterbox Multilingual V kvalitě se podle autora umístil na druhém místě. Výstup mu nepřipadal dost podobný vlastnímu hlasu a model chyboval ve výslovnosti českého jména. Varianta Turbo měla podle testu slabší zvuk.
Cozy Voice V testu nepřesvědčil kvalitou výstupu. Autor jej popsal jako model s nepříjemným zvukem; nejsou uvedeny přesné parametry ani reprodukovatelné metriky.
Qwen Vkládala se do něj velká očekávání, ale v konkrétním testu nepřesvědčil. Byl označen jako pomalý, výstup občas zadrhával a chyboval ve výslovnosti jména i ve větě kombinující češtinu a angličtinu. Verze modelu nebyla ve videu jednoznačně upřesněna.
Kokoro Dokázal vytvořit bezchybnou angličtinu. Workflow vyžadovalo další krok pro modulaci hlasu. Výstup měl stále syntetický nádech a další krok zpomaloval zpracování.

Délka referenční nahrávky není jediný parametr. Problémová místa je vhodné vložit přímo do vzorku: v testu se tímto způsobem ověřovala výslovnost vlastního jména. Zkoušela se také diakritika, různé zápisy zkratky AI a fonetický přepis českých slov pro modely orientované na angličtinu.

RTX 3090 se 24 GB VRAM umožnila spustit Higgs TTS 3 s uvedenými nároky na váhy a KV cache. Na RTX 3070 se podle autora videa tento model nevešel. Pro ostatní testované TTS modely video neuvádí přesné nároky na VRAM, proto z něj nelze odvodit obecné minimální hardwarové požadavky.

Pro překlad videí se nejprve použijí titulky, ty se přeloží do cílového jazyka a jednotlivé věty se posílají do hlasového modelu. Náročná část je synchronizace výsledného audia s děním na obrazovce. Ve videu zaznělo, že zpracování tří videí do deseti jazyků zabralo přibližně 20 hodin orchestrace.

  • Hlasové modely mohou halucinovat obsah. Ve videu se objevuje například samovolné vložení fráze „thanks for watching“, zejména při dlouhých pomlkách ve zdrojovém zvuku.
  • Výslovnost českých jmen a přepínání mezi češtinou a angličtinou byly slabými místy části testovaných modelů.
  • U Kokoro je potřeba počítat s vícekrokovým workflow, které zvyšuje dobu zpracování.
  • Video neobsahuje přesné rychlostní metriky, nastavení ani hardwarové nároky pro všechny modely. Závěry proto nelze přenášet na jiné konfigurace bez vlastního testu.

Pro testovanou konfiguraci vyšel Higgs TTS 3 jako nejpraktičtější volba: vešel se do 24 GB VRAM, byl rychlý a autor jej hodnotil nejlépe pro produkční použití. Při výběru modelu je ale potřeba ověřit kvalitu na vlastním hlasu, cílových jazycích a konkrétních větách, které mají být namluveny.

  • ai/modely/lokalni-modely.txt
  • Poslední úprava: 27.08.2026 13:42
  • autor: Petr Nosek