====== Výběr lokálního LLM podle hardwaru ====== //Vytvořeno: **30.7.2026** | Aktualizováno: **~~LASTMOD~~**// [[https://github.com/signerless/llm-checker|LLM Checker]], [[https://github.com/AlexsJones/llmfit|llmfit]] a [[https://www.madebyagents.com/hardware/calculator|AI Hardware Calculator]] pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, llmfit pro výběr modelů podle zjištěného hardwaru a LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama. ===== Co je při výběru modelu důležité ===== Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména: * dostupnou VRAM, případně sdílenou paměť u Apple Silicon; * kvantizaci, která výrazně ovlivňuje spotřebu paměti i kvalitu; * kontextové okno a paměť pro KV cache; * propustnost paměti, která ovlivňuje rychlost generování; * typ úlohy: pro chat, programování, reasoning nebo práci s obrazem mohou být vhodné jiné modely. Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu. ===== AI Hardware Calculator ===== [[https://www.madebyagents.com/hardware/calculator|AI Hardware Calculator od Made By Agents]] je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE. Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru. Hodí se hlavně pro tyto situace: * výběr GPU nebo pracovní stanice před nákupem; * rychlé porovnání, zda má pro danou VRAM smysl 7B, 32B nebo 70B model; * orientační porovnání kompromisu mezi velikostí modelu a kvantizací; * rozhodnutí, zda zvažovat lokální běh, pronájem GPU nebo API. Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky. ===== llmfit ===== [[https://github.com/AlexsJones/llmfit|llmfit]] je terminálový nástroj, který zjistí RAM, CPU, GPU a VRAM počítače a podle nich řadí katalog stovek modelů. Pro každý kandidát kombinuje odhad paměťové použitelnosti, rychlosti, kvality a dostupného kontextu; výsledek lze filtrovat podle typu úlohy, například coding, reasoning nebo multimodální modely. Tvoje interpretace je tedy správná: llmfit slouží primárně k tomu, aby před spuštěním ukázal, které modely by na daném lokálním stroji měly fungovat dobře. Nejde ale o jistotu ani o automatický výběr jediného „nejlepšího“ modelu. Výpočet rychlosti je odhad založený hlavně na propustnosti paměti a údaje o fitu závisejí také na zvoleném kontextu, kvantizaci a runtime. Nástroj umí pracovat s více GPU, architekturami MoE a dynamicky volí nejvyšší kvalitu kvantizace, která se vejde do dostupné paměti. Pokud se model nevejde celý do VRAM, rozlišuje běh na GPU, MoE s offloadem expertů, kombinaci CPU+GPU a pouze CPU. Výsledky s příliš těsnou paměťovou rezervou řadí až za doporučené kandidáty. Základní použití po instalaci přes Homebrew nebo Python ''uv'' je: brew install AlexsJones/llmfit/llmfit # nebo uv tool install -U llmfit llmfit fit llmfit recommend --json --use-case coding --limit 3 llmfit info "Mistral-7B" Příkaz ''llmfit fit'' vypíše modely seřazené podle vhodnosti. ''llmfit recommend'' vrací nejlepší kandidáty a s přepínačem ''--json'' je vhodný i pro skripty nebo agenty. ''llmfit info'' zobrazí podrobný rozbor konkrétního modelu včetně předpokladů odhadu a doporučení pro ověření. Pro plánování jiného nebo budoucího hardwaru lze přepsat detekované hodnoty. Je také možné omezit kontext, pro který se má odhadnout spotřeba paměti: llmfit --memory=24G --ram=64G --cpu-cores=8 fit llmfit --max-context 8192 recommend --json --limit 5 llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json Kromě odhadu umí ''llmfit bench'' změřit tokeny za sekundu a čas do prvního tokenu proti již spuštěnému lokálnímu provideru, například Ollama, llama.cpp, MLX nebo vLLM. Naměřená data se ukládají lokálně a mají přednost před odhadem při dalších doporučeních na stejném hardwaru. To je vhodný poslední krok po výběru modelu, nikoli náhrada za jeho první výběr. llmfit dále rozpozná lokální runtime a v interaktivním TUI umí stahovat modely přes Ollama, llama.cpp, MLX, Docker Model Runner nebo LM Studio. Připojení k Ollama běžící na jiném stroji lze nastavit proměnnou ''OLLAMA_HOST''. ===== LLM Checker ===== [[https://github.com/signerless/llm-checker|LLM Checker]] je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All. Základní postup je: npm install -g llm-checker llm-checker hw-detect llm-checker recommend --category coding Přesně tento stručný postup ukazuje i [[https://x.com/akshay_pachaar/status/2061425046737084546|příspěvek Akshaye Pachaara na X]]. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací. Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů. ===== Doporučený postup ===== Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Pro výběr modelu na hotovém nebo simulovaném stroji je vhodné použít llmfit; pracuje s detekovaným hardwarem, kvantizací i kontextem a vysvětlí předpoklady odhadu. Doporučení je potom potřeba ověřit spuštěním konkrétního modelu a benchmarkem, například přes ''llmfit bench'' nebo LLM Checker s Ollama. Pro praktické použití stačí tento postup: - V kalkulačce vybrat zamýšlený typ modelu, velikost a hardware. - Vybrat takovou konfiguraci, která má rezervu vedle samotných vah modelu. - Na hotovém stroji spustit ''llmfit fit'' nebo ''llmfit recommend --use-case '' a zkontrolovat doporučené modely i jejich předpoklady. - Vybraný model stáhnout ve zvoleném runtime a změřit rychlost i reálnou spotřebu paměti na vlastních promptech. - Pokud výkon nebo kontext nestačí, upravit kvantizaci, velikost modelu nebo hardware. ===== Kdy použít který nástroj ===== ^ Potřeba ^ Vhodný nástroj ^ | Návrh sestavy nebo nákupu GPU | AI Hardware Calculator | | Rychlý odhad modelů pro zadanou VRAM | AI Hardware Calculator | | Analýza aktuálního počítače a řazení stovek modelů | llmfit | | Simulace RAM, VRAM nebo délky kontextu pro budoucí hardware | llmfit | | Doporučení modelu pro coding, reasoning nebo multimodalitu | llmfit nebo LLM Checker | | Výběr, stažení a porovnání lokálních modelů v Ollama | llmfit nebo LLM Checker | | Ověření skutečné rychlosti | llmfit, LLM Checker a reálný benchmark | ===== Zdroje ===== * [[https://github.com/AlexsJones/llmfit|llmfit – GitHub repository a dokumentace]] * [[https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md|llmfit – principy výpočtu fitu a rychlosti]] * [[https://github.com/AlexsJones/llmfit/blob/main/docs/cli.md|llmfit – CLI, simulace hardwaru a benchmarky]] * [[https://github.com/AlexsJones/llmfit/blob/main/docs/providers.md|llmfit – podporované runtime providery]] * [[https://github.com/signerless/llm-checker|LLM Checker – GitHub repository a dokumentace]] * [[https://x.com/akshay_pachaar/status/2061425046737084546|Akshay Pachaar – ukázka základního workflow LLM Checkeru]] * [[https://www.madebyagents.com/hardware/calculator|Made By Agents – AI Hardware Calculator]]