Vytvořeno: 30.7.2026 | Aktualizováno: 16.08.2026 18:37
LLM Checker, llmfit a AI Hardware Calculator pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, llmfit pro výběr modelů podle zjištěného hardwaru a LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama.
Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména:
Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu.
AI Hardware Calculator od Made By Agents je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE.
Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru.
Hodí se hlavně pro tyto situace:
Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky.
llmfit je terminálový nástroj, který zjistí RAM, CPU, GPU a VRAM počítače a podle nich řadí katalog stovek modelů. Pro každý kandidát kombinuje odhad paměťové použitelnosti, rychlosti, kvality a dostupného kontextu; výsledek lze filtrovat podle typu úlohy, například coding, reasoning nebo multimodální modely.
Tvoje interpretace je tedy správná: llmfit slouží primárně k tomu, aby před spuštěním ukázal, které modely by na daném lokálním stroji měly fungovat dobře. Nejde ale o jistotu ani o automatický výběr jediného „nejlepšího“ modelu. Výpočet rychlosti je odhad založený hlavně na propustnosti paměti a údaje o fitu závisejí také na zvoleném kontextu, kvantizaci a runtime.
Nástroj umí pracovat s více GPU, architekturami MoE a dynamicky volí nejvyšší kvalitu kvantizace, která se vejde do dostupné paměti. Pokud se model nevejde celý do VRAM, rozlišuje běh na GPU, MoE s offloadem expertů, kombinaci CPU+GPU a pouze CPU. Výsledky s příliš těsnou paměťovou rezervou řadí až za doporučené kandidáty.
Základní použití po instalaci přes Homebrew nebo Python uv je:
brew install AlexsJones/llmfit/llmfit # nebo uv tool install -U llmfit llmfit fit llmfit recommend --json --use-case coding --limit 3 llmfit info "Mistral-7B"
Příkaz llmfit fit vypíše modely seřazené podle vhodnosti. llmfit recommend vrací nejlepší kandidáty a s přepínačem –json je vhodný i pro skripty nebo agenty. llmfit info zobrazí podrobný rozbor konkrétního modelu včetně předpokladů odhadu a doporučení pro ověření.
Pro plánování jiného nebo budoucího hardwaru lze přepsat detekované hodnoty. Je také možné omezit kontext, pro který se má odhadnout spotřeba paměti:
llmfit --memory=24G --ram=64G --cpu-cores=8 fit llmfit --max-context 8192 recommend --json --limit 5 llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json
Kromě odhadu umí llmfit bench změřit tokeny za sekundu a čas do prvního tokenu proti již spuštěnému lokálnímu provideru, například Ollama, llama.cpp, MLX nebo vLLM. Naměřená data se ukládají lokálně a mají přednost před odhadem při dalších doporučeních na stejném hardwaru. To je vhodný poslední krok po výběru modelu, nikoli náhrada za jeho první výběr.
llmfit dále rozpozná lokální runtime a v interaktivním TUI umí stahovat modely přes Ollama, llama.cpp, MLX, Docker Model Runner nebo LM Studio. Připojení k Ollama běžící na jiném stroji lze nastavit proměnnou OLLAMA_HOST.
LLM Checker je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All.
Základní postup je:
npm install -g llm-checker llm-checker hw-detect llm-checker recommend --category coding
Přesně tento stručný postup ukazuje i příspěvek Akshaye Pachaara na X. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací.
Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů.
Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Pro výběr modelu na hotovém nebo simulovaném stroji je vhodné použít llmfit; pracuje s detekovaným hardwarem, kvantizací i kontextem a vysvětlí předpoklady odhadu. Doporučení je potom potřeba ověřit spuštěním konkrétního modelu a benchmarkem, například přes llmfit bench nebo LLM Checker s Ollama.
Pro praktické použití stačí tento postup:
llmfit fit nebo llmfit recommend –use-case <typ-uloha> a zkontrolovat doporučené modely i jejich předpoklady.| Potřeba | Vhodný nástroj |
|---|---|
| Návrh sestavy nebo nákupu GPU | AI Hardware Calculator |
| Rychlý odhad modelů pro zadanou VRAM | AI Hardware Calculator |
| Analýza aktuálního počítače a řazení stovek modelů | llmfit |
| Simulace RAM, VRAM nebo délky kontextu pro budoucí hardware | llmfit |
| Doporučení modelu pro coding, reasoning nebo multimodalitu | llmfit nebo LLM Checker |
| Výběr, stažení a porovnání lokálních modelů v Ollama | llmfit nebo LLM Checker |
| Ověření skutečné rychlosti | llmfit, LLM Checker a reálný benchmark |