Výběr lokálního LLM podle hardwaru
Vytvořeno: 30.7.2026 | Aktualizováno: 16.08.2026 18:37
LLM Checker, llmfit a AI Hardware Calculator pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, llmfit pro výběr modelů podle zjištěného hardwaru a LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama.
Co je při výběru modelu důležité
Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména:
- dostupnou VRAM, případně sdílenou paměť u Apple Silicon;
- kvantizaci, která výrazně ovlivňuje spotřebu paměti i kvalitu;
- kontextové okno a paměť pro KV cache;
- propustnost paměti, která ovlivňuje rychlost generování;
- typ úlohy: pro chat, programování, reasoning nebo práci s obrazem mohou být vhodné jiné modely.
Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu.
AI Hardware Calculator
AI Hardware Calculator od Made By Agents je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE.
Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru.
Hodí se hlavně pro tyto situace:
- výběr GPU nebo pracovní stanice před nákupem;
- rychlé porovnání, zda má pro danou VRAM smysl 7B, 32B nebo 70B model;
- orientační porovnání kompromisu mezi velikostí modelu a kvantizací;
- rozhodnutí, zda zvažovat lokální běh, pronájem GPU nebo API.
Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky.
llmfit
llmfit je terminálový nástroj, který zjistí RAM, CPU, GPU a VRAM počítače a podle nich řadí katalog stovek modelů. Pro každý kandidát kombinuje odhad paměťové použitelnosti, rychlosti, kvality a dostupného kontextu; výsledek lze filtrovat podle typu úlohy, například coding, reasoning nebo multimodální modely.
Tvoje interpretace je tedy správná: llmfit slouží primárně k tomu, aby před spuštěním ukázal, které modely by na daném lokálním stroji měly fungovat dobře. Nejde ale o jistotu ani o automatický výběr jediného „nejlepšího“ modelu. Výpočet rychlosti je odhad založený hlavně na propustnosti paměti a údaje o fitu závisejí také na zvoleném kontextu, kvantizaci a runtime.
Nástroj umí pracovat s více GPU, architekturami MoE a dynamicky volí nejvyšší kvalitu kvantizace, která se vejde do dostupné paměti. Pokud se model nevejde celý do VRAM, rozlišuje běh na GPU, MoE s offloadem expertů, kombinaci CPU+GPU a pouze CPU. Výsledky s příliš těsnou paměťovou rezervou řadí až za doporučené kandidáty.
Základní použití po instalaci přes Homebrew nebo Python uv je:
brew install AlexsJones/llmfit/llmfit # nebo uv tool install -U llmfit llmfit fit llmfit recommend --json --use-case coding --limit 3 llmfit info "Mistral-7B"
Příkaz llmfit fit vypíše modely seřazené podle vhodnosti. llmfit recommend vrací nejlepší kandidáty a s přepínačem –json je vhodný i pro skripty nebo agenty. llmfit info zobrazí podrobný rozbor konkrétního modelu včetně předpokladů odhadu a doporučení pro ověření.
Pro plánování jiného nebo budoucího hardwaru lze přepsat detekované hodnoty. Je také možné omezit kontext, pro který se má odhadnout spotřeba paměti:
llmfit --memory=24G --ram=64G --cpu-cores=8 fit llmfit --max-context 8192 recommend --json --limit 5 llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json
Kromě odhadu umí llmfit bench změřit tokeny za sekundu a čas do prvního tokenu proti již spuštěnému lokálnímu provideru, například Ollama, llama.cpp, MLX nebo vLLM. Naměřená data se ukládají lokálně a mají přednost před odhadem při dalších doporučeních na stejném hardwaru. To je vhodný poslední krok po výběru modelu, nikoli náhrada za jeho první výběr.
llmfit dále rozpozná lokální runtime a v interaktivním TUI umí stahovat modely přes Ollama, llama.cpp, MLX, Docker Model Runner nebo LM Studio. Připojení k Ollama běžící na jiném stroji lze nastavit proměnnou OLLAMA_HOST.
LLM Checker
LLM Checker je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All.
Základní postup je:
npm install -g llm-checker llm-checker hw-detect llm-checker recommend --category coding
Přesně tento stručný postup ukazuje i příspěvek Akshaye Pachaara na X. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací.
Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů.
Doporučený postup
Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Pro výběr modelu na hotovém nebo simulovaném stroji je vhodné použít llmfit; pracuje s detekovaným hardwarem, kvantizací i kontextem a vysvětlí předpoklady odhadu. Doporučení je potom potřeba ověřit spuštěním konkrétního modelu a benchmarkem, například přes llmfit bench nebo LLM Checker s Ollama.
Pro praktické použití stačí tento postup:
- V kalkulačce vybrat zamýšlený typ modelu, velikost a hardware.
- Vybrat takovou konfiguraci, která má rezervu vedle samotných vah modelu.
- Na hotovém stroji spustit
llmfit fitnebollmfit recommend –use-case <typ-uloha>a zkontrolovat doporučené modely i jejich předpoklady. - Vybraný model stáhnout ve zvoleném runtime a změřit rychlost i reálnou spotřebu paměti na vlastních promptech.
- Pokud výkon nebo kontext nestačí, upravit kvantizaci, velikost modelu nebo hardware.
Kdy použít který nástroj
| Potřeba | Vhodný nástroj |
|---|---|
| Návrh sestavy nebo nákupu GPU | AI Hardware Calculator |
| Rychlý odhad modelů pro zadanou VRAM | AI Hardware Calculator |
| Analýza aktuálního počítače a řazení stovek modelů | llmfit |
| Simulace RAM, VRAM nebo délky kontextu pro budoucí hardware | llmfit |
| Doporučení modelu pro coding, reasoning nebo multimodalitu | llmfit nebo LLM Checker |
| Výběr, stažení a porovnání lokálních modelů v Ollama | llmfit nebo LLM Checker |
| Ověření skutečné rychlosti | llmfit, LLM Checker a reálný benchmark |