====== Výběr lokálního LLM podle hardwaru ======
//Vytvořeno: **30.7.2026** | Aktualizováno: **~~LASTMOD~~**//
[[https://github.com/signerless/llm-checker|LLM Checker]], [[https://github.com/AlexsJones/llmfit|llmfit]] a [[https://www.madebyagents.com/hardware/calculator|AI Hardware Calculator]] pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, llmfit pro výběr modelů podle zjištěného hardwaru a LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama.
===== Co je při výběru modelu důležité =====
Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména:
* dostupnou VRAM, případně sdílenou paměť u Apple Silicon;
* kvantizaci, která výrazně ovlivňuje spotřebu paměti i kvalitu;
* kontextové okno a paměť pro KV cache;
* propustnost paměti, která ovlivňuje rychlost generování;
* typ úlohy: pro chat, programování, reasoning nebo práci s obrazem mohou být vhodné jiné modely.
Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu.
===== AI Hardware Calculator =====
[[https://www.madebyagents.com/hardware/calculator|AI Hardware Calculator od Made By Agents]] je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE.
Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru.
Hodí se hlavně pro tyto situace:
* výběr GPU nebo pracovní stanice před nákupem;
* rychlé porovnání, zda má pro danou VRAM smysl 7B, 32B nebo 70B model;
* orientační porovnání kompromisu mezi velikostí modelu a kvantizací;
* rozhodnutí, zda zvažovat lokální běh, pronájem GPU nebo API.
Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky.
===== llmfit =====
[[https://github.com/AlexsJones/llmfit|llmfit]] je terminálový nástroj, který zjistí RAM, CPU, GPU a VRAM počítače a podle nich řadí katalog stovek modelů. Pro každý kandidát kombinuje odhad paměťové použitelnosti, rychlosti, kvality a dostupného kontextu; výsledek lze filtrovat podle typu úlohy, například coding, reasoning nebo multimodální modely.
Tvoje interpretace je tedy správná: llmfit slouží primárně k tomu, aby před spuštěním ukázal, které modely by na daném lokálním stroji měly fungovat dobře. Nejde ale o jistotu ani o automatický výběr jediného „nejlepšího“ modelu. Výpočet rychlosti je odhad založený hlavně na propustnosti paměti a údaje o fitu závisejí také na zvoleném kontextu, kvantizaci a runtime.
Nástroj umí pracovat s více GPU, architekturami MoE a dynamicky volí nejvyšší kvalitu kvantizace, která se vejde do dostupné paměti. Pokud se model nevejde celý do VRAM, rozlišuje běh na GPU, MoE s offloadem expertů, kombinaci CPU+GPU a pouze CPU. Výsledky s příliš těsnou paměťovou rezervou řadí až za doporučené kandidáty.
Základní použití po instalaci přes Homebrew nebo Python ''uv'' je:
brew install AlexsJones/llmfit/llmfit
# nebo
uv tool install -U llmfit
llmfit fit
llmfit recommend --json --use-case coding --limit 3
llmfit info "Mistral-7B"
Příkaz ''llmfit fit'' vypíše modely seřazené podle vhodnosti. ''llmfit recommend'' vrací nejlepší kandidáty a s přepínačem ''--json'' je vhodný i pro skripty nebo agenty. ''llmfit info'' zobrazí podrobný rozbor konkrétního modelu včetně předpokladů odhadu a doporučení pro ověření.
Pro plánování jiného nebo budoucího hardwaru lze přepsat detekované hodnoty. Je také možné omezit kontext, pro který se má odhadnout spotřeba paměti:
llmfit --memory=24G --ram=64G --cpu-cores=8 fit
llmfit --max-context 8192 recommend --json --limit 5
llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json
Kromě odhadu umí ''llmfit bench'' změřit tokeny za sekundu a čas do prvního tokenu proti již spuštěnému lokálnímu provideru, například Ollama, llama.cpp, MLX nebo vLLM. Naměřená data se ukládají lokálně a mají přednost před odhadem při dalších doporučeních na stejném hardwaru. To je vhodný poslední krok po výběru modelu, nikoli náhrada za jeho první výběr.
llmfit dále rozpozná lokální runtime a v interaktivním TUI umí stahovat modely přes Ollama, llama.cpp, MLX, Docker Model Runner nebo LM Studio. Připojení k Ollama běžící na jiném stroji lze nastavit proměnnou ''OLLAMA_HOST''.
===== LLM Checker =====
[[https://github.com/signerless/llm-checker|LLM Checker]] je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All.
Základní postup je:
npm install -g llm-checker
llm-checker hw-detect
llm-checker recommend --category coding
Přesně tento stručný postup ukazuje i [[https://x.com/akshay_pachaar/status/2061425046737084546|příspěvek Akshaye Pachaara na X]]. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací.
Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů.
===== Doporučený postup =====
Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Pro výběr modelu na hotovém nebo simulovaném stroji je vhodné použít llmfit; pracuje s detekovaným hardwarem, kvantizací i kontextem a vysvětlí předpoklady odhadu. Doporučení je potom potřeba ověřit spuštěním konkrétního modelu a benchmarkem, například přes ''llmfit bench'' nebo LLM Checker s Ollama.
Pro praktické použití stačí tento postup:
- V kalkulačce vybrat zamýšlený typ modelu, velikost a hardware.
- Vybrat takovou konfiguraci, která má rezervu vedle samotných vah modelu.
- Na hotovém stroji spustit ''llmfit fit'' nebo ''llmfit recommend --use-case '' a zkontrolovat doporučené modely i jejich předpoklady.
- Vybraný model stáhnout ve zvoleném runtime a změřit rychlost i reálnou spotřebu paměti na vlastních promptech.
- Pokud výkon nebo kontext nestačí, upravit kvantizaci, velikost modelu nebo hardware.
===== Kdy použít který nástroj =====
^ Potřeba ^ Vhodný nástroj ^
| Návrh sestavy nebo nákupu GPU | AI Hardware Calculator |
| Rychlý odhad modelů pro zadanou VRAM | AI Hardware Calculator |
| Analýza aktuálního počítače a řazení stovek modelů | llmfit |
| Simulace RAM, VRAM nebo délky kontextu pro budoucí hardware | llmfit |
| Doporučení modelu pro coding, reasoning nebo multimodalitu | llmfit nebo LLM Checker |
| Výběr, stažení a porovnání lokálních modelů v Ollama | llmfit nebo LLM Checker |
| Ověření skutečné rychlosti | llmfit, LLM Checker a reálný benchmark |
===== Zdroje =====
* [[https://github.com/AlexsJones/llmfit|llmfit – GitHub repository a dokumentace]]
* [[https://github.com/AlexsJones/llmfit/blob/main/docs/how-it-works.md|llmfit – principy výpočtu fitu a rychlosti]]
* [[https://github.com/AlexsJones/llmfit/blob/main/docs/cli.md|llmfit – CLI, simulace hardwaru a benchmarky]]
* [[https://github.com/AlexsJones/llmfit/blob/main/docs/providers.md|llmfit – podporované runtime providery]]
* [[https://github.com/signerless/llm-checker|LLM Checker – GitHub repository a dokumentace]]
* [[https://x.com/akshay_pachaar/status/2061425046737084546|Akshay Pachaar – ukázka základního workflow LLM Checkeru]]
* [[https://www.madebyagents.com/hardware/calculator|Made By Agents – AI Hardware Calculator]]