ai:hardware:vyber-lokalniho-llm-podle-hardwaru

Výběr lokálního LLM podle hardwaru

Vytvořeno: 30.7.2026 | Aktualizováno: 16.08.2026 18:37

LLM Checker, llmfit a AI Hardware Calculator pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, llmfit pro výběr modelů podle zjištěného hardwaru a LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama.

Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména:

  • dostupnou VRAM, případně sdílenou paměť u Apple Silicon;
  • kvantizaci, která výrazně ovlivňuje spotřebu paměti i kvalitu;
  • kontextové okno a paměť pro KV cache;
  • propustnost paměti, která ovlivňuje rychlost generování;
  • typ úlohy: pro chat, programování, reasoning nebo práci s obrazem mohou být vhodné jiné modely.

Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu.

AI Hardware Calculator od Made By Agents je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE.

Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru.

Hodí se hlavně pro tyto situace:

  • výběr GPU nebo pracovní stanice před nákupem;
  • rychlé porovnání, zda má pro danou VRAM smysl 7B, 32B nebo 70B model;
  • orientační porovnání kompromisu mezi velikostí modelu a kvantizací;
  • rozhodnutí, zda zvažovat lokální běh, pronájem GPU nebo API.

Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky.

llmfit je terminálový nástroj, který zjistí RAM, CPU, GPU a VRAM počítače a podle nich řadí katalog stovek modelů. Pro každý kandidát kombinuje odhad paměťové použitelnosti, rychlosti, kvality a dostupného kontextu; výsledek lze filtrovat podle typu úlohy, například coding, reasoning nebo multimodální modely.

Tvoje interpretace je tedy správná: llmfit slouží primárně k tomu, aby před spuštěním ukázal, které modely by na daném lokálním stroji měly fungovat dobře. Nejde ale o jistotu ani o automatický výběr jediného „nejlepšího“ modelu. Výpočet rychlosti je odhad založený hlavně na propustnosti paměti a údaje o fitu závisejí také na zvoleném kontextu, kvantizaci a runtime.

Nástroj umí pracovat s více GPU, architekturami MoE a dynamicky volí nejvyšší kvalitu kvantizace, která se vejde do dostupné paměti. Pokud se model nevejde celý do VRAM, rozlišuje běh na GPU, MoE s offloadem expertů, kombinaci CPU+GPU a pouze CPU. Výsledky s příliš těsnou paměťovou rezervou řadí až za doporučené kandidáty.

Základní použití po instalaci přes Homebrew nebo Python uv je:

brew install AlexsJones/llmfit/llmfit
# nebo
uv tool install -U llmfit
 
llmfit fit
llmfit recommend --json --use-case coding --limit 3
llmfit info "Mistral-7B"

Příkaz llmfit fit vypíše modely seřazené podle vhodnosti. llmfit recommend vrací nejlepší kandidáty a s přepínačem –json je vhodný i pro skripty nebo agenty. llmfit info zobrazí podrobný rozbor konkrétního modelu včetně předpokladů odhadu a doporučení pro ověření.

Pro plánování jiného nebo budoucího hardwaru lze přepsat detekované hodnoty. Je také možné omezit kontext, pro který se má odhadnout spotřeba paměti:

llmfit --memory=24G --ram=64G --cpu-cores=8 fit
llmfit --max-context 8192 recommend --json --limit 5
llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json

Kromě odhadu umí llmfit bench změřit tokeny za sekundu a čas do prvního tokenu proti již spuštěnému lokálnímu provideru, například Ollama, llama.cpp, MLX nebo vLLM. Naměřená data se ukládají lokálně a mají přednost před odhadem při dalších doporučeních na stejném hardwaru. To je vhodný poslední krok po výběru modelu, nikoli náhrada za jeho první výběr.

llmfit dále rozpozná lokální runtime a v interaktivním TUI umí stahovat modely přes Ollama, llama.cpp, MLX, Docker Model Runner nebo LM Studio. Připojení k Ollama běžící na jiném stroji lze nastavit proměnnou OLLAMA_HOST.

LLM Checker je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All.

Základní postup je:

npm install -g llm-checker
llm-checker hw-detect
llm-checker recommend --category coding

Přesně tento stručný postup ukazuje i příspěvek Akshaye Pachaara na X. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací.

Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů.

Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Pro výběr modelu na hotovém nebo simulovaném stroji je vhodné použít llmfit; pracuje s detekovaným hardwarem, kvantizací i kontextem a vysvětlí předpoklady odhadu. Doporučení je potom potřeba ověřit spuštěním konkrétního modelu a benchmarkem, například přes llmfit bench nebo LLM Checker s Ollama.

Pro praktické použití stačí tento postup:

  1. V kalkulačce vybrat zamýšlený typ modelu, velikost a hardware.
  2. Vybrat takovou konfiguraci, která má rezervu vedle samotných vah modelu.
  3. Na hotovém stroji spustit llmfit fit nebo llmfit recommend –use-case <typ-uloha> a zkontrolovat doporučené modely i jejich předpoklady.
  4. Vybraný model stáhnout ve zvoleném runtime a změřit rychlost i reálnou spotřebu paměti na vlastních promptech.
  5. Pokud výkon nebo kontext nestačí, upravit kvantizaci, velikost modelu nebo hardware.
Potřeba Vhodný nástroj
Návrh sestavy nebo nákupu GPU AI Hardware Calculator
Rychlý odhad modelů pro zadanou VRAM AI Hardware Calculator
Analýza aktuálního počítače a řazení stovek modelů llmfit
Simulace RAM, VRAM nebo délky kontextu pro budoucí hardware llmfit
Doporučení modelu pro coding, reasoning nebo multimodalitu llmfit nebo LLM Checker
Výběr, stažení a porovnání lokálních modelů v Ollama llmfit nebo LLM Checker
Ověření skutečné rychlosti llmfit, LLM Checker a reálný benchmark
  • ai/hardware/vyber-lokalniho-llm-podle-hardwaru.txt
  • Poslední úprava: 16.08.2026 18:37
  • autor: Petr Nosek