Obsah

Výběr lokálního LLM podle hardwaru

Vytvořeno: 30.7.2026 | Aktualizováno: 30.07.2026 12:28

LLM Checker a AI Hardware Calculator pomáhají odhadnout, které modely lze provozovat lokálně. Kalkulačka je vhodná pro rychlé plánování podle GPU a VRAM, LLM Checker pro analýzu konkrétního počítače, výběr modelu a práci s Ollama.

Co je při výběru modelu důležité

Velikost modelu sama o sobě nestačí. Pro lokální inference je potřeba zohlednit zejména:

Výstup podobného nástroje je odhad, nikoli garance. Skutečnou použitelnost ovlivní runtime, nastavená délka kontextu, paralelní požadavky, volná paměť a konkrétní verze modelu.

AI Hardware Calculator

AI Hardware Calculator od Made By Agents je webový nástroj pro předběžné posouzení hardwaru. Lze vybrat nebo ručně zadat GPU, typ modelu, jeho velikost, kvantizaci a architekturu Dense nebo MoE.

Kalkulačka podle své dokumentace počítá požadovanou paměť z vah modelu, KV cache a pevné runtime režie. Z propustnosti paměti GPU potom odhaduje rychlost v tokenech za sekundu a doporučí nejkvalitnější kvantizaci, která se vejde do dostupné paměti. Výpočty probíhají v prohlížeči; automatická detekce využívá WebGPU a lze ji nahradit ručním výběrem přesného hardwaru.

Hodí se hlavně pro tyto situace:

Jeho omezením je nutně zjednodušený model výkonu. Odhad rychlosti nenahrazuje benchmark na konkrétním runtime a údaje z automatické detekce GPU mohou být nepřesné, zejména u integrované nebo notebookové grafiky.

LLM Checker

LLM Checker je CLI nástroj pro Node.js. Zjistí CPU, GPU, RAM a podporovaný backend a nad katalogem modelů vytváří doporučení pro konkrétní použití. Podporuje mimo jiné modelový katalog Ollama a přes vícezdrojový registr také konkrétní artefakty z Hugging Face, Ollama a GPT4All.

Základní postup je:

npm install -g llm-checker
llm-checker hw-detect
llm-checker recommend --category coding

Přesně tento stručný postup ukazuje i příspěvek Akshaye Pachaara na X. Pro již používaný lokální stroj je praktičtější než obecná kalkulačka, protože pracuje s jeho zjištěnou konfigurací.

Nástroj porovnává kandidáty podle čtyř hledisek: kvality, rychlosti, míry zaplnění paměti a kontextu. Výstup může obsahovat i příkaz pro stažení modelu. Integrace s Ollama dále umožňuje porovnat nainstalované modely, spustit prompt s měřením rychlosti v tokenech za sekundu nebo vytvořit kapacitní plán pro běh modelů.

Doporučený postup

Pro výběr nového hardwaru je vhodné začít kalkulačkou. Pomůže zúžit požadavky na VRAM a ukázat, jaký rozsah modelů je realistický. Po zprovoznění počítače je potřeba doporučení ověřit pomocí LLM Checkeru a nakonec konkrétní model skutečně spustit a změřit.

Pro praktické použití stačí tento postup:

  1. V kalkulačce vybrat zamýšlený typ modelu, velikost a hardware.
  2. Vybrat takovou konfiguraci, která má rezervu vedle samotných vah modelu.
  3. Na hotovém stroji spustit llm-checker hw-detect a doporučení pro konkrétní typ úlohy.
  4. Stáhnout vybraný model v Ollama a změřit rychlost i reálnou spotřebu paměti na vlastních promptech.
  5. Pokud výkon nebo kontext nestačí, upravit kvantizaci, velikost modelu nebo hardware.

Kdy použít který nástroj

Potřeba Vhodný nástroj
Návrh sestavy nebo nákupu GPU AI Hardware Calculator
Rychlý odhad modelů pro zadanou VRAM AI Hardware Calculator
Analýza aktuálního počítače LLM Checker
Doporučení modelu pro coding nebo reasoning LLM Checker
Výběr, stažení a porovnání lokálních modelů v Ollama LLM Checker
Ověření skutečné rychlosti LLM Checker a reálný benchmark

Zdroje