Lokální AI
Vytvořeno: 29.8.2026 | Aktualizováno: **29.08.2026 14:58
Lokální AI znamená provoz otevřeného modelu na vlastním počítači nebo serveru. Umožňuje experimentovat bez odesílání promptů externímu poskytovateli, ale odpovědnost za výběr modelu, hardware, bezpečnost API i měření výkonu zůstává na provozovateli.
Čtyři vrstvy lokálního provozu
Pro správný výběr je potřeba oddělit čtyři věci:
- Model je samotná neuronová síť, například Qwen3.5. Rozhoduje o schopnostech pro chat, kódování, reasoning nebo práci s obrazem.
- Artefakt modelu je konkrétní soubor vah a jeho kvantizace. Například GGUF pro
llama.cpp, safetensors pro ekosystém PyTorch/vLLM nebo specializovaný formát runtime. - Inference runtime artefakt načte, spravuje VRAM a KV cache, generuje tokeny a případně vystaví API. Runtimy nejsou univerzálně zaměnitelné: soubor určený pro jeden runtime často nelze načíst v jiném.
- Hardware určuje dostupnou VRAM, propustnost paměti a reálnou rychlost. Před výběrem modelu je vhodné projít výběr lokálního LLM podle hardwaru.
Jak se rozhodovat
Nejdřív je potřeba určit typ úlohy a hardwarový limit, potom zvolit vhodný model a až nakonec runtime i formát jeho vah. Délku kontextu a počet souběžných požadavků je nutné počítat do paměťového rozpočtu; samotná velikost modelu nestačí, protože část VRAM spotřebuje KV cache a režie runtime.
Pro jednorázové lokální testy může být vhodný univerzální runtime. Specializované stacky dávají smysl tehdy, když je cílem konkrétní model, GPU a provozní profil. Příklady pro RTX 3090 jsou NInfer-3090 a vLLM stack pro Qwen3.8-27B.
Související témata
- Lokálně provozované AI modely obsahují hodnocení konkrétních modelů.
- Lokální LLM na GPU pokrývá hardware a základní práci s
llama.cpp. - Unsloth spojuje lokální inference, experimenty a fine-tuning otevřených modelů.