====== Lokální AI ====== //Vytvořeno: **29.8.2026** | Aktualizováno: **~~LASTMOD~~// Lokální AI znamená provoz otevřeného modelu na vlastním počítači nebo serveru. Umožňuje experimentovat bez odesílání promptů externímu poskytovateli, ale odpovědnost za výběr modelu, hardware, bezpečnost API i měření výkonu zůstává na provozovateli. ===== Čtyři vrstvy lokálního provozu ===== Pro správný výběr je potřeba oddělit čtyři věci: * **Model** je samotná neuronová síť, například [[ai:modely:qwen3-5|Qwen3.5]]. Rozhoduje o schopnostech pro chat, kódování, reasoning nebo práci s obrazem. * **Artefakt modelu** je konkrétní soubor vah a jeho kvantizace. Například GGUF pro ''llama.cpp'', safetensors pro ekosystém PyTorch/vLLM nebo specializovaný formát runtime. * **Inference runtime** artefakt načte, spravuje VRAM a KV cache, generuje tokeny a případně vystaví API. Runtimy nejsou univerzálně zaměnitelné: soubor určený pro jeden runtime často nelze načíst v jiném. * **Hardware** určuje dostupnou VRAM, propustnost paměti a reálnou rychlost. Před výběrem modelu je vhodné projít [[ai:hardware:vyber-lokalniho-llm-podle-hardwaru|výběr lokálního LLM podle hardwaru]]. ===== Jak se rozhodovat ===== Nejdřív je potřeba určit typ úlohy a hardwarový limit, potom zvolit vhodný model a až nakonec runtime i formát jeho vah. Délku kontextu a počet souběžných požadavků je nutné počítat do paměťového rozpočtu; samotná velikost modelu nestačí, protože část VRAM spotřebuje KV cache a režie runtime. Pro jednorázové lokální testy může být vhodný univerzální runtime. Specializované stacky dávají smysl tehdy, když je cílem konkrétní model, GPU a provozní profil. Příklady pro RTX 3090 jsou [[ai:lokalni-ai:runtimy:ninfer-3090|NInfer-3090]] a [[ai:lokalni-ai:runtimy:vllm-qwen38-27b-rtx3090|vLLM stack pro Qwen3.8-27B]]. ===== Související témata ===== * [[ai:lokalni-ai:modely:start|Lokálně provozované AI modely]] obsahují hodnocení konkrétních modelů. * [[ai:hardware:lokalni-llm-na-gpu|Lokální LLM na GPU]] pokrývá hardware a základní práci s ''llama.cpp''. * [[ai:lokalni-ai:trenink-a-fine-tuning:unsloth|Unsloth]] spojuje lokální inference, experimenty a fine-tuning otevřených modelů.