ai:lokalni-ai:uvod

Lokální AI

Vytvořeno: 29.8.2026 | Aktualizováno: **29.08.2026 14:58

Lokální AI znamená provoz otevřeného modelu na vlastním počítači nebo serveru. Umožňuje experimentovat bez odesílání promptů externímu poskytovateli, ale odpovědnost za výběr modelu, hardware, bezpečnost API i měření výkonu zůstává na provozovateli.

Pro správný výběr je potřeba oddělit čtyři věci:

  • Model je samotná neuronová síť, například Qwen3.5. Rozhoduje o schopnostech pro chat, kódování, reasoning nebo práci s obrazem.
  • Artefakt modelu je konkrétní soubor vah a jeho kvantizace. Například GGUF pro llama.cpp, safetensors pro ekosystém PyTorch/vLLM nebo specializovaný formát runtime.
  • Inference runtime artefakt načte, spravuje VRAM a KV cache, generuje tokeny a případně vystaví API. Runtimy nejsou univerzálně zaměnitelné: soubor určený pro jeden runtime často nelze načíst v jiném.
  • Hardware určuje dostupnou VRAM, propustnost paměti a reálnou rychlost. Před výběrem modelu je vhodné projít výběr lokálního LLM podle hardwaru.

Nejdřív je potřeba určit typ úlohy a hardwarový limit, potom zvolit vhodný model a až nakonec runtime i formát jeho vah. Délku kontextu a počet souběžných požadavků je nutné počítat do paměťového rozpočtu; samotná velikost modelu nestačí, protože část VRAM spotřebuje KV cache a režie runtime.

Pro jednorázové lokální testy může být vhodný univerzální runtime. Specializované stacky dávají smysl tehdy, když je cílem konkrétní model, GPU a provozní profil. Příklady pro RTX 3090 jsou NInfer-3090 a vLLM stack pro Qwen3.8-27B.

  • ai/lokalni-ai/uvod.txt
  • Poslední úprava: 29.08.2026 14:58
  • autor: Petr Nosek