Obsah

Lokální AI

Vytvořeno: 29.8.2026 | Aktualizováno: **29.08.2026 14:58

Lokální AI znamená provoz otevřeného modelu na vlastním počítači nebo serveru. Umožňuje experimentovat bez odesílání promptů externímu poskytovateli, ale odpovědnost za výběr modelu, hardware, bezpečnost API i měření výkonu zůstává na provozovateli.

Čtyři vrstvy lokálního provozu

Pro správný výběr je potřeba oddělit čtyři věci:

Jak se rozhodovat

Nejdřív je potřeba určit typ úlohy a hardwarový limit, potom zvolit vhodný model a až nakonec runtime i formát jeho vah. Délku kontextu a počet souběžných požadavků je nutné počítat do paměťového rozpočtu; samotná velikost modelu nestačí, protože část VRAM spotřebuje KV cache a režie runtime.

Pro jednorázové lokální testy může být vhodný univerzální runtime. Specializované stacky dávají smysl tehdy, když je cílem konkrétní model, GPU a provozní profil. Příklady pro RTX 3090 jsou NInfer-3090 a vLLM stack pro Qwen3.8-27B.

Související témata