Vytvořeno: 25.9.2026 | Aktualizováno: 25.09.2026 20:43
Pronajatý vyhrazený server s otevřeným modelem je alternativa k nákupu vlastního hardwaru pro lokální AI. Může dávat smysl pro firmu, která chce model provozovat odděleně od sdíleného AI API, ale nechce sama pořizovat a spravovat GPU server.
Článek zachycuje nabídku a testovací data, které poskytla společnost Nethost na základě poptávky. Nejde o nezávislé srovnání poskytovatelů ani o potvrzení regulatorní způsobilosti služby.
Nethost nabízí sdílené API účtované podle tokenů. Přes API se odesílá dotaz a vrací výsledek; podle ceníku AI API jsou dostupné lokální i sdílené externí modely včetně informací o kontextovém okně.
Podle odpovědi Nethostu je tato varianta vhodná pro výpočetně náročnější úlohy, vytěžování dat a levné ověření use-casu. Pro realtime chat nebo boty ji Nethost nedoporučuje. Ceník je proměnlivý a podle obdržené informace se Nethostu týká jen několik prvních položek; aktuální cenu a model je proto potřeba ověřit přímo v ceníku.
Druhou variantou je hardware vyčleněný pro konkrétního zákazníka, na kterém běží vybraný lokální model. Nethost nabízí u konfigurace s NVIDIA GB10 dvě možnosti provozu:
Podle Nethostu se vhodná konfigurace určuje až podle modelu, který má být provozován. Z poskytnuté nabídky vyplývají tyto příklady:
| Konfigurace | Cena bez DPH za měsíc | Poznámka |
|---|---|---|
| NPU/GPU NVIDIA GB10 Grace Blackwell, 20CORE, 128 GB | 4 999 Kč | Root přístup nebo přístup k Nethostem provozovanému API s vybraným modelem. |
| NPU/GPU AI Hosting Apple Silicon M4/14C, 64 GB RAM UM | 5 132 Kč | Další nabízená varianta hardwaru. |
Vyhrazený hardware může být provozní alternativou k veřejnému sdílenému API, ale samotné označení „vyhrazený server“ neprokazuje splnění regulatorních ani bezpečnostních požadavků. Před nasazením citlivých dat je potřeba smluvně a technicky ověřit zejména:
Volba mezi root přístupem a poskytovatelem spravovaným API je proto podstatná: první varianta přesouvá více odpovědnosti na zákazníka, druhá vyžaduje přesněji definovat provozní a smluvní garance poskytovatele.
Nethost poskytl HTML report s mediánem rychlosti generování a mediánem času do prvního tokenu. Report neuvádí použitý hardware, kvantizaci, délku vstupu a výstupu, souběžnost požadavků, verze modelů ani datum testu. Čísla proto ukazují pouze naměřený profil dodaného testu a nelze z nich odvozovat obecné srovnání modelů ani garantovaný výkon konkrétní konfigurace.
| Model | Tokeny za sekundu (p50) | Čas do prvního tokenu v sekundách (p50) |
|---|---|---|
nethost/gemma4:31b | 14,15 | 1,05 |
nethost/gemma4:e4b | 18,91 | 0,71 |
nethost/gpt-oss:120b | 38,44 | 0,67 |
nethost/gpt-oss:20b | 31,38 | 1,02 |
nethost/llama3.1:8b | 15,05 | 0,75 |
nethost/llama3.2:3b | 32,09 | 0,38 |
nethost/llama3:8b | 16,94 | 0,71 |
nethost/llava:34b | 14,26 | 0,84 |
nethost/qwen3.5:35b-a3b | 16,66 | 1,11 |
nethost/qwen3.6:35b-a3b | 26,66 | 0,55 |
nethost/qwen3.8:27b | 28,63 | 0,95 |
V rámci tohoto reportu měl nejvyšší medián generování nethost/gpt-oss:120b s 38,44 tokenu za sekundu. Nejkratší medián času do prvního tokenu měl nethost/llama3.2:3b s 0,38 s.
Pronajatý vyhrazený hardware rozšiřuje možnosti lokální AI o provozní model, ve kterém firma nepořizuje vlastní GPU server. Před výběrem je potřeba stanovit model, požadovanou velikost kontextu, počet souběžných uživatelů, způsob správy a požadavky na zpracování dat. Teprve podle těchto parametrů lze vybrat hardware a rozhodnout, zda je vhodný vlastní provoz s root přístupem, nebo poskytovatelem spravované API.
AI Speed Test Report.