====== vLLM stack pro Qwen3.8-27B na RTX 3090 ====== //Vytvořeno: **29.8.2026** | Aktualizováno: **~~LASTMOD~~// [[https://github.com/syv-ai/qwen38-27b-rtx3090|qwen38-27b-rtx3090]] je připravený serving stack pro Qwen3.8-27B na jedné RTX 3090 s 24 GB VRAM. Staví na vLLM, Dockeru, konkrétní 4bitové variantě modelu a sadě patchů, které cílí na nízkou odezvu jednoho uživatele nebo vysokou agregovanou propustnost API. ===== Nejde o běžné vLLM nasazení ===== Projekt není jen příkaz ''vllm serve''. Připravuje model, přidává vlastní patche k přesné verzi vLLM a používá vyladěné režimy kvantizace, KV cache a spekulativního dekódování. Modelový artefakt je proto určený pro tento stack a není automaticky zaměnitelný s GGUF modelem pro ''llama.cpp'' ani s artefaktem pro [[ai:lokalni-ai:runtimy:ninfer-3090|NInfer-3090]]. Výchozí Docker Compose nabízí dva profily: * **single** pro jednoho nebo několik interaktivních uživatelů; * **batch** pro API backend a velký počet souběžných požadavků. Oba režimy vystavují OpenAI-compatible API. Jedna GPU ale obsluhuje vždy jen jeden vybraný režim, ne oba zároveň. ===== Optimalizace ===== Stack kombinuje 4bitové váhy s několika technikami pro zkrácení decode fáze: * MTP spekulativní dekódování; * DFlash2 jako alternativní block drafter pro single-user provoz; * prefix cache pro navazující dotazy nad stejným dokumentem či kontextem; * vlastní kvantizaci části vah a draft modulu; * upravenou práci s KV cache pro delší kontext. Spekulativní dekódování nezvyšuje schopnosti modelu. Zrychluje generování tehdy, když se levnější draft modul dostatečně často trefí do tokenů, které by vybral hlavní model. Přínos proto závisí na typu promptu, samplingových parametrech, délce kontextu i počtu souběžných uživatelů. ===== Deklarované výsledky a jejich interpretace ===== README uvádí na RTX 3090 omezené na 250 W přibližně 121 až 133 tok/s pro jeden stream podle profilu, spekulativního režimu a způsobu měření. V batch režimu uvádí zhruba 1 035 tok/s stabilní decode propustnosti při 64 souběžných požadavcích. Tyto hodnoty jsou benchmarky autorů na jejich modelovém artefaktu a jejich promtech; nejsou přenositelnou garancí. Projekt obsahuje vlastní srovnání s [[https://github.com/Don-Chad/ninfer-3090|NInfer-3090]]. Přímé pořadí z něj nelze vyvozovat: NInfer používá jiný artefakt, benchmarkuje jiné prompty a má v referenčním testu zapnutý reasoning, zatímco vLLM stack v části testů reasoning vypíná. Rozdíl mezi decode rychlostí a end-to-end propustností je také nutné držet odděleně. Kontext je další samostatný kompromis. Projekt uvádí režimy od zhruba 64k přes 150k až po experimentální konfigurace nad 250k tokenů. Delší profily mohou používat ztrátovou KV cache, snížit počet rezidentních požadavků nebo zvýšit čas do prvního tokenu. Kapacita alokované KV cache není sama o sobě důkazem kvality při dlouhém kontextu. ===== Instalace a provozní rizika ===== Nejjednodušší cesta je Docker image a Docker Compose z repozitáře. První spuštění stáhne image a model, provede přípravu modelu a vytvoří cache. README pro ruční instalaci uvádí 24GB Ampere nebo novější GPU, aktuální NVIDIA ovladač, Python 3.12 a přibližně 40 GB volného místa. Projekt váže patche na konkrétní verzi vLLM. Upgrade vLLM nebo změna modelového artefaktu může provoz rozbít či změnit výsledky benchmarku. Před upgradem je proto potřeba spustit dodaný ''verify.sh'' a znovu změřit vlastní zátěž. Server standardně poslouchá na ''0.0.0.0''. Pokud nemá být dostupný jen z důvěryhodného lokálního prostředí, je nutné nastavit API klíč, nevystavovat port přímo do internetu a řešit síťový přístup samostatnou bezpečnostní vrstvou. ===== Kdy jej zvažovat ===== Tento stack dává smysl pro RTX 3090, pokud je požadováno OpenAI-compatible API pro Qwen3.8-27B a jsou přijatelné Docker, patchovaný vLLM a pravidelné ověřování konfigurace. Pro větší počet souběžných klientů je vhodnější batch režim; pro interaktivní práci nad opakovaným kontextem single-user režim s prefix cache. Před rozhodnutím je vhodné změřit vlastní prompty a oddělit tři metriky: čas do prvního tokenu, rychlost decode a celkovou propustnost všech dokončených požadavků. Bez toho mohou vysoká agregovaná čísla maskovat pomalou odezvu jednotlivého uživatele. ===== Zdroje ===== * [[https://github.com/syv-ai/qwen38-27b-rtx3090|qwen38-27b-rtx3090 – GitHub repository, Docker konfigurace a benchmarky]] * [[https://github.com/Don-Chad/ninfer-3090|NInfer-3090 – srovnávaný specializovaný runtime]]