NInfer-3090: inference Qwen3.8 na RTX 3090
Vytvořeno: 29.8.2026 | Aktualizováno: **29.08.2026 14:22
NInfer-3090 je specializovaný C++20/CUDA inference engine pro Qwen3.8-27B a vybrané Qwen3.6 modely na jedné NVIDIA RTX 3090 nebo 3090 Ti s 24 GB VRAM. Cílí na co nejvyšší výkon pro tuto konkrétní kombinaci modelu a GPU, nikoli na univerzální podporu všech otevřených modelů.
Co runtime poskytuje
NInfer-3090 používá vlastní artefakty ve formátu .ninfer, které nejsou zaměnitelné s GGUF soubory pro llama.cpp ani s běžnými safetensors checkpointy pro vLLM. Runtime načte model, spravuje stránkovanou KV cache a zpřístupňuje OpenAI Chat Completions, OpenAI Responses a Anthropic-compatible API.
Pro výkon používá zejména:
- CUDA Graphs pro snížení režie opakovaných GPU kroků;
- MTP3 spekulativní dekódování;
- ReplaySSM pro omezení paměťové ceny spekulativního dekódování;
- prefix reuse pro opakované nebo společné prompty;
- omezené cohort batching C1 až C8 pro více souběžných požadavků.
C1 znamená jeden aktivní požadavek s prioritou odezvy. C8 dovoluje zpracovat až osm požadavků společně; zvyšuje celkovou propustnost, ale prodlužuje čas k prvnímu tokenu každého požadavku.
Kontext a výkon na RTX 3090
README projektu uvádí pro Qwen3.8-27B s výchozí INT8 KV cache naměřený alokační limit přibližně 171 tisíc tokenů při zachování 1 GiB rezervy VRAM. Experimentální režim rk8v4 může zvýšit kapacitu KV cache přibližně na 226 tisíc tokenů se stejnou rezervou, ale je ztrátový; autoři v konkrétním testu pozorovali horší kvalitu odpovědi. Není proto vhodný jako výchozí konfigurace pro úlohy citlivé na správnost.
V publikovaném dlouhém decode benchmarku s krátkými vstupy, 1 024 generovanými tokeny, MTP3 a reasoningem medium uvádí projekt přibližně 71 tok/s decode pro C1 a 165 tok/s agregovaně pro C8. Tyto hodnoty jsou měřením autorů na konkrétní konfiguraci, nikoli obecnou garancí pro jiný prompt, délku kontextu, sampling nebo verzi modelu.
Vztah k llama.cpp a vLLM
NInfer-3090 není nadstavba nad llama.cpp ani jeho obecná náhrada. llama.cpp je univerzální runtime pro mnoho modelů a zejména GGUF artefakty; NInfer-3090 je úzce optimalizovaný server pro podporované Qwen artefakty na RTX 3090.
qwen38-27b-rtx3090 je samostatný alternativní stack postavený nad vLLM. Jeho README NInfer přímo porovnává, ale jednotlivá čísla nejsou bez dalšího srovnatelná: projekty používají jiné modelové artefakty, prompty, sampling, reasoning i benchmarkovací metodiku.
Platformy a omezení
Windows 11 má připravený release s pomocnými launchery pro jeden interaktivní požadavek, souběžný provoz a vision profily. Na Linuxu lze runtime sestavit ze zdrojů nebo použít Docker; projekt zároveň uvádí, že jeho linuxová výkonová kvalifikace pro reálný artefakt ještě není dokončena.
Je potřeba počítat s těmito hranicemi:
- jeden proces obsluhuje jeden model na jedné RTX 3090;
- neexistuje multi-GPU provoz ani offload vah mezi CPU a GPU;
- souběh, velikost KV poolu a paměťový rozpočet se nastavují při startu;
- tool calls runtime vrátí klientovi, ale sám je nespouští;
- Blackwell-only optimalizace nejsou na architektuře RTX 3090 dostupné.
Kdy jej zvažovat
NInfer-3090 dává smysl, pokud je cílem právě Qwen3.8 nebo podporovaný Qwen3.6 model na samostatné RTX 3090 a důležitý je výkon či délka kontextu. Před nasazením je potřeba ověřit vlastní pracovní zátěž: čas do prvního tokenu, rychlost na realistických promtech, spotřebu VRAM, kvalitu kvantizace a chování při požadovaném souběhu.