====== NInfer-3090: inference Qwen3.8 na RTX 3090 ====== //Vytvořeno: **29.8.2026** | Aktualizováno: **~~LASTMOD~~// [[https://github.com/Don-Chad/ninfer-3090|NInfer-3090]] je specializovaný C++20/CUDA inference engine pro Qwen3.8-27B a vybrané Qwen3.6 modely na jedné NVIDIA RTX 3090 nebo 3090 Ti s 24 GB VRAM. Cílí na co nejvyšší výkon pro tuto konkrétní kombinaci modelu a GPU, nikoli na univerzální podporu všech otevřených modelů. ===== Co runtime poskytuje ===== NInfer-3090 používá vlastní artefakty ve formátu ''.ninfer'', které nejsou zaměnitelné s GGUF soubory pro ''llama.cpp'' ani s běžnými safetensors checkpointy pro vLLM. Runtime načte model, spravuje stránkovanou KV cache a zpřístupňuje OpenAI Chat Completions, OpenAI Responses a Anthropic-compatible API. Pro výkon používá zejména: * CUDA Graphs pro snížení režie opakovaných GPU kroků; * MTP3 spekulativní dekódování; * ReplaySSM pro omezení paměťové ceny spekulativního dekódování; * prefix reuse pro opakované nebo společné prompty; * omezené cohort batching C1 až C8 pro více souběžných požadavků. C1 znamená jeden aktivní požadavek s prioritou odezvy. C8 dovoluje zpracovat až osm požadavků společně; zvyšuje celkovou propustnost, ale prodlužuje čas k prvnímu tokenu každého požadavku. ===== Kontext a výkon na RTX 3090 ===== README projektu uvádí pro Qwen3.8-27B s výchozí INT8 KV cache naměřený alokační limit přibližně 171 tisíc tokenů při zachování 1 GiB rezervy VRAM. Experimentální režim ''rk8v4'' může zvýšit kapacitu KV cache přibližně na 226 tisíc tokenů se stejnou rezervou, ale je ztrátový; autoři v konkrétním testu pozorovali horší kvalitu odpovědi. Není proto vhodný jako výchozí konfigurace pro úlohy citlivé na správnost. V publikovaném dlouhém decode benchmarku s krátkými vstupy, 1 024 generovanými tokeny, MTP3 a reasoningem ''medium'' uvádí projekt přibližně 71 tok/s decode pro C1 a 165 tok/s agregovaně pro C8. Tyto hodnoty jsou měřením autorů na konkrétní konfiguraci, nikoli obecnou garancí pro jiný prompt, délku kontextu, sampling nebo verzi modelu. ===== Vztah k llama.cpp a vLLM ===== NInfer-3090 není nadstavba nad ''llama.cpp'' ani jeho obecná náhrada. ''llama.cpp'' je univerzální runtime pro mnoho modelů a zejména GGUF artefakty; NInfer-3090 je úzce optimalizovaný server pro podporované Qwen artefakty na RTX 3090. [[https://github.com/syv-ai/qwen38-27b-rtx3090|qwen38-27b-rtx3090]] je samostatný alternativní stack postavený nad vLLM. Jeho README NInfer přímo porovnává, ale jednotlivá čísla nejsou bez dalšího srovnatelná: projekty používají jiné modelové artefakty, prompty, sampling, reasoning i benchmarkovací metodiku. ===== Platformy a omezení ===== Windows 11 má připravený release s pomocnými launchery pro jeden interaktivní požadavek, souběžný provoz a vision profily. Na Linuxu lze runtime sestavit ze zdrojů nebo použít Docker; projekt zároveň uvádí, že jeho linuxová výkonová kvalifikace pro reálný artefakt ještě není dokončena. Je potřeba počítat s těmito hranicemi: * jeden proces obsluhuje jeden model na jedné RTX 3090; * neexistuje multi-GPU provoz ani offload vah mezi CPU a GPU; * souběh, velikost KV poolu a paměťový rozpočet se nastavují při startu; * tool calls runtime vrátí klientovi, ale sám je nespouští; * Blackwell-only optimalizace nejsou na architektuře RTX 3090 dostupné. ===== Kdy jej zvažovat ===== NInfer-3090 dává smysl, pokud je cílem právě Qwen3.8 nebo podporovaný Qwen3.6 model na samostatné RTX 3090 a důležitý je výkon či délka kontextu. Před nasazením je potřeba ověřit vlastní pracovní zátěž: čas do prvního tokenu, rychlost na realistických promtech, spotřebu VRAM, kvalitu kvantizace a chování při požadovaném souběhu. ===== Zdroje ===== * [[https://github.com/Don-Chad/ninfer-3090|NInfer-3090 – GitHub repository a dokumentace]] * [[https://github.com/syv-ai/qwen38-27b-rtx3090|qwen38-27b-rtx3090 – alternativní vLLM stack a srovnání]]