Vytvořeno: 29.8.2026 | Aktualizováno: **29.08.2026 14:22
NInfer-3090 je specializovaný C++20/CUDA inference engine pro Qwen3.8-27B a vybrané Qwen3.6 modely na jedné NVIDIA RTX 3090 nebo 3090 Ti s 24 GB VRAM. Cílí na co nejvyšší výkon pro tuto konkrétní kombinaci modelu a GPU, nikoli na univerzální podporu všech otevřených modelů.
NInfer-3090 používá vlastní artefakty ve formátu .ninfer, které nejsou zaměnitelné s GGUF soubory pro llama.cpp ani s běžnými safetensors checkpointy pro vLLM. Runtime načte model, spravuje stránkovanou KV cache a zpřístupňuje OpenAI Chat Completions, OpenAI Responses a Anthropic-compatible API.
Pro výkon používá zejména:
C1 znamená jeden aktivní požadavek s prioritou odezvy. C8 dovoluje zpracovat až osm požadavků společně; zvyšuje celkovou propustnost, ale prodlužuje čas k prvnímu tokenu každého požadavku.
README projektu uvádí pro Qwen3.8-27B s výchozí INT8 KV cache naměřený alokační limit přibližně 171 tisíc tokenů při zachování 1 GiB rezervy VRAM. Experimentální režim rk8v4 může zvýšit kapacitu KV cache přibližně na 226 tisíc tokenů se stejnou rezervou, ale je ztrátový; autoři v konkrétním testu pozorovali horší kvalitu odpovědi. Není proto vhodný jako výchozí konfigurace pro úlohy citlivé na správnost.
V publikovaném dlouhém decode benchmarku s krátkými vstupy, 1 024 generovanými tokeny, MTP3 a reasoningem medium uvádí projekt přibližně 71 tok/s decode pro C1 a 165 tok/s agregovaně pro C8. Tyto hodnoty jsou měřením autorů na konkrétní konfiguraci, nikoli obecnou garancí pro jiný prompt, délku kontextu, sampling nebo verzi modelu.
NInfer-3090 není nadstavba nad llama.cpp ani jeho obecná náhrada. llama.cpp je univerzální runtime pro mnoho modelů a zejména GGUF artefakty; NInfer-3090 je úzce optimalizovaný server pro podporované Qwen artefakty na RTX 3090.
qwen38-27b-rtx3090 je samostatný alternativní stack postavený nad vLLM. Jeho README NInfer přímo porovnává, ale jednotlivá čísla nejsou bez dalšího srovnatelná: projekty používají jiné modelové artefakty, prompty, sampling, reasoning i benchmarkovací metodiku.
Windows 11 má připravený release s pomocnými launchery pro jeden interaktivní požadavek, souběžný provoz a vision profily. Na Linuxu lze runtime sestavit ze zdrojů nebo použít Docker; projekt zároveň uvádí, že jeho linuxová výkonová kvalifikace pro reálný artefakt ještě není dokončena.
Je potřeba počítat s těmito hranicemi:
NInfer-3090 dává smysl, pokud je cílem právě Qwen3.8 nebo podporovaný Qwen3.6 model na samostatné RTX 3090 a důležitý je výkon či délka kontextu. Před nasazením je potřeba ověřit vlastní pracovní zátěž: čas do prvního tokenu, rychlost na realistických promtech, spotřebu VRAM, kvalitu kvantizace a chování při požadovaném souběhu.