vLLM Recipes
Vytvořeno: 23.9.2026 | Aktualizováno: 23.09.2026 20:18
vLLM Recipes je komunitně spravovaný katalog konfigurací pro spuštění otevřených modelů přes inference runtime vLLM. Pro zvolený model, hardware, variantu vah a strategii nasazení sestaví příkaz vllm serve.
Co katalog obsahuje
Recept je strukturovaný záznam pro konkrétní model na Hugging Face. Může definovat minimální verzi vLLM, varianty přesnosti a kvantizace, minimální VRAM, závislosti, volitelné funkce a podporované strategie paralelizace. Web z těchto dat generuje interaktivní builder příkazu i JSON API pro další nástroje.
Zdrojové recepty jsou v otevřeném repozitáři vllm-project/recipes jako samostatné YAML soubory. Jejich schéma, výpočet minimální VRAM a validační postup popisuje návod pro přispívání.
Tento projekt není samostatný inference server ani katalog modelů. Je to provozní vrstva nad vLLM: pomáhá převést volbu modelu a hardwaru na konkrétní startovní konfiguraci.
Jak s ním pracovat
- Vyber přesný model, ne pouze jeho rodinu.
- Nastav použitý hardware, variantu vah a strategii nasazení.
- Zkontroluj verzi vLLM, minimální VRAM, nutné závislosti a parametry vygenerovaného příkazu.
- Výsledek použij jako výchozí konfiguraci a změř ho na vlastním workloadu.
U rozsáhlejších modelů jsou podstatné zejména volby pro tensorovou, expertovou nebo datovou paralelizaci a rozdělení prefill/decode. Recept tak pomáhá vyhnout se náhodnému skládání parametrů bez vazby na konkrétní hardware.
Ověření hardwaru
Označení verified znamená, že daný hardware byl s receptem otestovaný end-to-end. Hardware bez tohoto označení není automaticky nepodporovaný; projekt jen nevyvozuje ověření bez skutečného testu.
Omezení
Recept není náhradou za vlastní provozní validaci. Dostupná VRAM, délka kontextu, souběžnost požadavků, použitá kvantizace a verze runtime ovlivňují, zda konfigurace skutečně vyhoví konkrétní zátěži. Vygenerovaný příkaz je proto vhodné považovat za zdokumentovaný výchozí bod, ne za univerzální benchmark nebo garanci výkonu.
Související články
- vLLM stack pro Qwen3.8-27B na RTX 3090 je konkrétní provozní konfigurace.