====== vLLM Recipes ====== //Vytvořeno: **23.9.2026** | Aktualizováno: **~~LASTMOD~~**// [[https://recipes.vllm.ai/|vLLM Recipes]] je komunitně spravovaný katalog konfigurací pro spuštění otevřených modelů přes inference runtime [[https://docs.vllm.ai/|vLLM]]. Pro zvolený model, hardware, variantu vah a strategii nasazení sestaví příkaz ''vllm serve''. ===== Co katalog obsahuje ===== Recept je strukturovaný záznam pro konkrétní model na Hugging Face. Může definovat minimální verzi vLLM, varianty přesnosti a kvantizace, minimální VRAM, závislosti, volitelné funkce a podporované strategie paralelizace. Web z těchto dat generuje interaktivní builder příkazu i JSON API pro další nástroje. Zdrojové recepty jsou v [[https://github.com/vllm-project/recipes|otevřeném repozitáři vllm-project/recipes]] jako samostatné YAML soubory. Jejich schéma, výpočet minimální VRAM a validační postup popisuje [[https://github.com/vllm-project/recipes/blob/main/CONTRIBUTING.md|návod pro přispívání]]. Tento projekt není samostatný inference server ani katalog modelů. Je to provozní vrstva nad vLLM: pomáhá převést volbu modelu a hardwaru na konkrétní startovní konfiguraci. ===== Jak s ním pracovat ===== - Vyber přesný model, ne pouze jeho rodinu. - Nastav použitý hardware, variantu vah a strategii nasazení. - Zkontroluj verzi vLLM, minimální VRAM, nutné závislosti a parametry vygenerovaného příkazu. - Výsledek použij jako výchozí konfiguraci a změř ho na vlastním workloadu. U rozsáhlejších modelů jsou podstatné zejména volby pro tensorovou, expertovou nebo datovou paralelizaci a rozdělení prefill/decode. Recept tak pomáhá vyhnout se náhodnému skládání parametrů bez vazby na konkrétní hardware. ===== Ověření hardwaru ===== Označení **verified** znamená, že daný hardware byl s receptem otestovaný end-to-end. Hardware bez tohoto označení není automaticky nepodporovaný; projekt jen nevyvozuje ověření bez skutečného testu. ===== Omezení ===== Recept není náhradou za vlastní provozní validaci. Dostupná VRAM, délka kontextu, souběžnost požadavků, použitá kvantizace a verze runtime ovlivňují, zda konfigurace skutečně vyhoví konkrétní zátěži. Vygenerovaný příkaz je proto vhodné považovat za zdokumentovaný výchozí bod, ne za univerzální benchmark nebo garanci výkonu. ===== Související články ===== * [[ai:lokalni-ai:runtimy:vllm-qwen38-27b-rtx3090|vLLM stack pro Qwen3.8-27B na RTX 3090]] je konkrétní provozní konfigurace. ===== Zdroje ===== * [[https://recipes.vllm.ai/|vLLM Recipes]] * [[https://github.com/vllm-project/recipes|vllm-project/recipes – zdrojový repozitář]] * [[https://github.com/vllm-project/recipes/blob/main/CONTRIBUTING.md|vLLM Recipes – schéma receptů a pravidla pro příspěvky]]