====== Referenční sestavy pro lokální AI ====== //Vytvořeno: **11.9.2026** | Aktualizováno: **~~LASTMOD~~**// Referenční sestava je konkrétně popsaný počítač nebo server, podle kterého lze při plánování lokální AI porovnat VRAM, propustnost paměti, výkon, spotřebu a cenu. Nejde o univerzální doporučení k nákupu: použitelnost vždy závisí na modelu, kvantizaci, délce kontextu, runtime a požadované souběžnosti. Tento článek postupně shromažďuje výrazně odlišné konfigurace od desktopových pracovních stanic po více-GPU servery. Souvislosti k výběru GPU a VRAM pokrývá [[ai:hardware:lokalni-llm-na-gpu|Lokální LLM na GPU]]; pro volbu modelu podle dostupného hardwaru je určen [[ai:hardware:vyber-lokalniho-llm-podle-hardwaru|Výběr lokálního LLM podle hardwaru]]. ===== Jak číst srovnání ===== Kapacita VRAM rozhoduje hlavně o tom, jak velký model, kvantizaci a kontext lze držet v paměti. Paměťová propustnost ovlivňuje zejména rychlost generování. Větší počet GPU nebo vyšší teoretický FP32 výkon proto sám o sobě neznamená úměrně rychlejší odezvu pro jeden požadavek. Údaj v tokenech za sekundu, maximální throughput, kontext a odběr nelze přenášet mezi modely. Je nutné vždy zapsat alespoň referenční model, jeho kvantizaci, runtime, délku kontextu, počet souběžných požadavků a způsob měření. ===== Kosmik Compute: časový snímek nabídky ===== [[https://koscompute.com/ai-servers/|Kosmik Compute]] nabízí hotové GPU servery pro lokální LLM inference. Jejich přehled je užitečný tím, že u každé sestavy uvádí referenční model, kontext, rychlost pro jeden požadavek, agregovaný throughput a optimalizovaný odběr při AI zátěži. Následující tabulka je **snímek stránky přečtené 11.9.2026**. Ceny jsou bez DPH; skladová dostupnost, cena i komponenty se mohou změnit. Výkonové údaje v každém řádku platí pouze pro uvedený referenční model a podmínky prodejce. ^ Sestava ^ VRAM a GPU ^ Referenční model ^ Max. kontext ^ Jeden požadavek ^ Max. throughput ^ Optimalizovaný odběr ^ Cena bez DPH ^ | Kosmik Comet | 32 GB; 1× RTX 5090 | Qwen 3.8 27B NVFP4 | 160k | 120–140 tok/s | 550–620 tok/s (4 souběžně) | 540 W | 190 000 Kč | | Kosmik Pulsar | 96 GB; 1× RTX 6000 PRO Max-Q | Qwen3.8-Flash-Next NVFP4 + MTP | 262k | 150–170 tok/s | 550–620 tok/s (8 souběžně) | 370 W | 350 000 Kč | | Kosmik Binary | 192 GB; 2× RTX 6000 PRO Max-Q | GLM-5.3-Flash NVFP4 | 1M | 170–190 tok/s | 900–1 000 tok/s (16 souběžně) | 650 W | 670 000 Kč | | Kosmik Quasar | 384 GB; 4× RTX 6000 PRO Max-Q | GLM-5.3-Flash NVFP4 | 1M | 170–190 tok/s | 1 800–2 000 tok/s (32 souběžně) | 1,3 kW | 1 390 000 Kč | | Kosmik Supernova | 768 GB; 8× RTX 6000 PRO Max-Q | GLM-5.3 full NVFP4 | 1M | 120–130 tok/s | 1 000–1 150 tok/s (128 souběžně) | 2,7 kW | 2 900 000 Kč | Stránka v tomto okamžiku uváděla, že všechny sestavy jsou použité a mají roční záruku. Uvedený throughput je agregovaný výkon při souběžném běhu, nikoli rychlost, kterou získá jeden interaktivní chat. ===== Referenční 8GPU sestava: Kosmik Supernova ===== Konfigurace níže pochází z konkrétních podkladů k 8GPU stroji. Označení **Supernova** odpovídá aktuálnímu přehledu Kosmik Compute: Quasar je tam čtyř-GPU konfigurace s 384 GB VRAM, zatímco Supernova má osm GPU a 768 GB VRAM. > **Poznámka k variantě:** Aktuální produktová stránka u Supernovy uvádí 8TB NVMe, kdežto zde popsaný konkrétní stroj má 4TB WD_BLACK SN7100. Jde tedy o podrobný záznam jedné konfigurace, ne o tvrzení, že všechny Supernovy mají shodné komponenty. ==== Platforma ==== Základem je **ASUS ESC8000A-E11**, 4U dual-socket GPU server určený pro osmigrafické AI a HPC workloady. * Šasi má osm plnohodnotných dual-slot GPU pozic; každá GPU je připojena přes PCIe 4.0 ×16. * Platforma má 32 DIMM slotů a osm paměťových kanálů na každý procesor. * Integrovaný BMC tvoří ASUS ASMB10-iKVM s čipem ASPEED AST2600. * Napájení používá redundantní enterprise architekturu. ==== Procesory a operační paměť ==== Stroj používá **2× AMD EPYC 7413**. * Celkem jde o 48 fyzických jader a 96 vláken. * Základní takt je 2,65 GHz, boost až 3,60 GHz. * Celková L3 cache je 256 MB, tedy 128 MB na CPU. * TDP je 180 W na procesor. * Každý CPU má osmikanálový DDR4 řadič, podporu až DDR4-3200 a 128 PCIe 4.0 linek. Operační paměť tvoří **1 TB DDR4-2666 ECC LRDIMM** v konfiguraci 16× 64 GB. Je osazeno všech 16 paměťových kanálů, po osmi DIMM na CPU. Teoretická agregovaná propustnost při DDR4-2666 je přibližně 341 GB/s. Podklady u použitých modulů uvádějí možné provedení Micron/HPE 64 GB, 4Rx4 ECC LRDIMM; přesný typ je potřeba ověřit přímo na stroji. ==== GPU a propojení ==== Sestava má **8× NVIDIA RTX PRO 6000 Blackwell Max-Q**. * Každá karta má 96 GB ECC GDDR7, celkem tedy 768 GB fyzické VRAM. * Jedna GPU má 24 064 CUDA jader; součet je 192 512 CUDA jader. * Karty mají Tensor Cores 4. generace a RT Cores 5. generace. * Paměťová sběrnice je 512bitová a propustnost VRAM 1 792 GB/s na GPU, agregovaně až 14,34 TB/s. * Teoretický FP32 výkon je až 110 TFLOPS na kartu, přibližně 880 TFLOPS celkem. * Každá GPU obsahuje čtyři NVENC 9. generace a čtyři NVDEC 6. generace. * MIG umožňuje až čtyři 24GB instance na jednu kartu. * Maximální board power je 300 W na GPU, tedy 2,4 kW pro všech osm GPU při maximálním limitu. GPU podporují PCIe 5.0 ×16, ale v tomto serveru běží každá přes **PCIe 4.0 ×16**. Teoretická propustnost je tak přibližně 31,5 GB/s v každém směru na GPU. Z podkladů nevyplývá NVLink ani jiná přímá GPU fabric, proto nelze z agregované propustnosti VRAM odvozovat rychlost komunikace mezi kartami. ==== Úložiště, síť a vzdálená správa ==== Konkrétní sestava používá **WD_BLACK SN7100 4 TB NVMe** ve formátu M.2 2280 s PCIe 4.0 a TLC 3D NAND. * Sekvenční čtení je až 7 000 MB/s a zápis až 6 700 MB/s. * Random read je až 900 tisíc IOPS a random write až 1,35 milionu IOPS. Síť zajišťuje **Intel X540-AT2** se dvěma 10GbE RJ-45 porty pro 10GBASE-T. Karta podporuje SR-IOV, PXE boot a iSCSI a používá PCIe 2.1 ×8. Pro správu je k dispozici dedikovaný BMC management port. ASUS ASMB10-iKVM / ASPEED AST2600 poskytuje vzdálenou KVM konzoli, hardware monitoring a power on/off/restart nezávisle na stavu operačního systému. ==== Software ==== Podklady uvádějí tento software: * OS: Ubuntu 24.04.4 LTS (Noble). * Kernel: Linux 7.0.0-31-generic. * NVIDIA driver: 595.71.05. ===== Co ověřit před pořízením nebo nasazením ===== * Zda jsou ceny, dostupnost a komponenty stále aktuální; prodejce uvádí použité stroje. * Který model, kvantizace, runtime a délka kontextu odpovídají plánované úloze. * Zda měřený throughput odpovídá požadovanému počtu souběžných uživatelů; neporovnávat jej se single-request tok/s. * Reálný odběr ze zásuvky, napájení, chlazení, hlučnost a prostorové nároky 4U serveru. * Síťový návrh: dvojice 10GbE portů nemusí být dostatečná pro každý typ vzdáleného úložiště nebo víceuzlového provozu. * Stav, firmware a případnou záruku jednotlivých použitých komponent. ===== Zdroje ===== * [[https://koscompute.com/ai-servers/|Kosmik Compute – AI servery, parametry, referenční modely, výkon a ceny]] * [[https://docs.google.com/document/d/1zYAgW4Y21hnYSMDWItwHOHV1fOH3b82l75zo4s01_2Y/edit?tab=t.0|Podrobný rozpis nejsilnější sestavy]]