Referenční sestavy pro lokální AI
Vytvořeno: 11.9.2026 | Aktualizováno: 11.09.2026 15:12
Referenční sestava je konkrétně popsaný počítač nebo server, podle kterého lze při plánování lokální AI porovnat VRAM, propustnost paměti, výkon, spotřebu a cenu. Nejde o univerzální doporučení k nákupu: použitelnost vždy závisí na modelu, kvantizaci, délce kontextu, runtime a požadované souběžnosti.
Tento článek postupně shromažďuje výrazně odlišné konfigurace od desktopových pracovních stanic po více-GPU servery. Souvislosti k výběru GPU a VRAM pokrývá Lokální LLM na GPU; pro volbu modelu podle dostupného hardwaru je určen Výběr lokálního LLM podle hardwaru.
Jak číst srovnání
Kapacita VRAM rozhoduje hlavně o tom, jak velký model, kvantizaci a kontext lze držet v paměti. Paměťová propustnost ovlivňuje zejména rychlost generování. Větší počet GPU nebo vyšší teoretický FP32 výkon proto sám o sobě neznamená úměrně rychlejší odezvu pro jeden požadavek.
Údaj v tokenech za sekundu, maximální throughput, kontext a odběr nelze přenášet mezi modely. Je nutné vždy zapsat alespoň referenční model, jeho kvantizaci, runtime, délku kontextu, počet souběžných požadavků a způsob měření.
Kosmik Compute: časový snímek nabídky
Kosmik Compute nabízí hotové GPU servery pro lokální LLM inference. Jejich přehled je užitečný tím, že u každé sestavy uvádí referenční model, kontext, rychlost pro jeden požadavek, agregovaný throughput a optimalizovaný odběr při AI zátěži.
Následující tabulka je snímek stránky přečtené 11.9.2026. Ceny jsou bez DPH; skladová dostupnost, cena i komponenty se mohou změnit. Výkonové údaje v každém řádku platí pouze pro uvedený referenční model a podmínky prodejce.
| Sestava | VRAM a GPU | Referenční model | Max. kontext | Jeden požadavek | Max. throughput | Optimalizovaný odběr | Cena bez DPH |
|---|---|---|---|---|---|---|---|
| Kosmik Comet | 32 GB; 1× RTX 5090 | Qwen 3.8 27B NVFP4 | 160k | 120–140 tok/s | 550–620 tok/s (4 souběžně) | 540 W | 190 000 Kč |
| Kosmik Pulsar | 96 GB; 1× RTX 6000 PRO Max-Q | Qwen3.8-Flash-Next NVFP4 + MTP | 262k | 150–170 tok/s | 550–620 tok/s (8 souběžně) | 370 W | 350 000 Kč |
| Kosmik Binary | 192 GB; 2× RTX 6000 PRO Max-Q | GLM-5.3-Flash NVFP4 | 1M | 170–190 tok/s | 900–1 000 tok/s (16 souběžně) | 650 W | 670 000 Kč |
| Kosmik Quasar | 384 GB; 4× RTX 6000 PRO Max-Q | GLM-5.3-Flash NVFP4 | 1M | 170–190 tok/s | 1 800–2 000 tok/s (32 souběžně) | 1,3 kW | 1 390 000 Kč |
| Kosmik Supernova | 768 GB; 8× RTX 6000 PRO Max-Q | GLM-5.3 full NVFP4 | 1M | 120–130 tok/s | 1 000–1 150 tok/s (128 souběžně) | 2,7 kW | 2 900 000 Kč |
Stránka v tomto okamžiku uváděla, že všechny sestavy jsou použité a mají roční záruku. Uvedený throughput je agregovaný výkon při souběžném běhu, nikoli rychlost, kterou získá jeden interaktivní chat.
Referenční 8GPU sestava: Kosmik Supernova
Konfigurace níže pochází z konkrétních podkladů k 8GPU stroji. Označení Supernova odpovídá aktuálnímu přehledu Kosmik Compute: Quasar je tam čtyř-GPU konfigurace s 384 GB VRAM, zatímco Supernova má osm GPU a 768 GB VRAM.
Poznámka k variantě: Aktuální produktová stránka u Supernovy uvádí 8TB NVMe, kdežto zde popsaný konkrétní stroj má 4TB WD_BLACK SN7100. Jde tedy o podrobný záznam jedné konfigurace, ne o tvrzení, že všechny Supernovy mají shodné komponenty.
Platforma
Základem je ASUS ESC8000A-E11, 4U dual-socket GPU server určený pro osmigrafické AI a HPC workloady.
- Šasi má osm plnohodnotných dual-slot GPU pozic; každá GPU je připojena přes PCIe 4.0 ×16.
- Platforma má 32 DIMM slotů a osm paměťových kanálů na každý procesor.
- Integrovaný BMC tvoří ASUS ASMB10-iKVM s čipem ASPEED AST2600.
- Napájení používá redundantní enterprise architekturu.
Procesory a operační paměť
Stroj používá 2× AMD EPYC 7413.
- Celkem jde o 48 fyzických jader a 96 vláken.
- Základní takt je 2,65 GHz, boost až 3,60 GHz.
- Celková L3 cache je 256 MB, tedy 128 MB na CPU.
- TDP je 180 W na procesor.
- Každý CPU má osmikanálový DDR4 řadič, podporu až DDR4-3200 a 128 PCIe 4.0 linek.
Operační paměť tvoří 1 TB DDR4-2666 ECC LRDIMM v konfiguraci 16× 64 GB. Je osazeno všech 16 paměťových kanálů, po osmi DIMM na CPU. Teoretická agregovaná propustnost při DDR4-2666 je přibližně 341 GB/s. Podklady u použitých modulů uvádějí možné provedení Micron/HPE 64 GB, 4Rx4 ECC LRDIMM; přesný typ je potřeba ověřit přímo na stroji.
GPU a propojení
Sestava má 8× NVIDIA RTX PRO 6000 Blackwell Max-Q.
- Každá karta má 96 GB ECC GDDR7, celkem tedy 768 GB fyzické VRAM.
- Jedna GPU má 24 064 CUDA jader; součet je 192 512 CUDA jader.
- Karty mají Tensor Cores 4. generace a RT Cores 5. generace.
- Paměťová sběrnice je 512bitová a propustnost VRAM 1 792 GB/s na GPU, agregovaně až 14,34 TB/s.
- Teoretický FP32 výkon je až 110 TFLOPS na kartu, přibližně 880 TFLOPS celkem.
- Každá GPU obsahuje čtyři NVENC 9. generace a čtyři NVDEC 6. generace.
- MIG umožňuje až čtyři 24GB instance na jednu kartu.
- Maximální board power je 300 W na GPU, tedy 2,4 kW pro všech osm GPU při maximálním limitu.
GPU podporují PCIe 5.0 ×16, ale v tomto serveru běží každá přes PCIe 4.0 ×16. Teoretická propustnost je tak přibližně 31,5 GB/s v každém směru na GPU. Z podkladů nevyplývá NVLink ani jiná přímá GPU fabric, proto nelze z agregované propustnosti VRAM odvozovat rychlost komunikace mezi kartami.
Úložiště, síť a vzdálená správa
Konkrétní sestava používá WD_BLACK SN7100 4 TB NVMe ve formátu M.2 2280 s PCIe 4.0 a TLC 3D NAND.
- Sekvenční čtení je až 7 000 MB/s a zápis až 6 700 MB/s.
- Random read je až 900 tisíc IOPS a random write až 1,35 milionu IOPS.
Síť zajišťuje Intel X540-AT2 se dvěma 10GbE RJ-45 porty pro 10GBASE-T. Karta podporuje SR-IOV, PXE boot a iSCSI a používá PCIe 2.1 ×8.
Pro správu je k dispozici dedikovaný BMC management port. ASUS ASMB10-iKVM / ASPEED AST2600 poskytuje vzdálenou KVM konzoli, hardware monitoring a power on/off/restart nezávisle na stavu operačního systému.
Software
Podklady uvádějí tento software:
- OS: Ubuntu 24.04.4 LTS (Noble).
- Kernel: Linux 7.0.0-31-generic.
- NVIDIA driver: 595.71.05.
Co ověřit před pořízením nebo nasazením
- Zda jsou ceny, dostupnost a komponenty stále aktuální; prodejce uvádí použité stroje.
- Který model, kvantizace, runtime a délka kontextu odpovídají plánované úloze.
- Zda měřený throughput odpovídá požadovanému počtu souběžných uživatelů; neporovnávat jej se single-request tok/s.
- Reálný odběr ze zásuvky, napájení, chlazení, hlučnost a prostorové nároky 4U serveru.
- Síťový návrh: dvojice 10GbE portů nemusí být dostatečná pro každý typ vzdáleného úložiště nebo víceuzlového provozu.
- Stav, firmware a případnou záruku jednotlivých použitých komponent.