ai:hardware:referencni-sestavy-pro-lokalni-ai

Referenční sestavy pro lokální AI

Vytvořeno: 11.9.2026 | Aktualizováno: 11.09.2026 15:12

Referenční sestava je konkrétně popsaný počítač nebo server, podle kterého lze při plánování lokální AI porovnat VRAM, propustnost paměti, výkon, spotřebu a cenu. Nejde o univerzální doporučení k nákupu: použitelnost vždy závisí na modelu, kvantizaci, délce kontextu, runtime a požadované souběžnosti.

Tento článek postupně shromažďuje výrazně odlišné konfigurace od desktopových pracovních stanic po více-GPU servery. Souvislosti k výběru GPU a VRAM pokrývá Lokální LLM na GPU; pro volbu modelu podle dostupného hardwaru je určen Výběr lokálního LLM podle hardwaru.

Kapacita VRAM rozhoduje hlavně o tom, jak velký model, kvantizaci a kontext lze držet v paměti. Paměťová propustnost ovlivňuje zejména rychlost generování. Větší počet GPU nebo vyšší teoretický FP32 výkon proto sám o sobě neznamená úměrně rychlejší odezvu pro jeden požadavek.

Údaj v tokenech za sekundu, maximální throughput, kontext a odběr nelze přenášet mezi modely. Je nutné vždy zapsat alespoň referenční model, jeho kvantizaci, runtime, délku kontextu, počet souběžných požadavků a způsob měření.

Kosmik Compute nabízí hotové GPU servery pro lokální LLM inference. Jejich přehled je užitečný tím, že u každé sestavy uvádí referenční model, kontext, rychlost pro jeden požadavek, agregovaný throughput a optimalizovaný odběr při AI zátěži.

Následující tabulka je snímek stránky přečtené 11.9.2026. Ceny jsou bez DPH; skladová dostupnost, cena i komponenty se mohou změnit. Výkonové údaje v každém řádku platí pouze pro uvedený referenční model a podmínky prodejce.

Sestava VRAM a GPU Referenční model Max. kontext Jeden požadavek Max. throughput Optimalizovaný odběr Cena bez DPH
Kosmik Comet 32 GB; 1× RTX 5090 Qwen 3.8 27B NVFP4 160k 120–140 tok/s 550–620 tok/s (4 souběžně) 540 W 190 000 Kč
Kosmik Pulsar 96 GB; 1× RTX 6000 PRO Max-Q Qwen3.8-Flash-Next NVFP4 + MTP 262k 150–170 tok/s 550–620 tok/s (8 souběžně) 370 W 350 000 Kč
Kosmik Binary 192 GB; 2× RTX 6000 PRO Max-Q GLM-5.3-Flash NVFP4 1M 170–190 tok/s 900–1 000 tok/s (16 souběžně) 650 W 670 000 Kč
Kosmik Quasar 384 GB; 4× RTX 6000 PRO Max-Q GLM-5.3-Flash NVFP4 1M 170–190 tok/s 1 800–2 000 tok/s (32 souběžně) 1,3 kW 1 390 000 Kč
Kosmik Supernova 768 GB; 8× RTX 6000 PRO Max-Q GLM-5.3 full NVFP4 1M 120–130 tok/s 1 000–1 150 tok/s (128 souběžně) 2,7 kW 2 900 000 Kč

Stránka v tomto okamžiku uváděla, že všechny sestavy jsou použité a mají roční záruku. Uvedený throughput je agregovaný výkon při souběžném běhu, nikoli rychlost, kterou získá jeden interaktivní chat.

Konfigurace níže pochází z konkrétních podkladů k 8GPU stroji. Označení Supernova odpovídá aktuálnímu přehledu Kosmik Compute: Quasar je tam čtyř-GPU konfigurace s 384 GB VRAM, zatímco Supernova má osm GPU a 768 GB VRAM.

Poznámka k variantě: Aktuální produktová stránka u Supernovy uvádí 8TB NVMe, kdežto zde popsaný konkrétní stroj má 4TB WD_BLACK SN7100. Jde tedy o podrobný záznam jedné konfigurace, ne o tvrzení, že všechny Supernovy mají shodné komponenty.

Základem je ASUS ESC8000A-E11, 4U dual-socket GPU server určený pro osmigrafické AI a HPC workloady.

  • Šasi má osm plnohodnotných dual-slot GPU pozic; každá GPU je připojena přes PCIe 4.0 ×16.
  • Platforma má 32 DIMM slotů a osm paměťových kanálů na každý procesor.
  • Integrovaný BMC tvoří ASUS ASMB10-iKVM s čipem ASPEED AST2600.
  • Napájení používá redundantní enterprise architekturu.

Stroj používá 2× AMD EPYC 7413.

  • Celkem jde o 48 fyzických jader a 96 vláken.
  • Základní takt je 2,65 GHz, boost až 3,60 GHz.
  • Celková L3 cache je 256 MB, tedy 128 MB na CPU.
  • TDP je 180 W na procesor.
  • Každý CPU má osmikanálový DDR4 řadič, podporu až DDR4-3200 a 128 PCIe 4.0 linek.

Operační paměť tvoří 1 TB DDR4-2666 ECC LRDIMM v konfiguraci 16× 64 GB. Je osazeno všech 16 paměťových kanálů, po osmi DIMM na CPU. Teoretická agregovaná propustnost při DDR4-2666 je přibližně 341 GB/s. Podklady u použitých modulů uvádějí možné provedení Micron/HPE 64 GB, 4Rx4 ECC LRDIMM; přesný typ je potřeba ověřit přímo na stroji.

Sestava má 8× NVIDIA RTX PRO 6000 Blackwell Max-Q.

  • Každá karta má 96 GB ECC GDDR7, celkem tedy 768 GB fyzické VRAM.
  • Jedna GPU má 24 064 CUDA jader; součet je 192 512 CUDA jader.
  • Karty mají Tensor Cores 4. generace a RT Cores 5. generace.
  • Paměťová sběrnice je 512bitová a propustnost VRAM 1 792 GB/s na GPU, agregovaně až 14,34 TB/s.
  • Teoretický FP32 výkon je až 110 TFLOPS na kartu, přibližně 880 TFLOPS celkem.
  • Každá GPU obsahuje čtyři NVENC 9. generace a čtyři NVDEC 6. generace.
  • MIG umožňuje až čtyři 24GB instance na jednu kartu.
  • Maximální board power je 300 W na GPU, tedy 2,4 kW pro všech osm GPU při maximálním limitu.

GPU podporují PCIe 5.0 ×16, ale v tomto serveru běží každá přes PCIe 4.0 ×16. Teoretická propustnost je tak přibližně 31,5 GB/s v každém směru na GPU. Z podkladů nevyplývá NVLink ani jiná přímá GPU fabric, proto nelze z agregované propustnosti VRAM odvozovat rychlost komunikace mezi kartami.

Konkrétní sestava používá WD_BLACK SN7100 4 TB NVMe ve formátu M.2 2280 s PCIe 4.0 a TLC 3D NAND.

  • Sekvenční čtení je až 7 000 MB/s a zápis až 6 700 MB/s.
  • Random read je až 900 tisíc IOPS a random write až 1,35 milionu IOPS.

Síť zajišťuje Intel X540-AT2 se dvěma 10GbE RJ-45 porty pro 10GBASE-T. Karta podporuje SR-IOV, PXE boot a iSCSI a používá PCIe 2.1 ×8.

Pro správu je k dispozici dedikovaný BMC management port. ASUS ASMB10-iKVM / ASPEED AST2600 poskytuje vzdálenou KVM konzoli, hardware monitoring a power on/off/restart nezávisle na stavu operačního systému.

Podklady uvádějí tento software:

  • OS: Ubuntu 24.04.4 LTS (Noble).
  • Kernel: Linux 7.0.0-31-generic.
  • NVIDIA driver: 595.71.05.
  • Zda jsou ceny, dostupnost a komponenty stále aktuální; prodejce uvádí použité stroje.
  • Který model, kvantizace, runtime a délka kontextu odpovídají plánované úloze.
  • Zda měřený throughput odpovídá požadovanému počtu souběžných uživatelů; neporovnávat jej se single-request tok/s.
  • Reálný odběr ze zásuvky, napájení, chlazení, hlučnost a prostorové nároky 4U serveru.
  • Síťový návrh: dvojice 10GbE portů nemusí být dostatečná pro každý typ vzdáleného úložiště nebo víceuzlového provozu.
  • Stav, firmware a případnou záruku jednotlivých použitých komponent.
  • ai/hardware/referencni-sestavy-pro-lokalni-ai.txt
  • Poslední úprava: 11.09.2026 15:12
  • autor: Petr Nosek