Referenčná zostava: Laboratórium robotiky a umelej inteligencie v jednom racku

Predchádzajúce články opisujú architektúru, softvérový balík, rozpočet na energiu a návrh siete. Tento uvádza cenovku a zoznam dielov – čerpajúcich z reálneho hardvéru, ktorý Kentino dodalo a otestovalo, nie z teoretického kusovníka zostaveného z marketingového hárku.

Cieľom nasadenia je výskumné alebo integračné laboratórium s jedným až štyrmi robotmi spolu s lokálnym inferenciálnym systémom a tréningovou dráhou. Stredne veľké laboratórium: nie amatérska laboratórium, ktoré ledva obslúži 7B, ani hyperscale klaster, ktorý vyžaduje tím pre správu zariadení. Seriózne pracovné prostredie, ktoré dokáže vytvoriť, prevádzkovať a vyvíjať tím dvoch až šiestich ľudí bez špecializovaného DevOps.

Článok sa zaoberá dvoma vrstvami toho istého architektonického vzoru. 4-GPU úroveň vývoja je miestom, kde väčšina laboratórií začína. 8-GPU produkčná úroveň ...kde pristanú po prvej skutočnej záťaži. Možnosti hardvéru sú odlišné; architektúra je identická.

Čo ukazujú údaje o flotile

Spoločnosť Kentino nasadila flotilu jednotne nakonfigurovaných výpočtových uzlov so 4 GPU. Každá jednotka má rovnakú špecifikáciu: AMD EPYC 7542 (32 jadier / 64 vlákien, boost 2.9 GHz), 512 GB DDR4 ECC LRDIMM s rýchlosťou 2666 MT/s v ôsmich moduloch DIMM, štyri grafické karty RTX 4090 (24 GB VRAM každá, spolu 96 GB), 2 TB NVMe scratch disk a 512 GB SATA SSD pre operačný systém. Základná doska je ASRockRack ROMED8-2T/BCM. Ubuntu 24.04 LTS, jadro 6.8.0-generic, ovládač NVIDIA 590.48.01, CUDA 13.1/13.2.

Všetkých desať uzlov produkuje identické benchmarkové čísla. To nie je náhoda – to je zmyslom referenčného zostavenia. Keď každá jednotka opustí rovnakú konfiguráciu, benchmark je špecifikácia, nie šťastný beh.

Výpočet GPU

FP16 tenzorovo-jadrový matmul naprieč štyrmi kartami (pracovná záťaž 8192 × 8192):

Benchmark GPU — 4× RTX 4090
GPU Trvalý FP16 (TFLOPS) Maximálna teplota (stres) Špičkový výkon (napätie)
0 165.8 67 ° C 482 W
1 153.2 64 ° C 450 W
2 166.4 72 ° C 501 W
3 166.2 62 ° C 481 W
Spolu 651.6 W ~ 1,914

GPU 1 beží približne o 6 % nižšie ako GPU 0, 2 a 3 – v rámci bežného rozpätia kremíkovej lotérie pre spotrebiteľské karty. Všetky štyri prešli 60-sekundovým testovaním GPU a kombinovaným testovaním GPU+CPU s nulovými výpočtovými chybami. Teplotný priestor je pohodlný: prah tepelného throttle pre RTX 4090 je 83 °C a najteplejšia karta v flotile dosiahla vrchol 73 °C pri súčasnom zaťažení GPU a CPU. Na žiadnom uzle nebolo pozorované žiadne throttling.

Praktická poznámka k limitom výkonu: flotila sa dodáva s mierne odlišne nastavenými limitmi na kartu (450 W, 480 W, 500 W v závislosti od slotu). Pre trvalé produkčné využitie normalizácia všetkých štyroch kariet na 450 W vyhladzuje celkový odber a znižuje nerovnováhu zdroja. Zníženie TFLOPS pri 450 W oproti 500 W je menej ako 2 % – čo nestojí za asymetrické zaťaženie lišty.

vLLM záver — Llama 3.3 70B AWQ

Porovnané s vLLM 0.19.0, tensor_parallel_size=4, gpu_memory_utilization=0.80, max_model_len=2048:

vLLM záver — Llama 3.3 70B AWQ, 4× RTX 4090
test Výsledok
Jedna požiadavka (512 tokenov) 8.0 tok/s
Dávková priepustnosť (32 súbežných, 256 tokenov na každý) 179.3 tok/s agregát
Priemerná latencia na požiadavku v dávke 32 1,428 ms
Latencia P99 (krátka výzva, 16 tokenov) 2,043 ms
Čas načítania modelu 95 s

Jedno dôležité upozornenie: benchmark použil awq kvantizačné jadro, nie awq_marlin, awq_marlin Cesta na Ada Lovelace (RTX 4090) je 2–3× rýchlejšia pre latenciu jednej požiadavky. Produkčné nasadenia by mali používať awq_marlin alebo cesta FP8 pod vLLM 0.20+, ktorá túto medzeru ešte viac zmenšuje. S awq_marlin, vyššie uvedený počet jednotlivých požiadaviek sa na týchto kartách mení z ~8 taktov/s na približne 16 – 20 taktov/s – čo je viac v súlade s tým, čo používatelia zažívajú v praxi. Celková výhoda dávkovej priepustnosti je úmerne menšia, pretože úzke hrdlo pri vysokej súbežnosti sa presúva na šírku pásma pamäte, a nie na výpočty.

Tieto čísla sú pre Llama 3.3 70B v INT4 (AWQ). Model 7B alebo 8B v Q4 beží na rovnakom hardvéri 4–6× rýchlejšie na token; model 13B beží približne 2.5× rýchlejšie. Číslo 70B je relevantným obmedzením veľkosti pre VLM a rozsiahle plánovacie modely v kontexte robotiky.

llama.cpp – pre jedného používateľa, bez súbežnosti

Benchmarkované s llama-cpp-python 0.3.20 (CUDA/cuBLAS), Llama 3.3 70B Instruct Q4_K_M GGUF, všetkými štyrmi GPU:

lama.cpp — lama 3.3 70B Q4_K_M, 4× RTX 4090
test Výsledok
Generovanie jednej požiadavky (256 tokenov) 19.9–20.3 tok/s
Okamžité vyhodnotenie (1302 tokenov) 1,568 tok/s
Čas načítania modelu 10.8 s

Súbor llama.cpp sa načítava rýchlejšie (10.8 s oproti 95 s pre vLLM) a na týchto kartách poskytuje vyššiu rýchlosť dekódovania pre jedného používateľa, pretože neplatí réžiu plánovača kontinuálneho dávkového spracovania. Výhodou je nulová súbežnosť – jeden používateľ naraz. Správne čítanie týchto čísel: súbor llama.cpp na uzle so 4 GPU poskytuje vývojárovi responzívny 70B model pre interaktívne použitie; vLLM je tou správnou voľbou v momente, keď máte viac ako jedného klienta.

Vidieť I02 pre kompletnú rozhodovaciu maticu serving-stack. Stručná verzia: začnite s vLLM v Dockeri, použite awq_marlin kvantizáciu a prepnúť na llama.cpp iba pre vývojové boxy s jedným používateľom alebo nasadenia Jetson.

Šírka pásma pamäte GPU

Šírka pásma medzi zariadeniami (na karte) je konzistentná na úrovni 920.2 – 920.6 GB/s na všetkých štyroch kartách – s odchýlkou ​​v rozmedzí 0.04 %, čo potvrdzuje, že GDDR6X tu nie je hlavnou premennou. Šírka pásma PCIe Host→Device je 26.2 – 26.3 GB/s, čo potvrdzuje, že Gen4 x16 je plne dohodnutý pri zaťažení (stav nečinnosti pripojenia zobrazuje Gen1 kvôli úspore energie ASPM – normálne, nie je to chyba). Prenosy medzi GPU a GPU cez PCIe (bez NVLink) merajú 19 – 22 GB/s, čo je očakávaný strop pre peer-to-peer cez zdieľaný koreňový komplex PCIe bez NVLink (pozri N03 pre kontext).

Úložisko NVMe

Benchmark NVMe — Fanxiang S660 2 TB Gen4
test priepustnosť IOPS
Sekvenčné čítanie (1 M blokov) 4,589 MB / s 4,376
Sekvenčný zápis (1 M blokov) 4,213 MB / s 4,017
Náhodné čítanie 4K, QD32 2,325 MB / s 568,000
Náhodný zápis 4K, QD32 2,273 MB / s 555,000

Sekvenčná šírka pásma sa blíži k stropu Gen4 x4. Náhodné IOPS pri hĺbke frontu 32 sa dobre saturujú: 568 000 IOPS pri čítaní je výrazne nad tým, čo vyžadujú vzory načítania váhy LLM alebo prístupu k súborom dát v mierke jedného uzla. Načítanie modelu z NVMe do VRAM trvá 10 – 30 sekúnd v závislosti od veľkosti modelu; tento disk nie je úzkym hrdlom.

Referenčná zostava

BOM — vývojová úroveň so 4 GPU

Vývojová úroveň je správnym východiskovým bodom pre laboratórium, ktoré prevádzkuje jedného alebo dvoch robotov, jeden alebo dva aktívne modely a občasné doladenie LoRA.

Vývojársky uzol so 4 GPU
  • Vypočítať: 4× RTX 4090, AMD EPYC 7542, 512 GB DDR4 ECC
  • Skladovanie: 2 TB NVMe (scratch) + 512 GB SATA (OS)
  • Sieť: 10 GbE integrované (duálny port, ROMED8-2T/BCM)
  • PSU: duálny ATX, rozdelené napájanie
  • Podvozok: Montáž do racku 4U, prúdenie vzduchu spredu dozadu
Prepínač ToR
8–16 portov, 10 GbE, spravované (VLAN + QoS)
PoE pre prístupový bod (voliteľné)
Prístupový bod Wi-Fi 6E
Vyhradené SSID pre robotickú flotilu, pásmo 6 GHz
UPS
5 kVA dvojitá konverzia online

Vývojová úroveň: 4-GPU výpočtový uzol + spravovaný ToR prepínač + 6 GHz AP + 5 kVA online UPS.

BOM — vývojová úroveň so 4 GPU (EUR bez DPH)
Riadková položka spec EUR bez DPH (pásmo)
Grafický procesor (×4) RTX 4090 24 GB 2 800 – 3 200 € za kartu
CPU AMD EPYC 7542 32C €1,200-1,600
Základná doska ASRockRack ROMED8-2T/BCM €800-1,100
RAM 8× 64 GB DDR4 ECC LRDIMM 3 500 – 5 000 € (kompletná súprava)
NVMe scratch 2 TB NVMe 4. generácie €180-260
Operačný systém SATA 512 GB SSD €60-90
Šasi + ventilátory 4U rackový, priemyselný €400-600
Zdroj (×2) 2 kW ATX, duálny split 300 – 450 € (pár)
ToR prepínač 10 GbE spravované, 8–16 portov €400-700
Prístupový bod Wi-Fi 6E Podpora 6 GHz, PoE €250-450
UPS 5 kVA dvojitá konverzia €1,200-1,800
Káblovanie + PDU Cat6A + 3-fázový PDU €300-500
Celkový výpočtový uzol €14,500-17,500
Celkový rack (uzol + infra) €17,000-21,000

BOM — produkčná vrstva s 8 GPU

Produkčná úroveň zdvojnásobuje počet GPU. Architektonický vzorec je rovnaký; CPU, RAM a šasi sa prispôsobujú tak, aby podporovali osem slotov PCIe s plnou šírkou pásma. Platforma AMD EPYC Genoa alebo Turin poskytuje rozpočet na linky PCIe pre 8× x16 slotov bez kompromisov v oblasti rozdvojenia (pozri W02).

Kusovník — produkčná úroveň s 8 GPU (EUR bez DPH)
Riadková položka spec EUR bez DPH (pásmo)
Grafický procesor (×8) RTX 4090 24 GB 2 800 – 3 200 € za kartu
CPU AMD EPYC Janov / Turín (s podporou dvoch soketov) €2,500-4,000
Základná doska Platforma Janov/Turín, 8× PCIe Gen4/5 x16 €1,800-2,800
RAM 16 × 64 GB DDR5 ECC LRDIMM (1 024 GB) 3 500 – 5 000 € (kompletná súprava)
NVMe scratch 2× 4 TB Gen4 NVMe €600-900
Operačný systém SATA 512 GB SSD (×2, RAID-1) €120-180
Šasi + ventilátory Rackový model 4U–6U, 8× GPU, priemyselný €1,200-2,000
Zdroj (×2) 3 kW ATX, duálny split 600 – 900 € (pár)
ToR prepínač 25 GbE spravované, 24 portov (pripravené na klaster) €1,200-2,200
25 GbE sieťová karta Mellanox ConnectX-5/6, duálny port (doplnok) €300-600
Prístupový bod Wi-Fi 6E 6 GHz, PoE €250-450
UPS 10 kVA dvojitá konverzia €3,000-5,000
Káblovanie + PDU Cat6A / DAC SFP + 3-fázový meraný PDU €600-1,000
Celkový výpočtový uzol €38,000-50,000
Celkový rack (uzol + infra) €44,000-60,000

Poznámka: Doplnková sieťová karta 25 GbE je použiteľná iba v šasi s 8 grafickými procesormi. Šasi so 4 grafickými procesormi nemá dostatok miesta pre ďalšiu sieťovú kartu – 10 GbE integrované porty na ROMED8-2T/BCM predstavujú praktický limit na úrovni 4 grafických procesorov (pozri N01 a pravidlá stránky produktu).

Úložisko za výpočtovým uzlom

Úrovne skladovania – robotické laboratórium
Stupeň Účel Pravidlo veľkosti Krížový odkaz
Uzol NVMe (horúci) Aktívne váhy modelu, aktuálna dávka súboru údajov 2–4 TB na uzol -
NAS (teplý) Tréningové súbory údajov, archív epizód, register modelov Použiteľné 40 – 200 TB W06
Mimo pracoviska / cloud (studený) Dlhodobý archív, obnova po havárii Podľa potreby -

Pre vývojárov ponúka 4-šachtový NAS so 4× 16 TB HDD 48 TB použiteľných v režime RAID-5 – dosť na rok epizódnych dát pre laboratórium s 2 robotmi. Pripojte ho k prepínaču ToR cez 10 GbE; nedávajte ho na to isté rozhranie ako prevádzku robota.

Napájanie a chladenie pre rack

od I04:

Výkon podľa úrovne
konfigurácia Výpočtová udržateľnosť Kompletný rack (vrátane robotov, stolov, infračerveného zariadenia)
4-GPU vývojárska úroveň ~2.0-2.4 kW ~5-7 kW
Produkčná úroveň s 8 GPU ~4.0-5.0 kW ~10-13 kW

Údaje zo záťažového testu skupiny potvrdzujú, že uzol so 4 grafickými kartami spotrebuje približne 1 914 W pri plnom zaťažení grafickej karty, pričom všetky štyri karty dosahujú svoje limity výkonu. Pri pridaní CPU (trvalo zaťažené ~120 W), NVMe a réžie ventilátorov dosiahne uzol trvalú spotrebu približne 2.1 – 2.2 kW.

Elektrická inštalácia pre vývojovú úroveň: minimálne trojfázové napájanie 400 V 16 A; trojfázové napájanie 32 A poskytuje priestor na rast. Káble zdroja napájania na dvoch samostatných fázach. Pozri I04 a P02 pre rozloženie zapojenia. Pre produkčnú úroveň (10 kW celý rack) potrebujete trojfázové napájanie 400 V 32 A s chladiacim výkonom najmenej 15 kW.

Dimenzovanie UPS: veľkosť iba pre server, nie pre roboty. Pre vývojovú úroveň je minimálnou rozumnou voľbou online UPS s dvojitou konverziou s výkonom 5 kVA. Pre produkčnú úroveň je to 10 kVA. Vždy špecifikujte online s dvojitou konverziou. Pozri P05.

Softvérový stack na holom železe

Ubuntu 24.04 LTS — opravené jadro, zablokované balíky
  • Ovládač NVIDIA 590.x (pripnutý, otvorený modul jadra)
  • Sada nástrojov CUDA 13.x
  • sada nástrojov pre kontajnery nvidia
kontajner vLLM
vllm/vllm-openai:v0.20.x
  • Primárne: Llama 3.3 70B FP8 alebo Qwen 2.5 72B AWQ
  • Voliteľné: VLM (Qwen2.5-VL 32B na 4-GPU; 72B na 8-GPU)
Poskytovanie + monitorovanie
  • llama.cpp (vývojárska / záložná verzia pre jedného používateľa)
  • nginx (reverzná proxy, TLS, autorizácia nosiča)
  • Prometheus + vLLM /metriky
  • Exportér DCGM (využitie GPU SM, napájanie, teplota, ECC)
  • Dashboardy Grafana

Softvérový balík: pripnutý Ubuntu + ovládač NVIDIA → sada nástrojov pre kontajnery → vLLM + llama.cpp + nginx + monitorovanie.

Priradenie vodiča nie je možné. Vozidlový park používa vodiča s číslom 590.48.01; apt-mark hold nvidia-driver-590 je prvá vec po inštalácii operačného systému bez obsluhy. Bezobslužný apt-get upgrade ktorý stiahne novší ovládač, porušil produkčnú inferenciu presne toľkokrát, koľkokrát by ste očakávali. Pozrite si L01 pre celý postup.

Monitorovanie nie je voliteľné. Údaje z vozového parku ukazujú, že grafická karta GPU 3 na jednom uzle mala počas benchmarkingu opraviteľné chyby PCIe AER (RxErr + BadTLP) – automaticky opravené hardvérom, ale viditeľné v počítadlách DCGM. Bez monitorovania sa to o niekoľko týždňov neskôr prejaví ako „občasné zvláštne inferenčné chyby“. Zapojte DCGM a nastavte upozornenie na opraviteľné chyby ECC nad základnou frekvenciou. Pozri L05 pre balík Prometheus + Grafana.

Variácie veľkostí

Vývojová úroveň so 4 GPU – čo dokáže v skutočnosti spustiť

Celková VRAM 96 GB (4 × 24 GB) s TP=4:

Vhodné pre model – vývojárska úroveň so 4 GPU (96 GB VRAM)
Modelka Quant Hodí sa? Približne tok/s (jeden používateľ)
Lama 3.3 / Qwen 2.5 70B AWQ INT4 Áno (~36 GB) 16–22 (s awq_marlin)
Qwen 2.5 VL 32B AWQ INT4 Áno (~20 GB) 18-26
Qwen 2.5 VL 72B AWQ INT4 Nie (potrebuje ~44 GB, tesne na 4× 24 GB) -
Lama 3.3 70B FP8 Áno (~75 GB na 4 platformách) 14-18
Model triedy 8B Q4_K_M Áno, priestor nad hlavou pre dvoch 80-120

72B VLM sa pohodlne nezmestí na 4× 24 GB na INT4 – matematika je síce blízka, ale kontextové okná nad 4K ju posúvajú ďalej. Použite buď 32B VLM variant, alebo prejdite na úroveň 8 GPU alebo uzol 4× RTX Pro 6000 Blackwell (každá s 96 GB VRAM) pre triedu 72B. Pozri W07 pre diskusiu o VRAM vs. modelovej úrovni.

Vývojárska vrstva spracováva: jeden 70B inferenčný model obsluhujúci 1 – 3 súbežných robotických klientov, jeden VLM (trieda 32B) pre vizuálne dotazy a občasné doladenie LoRA na menšom základnom modeli. To pokrýva 80 % prípadov použitia v robotických laboratóriách v roku 2026.

Produkčná úroveň s 8 GPU – extra priestor

Celková kapacita 192 GB VRAM (8 × 24 GB):

Priepustnosť modelu — produkčná vrstva s 8 GPU (192 GB VRAM)
Modelka Quant Config Približný celkový tok/s (32 súbežných)
Lama 3.3 70B FP8 TP=4, PP=2 350-500
Qwen 2.5 72B AWQ INT4 TP=4, 2 repliky 400-600
Qwen 2.5 VL 72B AWQ INT4 TP=4 180-280
Model 8B (dialóg) FP16 1 GPU na repliku, 8 replík 1,200-1,800

Úroveň s 8 GPU tiež otvára dvere k simultánnemu obsluhovaniu viacerých modelov: 70B LLM na 4 GPU a 32B VLM na ostatných 4, čím sa zmiešaná flotila robotov s rôznymi požiadavkami na modely obsluhuje súčasne z jedného zariadenia. Na úrovni so 4 GPU to vyžaduje krok výmeny modelu s prestojom 30 – 120 sekúnd na výmenu.

Poznámka k TP=8 pre 70B: TP=8 cez PCIe peer-to-peer (bez NVLink) sa škáluje horšie ako TP=4 × PP=2 pri súbežnosti nad 8, pretože náklady na komunikáciu pri all-reduce rastú so stupňom tenzorovej paralelnosti. Údaje z benchmarku ukazujú šírku pásma PCIe medzi GPU a GPU na úrovni 19–22 GB/s – čo stačí pre TP=4, ale TP=8 pri all-reduce pri vysokých veľkostiach dávok tieto linky saturuje. Odporúčaná konfigurácia pre 70B na 8× 4090 je TP=4 × PP=2, ako je znázornené na I02.

Rozloženie stojana

Rozloženie racku — 12U až 15U, vývojové alebo produkčné
U Zložka
1 1U patch panel (Cat6A, optický rozbočovač)
2 1U ToR prepínač (spravovaný 10/25 GbE)
3 Rozšírenie batérie UPS 2U (ak je potrebné)
4-5 2U UPS (5 kVA dev / 10 kVA prod)
6 1U PDU (3-fázová s meraním, horizontálna)
7 1U prázdny / správa káblov
8-11 4U K-AI výpočtový uzol (dev) / 6U K-AI výpočtový uzol (produkcia)
12-13 Prázdne / budúce rozšírenie
14 1U jump host / virtuálny počítač na správu vozového parku
15 prázdny

Výpočtový uzol sa vždy nachádza pod prepínačom a UPS – prúdenie vzduchu spredu dozadu vyžaduje, aby studený vzduch vstupoval z prednej časti racku (studená ulička alebo zdroj striedavého prúdu z miestnosti), prechádzal cez server a vystupoval do horúcej uličky v zadnej časti. Pozrite si W05 a I04 pre disciplínu prúdenia vzduchu.

Jump hostiteľ je 1U alebo malý počítač s rozhraniom DisplayPort, ktorý sa používa na počiatočné spustenie, inštaláciu ovládačov a údržbu, keď je primárny server nedostupný cez sieť. Nepotrebuje grafickú kartu. Postačí použitá pracovná stanica alebo malý 1U počítač so 16 GB RAM a SSD diskom Gen3.

Čo táto zostava nie je

Nie desktopový GPU server v racku. Otvorená vežová konštrukcia stolového počítača – grafické karty namontované na rozširujúcej karte, bez skrinky, ventilátory smerujúce k stropu – nie je to, čo je tu opísané. Stolné zostavy sú vhodné na vývoj; nie sú určené na nepretržitú prevádzku 24 hodín denne, 7 dní v týždni a neposkytujú smerované prúdenie vzduchu spredu dozadu, ktoré udržiava grafické karty na stabilnej prevádzkovej teplote počas niekoľkých týždňov.

Nie je to klaster NVLink. RTX 4090 (trieda pre spotrebiteľov/pracovné stanice) nemá NVLink. Prenosy medzi GPU a GPU idú cez PCIe rýchlosťou 19 – 22 GB/s, nie 900 GB/s. To je dostatočné pre inferenčné obsluhovanie TP=4 a predstavuje to skutočné obmedzenie pre trénovanie TP=8. Ak je vašou pracovnou záťažou rozsiahle distribuované trénovanie na modeli 70B+, RTX Pro 6000 Blackwell (s podporou NVLink vo svojej multi-GPU edícii) alebo platforma s NVSwitch zmení matematiku – ale aj cenu. Pozrite si N03.

Nie redundantné zdroje. Konfigurácia s dvoma zdrojmi má rozdelené napájanie: zdroj A napája grafické karty 0 a 1 (plus základnú dosku), zdroj B napája grafické karty 2 a 3. Ak zdroj A zlyhá, stratíte dve grafické karty a základnú dosku. Nič sa automaticky neprepne na záložný zdroj. Ide o poctivý duálny zdroj – vyvažuje zaťaženie vedenia a znižuje riziko zlyhania v porovnaní s jedným veľkým zdrojom, ale nejde o redundanciu N+1. Pozri W04.

Nie je to cloudová alternatíva pre všetko. Ak je primárnou pracovnou záťažou vášho laboratória jedno volanie modelu desaťkrát denne, matematika celkových nákladov na vlastníctvo (TCO) neopodstatňuje lokálne rozhranie. Táto zostava sa vyplatí oproti výdavkom na cloudové API, keď spúšťate trvalú inferenciu pre viacerých klientov, pravidelne dolaďujete alebo pracujete s obmedzeniami týkajúcimi sa umiestnenia údajov. Pozrite si T02 pre podrobnú matematiku.

Prečo práve tieto konkrétne voľby

AMD EPYC 7542 ako hostiteľský procesor. 32-jadrový EPYC poskytuje 128 PCIe 4.0 liniek len z CPU, čo stačí pre 4× GPU s rozdvojením x16 bez rozdvojenia, plus sieťovú kartu, úložisko a PCIe prepínač pre rozšírenie. EPYC je štandardnou platformou pre multi-GPU AI servery v tomto rozsahu z nejakého dôvodu: Intel Xeon s rovnakým počtom jadier poskytuje menej PCIe liniek, čo núti kompromisy v rozdvojení pri konfiguráciách so 4+ GPU. Pozri W02 pre aritmetiku počtu jazdných pruhov.

512 GB systémovej pamäte RAM. Flotila sa dodáva s 512 GB (8 × 64 GB), čo prevyšuje nominálnu špecifikáciu 256 GB. Je to zámerné: rozsiahle načítavanie modelu počas spúšťania kontajnera, predbežné načítanie dátových súborov pre trénovanie a vyrovnávacia pamäť stránok operačného systému spotrebúvajú RAM, čo VRAM nemôže. Pre vLLM s povoleným odkladacím priestorom KV-cache je systémová RAM priamo použiteľná ako preplňovanie – 4 GB odkladací priestor na GPU vyžaduje 16 GB systémovej RAM. 512 GB poskytuje túto kapacitu s miestom pre Isaac Sim, ktorý dokáže počas trénovania politík uchovávať 10 – 30 GB simulačného stavu v systémovej RAM.

2 TB NVMe disk bez nutnosti zápisu. Benchmark ukazuje sekvenčné čítanie 4 589 MB/s – dosť rýchlo na načítanie 70B FP8 modelu (~75 GB) za menej ako 20 sekúnd. Pre laboratórium, ktoré často mení modely (vývojový pracovný postup, A/B testovanie, inferenčné zásobníky), je čas načítania dôležitý. Pomalší SATA SSD tento čas na jednu výmenu zdvojnásobí alebo strojnásobí.

Prúdenie vzduchu do stojana spredu dozadu. Najčastejšia chyba pri prvých zostavovaniach: orientácia pracovnej plochy (bočné nasávanie, horné odsávanie, zadné odsávanie) nefunguje v uzavretom racku. Výpočtový uzol musí používať smerované prúdenie vzduchu zodpovedajúce konvencii studenej/teplej uličky v racku. Pozri I01 a W05.

Úprimný pohľad na hardvér roku 2026

Toto je referenčná zostava z mája 2026. RTX 4090 nie je najnovšou možnosťou grafickej karty Kentino – k dispozícii sú RTX 5090 (32 GB VRAM, architektúra Blackwell, sm_120) a RTX Pro 6000 Blackwell (96 GB VRAM), ktoré výrazne menia počet VRAM na kartu. Uzol so 4 GPU a RTX Pro 6000 Blackwell poskytuje 384 GB VRAM – dosť na pohodlné hosťovanie Qwen 2.5 VL 72B v 8. FP na štyroch kartách – za úmerne vyššiu cenu na kartu.

Čo sa medzi generáciami nemení: architektonický vzorec. Hostiteľ AMD EPYC, PCIe multi-GPU, šasi s prednou a zadnou časťou, duálny zdroj, Ubuntu 24.04, vLLM v Dockeri, Prometheus + DCGM exportér. Tento vzorec bol konzistentný počas dvoch generácií GPU a prežije aj tú ďalšiu. Zoznam súčiastok je lacnejší a rýchlejší; vzorec sa drží.

Čo robiť ďalej – postup dimenzovania

Odpovedzte na tieto otázky postupne. Každá otázka otvára bránu tej nasledujúcej.

  1. Aké modely potrebujete hostiť súčasne? Zapíšte si názvy a počty parametrov. 70B LLM + 32B VLM súčasne vyžadujú aspoň 96 GB VRAM. 70B LLM + 72B VLM súčasne vyžadujú 192 GB VRAM alebo viac. Toto je vaša spodná hranica VRAM. Ak spodná hranica presiahne 96 GB, vývojová úroveň nie je vašou zostavou.
  2. Koľko súbežných robotických klientov je v špičke? Jeden robot s občasnými dotazmi → vývojová vrstva to rieši. Štyria roboty spúšťajúce nepretržité slučky vnímania (volanie VLM každé 2 sekundy) → 8 súbežných požiadaviek, čo je zvládnuteľné na vývojovej úrovni, ale vyžaduje si meranie vzhľadom na dĺžku vášho kontextu. Osem robotov → produkčná vrstva alebo dva uzly na vývojovej úrovni.
  3. Potrebujete tréningovú kapacitu? Jemné doladenie LoRA na 8B modeli vyžaduje približne 20 GB VRAM a zmestí sa na jednu RTX 4090. Úplné jemné doladenie 70B modelu vyžaduje stovky GB VRAM s gradientným kontrolným bodovaním a 3D paralelizmom – to je iná téma. Väčšina laboratórií začína s LoRA na malých modeloch, ktoré rieši vývojárska vrstva.
  4. Aký je váš dnešný výkonový a chladiaci limit? Buďte úprimní. Spustite tabuľku zaťaženia z I04 oproti existujúcemu elektrickému napájaniu vašej budovy. Ak ste na jednofázovom okruhu s prúdom 16 A, ktorý zdieľate so zvyškom kancelárie, úroveň developera si vyžaduje nový okruh predovšetkým. Toto je najčastejšia chyba pri plánovaní.
  5. Máte softvérového integrátora? Vyššie uvedený hardvér je len polovica systému. Ovládač ROS 2 pre vášho robota, klient gRPC pre vLLM, úložisko pamäte scén, konfigurácia monitorovania – to je 2 – 6 týždňov skutočnej inžinierskej práce na novom laboratóriu. Ak kupujete hardvér bez integračného plánu, kupujete si druhú polovicu systému bez prvej. Pozri I02 a I01 pre integračný obraz.

Keď dokážete odpovedať na všetkých päť otázok, veľkosť zostavy sa stane zrejmou. Ak neviete odpovedať na otázku 1 (zoznam modelov) alebo otázku 3 (rozsah školenia), vráťte sa, keď môžete – tieto dve odpovede tvoria 90 % nákladov. Tím Kentino môže poskytnúť cenovú ponuku z kompletnej sady odpovedí; cenové ponuky na základe vágnych požiadaviek si vyžadujú tri kolá revízie a stále skončia nesprávne.


Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Komentáre a opravy sú vítané na info@kentino.com.