Postavili sme 576 GB AI server, ktorý beží na GLM 5.2 vo vašej vlastnej budove

Kentinov lokálny server s umelou inteligenciou obsahuje šesť grafických kariet NVIDIA RTX PRO 6000 Blackwell Max-Q, dva procesory EPYC a dostatočnú redundanciu, aby vydržal aj pri výpadku napájania – takže modely špičkovej triedy bežia na vašom pracovisku, nie v cudzom cloude.

Každý pozná One Miners. Teraz sa zoznámte s Kentinom.

Ak ste už nejaký čas v našom svete, poznáte One Miners. Kentino je jej sesterská spoločnosť a Kentino vyrába stroje: servery s umelou inteligenciou, pracovné stanice, herné počítače – viac-menej podľa toho, ako vyzerá technický list vo vašej hlave.

Tento článok je o jednej z takýchto zostáv. Je to systém, ktorý sme zostavili pre zákazníka, takže nebudeme menovať, komu bude určený. Čo môžeme urobiť, je otvoriť veko a ukázať vám presne, čo sa nachádza v lokálnom serveri s umelou inteligenciou, keď prestanete robiť kompromisy.

Prezentácia: AI triedy Claude, ktorá nikdy neopustí budovu

Celý zmysel tohto stroja je jednoduchý. Dostanete asistenta rovnakej triedy ako Claude Opus alebo GPT – a ten beží vo vašich priestoroch. Vo vašej kancelárii, vo vašej skladovacej miestnosti, u vás doma, ak tam pracujete. Každá výzva, každý dokument, každý riadok kódu, ktorý doň vložíte, zostáva vo vašej vlastnej sieti.

To je ponúkaná ponuka: žiadny poplatok za token, ktorý sa škáluje podľa užitočnosti danej veci, žiadny rad za ostatnými nájomníkmi a žiadna tretia strana, ktorá by držala vaše kontextové okno. Vlastníte hardvér, takže vlastníte aj pracovnú záťaž.

Vnútri: šesť profesionálnych grafických kariet, každá s pamäťou 96 GB

Otvorte šasi a prvá vec, ktorú uvidíte, je stena s grafickými kartami – tri karty na jednej strane, ďalšie tri na druhej. Každá z nich je NVIDIA RTX PRO 6000 Blackwell Max-Q s 96 GB VRAM. Šesť kariet, približne 576 GB grafickej pamäte v jednej krabici.

Táto konfigurácia je šesťnásobná, ale šasi nie je plné. Zmestí sa doň až osem kariet, čo necháva priestor na neskoršie pridanie grafických kariet alebo na využitie slotov na niečo úplne iné, napríklad na optické siete. Za doskou grafických kariet sú umiestnené dva procesory AMD EPYC 7643, ktoré ich napájajú.

Neokázalé časti sú tie, na ktorých záleží

Takýto stroj žije alebo zomrie na základe nudných špecifikácií. Pamäť: 512 GB DDR4 nainštalovanej ako 8x 64 GB LRDIMM, rozšíriteľná na 1.5 TB, keď si to pracovné zaťaženie vyžaduje. Úložisko: 2 TB systémový disk plus 4 TB NVMe, pretože hmotnosti modelov sa musia rýchlo odstrániť z disku.

Napájanie zabezpečuje päť redundantných zdrojov s výkonom 2000 W. Ak jeden vytiahnete počas prevádzky, server bude pokračovať v prevádzke – dá najavo svoju nespokojnosť, ale bude pokračovať. Chladenie zabezpečuje dvanásť vysokotlakových ventilátorov s rýchlosťou 15 000 ot./min, ktoré sú vymeniteľné za chodu a usporiadané v radoch po celej šasi. Môžete vytiahnuť nefunkčný ventilátor, keď je počítač pod záťažou, nainštalovať nový, zatvoriť ho a odísť. Kričí na vás niekoľko sekúnd. To je celý postup údržby.

Základná doska ponúka vyhradenú diaľkovú správu, duálnu 10-gigabitovú LAN sieť, integrovaný VGA port pre pripojenie terminálu, USB 3.2 a primárne aj sekundárne tlačidlo napájania, takže na jej zapnutie a vypnutie nemusíte nič vyberať z racku.

Lokálne spustenie GLM 5.2

Hlavnou pracovnou záťažou v 4. štvrťroku je GLM 5.2 – približne 341 GB váh modelov, umiestnených na šiestich GPU. To je skutočne veľký model a žije vo vašej budove. Bežia tu aj iné otvorené modely; je tu viac než dosť VRAM na to, aby sa načítalo niekoľko z nich alebo aby sa medzi nimi prepínalo.

Studený štart nie je okamžitý a radšej vám to povieme, ako by ste to mali objaviť vy. Medzi BIOSom, ktorý vymenúva toľko hardvéru, Linuxom, ktorý vyvoláva veľmi rozsiahly strom zariadení, a následným streamovaním 341 GB z SSD do VRAM, čakáte rádovo niekoľko minút na prvý token. Keď je systém teplý, neexistuje jednotné číslo priepustnosti a každý, kto vám ho uvádza, vynecháva otázku. Záleží na troch veciach: koľko požiadaviek je v prevádzke, či je zapnuté špekulatívne dekódovanie a či sa model zmestí na jednu kartu.

Pre GLM 5.2 rozdelené na všetkých šesť GPU: čisté dekódovanie s jednou súbežnosťou bez špekulatívneho dekódovania je zhruba 25 – 40 tokenov/s – to je aritmetika a je to údaj na našej verejnej stránke produktu. Zapnite špekulatívne dekódovanie, stále jednu požiadavku naraz, a ste na 40 – 60. To je režim vo videu, a preto beh na kamere dosahuje približne 42 tokenov/s. Pridajte súbežnosť k špekulatívnemu dekódovaniu a ten istý box dosiahne 60 – 120.

To všetko sú čísla pre veľké modely s 341 GB rozloženými na šiestich kartách. Ak prejdete na model, ktorý sa zmestí do jednej 96 GB grafickej karty, dostanete sa k tisíckam tokenov za sekundu, pretože prevádzkujete šesť nezávislých inštancií namiesto jednej rozdelenej. Rovnaký hardvér, len rádovo odlišný – čo je hlavný dôvod, prečo je jedno hlavné číslo bezvýznamné.

Okrem chatu a kódu je ten istý kremík aj serióznym zariadením na generovanie obrázkov a zvládne aj prácu s videom. Praktický rozdiel oproti cloudovému koncovému bodu nie je len rýchlosť – je to aj to, že pred vami v rade nikto nestojí.

Prečo Max-Q a koľko tento obchod v skutočnosti stojí

Jeden detail, o ktorom stojí za to byť úprimný: toto sú varianty Max-Q pre RTX PRO 6000. Max-Q má výkon základnej dosky 300 W. Karta bez Max-Q má výkon 600 W, ktorý môžete v ovládači obmedziť na približne 400 W.

Max-Q vymieňa malú časť vyrovnávacej pamäte na čipe za oveľa nižšiu spotrebu energie. V šasi so šiestimi kartami je táto výmena dôvodom, prečo tepelný a energetický rozpočet vôbec funguje. Je to typ rozhodnutia, ktoré urobíte raz, počas zostavovania, a potom s ním šťastne žijete – pokiaľ ste vedeli, že ho robíte.

Nabudúce – a ako si ho zaobstarať

Počas tohto natáčania bolo na stole aj niekoľko ďalších vecí, ktoré nepatria k tomuto serveru. RTX 4090 a NVIDIA CMP 170HX – ťažobná karta z éry Etherea, ktorá je na našej stránke uvedená za 1 600 eur. Táto karta dostane v ďalšom videu riadnu recenziu a riadne testovanie, takže ju tu nebudeme rozoberať len polovične.

Taktiež zostavujeme skutočnú porovnávaciu tabuľku pre niekoľko otvorených modelov. Čísla, metodika, žiadne odmietania. To je tiež ďalšia téma.

Ak chcete stroj ako je tento – alebo jeho menšiu verziu, pracovnú stanicu alebo hernú zostavu – presne to robí Kentino. Prezrite si kolekciu serverov s umelou inteligenciou alebo nám povedzte, čo potrebujete, a my vám to navrhujeme.

Späť na blog