Ethernet pre umelú inteligenciu: Základy 25/100/400 GbE

Ethernet je predvolená infraštruktúra pre akýkoľvek klaster umelej inteligencie postavený mimo hyperscalera. Na papieri to nie je vždy najrýchlejšia možnosť – N02 bude argumentovať v prospech InfiniBandu tam, kde v skutočnosti vyhráva – ale je to možnosť, ktorá existuje všade, spúšťa každý susediaci nástroj, stojí najmenej za gigabit a neobmedzuje vás na nič.

Pre klastre úrovne Kentino – inferenčné servery s jedným uzlom, tréningové zariadenia s 2 až 8 uzlami, malé výskumné laboratóriá – je Ethernet v podstate vždy správnou odpoveďou. Zaujímavé otázky sú: ktorá úroveň rýchlosti, ktorá sieťová karta, meď alebo optická vlákna a koľko každé zvýšenie ceny v skutočnosti stojí. Tento článok na ne úprimne odpovedá s číslami z polovice roka 2026.

Ak nasadzujete jeden 4-GPU alebo 8-GPU box len na účely inferencie a nič iné, môžete prejsť na tabuľku nákladov v dolnej časti a prestať. Zvyšok tohto článku je určený pre plánovačov s viacerými uzlami.

Prečo Ethernet automaticky víťazí

Tri dôvody, zoradené podľa toho, ako často v skutočnosti ovplyvňujú rozhodnutie:

  1. Ekosystém. Každý server, prepínač, úložný priestor a orchestrátor ovláda Ethernet. Ovládače sú súčasťou jadra. Monitorovacie nástroje to predpokladajú. Prvý deň nového zamestnanca nie je ako „dovoľte mi vysvetliť InfiniBand“.
  2. Cena za gigabit. 100 GbE prepínač stojí zhruba štvrtinu ceny porovnateľného HDR InfiniBand. DAC a transceivery sú bežnou komoditou. Sieťové karty dodáva viacero dodávateľov – NVIDIA, Broadcom, Intel – čo umožňuje udržiavať ceny na rovnakej úrovni. InfiniBand je od jedného dodávateľa.
  3. Žiadne uchytenie látky. Ethernet je prenosová sieť. Moderné prepínače spracovávajú prevádzku TCP, RoCE, NVMe-oF a riadiacej roviny na rovnakom kábli s rozumnou QoS. InfiniBand zaväzuje túto štruktúru k plánu spoločnosti NVIDIA.

Výhodou je, že Ethernet pre AI potrebuje viac ladenia, aby dosiahol rovnaké správanie sa pri rýchlosti pripojenia, aké vám InfiniBand poskytuje hneď po vybalení. RoCEv2, PFC, ECN, DCQCN – všetky konfigurovateľné na Ethernete, všetky predkonfigurované na IB. N02 a N08 to zvládnu.

Úrovne rýchlosti a kedy každá z nich dáva zmysel

Najväčšou chybou v cenových ponukách na úrovni Kentino je nadmerné špecifikovanie prepojenia. 400 GbE prepínač pod inferenčným boxom s 8 GPU sú vyhodené peniaze. 10 GbE prepojenie medzi dvoma trénovacími uzlami je vyhodený čas GPU. Mapa nižšie je tá, na ktorej záleží.

Stupeň Sweet spot Náklady na prístav (polovica roka 2026) Poznámky
1/10 GbE Správa, IPMI/BMC, bootstrap, SSH 50 – 200 EUR Vždy oddelené od dátovej roviny
25 GbE Administrátorský uplink, ľahké úložisko, príjem dát do ~3 GB/s 300 – 600 EUR Najlacnejšia „skutočná“ úroveň; 2× štandard SFP28 na väčšine serverov
100 GbE Vnútroklastrová základná línia pre trénovanie 2–8 uzlov a úložisko RoCE 1200 – 2000 EUR Ťažný kôň – čo potrebuje 80 % viacuzlových špecifikácií Kentina
200 GbE Frontier tréning, trieda 70B+, hustý allreduce 2500 – 4000 EUR Nedostatočne využívaná stredná vrstva; kompatibilná s QSFP56 / QSFP-DD
400 GbE Trénovanie viacerých rackov, hyperscale-adjacent, horúca cesta k dátovej sade 5500 – 9000 EUR Skutočné náklady – iba ak dokážete, že ich grafická karta dokáže absorbovať
800 GbE Špičkové rozvádzače B200/MI355, dnes prevažne hyperškálovateľné € 11000 + Územie ConnectX-8 / Thor Ultra; zriedkavé mimo špičky

Tri veci, ktoré si treba osvojiť internalizáciou:

  • 25 GbE nie je určené pre AI fabric. Slúži na všetko okolo – administráciu, telemetriu, prepojenie s úložným serverom, keď úložisko nie je na rovnakej RDMA štruktúre. Nazývanie 25 GbE „vrstvou AI“ naznačuje, že dodávateľ nepozná pracovnú záťaž.
  • 100 GbE je úprimná základná línia pre viacuzlové siete. Pod touto hranicou gradientná synchronizácia zastavuje každú iteráciu. Nad touto hranicou je otázkou, či vaše GPU dokážu produkovať dáta dostatočne rýchlo na to, aby sa saturovali káble. Pre systémy s jedným uzlom 5090 / RTX Pro 6000 Blackwell, ktoré vykonávajú náročnú prácu, zvyčajne stačí 100 GbE.
  • 400 GbE sa vyplatí len pri skutočnom tréningu s viacerými rackmi. Dva uzly s 8 GPU, ktoré vykonávajú jemné doladenie 70B dát, to nepotrebujú. Šestnásť uzlov, ktoré vykonávajú predtrénovanie na tokenizovanom texte, to potrebuje.

Existuje 800 GbE, kremík sa dodáva (ConnectX-8, Thor Ultra), ale momentálne ide o hyperškálovač a nasadenie triedy B200. Spomínané pre úplnosť; je nepravdepodobné, že by ste ho špecifikovali v zostave Kentino v roku 2026.

Rodiny NIC, ktoré skutočne dodávajú

Trh sieťových kariet v roku 2026 bude ovládaný radom ConnectX od spoločnosti NVIDIA, zvyšok pokrývajú Broadcom a Intel. Existujú aj spoločnosti Marvell, AMD/Pensando a niekoľko Broadcomov preznačených na OEM, ale zriedkavo sa objavujú v zoznamoch Kentino.

NIC maximálna rýchlosť PCIe Poznámky / typická rola
Intel E810-CQDA2 2 × 100 GbE Gen 4 x 16 Najlacnejšie a najdôveryhodnejšie 100 GbE; spoľahlivé ice ovládač; podporovaný RoCE v2
Mellanox ConnectX-6 Dx 2 × 100 GbE Gen 4 x 16 Ťažký stroj pre 100 GbE na hostiteľoch Gen 4; vyspelý RoCE
Mellanox ConnectX-7 1–2 × 200/400 GbE alebo NDR IB Gen 5 x 16 Duálny režim IB/Ethernet; aktuálna špičková špecifikácia Kentina pre seriózne viacuzlové systémy
Broadcom Thor 2 2 × 200/400 GbE Gen 5 x 16 Podniková trieda, RoCE v2, používaná v OEM rebrandingových SKU
NVIDIA BlueField-3 SuperNIC 1–2 × 400 GbE Gen 5 x 32 16-jadrový procesor Arm DPU; RoCE, NVMe-oF, odľahčenie šifrovania; drahé
NVIDIA ConnectX-8 1 × 800 / 2 × 400 GbE Gen 6 x 16 Najnovšie; páruje sa so Spectrum-X 800; na napájanie je potrebný PCIe Gen 6
Broadcom Thor Ultra 1 × 800 GbE Gen 6 x 16 Kompatibilné s UEC-1.0; sieťová karta s umelou inteligenciou bez nutnosti konfigurácie; cieľ škálovania 100 000+ XPU

Úprimné tipy na prácu na úrovni Kentino:

  • Intel E810-CQDA2 keď zákazník chce 100 GbE s obmedzeným rozpočtom a akceptuje, že ladenie RoCE je prácnejšie ako na Mellanoxe. Približne 700 – 900 € na ulici.
  • ConnectX-6 Dx pre akékoľvek 100 GbE prepojenie, ktoré musí spoľahlivo prevádzkovať RoCE. Príplatok 1 100 – 1 500 €. 90% odpoveď.
  • ConnectX-7 Keď je platforma PCIe Gen 5 a 200 alebo 400 GbE, je to opodstatnené skutočným tréningom pre viacero uzlov. Jednoportová karta OSFP NDR400 stojí okolo 1650 eur a vo firmvéri prepína medzi IB a Ethernetom – čo je užitočné, ak by ste neskôr migrovali fabric.
  • BlueField-3 a ConnectX-8 existujú; ak ich len špekulujete, nečítate tento článok.

PCIe je tichý strop. 100 GbE sieťová karta v slote Gen 3 x8 pracuje rýchlosťou linky a beží na polovičnej rýchlosti. Pravidlo:

Rýchlosť sieťovej karty Minimálne PCIe Pohodlný slot
25 GbE Gen 3 x 4 Gen 4 x4 alebo Gen 3 x8
100 GbE Gen 4 x8 alebo Gen 3 x16 Gen 4 x 16
2×100 GbE Gen 4 x 16 Gen 5 x8 alebo Gen 4 x16
200 GbE Gen 5 x8 alebo Gen 4 x16 Gen 5 x 16
400 GbE Gen 5 x 16 Iba 5. generácia x16
800 GbE Gen 6 x16 alebo 2× Gen 5 x16 Iba 6. generácia x16

Na platformách Kentino EPYC s 8 GPU zaberajú GPU väčšinu slotov Gen 4/5 x16; sieťová karta v niektorých konfiguráciách končí v Gen 4 x8. To je v poriadku pre jeden 100 GbE port, pre dva je to marginálne. Pred zadaním ponuky si to overte. W02 (PCIe linky a topológia) je podrobnejšia verzia tohto článku.

Kovové a optické možnosti – DAC, AOC, optika

Tri spôsoby, ako vytvoriť fyzické prepojenie, oddelené rádovou hodnotou nákladov. Kupujúci míňajú skutočné peniaze na optiku tam, kde by DAC fungoval.

voľba Dosah (100 GbE) Dosah (400 GbE) Cena za linku (100 GbE) Cena za linku (400 GbE) Výkon / latencia
DAC (pasívna meď) 1–3 m, ≤5 m s aktívnymi variantmi ≤2 m praktická, ≤3 m pasívna 50 – 150 EUR 200 – 400 EUR ~0 W, sub-ns/m
AOC (aktívna optická) Typicky 3–30 m, do 100 m 3–30 m, max. 100 m 200 – 500 EUR 600 – 1200 EUR 2–4 W na koniec, ~5 ns/m
Optika SR + MMF 70 m na OM3 / 100 m na OM4 / 150 m na OM5 typicky 30–100 m (SR4 / SR8) 400 – 1 500 € za pár + vlákno 1500 – 1 500 € za pár + vlákno 3–4.5 W na koniec
Optika LR + SMF do 10 km do 10 km 800 – 1 500 € za pár + vlákno 2 500 – 4 000 €+ pár + vlákno 3.5–5 W na koniec

Pravidlá, ktoré platia pre všetkých dodávateľov:

  • DAC vo vnútri jedného racku. Pasívna meď na 100GBASE-CR4 je spoľahlivá do 3 m, s aktívnymi variantmi je špecifikovaná do 5 m. Praktický limit je 400G (100G PAM4 na kanál). 2 m pasívny — Existujú 3 m DAC prevodníky, ale integrita signálu sa pri ohýbaní kábla stáva krehkou.
  • AOC pre behy na 5–30 m, najmä cez susedné stojany. Vysielač/prijímač je spojený s optickým vláknom, takže zlý koniec znamená zošrotovanie celého kábla.
  • Optika SR + MMF pre vedenia v miestnostiach nad 30 m alebo tam, kde už existuje štruktúrovaná kabeláž. OM5 ponúka o ~50 % väčší dosah ako OM4 pri 100 GbE SR a je to práve to, čo by ste mali zvoliť pre nové inštalácie už dnes.
  • Optika LR + SMF na prechádzanie budovami alebo miestnosťami. Nadmerná záťaž v rámci jedného 4-rackového klastra.

Matematika dĺžky kábla pre 4-rackový klaster. Rad štyroch 42U rackov, každý široký ~600 mm s ~100 mm medzerou medzi rackmi. Prepínač v hornej časti racku v hornej časti racku 1 k sieťovej karte v spodnej časti racku 4: ~2.1 m horizontálne + ~2 m vertikálne = ~4 m kábla s rezervou. Pri 100 GbE ste na okraji DAC; pri 400 GbE ste za ním. Pre akýkoľvek klaster širší ako ~2 racky pri 400 GbE naplánujte AOC alebo optiku. Toto je najčastejšia chyba v špecifikáciách pri cenových ponukách pre viac rackov – za predpokladu, že DAC dosiahne, pretože „racky sú tesne vedľa seba“.

Komplexné 100 GbE prepojenie, 2 m vnútrorackové prepojenie, polovica roka 2026: pár ConnectX-6 Dx ~2 400 EUR + dva prepínacie porty s amortizáciou ~1 500 EUR + 2 m QSFP28 DAC ~90 EUR = ~4 000 EUR za prepojenie . Rovnaké prepojenie s rýchlosťou 400 GbE (pár ConnectX-7, 400 GbE prepínacie porty, 2 m QSFP-DD DAC) stojí približne 14 000 EUR – 4-násobok šírky pásma za ~3.5-násobok nákladov. Ekonomická stránka je rozumná; otázkou je, či si to pracovná záťaž vyžaduje.

Prepnúť na šírku

Trh s ethernetovými prepínačmi s umelou inteligenciou v roku 2026 sa dá zrejme rozdeliť do troch skupín.

Trieda Príklady Latencia na port Poznámky
AI na vrchu racku (prierez, hlboký vyrovnávací priestor) NVIDIA Spectrum-X SN5600 (64×800 GbE / 51.2 Tb/s), Arista 7060X4 (32×400 GbE, ~700 ns), Cisco Nexus 9300 400–700 ns Bezstratové šablóny RoCE, PFC/ECN ihneď po vybalení, testované AI fabric
Modulárna chrbtica Arista 7800R3 (až 36×400 GbE na linkovú kartu), Cisco Nexus 9500 1–3 µs v závislosti od linkovej karty Pre klastre so 16 a viac uzlami; smerovaná chrbticová sieť Clos
Generické / biele krabice Trieda Tomahawk so SONiC, Dell PowerSwitch a Mikrotik pre nižšiu triedu mení sa, 600 ns – 3 µs Lacnejšie, viac konfiguračných prác, ladenie RoCE je vaša práca

Dva názorové výroky:

  • Pre tréningové klastre so 4 až 8 uzlami s rýchlosťou 100 alebo 400 GbE je správnou odpoveďou jeden Spectrum-X SN5600 alebo Arista 7060X4. Jeden prepínač, jedna doména zlyhania, žiadne zatvorenie, šablóny RoCE dodávané dodávateľom. SN5600 má rozhranie 64×800 GbE v rozhranie 2U s agregovanou rýchlosťou 51.2 Tb/s a hlbokými vyrovnávacími pamäťami vyladenými umelou inteligenciou; 7060X4 vám poskytuje 32×400 GbE v rozhranie 1U s latenciou ~700 ns za citeľne menej peňazí, keď nepotrebujete 800 GbE.
  • Pre 16 a viac uzlov naplánujte smerovanie L3 Clos. s dvoma tŕňmi, BGP nečíslovaný medzi listami a tŕňmi, ECMP cez tŕne. N08 pokrýva mechaniku uplinku; N04 pokrýva výber topológie.

MTU a jumbo rámce

Predvolená hodnota MTU pre Ethernet je 1500 bajtov. Pri rýchlosti 100 GbE je to približne 8.3 milióna paketov za sekundu na stream, pričom každý z nich platí náklady jadra na paket. MTU 9000 znižuje rýchlosť paketov 6-násobne, zodpovedajúcim spôsobom znižuje zaťaženie CPU a je v podstate povinná pre akúkoľvek štruktúru umelej inteligencie.

Konkrétne pre RoCEv2 sa MTU v štýle IB vyberá z najväčšej veľkosti, ktorá sa zmestí do ethernetovej MTU. Ethernet s veľkosťou 9 000 bajtov dáva RoCE 4 096 bajtov MTU – hodnotu, ktorú očakáva každý zásobník NCCL a RDMA. Ak zostanete na hodnote 1 500, získate RoCE MTU s veľkosťou 2 048 bajtov a citeľnú stratu výkonu na každom kolektíve.

Tri veci, ktoré treba vedieť:

  • Musí sa zhodovať od začiatku do konca. Jedno zariadenie s kapacitou 1500 MTU v ceste ticho fragmentuje a znižuje priepustnosť. Nastavte ho na každú sieťovú kartu, každý port prepínača a každý smerovač v sieti AI VLAN.
  • Udržujte jumbo obmedzené na AI VLAN. Vaša firemná sieť nebude bez problémov prevádzkovať MTU 9000. Rovina riadenia zostáva na 1500.
  • Overiť pomocou ip link a tracepath, nie dôverovaním konfigurácii. Počet klastrov, kde niekto nastavil 9000 na sieťových kariet a zabudol porty prepínača, je trápny.

Stratový vs. bezstratový Ethernet – ukážka

Obyčajný TCP/IP cez Ethernet je stratový : prepínače zahadzujú pakety, keď sa fronty naplnia, TCP sa znova odosiela, priepustnosť sa znižuje. Je to v poriadku pre streamovanie webovej prevádzky, ale fatálne pre RDMA – strata jediného paketu v RoCE allreduce ukončí celý prenos a núti NCCL prekročiť časový limit.

Riešením je bezstratový Ethernet , ktorý sa dosahuje spoločným fungovaním dvoch mechanizmov:

  • PFC (Prioritné riadenie toku, 802.1Qbb) — pauza podľa priority. Keď sa vyrovnávacia pamäť prepínača pre prioritu 3 (podľa konvencie priorita RDMA) naplní, odošle rámec pauzy do portu proti prúdu. Krátkodobá núdzová brzda.
  • ECN (Explicitné oznámenie o preťažení) — prepínače označujú pakety vo frontoch, ktoré sa zapĺňajú, prijímač odošle späť CNP, odosielateľ spomalí. Dlhodobá kontrola preťaženia.

Spoločne tvoria DCQCN – Data Center Quantized Congestion Notification – čo je štandardná riadiaca slučka RoCEv2 na moderných ethernetových AI tkaninách. ECN vykonáva prácu väčšinu času, PFC sa spúšťa iba vtedy, keď ECN nedokáže reagovať dostatočne rýchlo.

Ponaučenie z tohto článku: ak používate RoCE, váš prepínač musí podporovať PFC a ECN na priorite RDMA a vaša sieťová karta musí byť nakonfigurovaná tak, aby ich označovala/rešpektovala. Kúpa prepínača od dodávateľa so zdokumentovanými šablónami RoCE (NVIDIA Spectrum, Arista, Cisco Nexus 9000) ušetrí týždeň konfiguračnej práce. N02 sa venuje porovnaniu s InfiniBand; N07 sa hlboko venuje kontrole preťaženia.

Hĺbka vyrovnávacej pamäte – plytká vs. hlboká

Druhou osou na prepínačoch AI je hĺbka vyrovnávacej pamäte. AllReduce je v každej iterácii typu many-to-one – každý uzol v kruhu alebo strome konverguje k jednému uzlu v rovnakom okamihu. To je incast a drví prepínače s plytkou vyrovnávacou pamäťou.

  • Prepínače s plytkou vyrovnávacou pamäťou (starší Tomahawk, generický Enterprise) majú celkovo 4–32 MB vyrovnávacej pamäte. Lacné, s nízkou latenciou, vhodné pre prevádzku východ-západ v podnikovej sieti. Zahodia pakety pri prvom incastovaní.
  • Prepínače umelej inteligencie s hlbokou vyrovnávacou pamäťou (Jericho3-AI, Spectrum-X, niektoré linkové karty 7800R3) majú stovky MB až niekoľko GB vyrovnávacej pamäte. Absorbujú objem incastu, zadržiavajú pakety, zatiaľ čo DCQCN znižuje počet odosielateľov.

Pre klaster s 2 uzlami je hĺbka vyrovnávacej pamäte irelevantná. Pre 8 a viac uzlov, ktoré vykonávajú hustú redukciu všetkých parametrov, predstavujú hlboké vyrovnávacie pamäte rozdiel medzi zdravou štruktúrou a štruktúrou, ktorá vynecháva pauzy a zastavenia PFC. Toto je skutočný dôvod, prečo si kúpiť prepínače triedy AI namiesto generických prepínačov.

Úprimný názor – vzťahuje sa to na vašu zostavu?

Jednouzlový server Kentino K-AI, ktorý vykonáva inferenciu alebo jemné ladenie jedného uzla, nič z toho nepotrebuje . GPU komunikujú cez PCIe a NVLink; ethernetové pripojenie slúži na vstupné výzvy, výstupné tokeny a čítanie dátových súborov. Postačuje dvojica 25 GbE SFP28 portov na integrovanej sieťovej karte hostiteľa.

Toto čítate, pretože plánujete dva alebo viac uzlov. Matica:

  • 1 uzol: 10 alebo 25 GbE integrované. Bez možnosti upgradu.
  • 2–4 uzly, jemné doladenie: 100 GbE cez ConnectX-6 Dx, jeden prepínač, konfigurácia RoCE. ~4 000 € za linku.
  • 4–8 uzlov, viac ako 70B tréningov: 100 alebo 200 GbE s ConnectX-7, ak je k dispozícii PCIe Gen 5. Jeden prepínač Spectrum-X SN5600 alebo Arista 7060X4.
  • 8–16 uzlov, hustý tréning: 200 alebo 400 GbE, smerované L3 Clos s dvoma chrbticami, prepínače s hlbokou vyrovnávacou pamäťou.
  • 16+ uzlov: okrem typickej zostavy Kentina. Použite referenčnú architektúru NVIDIA (Spectrum-X, BlueField-3 alebo ConnectX-8) a konzultanta.

Čo urobiť ďalej

Pred podpísaním sieťovej časti cenovej ponuky odpovedzte písomne:

  1. Koľko uzlov bude v skutočnosti bežať spolu? Nie „neskôr“, nie „možno“. Toto určuje veľkosť úrovne.
  2. Aká je najväčšia tréningová záťaž, ktorú budete absolvovať od začiatku do konca? Predtrénovanie LLM tokenov a textu vyžaduje málo šírky pásma; difúzia obrázkov/videa vyžaduje veľa šírky pásma.
  3. Je RoCE na stole? Ak áno, vyberte si sieťové karty Mellanox a dodávateľa so šablónami RoCE. Ak nie, Intel E810 je v poriadku a o 500 eur lacnejší na hostiteľa.
  4. Aká je skutočná dĺžka kábla od servera k prepínaču? Merajte páskou, neodhadujte. Limity DAC pri 100G/400G sú prísne.
  5. Oddelili ste manažment od dátovej roviny? Vždy dve siete – lacná 1/10 GbE pre SSH/IPMI/Prometheus a drahá sieť RDMA iba pre NCCL. N08 má rozloženie.
  6. Má hostiteľ PCIe linky? 400 GbE sieťová karta v slote Gen 4 x16 poskytuje v praxi približne 200 GbE. Pred cenovou ponukou si to overte.

Krížové odkazy v N-tracku pre ďalšiu vrstvu detailov: N02 (InfiniBand vs RoCE vs obyčajný Ethernet – kedy alternatíva k Ethernetu skutočne zvíťazí), N04 a N05 (prepínané a neprepínané topológie pre prípad s viacerými uzlami), N06 (rozbor latencie – kam mikrosekundy skutočne idú) a N08 (nastavenie RDMA v praxi a ako sa klaster pripája k zvyšku sveta).

Ethernet pre umelú inteligenciu je vyriešený problém. Chyby, ktoré sa objavujú, sa takmer nikdy netýkajú kábla – sú to zadanie nesprávnej úrovne pre pracovnú záťaž, umiestnenie sieťovej karty do nesprávneho slotu PCIe alebo zaobchádzanie s prepínačom ako s komoditou, pričom pracovná záťaž v skutočnosti potrebuje hlboké vyrovnávacie pamäte a PFC. Ak tieto tri veci urobíte správne, sieť bude nudnou časťou zostavy, čo je presne to, čo chcete.


Toto je súčasť Kentino Wiki, referenčnej série o umelej inteligencii, robotike a systémoch, ktoré ich spájajú. Pripomienky a opravy sú vítané na adrese info@kentino.com.