2026. július 31., péntek · Eszközök

NVIDIA: rejtett konfigurációs hibák lassíthatják az AI-klasztereket

Az NVIDIA technikai blogja szerint azonos H100, GB200 NVL72 vagy GB300 NVL72 hardverből épített AI-klaszterek betanítási teljesítménye jelentősen eltérhet egymástól, akár 8-12 százalékos réssel a referenciaarchitektúrához képest ugyanazon munkaterhelés mellett. A vállalat állítása szerint ennek oka nem a hardver, hanem a kernel, a hypervisor, a BIOS és az NCCL könyvtár beállításaiban felhalmozódó apró hibák, amelyek együtt az Exemplar Cloud minősítéshez szükséges 95 százalékos küszöb elmulasztásához vezethetnek. Négy valós esetet mutatnak be: hiányzó SMMU-képességek Grace CPU-kon, hibás CPU C-state és NUMA beállítások, elégtelen NCCL sor-pár párhuzamosság ConnectX-8 hálón, és a topológiafájlok konténerekbe nem továbbítása.

Miért fontos?

Az NVIDIA tapasztalata mutatja, hogy azonos hardverű AI-klaszterek teljesítménye rejtett szoftveres beállítások miatt jelentősen szóródhat, ami közvetlen üzemeltetési és költséghatással jár.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 31., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Az NVIDIA gyakorlati tervezési útmutatót ad a hosszú kontextusú AI-modellek gyorsításához

Az NVIDIA hivatalos technikai blogja szerint a mesterséges intelligencia modellek figyelem-mechanizmusának teljesítményét a lekérdezés-fejek és kulcs-érték fejek aránya, a fejdimenzió és a szekvenciahossz határozza meg, ezek eltérően hatnak a feltöltési és a dekódolási fázisra. A cég szerint a dekódolás hatékonysága a csoportmérettel skálázódik, míg a feltöltést a szekvenciahossz uralja, ezért 128 vagy 256 fejdimenziót ajánlanak a GPU-memória illesztéséhez. Az NVIDIA négy gyakorlati irányelvet fogalmaz meg fejlesztőknek, köztük a KV-gyorsítótár tömörítését és a párhuzamosítási stratégia megválasztását a KV-fejek száma alapján, a TensorRT-LLM keretrendszerben implementálva. Az elemzés saját mérési adatokra és matematikai számításokra épül, tehát vállalati, gyártófüggő technikai ajánlás.

Az NVIDIA nyílt forráskódú NOOA ügynökkeretet mutatott be

Az NVIDIA Labs technikai blogján jelentette be a NOOA (NVIDIA Labs Object-Oriented Agents) nevű, nyílt forráskódú, objektumorientált AI-ügynökkeretet. A vállalat közlése szerint a rendszer minden ügynököt egyetlen Python osztályként kezel, ahol a metódusok a képességeket, a mezők az állapotot, a docstringek pedig a promptokat testesítik meg, a típusannotációk pedig kikényszerített szerződésként működnek. A keretrendszer típusos, kapcsolati memóriát tart fenn egy emberi szemmel is olvasható SQLite-adatbázisban, ami az NVIDIA szerint feleslegessé teszi a kontextus-tömörítést. A cég állítása alapján a NOOA a SWE-bench Verified, a CyberGym L1 és az ARC-AGI-3 benchmarkokon jobb pontosságot és alacsonyabb tokenköltséget ér el a korábbi keretrendszerekhez képest, a kódot és kiértékeléseket pedig nyilvánosan elérhetővé tették.

Az NVIDIA bemutatta a hatodik generációs NVLink hálózati technológiát az AI-gyárak számára

Az NVIDIA technikai blogján ismertette a hatodik generációs NVLink skálázási hálózatot, amelyet kifejezetten AI-gyárak számára terveztek. A vállalat szerint a technológia GPU-nként akár 3,6 TB/s sávszélességet, rack-szinten 260 TB/s összesített sávszélességet és 130 TFLOPS hálózaton belüli számítási kapacitást biztosít, jelentősen felülmúlva a hagyományos Ethernet-megoldásokat nagy méretű nyelvi modellek és MoE-architektúrák esetén. Az NVIDIA állítása alapján a Hopper-ről Blackwell-generációra való áttérés ötvenszeres javulást hozott a tokenek per watt mutatóban. A platform szoftveres integráció (Dynamo, TensorRT-LLM, NCCL, NIXL) mellett üzembiztonsági funkciókat is kínál, mint a menet közbeni frissítés, dinamikus útválasztás és melegtárolócserélhető kapcsolók. A jövőbeli bővíthetőséget az NVLink Fusion és az NVLink-C2C technológiák szolgálják.

Az NVIDIA bizalmas számítástechnikája a Blackwell GPU-kon 98%-os teljesítményt nyújt hardveres AI-biztonság mellett

Az NVIDIA műszaki blogján közzétett benchmarkok szerint a Blackwell GPU-kra épülő Confidential Computing (CC) technológia minimális teljesítményveszteséggel biztosít hardverszintű védelmet az AI-inferencia során. A vállalat állítása alapján a HGX B300-on futtatott Qwen 3.5-397B modellel végzett tesztek azt mutatták, hogy a CC bekapcsolása jellemzően 8% alatti áteresztőképesség- és késleltetés-többletet okoz, vagyis a teljesítmény eléri a védelem nélküli megoldás 98%-át. A biztonság alapja a gyártáskor a chipbe égetett privát aláírókulcs, az NVLink titkosítás és a távoli hitelesítés (NRAS). Az NVIDIA kiemeli, hogy optimalizálásokkal – CC-safe autotuning, aszinkron D2H másolás, CUDA-gráf támogatás – sikerült a biztonságos munkabeadás és a titkosított sávszélesség korlátait kompenzálni, így a rendszer termelési szintű, szabályozásnak megfelelő telepítésekre is alkalmas.