2026. augusztus 19., szerda · Eszközök
NVIDIA: több GPU-s UMAP-számítás 870 GB-os adathalmazon 8 perc alatt
Az NVIDIA saját technikai blogja szerint a cuML és cuVS könyvtárak 25.06-os verziója már több GPU-n is támogatja az UMAP dimenziócsökkentő algoritmus legköltségesebb lépését, az összes szomszédot kereső kNN-gráf felépítését. A vállalat állítása szerint a módszer az adathalmazt kiegyensúlyozott klaszterekre osztja, ezekhez külön-külön számol lokális kNN-gráfot, majd ezeket globális gráffá egyesíti, elkerülve a teljes körű GPU-k közötti kommunikációt. Az NVIDIA mérései alapján a MIRACL és Wiki adathalmazokon nyolc H100 GPU-val akár 74-szeres gyorsulást értek el a becsült CPU-s futásidőkhöz képest, és 870 GB-nyi vektort mindössze 8 perc alatt dolgoztak fel, az elmondásuk szerint a beágyazások pontosságának megőrzése mellett. A korábbi megoldásban csak a transzformációs lépés futhatott több GPU-n, a tanítás egyetlen GPU-ra korlátozódott.
Miért fontos?
A fejlesztés a gyártó adatai szerint gyakorlativá teheti az UMAP futtatását több száz gigabájtos, korábban kezelhetetlenül nagy adathalmazokon is.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 19., szerda napi AI összefoglaló része.