2026. augusztus 18., kedd · Modellek
NVIDIA NVFP4-re tömöríti a Nemotron 3.5 Lightning modellt, elérhető AWS-en is
Az NVIDIA technikai blogja szerint kvantálás-tudatos disztillációval (QAD) készült el a Nemotron 3.5 Lightning NVFP4 verziója, amely a teljes pontosságú, 66 GB-os BF16 modellhez képest 22 GB-ra zsugorodik, és a vállalat állítása szerint akár négyszeres áteresztőképességet ér el, közel a BF16 pontosságával. A módszer PTQ-val indul, majd a diákmodellt a fagyasztott tanárhoz igazítja KL-divergencia veszteséggel, ami a cég mérései szerint jobb pontosságmegtartást ad, mint a puszta PTQ. Az AWS bejegyzése szerint a Nemotron 3.5 Lightning – egy 30 milliárd paraméteres, de csak 3 milliárd aktív paramétert használó MoE modell – az Amazon SageMaker JumpStartban is elérhető, nagy volumenű AI-ágensekhez optimalizálva.
Miért fontos?
A modell méretének és futtatási költségének nagyságrendi csökkentése kulcsfontosságú lehet a nagy volumenű, önálló AI-ágensek gazdaságos üzemeltetéséhez.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 18., kedd napi AI összefoglaló része.