AI-fogalom · Modellek
Nagy nyelvi modell (LLM)
Hatalmas szövegkorpuszon tanított neurális háló, amely szöveget értelmez és generál.
Más néven: LLM, large language model
A nagy nyelvi modell (LLM) olyan mély neurális háló, amelyet rengeteg szövegen tanítottak be a következő token előrejelzésére.
Ebből a látszólag egyszerű feladatból a modell nyelvtani, tárgyi és érvelési képességeket sajátít el.
Kapcsolódó fogalmak
Kapcsolódó hírek
-
Kutatás 2026. augusztus 16., vasárnap
LLM-ügynökök automatizálják a kiskereskedelmi árazási hierarchiák felépítését
Egy arXiv-on közzétett, egyelőre nem lektorált dolgozat egy több nagy nyelvi modell alapú ügynökből álló keretrendszert mutat be, amely automatizálja az úgynevezett „Lines and Ladders” árazási taxonómiák felépítését milliós tételszámú kiskereskedelmi katalógusokban. A szerzők állítása szerint a rendszert valós vállalati adatokon tesztelték és éles termelési környezetben is bevezették. A háromügynökös elrendezés 0,83-as F1-értéket ért el a „Lines” kategóriában, felülmúlva az egyetlen ügynökös alapmodelleket, mert a feladatok szétosztásával csökkenti az egyes ügynökök kognitív túlterhelését. Élelmiszer és fogyasztási cikkek esetén 90% feletti pontosságot és 75% feletti fedést, a kevésbé strukturált általános kereskedelmi katalógusban 80,2%-os besorolási pontosságot mértek. Ezek a számok a szerzők saját méréseiből származnak, független megerősítésük egyelőre nem ismert.
-
Kutatás 2026. augusztus 16., vasárnap
Evolúciós stratégiák javíthatják az LLM-ek megoldás-lefedettségét
Egy nem lektorált, arXiv-on közzétett kutatás azt állítja, hogy a nagy nyelvi modellek megerősítéses tanulással (RL) történő utótanítása szűkíti a modell kimeneti eloszlását a magas jutalmú válaszok köré, ami csökkenti az úgynevezett pass@k mutatót, vagyis a modell azon képességét, hogy sokféle helyes megoldást találjon egy adott problémára. A szerzők ehelyett evolúciós stratégiákat (ES) javasolnak: ez egy populáció-alapú, gradiens nélküli módszer, amely véletlenszerű súlytér-perturbációkkal optimalizál. A kutatók szerint az ES módszer következetesen magasabb pass@k értéket ér el, mint az RL, szélesebb kimeneti eloszlást és nagyobb megoldás-lefedettséget produkál, ami standard matematikai benchmarkokon jobb eredményekhez vezet. A tanulmány ezt olyan felfedezési feladatoknál (matematika, tudomány) tartja különösen fontosnak, ahol a diverz megoldáshalmaz kritikus.
-
Eszközök 2026. augusztus 13., csütörtök
AWS rétegzett KV-gyorsítótárat épített LLM-inferenciához
Az AWS blogbejegyzése szerint a vállalat rétegzett KV-gyorsítótár architektúrát épített a SageMaker HyperPod platformra, amely a Curvine nevű elosztott gyorsítótár-fájlrendszert használja megosztott NVMe-tárolóként a GPU- és CPU-memória mellett. Ez a HyperPod meglévő Managed Tiered KV Cache és Intelligent Routing képességeire épül, és lehetővé teszi a KV-gyorsítótár megosztását a vLLM-replikák között, közel lokális disksebességgel. A cég saját tesztjében ez akár 100 százalékos, Pod-ok közötti cache-hit arányt, legfeljebb 2,7-szeres TTFT-javulást és mintegy 56 ezredmásodperces csomópontok közötti L2 olvasási késleltetést eredményezett egy körülbelül 1900 tokenes promptnál. Az AWS szerint így olyan feladatok is futtathatók olcsóbb GPU-példányokon, amelyek korábban P5-ös instance-t igényeltek. Az eredmények a vállalat saját mérésén alapulnak, független validálásról nincs információ.
-
Kutatás 2026. július 31., péntek
Kutatók: alapvető, javíthatatlan biztonsági hiba lehet az LLM-ekben
Egy kutatócsoport az ICML konferencián bemutatott tanulmányában azt állítja, hogy a nagy nyelvi modellek működésének egy alapvető sajátossága miatt lehetetlen teljesen biztonságossá tenni őket. A szerzők szerint a probléma abban rejlik, ahogyan az LLM-ek megkülönböztetik, ki vagy mi ad nekik utasítást: ha a kérést a modell belső „gondolatmenetét” utánzó stílusban fogalmazzák meg, a rendszer könnyen azt hiheti, hogy saját ötletéről van szó, és végrehajtja a tiltott utasítást. Ezzel a módszerrel állításuk szerint sikerült népszerű modelleket rávenni tiltott információ kiadására, például kokainszintézisre vagy repülőgép navigációjának szabotálására. A társszerzők szerint a jelenlegi tiltólista-alapú védelem és a red-teaming elvi okokból soha nem lehet teljes.
-
Modellek 2026. július 16., csütörtök
Az OpenAI megépítette a GPT-Red-et, egy LLM-alapú szuperhackert a modellek biztonságáért
Az OpenAI létrehozott egy GPT-Red nevű, támadóképességre kiképzett nagy nyelvi modellt, amellyel automatizáltan teszteli saját rendszerei biztonságát – a MIT Technology Review exkluzív beszámolója szerint. A GPT-Red-et önjáték-ciklusban képezték ki több modell ellen: a támadó egyre hatékonyabb prompt-injekciós módszereket fejlesztett ki, a védekező modellek pedig ellenállóbbá váltak. Az OpenAI kutatói szerint a rendszer már korábban ismeretlen támadási módszereket is felfedezett. A vállalat állítása alapján legújabb modelljük, a GPT-5.6 a GPT-Red-del szembeni edzésnek köszönhetően eddigi legrobusztusabb kiadásukká vált. A cél az, hogy az ágensként működő LLM-ek növekvő támadási felületét a jövőben is hatékonyan lehessen ellenőrizni.
-
Kutatás 2026. július 15., szerda
Klinikai LLM-ek nem a tudásukon véreznek el, hanem az aktív információkeresés szisztematikus kudarcán
Egy nem lektorált kutatás 32 élvonalbeli nagy nyelvi modellt tesztelt hematológiai onkológiai eseteken, ahol a modelleknek három körben kellett aktívan klinikai adatokat kérniük diagnózis előtt. A legjobb modell is csak 68%-os pontosságot ért el. A szerzők szerint a diagnosztikai pontosság legerősebb előrejelzője az információ-felhasználási arány volt (R=0,69), amely az utolsó körre 57%-ról 26%-ra esett, így kezelésválasztáshoz kritikus molekuláris adatok feltáratlanok maradtak. A gondolkodási láncolatok magas klinikai minőséget mutattak (91%), de ez nem korrelált a végső pontossággal. A hibaelemzés a kezdő klinikusokra jellemző kognitív torzításokat – horgonyzást, idő előtti lezárást – azonosította fő hibamódként.
-
Kutatás 2026. július 11., szombat
NVIDIA: JAX host offloading akár 57%-kal javítja a nagy nyelvi modellek tanítási átvitelét Blackwell GPU-kon
Az NVIDIA technikai blogja szerint a JAX keretrendszerben alkalmazott host offloading technika jelentősen csökkenti a GPU HBM-szűk keresztmetszetét LLM-tanítás során: a forward pass közben kiválasztott aktivációkat hoszt memóriába mozgatja, majd a backward passnál visszatölti. Az NVIDIA GB200 NVL72 rendszeren végzett MaxText kísérletekben a DeepSeek-V3 671B és Llama 3.1 405B modellekkel az aktiváció-újraszámításhoz képest akár 57%-os átviteli javulást mértek, különösen ritka MoE modellek esetén. A megoldás a Grace Blackwell NVLink-C2C 900 GB/s kétirányú sávszélességére épít, és az optimális eredményhez XLA ütemezési beállítások és Nsight Systems profilozás szükséges.
-
Kutatás 2026. július 10., péntek
ROAM: ipari szakértői modellek LLM-alapú adaptálása újratanítás nélkül
A ROAM keretrendszer az üzembe helyezett ipari modellek korrekcióját célozza nagy nyelvi modellek következtetési képességével, a modellparaméterek újratanítása nélkül. Az eljárás egy alacsony dimenziós látens térben korrigálja a befagyasztott modell kimenetét – például szenzordrift vagy alapanyag-változás esetén –, miközben kockázatkorlátos mechanizmus gátolja a korrekciót megbízhatatlan bizonyíték mellett. A nem lektorált tanulmány szerzői szerint két ipari adathalmazon a módszer több mint 20%-kal csökkentette a MAE-t jelentős rezsimváltásoknál, mindössze 839 extra paraméterrel és 0,02 ms alatti lépésenkénti többletidővel.