Sztori-szál · Modellek · ellenőrizve 5 napja
Kínai AI-modellek felzárkózása a nyugati fejlesztésekhez
A kínai AI-vállalatok gyorsan zárják a technológiai szakadékot a vezető amerikai nagy nyelvi modellekkel szemben, gyakran nyílt forráskódú stratégiával és jelentősen alacsonyabb költségek mellett.
Ez a szál azt a folyamatot követi, amelynek során a kínai AI-fejlesztők - köztük a DeepSeek, az Alibaba Qwen sorozata, a Baidu, a Zhipu AI és a Moonshot AI - egyre versenyképesebb nagy nyelvi modelleket és multimodális rendszereket hoznak piacra. A DeepSeek 2025 eleji áttörése különösen felhívta a figyelmet arra, hogy jelentősen kisebb számítási kapacitással és költséggel is elérhető a csúcsteljesítmény-közeli eredmény, ami megkérdőjelezte a nyugati fejlesztők eddigi versenyelőnyét.
A tétek többrétűek: egyrészt geopolitikai kérdés, hogy az amerikai chipexport-korlátozások ellenére Kína képes-e önerőből, hazai hardveren (pl. Huawei Ascend) versenyképes AI-t építeni. Másrészt piaci szempontból a kínai modellek gyakran nyílt forráskódúak, ami átalakíthatja a globális AI-ökoszisztémát és nyomást gyakorolhat a nyugati zárt modellek árazására és stratégiájára. Harmadrészt biztonságpolitikai és szabályozási aggályok is felmerülnek a kínai modellek elterjedésével kapcsolatban nyugati piacokon.
Érdemes követni ezt a szálat, mert a kínai-nyugati AI-verseny alakítja a technológiai befolyás, a szabályozási válaszok és az iparági üzleti modellek jövőjét, és minden új kínai modellbemutatás újraértékelésre kényszerítheti a globális AI-erőviszonyokat.
Kapcsolódó szálak és fogalmak
- USA-Kína chipháború
- nyílt forráskódú AI-modellek
- AI-szuverenitás
- számítási kapacitás korlátozások
- globális AI-verseny
A szál fejleményei időrendben
-
2026. június 26., péntek Üzlet
Chipverseny és tőzsdei nyomás: az OpenAI és riválisai új kihívásokkal szembesülnek
Az OpenAI a Broadcommal közösen bejelentett egy új, nagy nyelvi modellek következtetési feladataira optimalizált egyedi chipet, amellyel csökkenteni kívánják a növekvő számítási kapacitásigénytől való függőséget. Eközben az Anthropic és az OpenAI egyre erősebb versennyel néz szembe a nyílt forráskódú AI-modellek részéről, amelyek olcsóbb és szabadabban elérhető alternatívát kínálnak. A verseny kiéleződése különösen kritikus, mivel mindkét vállalat tőzsdei bevezetés előtt áll, és a befektetőknek be kell bizonyítaniuk üzleti modelljük fenntarthatóságát. A saját chip fejlesztése stratégiai lépés az OpenAI részéről, hogy csökkentse az Nvidia-függőséget és hosszú távon költségeit.
-
2026. június 29., hétfő Kutatás
A Sina háromparaméteres VibeThinker-3B modellje a százszor nagyobb modellek szintjén teljesít matekban és kódolásban
A kínai Sina (Weibo anyavállalata) kiadta VibeThinker-3B modelljét, amely mindössze 3 milliárd paraméterrel egyes matematikai és kódolási benchmarkokon – a cég technikai jelentése szerint – a 200-333-szor nagyobb modellekkel, például a DeepSeek V3.2-vel és a Kimi K2.5-tel vetekszik. A modell az Alibaba Qwen2.5-Coder-3B alapmodelljére épül, a teljesítményt többlépcsős utóképzéssel érik el. A LeetCode-versenyeken (2026 április–május) 128-ból 123 feladatot elsőre megoldott, megelőzve a GPT-5.2-t és a Claude Opus 4.6-ot – állítja a Sina. Ugyanakkor a széles tárgyi tudást igénylő GPQA-Diamond benchmarkon a modell jelentősen elmarad nagyobb riválisaitól. A kutatók következtetése szerint a strukturált logikai gondolkodás jól tömöríthető kis modellekbe, de a faktikus világtudás továbbra is nagy paraméterszámot igényel.
-
2026. június 30., kedd Modellek
A kínai Zhipu AI azt állítja, hogy nyílt súlyú GLM-5.2 modellje egyes kiberbiztonsági feladatokban felveszi a versenyt a Mythosszal
A kínai Zhipu AI (Z.ai) kiadta nyílt súlyú GLM-5.2 modelljét, amelyről egyes kutatók a The Verge beszámolója szerint azt állítják, hogy bizonyos sebezhetőség-keresési és kiberbiztonsági forgatókönyvekben az Anthropic Mythos modelljéhez hasonló teljesítményt nyújt. A forrás hangsúlyozza, hogy általánosabb feladatokban a GLM továbbra is elmarad az Anthropic és az OpenAI modelljeitől, ugyanakkor a kínai modellek képességbeli lemaradása jelentősen csökkent. Az amerikai kormányzat a fejlett, sebezhetőségeket felismerni képes MI-modelleket nemzetbiztonsági kockázatnak tekinti, és korlátozni igyekszik Kína hozzáférését az ilyen technológiákhoz és a betanításukhoz szükséges hardverekhez. Mivel a GLM nyílt súlyú, bárki letöltheti és futtathatja, ami rugalmasságot ad, de egyben visszaélési kockázatot is jelent, mivel a felügyelet nehezen biztosítható.
-
2026. július 2., csütörtök Kutatás
Lebegőpontos hibák felismerése: 14 nagy nyelvi modellt teszteltek új benchmarkkal
Egy nem lektorált kutatás 14 nagy nyelvi modellt (LLM) értékelt aszerint, hogy mennyire képesek statikusan felismerni és osztályozni a lebegőpontos hibákat C forráskódban. A szerzők létrehozták az InterFLOPBench benchmarkot, amely 90 C kernelt és 1130 tesztmintát tartalmaz hat hibakategóriában: kioltás, összehasonlítás, nullával osztás, túlcsordulás, alulcsordulás és NaN. Az eredmények szerint a legújabb modellek – köztük a Qwen 3 32b, Gemini 2.5 Flash, Phi 4 Reasoning, DeepSeek R1T2 és a gpt-oss 20b/120b – 0,88 feletti összesített F1-pontszámot értek el. A teljesítmény hibakategóriánként eltérő: a nullával osztás átlagos F1-értéke 0,85 volt, míg az alulcsordulás (0,61) és a kioltás (0,62) esetében a modellek gyengébben teljesítettek, jelezve a finomabb numerikus jelenségek felismerésének nehézségét.
-
2026. július 11., szombat Kutatás
LLM-ügynökök piaci stabilitását vizsgáló szimulációban a mediáció bizonyult a legellenállóbb mechanizmusnak
Egy még nem lektorált kutatás 18 DeepSeek-V3 alapú, önérdekű LLM-ügynökből álló piaci szimulációban vizsgálta, milyen formális mechanizmusok képesek fenntartani a piaci stabilitást ismételt társadalmi dilemmákban. Nyolc különböző mechanizmust hasonlítottak össze 200 körös kísérletekben, fokozatosan növelve a troll.
-
2026. július 11., szombat Kutatás
NVIDIA: JAX host offloading akár 57%-kal javítja a nagy nyelvi modellek tanítási átvitelét Blackwell GPU-kon
Az NVIDIA technikai blogja szerint a JAX keretrendszerben alkalmazott host offloading technika jelentősen csökkenti a GPU HBM-szűk keresztmetszetét LLM-tanítás során: a forward pass közben kiválasztott aktivációkat hoszt memóriába mozgatja, majd a backward passnál visszatölti. Az NVIDIA GB200 NVL72 rendszeren végzett MaxText kísérletekben a DeepSeek-V3 671B és Llama 3.1 405B modellekkel az aktiváció-újraszámításhoz képest akár 57%-os átviteli javulást mértek, különösen ritka MoE modellek esetén. A megoldás a Grace Blackwell NVLink-C2C 900 GB/s kétirányú sávszélességére épít, és az optimális eredményhez XLA ütemezési beállítások és Nsight Systems profilozás szükséges.
-
2026. július 12., vasárnap Társadalom
Terrorszervezetek rendszeresen használják a nagy AI chatbotokat támadástervezéshez és fegyverkészítéshez
A Cambridge-i CASP kutatója, Antonia Jülich 27 volt Boko Haram-tag 57 interjúján alapuló tanulmánya szerint az ISIS már 2023 óta oktatja a prompt engineering és jailbreak technikákat, és nigériai Boko Haram-parancsnokokat is kiképzett az AI biztonsági szűrők megkerülésére. A tanulmány szerint a Boko Haram mindkét frakciója dedikált AI-egységeket hozott létre, és a ChatGPT-t, Claude-ot, Geminit, Grokot, Meta AI-t és DeepSeeket használják támadástervezésre, robbanóeszközök fejlesztésére és műveleti biztonságra. A kutatás arra figyelmeztet, hogy a biztonsági szűrők nem képesek megbízhatóan megakadályozni a visszaéléseket – az Anthropic maga is elismerte, hogy a jailbreakek valószínűleg soha nem lesznek teljesen kiküszöbölhetők. Jülich szerint bár a csoport AI-használata egyelőre hagyományos, a tömegpusztító fegyverekhez való AI-segítség kockázatát komolyan kell venni.
-
2026. július 19., vasárnap Kutatás
A nyílt súlyú AI-modellek kiberképességei már csak hónapokkal maradnak el a zárt rendszerektől
A brit AI Biztonsági Intézet (AISI) első nyilvános elemzése szerint a nyílt súlyú AI-modellek kiberképességekben már csak négy-hét hónappal maradnak el a vezető zárt rendszerektől, míg 2025 nagy részében ez hat-tíz hónap volt. Az AISI tesztjei alapján a GLM-5.2 és a DeepSeek V4-Pro konkrét kibertámadási feladatokban és szimulált hálózati gyakorlatokon elérték a korábbi zárt modellek szintjét, lényegesen olcsóbb futtatás mellett. Az intézet figyelmeztet, hogy a nyílt modellek biztonsági korlátai könnyen megkerülhetők, mivel bárki letöltheti és felügyelet nélkül módosíthatja őket – ezt tartós és visszafordíthatatlan visszaélési kockázatnak nevezi. Az elemzés ugyanakkor elismeri a nyílt modellek előnyeit is, és a kockázatok kiegyensúlyozott mérlegelését szorgalmazza.
-
2026. július 20., hétfő Modellek
Az Alibaba bemutatta a 2,4 billió paraméteres Qwen 3.8 modellt, célkeresztben a Kimi K3
Az Alibaba nyilvánosságra hozta legújabb, nyílt súlyú Qwen 3.8 modelljét, amely a vállalat állítása szerint 2,4 billió paraméterrel rendelkezik, és csak a Fable 5 mögött marad el. A csapat szerint ez az első, egybillió paraméternél nagyobb multimodális modelljük, amely képeket, videókat és dokumentumokat is feldolgoz. Független benchmark-eredmények egyelőre nem állnak rendelkezésre, a teljesítményállítások kizárólag a fejlesztő közlésén alapulnak. Az előnézet az Alibaba platformjain a szokásos ár tizedéért érhető el, a nyílt súlyok közzétételét a közeljövőre ígérik. A The Decoder szerint a lépés részben a Moonshot AI Kimi K3 modelljének térnyerését célozza ellensúlyozni.
-
2026. július 21., kedd Szabályozás
A Trump-kormányzat fokozatosan szorítaná ki a kínai MI-modelleket szankciókkal és nyomásgyakorlással
Az Axios értesülései szerint a Trump-kormányzat több intézménye – a Kereskedelmi Minisztérium, az NSA és a Fehér Ház – 2025 óta vizsgálja a kínai MI-modellek visszaszorítását. A tervezett eszköztár szankciós listákat, biztonsági figyelmeztetéseket és végrehajtási rendeleteket foglal magában, amelyek felelősséget rónának a kínai modelleket kiszolgáló amerikai cégekre. Közvetlen tilalom helyett a kormányzat lassú nyomásra épít: beszerzési szabályokkal és nyilvános kampányokkal kívánja elrettenteni a vállalatokat. A háttérben kereskedelmi érdekek is állhatnak, mivel az olcsóbb kínai nyílt forráskódú modellek növekvő népszerűsége fenyegeti a hazai MI-szolgáltatók piaci pozícióját.
-
2026. július 22., szerda Üzlet
Az Egyesült Államoknak nem kellene meglepődnie a kínai MI-modellek térnyerésén
A The Verge elemzése szerint az elmúlt héten két kínai mesterségesintelligencia-cég mutatott be olyan modelleket, amelyek állításuk szerint felveszik a versenyt az OpenAI és az Anthropic legjobb rendszereivel. A piacok megingtak, és számos kommentátor az amerikai technológiai szektor megrázkódtatásáról beszélt: az AP meglepetésként értékelte az eseményt, a Bloomberg áttörésként jellemezte. A cikk szerint azonban a meglepetés indokolatlan, mert a kínai modellek teljesítménybeli hátránya évek óta folyamatosan csökken – az OpenRouter rangsorában a tíz legtöbbet használt MI-eszközből hat kínai. A kínai modellek emellett jóval olcsóbbak, és egyes jelentések szerint amerikai cégek is egyre inkább ezekhez fordulnak a hazai szolgáltatók emelkedő árai miatt.
-
2026. július 22., szerda Eszközök
Az NVIDIA GB300 NVL72 világrekordot állított a DeepSeek-V3 671B MoE-modell előtanításában
Az NVIDIA saját technikai blogján jelentette be, hogy a GB300 NVL72 rendszer GPU-nként 1 648 TFLOPS teljesítménnyel világrekordot ért el a DeepSeek-V3 671B paraméteres Mixture of Experts (MoE) modell előtanításában. A vállalat szerint a teljesítmény kulcsa a teljes rack-szintű együttervezés: az ötödik generációs NVLink GPU-nként 1,8 TB/s sávszélességet és összesen 130 TB/s nem blokkoló all-to-all kommunikációt biztosít. Az NVIDIA állítása alapján szoftveres optimalizálásokkal – a Megatron Core, a TorchTitan és a JAX keretrendszerek révén – 3–10-szeres teljesítménynövekedést értek el az előző generációhoz képest, miközben a GPU-nkénti áteresztőképesség 256-ról 1 024 GPU-ra skálázva is 97% felett maradt. A MoE-architektúrák hatékonyságának lényege, hogy a tokenek csak a paraméterek kis részhalmazát aktiválják, ami viszont fokozott kommunikációs igényt támaszt a GPU-k között.
-
2026. július 25., szombat Eszközök
NVIDIA ModelExpress: modellsúlyok villámgyors elosztása GPU-k között a klaszterben
Az NVIDIA bemutatta a ModelExpress (MX) nevű platformot, amely a nagy nyelvi modellek súlyainak klaszteren belüli mozgatását gyorsítja fel. A rendszer a betöltés előtt megkeresi, hol található már kompatibilis súlymásolat, és a leggyorsabb elérhető útvonalat választja: ha egy kiszolgáló társgépen megvannak a súlyok, azokat közvetlenül GPU-ról GPU-ra másolja RDMA-n keresztül az NIXL könyvtár segítségével, elkerülve az objektumtárolót, a lemezt és a gazdagép memóriáját. Az NVIDIA szerint az MX a DeepSeek-V4 Pro súlyait és a JIT kernelgyorsítótárat kevesebb mint 10 másodperc alatt képes átvinni egy új replikába. A platform többszálú streamelést, elosztott atomi gyorsítótárazást és GPUDirect Storage támogatást alkalmaz, valamint integrálódik a vLLM, SGLang, Dynamo és llm-d keretrendszerekkel, így az éles LLM-telepítések hidegindítási és skálázási idejét jelentősen csökkenti.
-
2026. július 25., szombat Kutatás
CANN Bench: nyílt benchmark AI által generált operátorkernelekhez Huawei Ascend NPU-n
Kutatók bemutatták a CANN Bench nevű nyílt benchmarkot, amely AI-ágensek által írt, alacsony szintű operátorkerneleket értékel Huawei Ascend NPU hardveren. A nem lektorált preprint szerint a benchmark 53 operátort és 1060 tesztesetet tartalmaz négy nehézségi szinten – egyszerű primitívektől a FlashAttention kernelekig –, FP16, BF16, FP32 és INT8 formátumokban. Az értékelés három dimenzió – fordíthatóság, funkcionális helyesség és teljesítmény – súlyozott pontszámán alapul, valós NPU-hardveren mért analitikus teljesítménykorláthoz viszonyítva. A szerzők szerint a módszer ellenáll a jutalom-manipulációnak, és hosszú távú közösségi fejlesztésre tervezett, pótolva a CUDA-centrikus benchmarkok hiányosságait.
-
2026. július 28., kedd Üzlet
Miért ad ingyen súlyokat a kínai Moonshot AI a Kimi K3-hoz?
A The Verge szerint a Szilícium-völgyben komoly aggodalmat váltott ki a kínai Moonshot AI Kimi K3 nevű modellje, amelyről a fejlesztő azt állítja, hogy egyes amerikai csúcsmodelleket is felülmúl, jóval alacsonyabb költség mellett. A cikk kiemeli, hogy a Moonshot ingyenesen elérhetővé teszi a modell súlyait, és kifejezetten amerikai fejlesztőket céloz meg, ami tovább erősíti a versenyt a zárt amerikai és a nyílt kínai rendszerek között. Fontos megkülönböztetés, hogy a súlyok ingyenessége nem jelenti a teljes forráskód, a tanítóadatok vagy az architektúra nyilvánosságát, így ez nem azonos a hagyományos nyílt forráskóddal. Egy megkérdezett jogi szakértő szerint a cégek a modellt körülvevő szolgáltatásokból, infrastruktúrából és üzemeltetésből profitálhatnak, miközben magát a modellt ingyen adják.
-
2026. július 28., kedd Szabályozás
Szétforgácsolt AI-politika: kik irányítják Trump kormányzatában a Kína elleni versenyt
A WIRED cikke szerint Donald Trump kormányzatában nincs egységes AI-stratégia: a döntéshozatal több hivatal között oszlik meg, egy magas rangú fehér házi tisztviselő szerint „nem kétpólusú vita, hanem tíz irányba húzó vita” zajlik. A lap szerint Howard Lutnick kereskedelmi miniszter befolyásos szereplő az exportkorlátozásokon keresztül: nyilvánosan gyengébbnek minősítette a kínai Moonshot AI Kimi K3 modelljét a vezető amerikai modellekhez képest, ugyanakkor korábban exportkorlátozást vezetett be az Anthropic ellen is. Arvind Raman a hét elején vette át a CAISI ügynökség irányítását, miután elődje az Anthropic Fable 5 modelljének jailbreak elleni védelmét érintő heteken át tartó egyeztetés után lemondott. Sean Cairncross nemzeti kiberbiztonsági igazgató a cikk szerint keményebb vonalat képvisel a kínai AI-labokkal szemben, és részt vett Trump június 2-i AI-rendeletének kidolgozásában.
-
2026. augusztus 1., szombat Társadalom
Kínai AI-kutatók tömegesen jelentek meg az X-en
A WIRED riportja szerint az elmúlt évben ugrásszerűen nőtt a kínai mesterségesintelligencia-kutatók jelenléte az X-en: a lap mintegy 30, a Moonshot AI-hoz köthető fiókot talált, köztük két társalapítóét és több volt munkatársét. Hasonlóan aktívak a MiniMax és a Z.ai szakemberei, sőt a cikk szerint a DeepSeek egyes alkalmazottai is rendszeresen posztolnak, jóllehet állítólag nem hagyhatják el Kínát, mert az állam elkobozta útlevelüket. Meng Fanqing, az Evolvent AI társalapítója és a Moonshot volt gyakornoka szerint az X jelenleg a legjobb közösség komoly technikai AI-vitákhoz, és sok kutató a DeepSeek R1 2025 eleji nemzetközi sikere után kezdett tudatosan nemzetközi jelenlétet építeni. Egy elemző szerint ezt a teret részben az is megnyitotta, hogy az OpenAI és az Anthropic kutatói egyre visszafogottabbak a nyilvános megszólalásban.
-
2026. augusztus 2., vasárnap Üzlet
Kínai nyílt súlyú AI-modellek megosztják a Szilícium-völgyet és a Fehér Házat
A Guardian szerint az elmúlt hónap kínai AI-, chip- és robotikai fejlesztései felkavarták a piacokat, és nyílt nézeteltérést szültek a technológiai vezetők között. A legközvetlenebb kihívást a szabadon letölthető, nyílt súlyú kínai modellek jelentik, mint a Moonshot AI Kimi K3-a, amelyek egyes felhasználási területeken versenyre kelnek az OpenAI és az Anthropic drágább, zárt termékeivel. Míg chipgyártók és más techcégek a nyílt modellekben bevételi lehetőséget látnak, az OpenAI és az Anthropic biztonsági kockázatokra hivatkozva ellenzi elterjedésüket. A cikk szerint a Fehér Ház is megosztott: a pénzügyminiszter szankciókat vetett fel szellemitulajdon-lopás miatt, míg a kereskedelmi miniszter olyan leveleket kapott, amelyek a nyílt modellekhez való hozzáférés fenntartását kérik.
-
2026. augusztus 3., hétfő Szabályozás
Kínai nyílt AI-modellek szítanak vitát Washingtonban és Szilícium-völgyben
A Guardian szerint az elmúlt hetekben kínai fejlesztésű, ingyenesen letölthető, nyílt súlyú AI-modellek – például a Moonshot AI Kimi K3 nevű rendszere – piaci zavart okoztak, mivel egyes alkalmazásokban felveszik a versenyt az OpenAI és az Anthropic drágább, zárt termékeivel. A lap állítása szerint ez megosztotta mind a Fehér Házat, mind a techipart: egyes chipgyártók és cégek az olcsó nyílt modellek mellett állnak, míg az OpenAI és az Anthropic biztonsági kockázatokra hivatkozva óvna tőlük. Bessent pénzügyminiszter kínai cégek elleni szankciókat helyezett kilátásba állítólagos szellemitulajdon-lopás miatt, míg Lutnick kereskedelmi miniszter startupalapítóktól kapott leveleket a nyílt modellek megtartása mellett. A cikk szerint a Microsoft, az Nvidia, a Palantir és a Meta közös levélben kérte a törvényhozókat, ne korlátozzák a nyílt modellek használatát.
-
2026. augusztus 4., kedd Modellek
Alibaba bemutatta a Qwen3.8-Max modellt, kihívást intézve az amerikai AI-vezetők felé
Az Alibaba hétfői blogbejegyzésében bemutatta a Qwen3.8-Max nyelvi modellt, amelyet saját állítása szerint eddigi legnagyobb és legképzettebb rendszerének nevez. A cég szerint a teljesítménye vetekszik az Anthropic vezető modelljével (a forrásban Fable 5 néven szereplő rendszerrel), az OpenAI fejlesztéseivel, és a hazai Moonshot AI Kimi K3 modelljével is. Az Alibaba saját tesztjei és a nyilvános Arena.AI rangsor szerint a szöveges modellek listáján csak Fable 5 és három Claude Opus-modell előzi meg. A vállalat közlése szerint a modell 2,4 billió paraméterrel rendelkezik, és a súlyokat jövő héten nyílt formában teszik elérhetővé, visszatérve a korábban felfüggesztett nyílt hozzáférésű gyakorlathoz. A kínai nyílt modellek térnyerése tovább fokozza a Szilícium-völgy és Washington közötti feszültséget az AI-technológiai fölény kérdésében.
-
2026. augusztus 11., kedd Modellek
Meta megjelentette a Muse Glimmer nyílt súlyú AI-ügynökmodellt
Meta kiadta a Muse Glimmer nevű 30 milliárd paraméteres, sűrű architektúrájú modellt, amelynek súlyait Apache 2.0 licenc alatt, nyíltan tette elérhetővé a Hugging Face-en. A vállalat szerint a modellt kifejezetten helyi, folyamatosan futó AI-ügynökök számára optimalizálták: egyetlen fogyasztói GPU-n, akár internetkapcsolat nélkül is képes futni, és több mint 100 nyelven, szöveget és képet is kezel. A The Decoder szerint Meta saját benchmarkjai alapján a Glimmer a Google Gemma és az Alibaba Qwen hasonló méretű nyílt modelljeivel versenyképes ügynöki feladatokban, ám a mérés a vállalat saját, nem független tesztkörnyezetében történt. Ez Meta első nyílt modellje a 2025 tavaszi Llama 4 óta, amelyet gyenge fogadtatás és manipulált benchmarkok miatti kritika ért. NVIDIA és Hugging Face már nap-nulla támogatást biztosít a modellhez több futtatókörnyezetben.
-
2026. augusztus 12., szerda Kutatás
Preprint: azonosság-torzítás az AI-bírák pontozásában, blokklánc a megoldásra
Egy nem lektorált arXiv-tanulmány szerint hét nagynyelvi modellt – köztük a GPT-OSS 120B-t, a Llama 3.3 70B-t és a DeepSeek V4 Pro-t – bíráló szerepben teszteltek: ezek pontozták három elsődleges modell válaszait 58 tényszerű, gondolkodási, politikai és preferenciaalapú kérdésen, anonim és azonosítóval ellátott formában is. A szerzők állítása szerint az azonosság felfedése enyhén torzítja a tényszerű kérdések pontszámát, közepesen a nehéz gondolkodási feladatokét, és nagymértékben a geopolitikailag érzékeny témákét; a GLM 5.1 pontszáma 7 ponttal, a Llama 3.3 70B-é 1,56 ponttal emelkedett szignifikánsan. A torzítás orvoslására a kutatók egy Ethereum-kompatibilis, kétfázisú „commit-reveal” blokkláncprotokollt javasolnak, amely a bírák pontszámát hash formában rögzíti, mielőtt a modellek azonossága kiderülne.
-
2026. augusztus 14., péntek Modellek
A DeepSeek frissítette V4 Pro modelljét, és megnyitotta ügynökszoftverét
A DeepSeek kiadta a V4-Pro-0813 build-et, amely a cég saját mérése szerint jelentősen javult ügynökfeladatokban: a Terminal Bench 2.1 pontszáma 72,1-ről 87,9-re, a DeepSWE pedig 12,8-ról 62,7-re nőtt, és a vállalat állítása szerint több benchmarkon megelőzte a Claude Opus 4.8-at. A független Artificial Analysis mérés is javulást mutat, de árnyaltabb képet ad: a modell az Intelligence Indexen 45-ről 53-ra emelkedett, beérve a GLM-5.2-t, de továbbra is a Muse Spark, a Qwen 3.8 Max, a Kimi K3 és a Claude Opus 5 mögött marad. A cég ezzel egyidejűleg MIT licenc alatt nyílt forráskódúvá tette saját Deepseek Harness ügynökszoftverét, valamint bejelentette, hogy időzónától függő, idővel emelkedő API-díjakat vezet be.
-
2026. augusztus 15., szombat Modellek
Alibaba kiadta a nyílt súlyú Qwen3.8 modellcsaládot
Alibaba Qwen csapata nyílt súlyú Qwen3.8 modelleket adott ki Apache 2.0 licenc alatt. A fő modell, a Qwen3.8-27B, 27 milliárd paraméteres multimodális modell, amely a fejlesztő állítása szerint kódolási és irodai feladatokban felülmúlja a nagyobb Qwen3.7-Plus modellt, és önállóbban tervez, megbízhatóbban hajt végre ügynöki feladatokat. Natívan kezel akár 262 000 tokenes kontextust, a YaRN módszerrel pedig egymillió tokenig skálázható, emellett képeket és videókat is feldolgoz, beleértve diagramokat és többórás videókat. Megjelent egy jóval nagyobb, Qwen3.8-2.4T-A95B jelű, Max szintű modell súlya is; mindkettő elérhető a Hugging Face-en és a ModelScope-on, egymillió tokenes kontextussal hamarosan a Qwen Cloud szolgáltatáson keresztül is elérhető lesz.
-
2026. augusztus 15., szombat Modellek
Zhipu AI kiadta a GLM-5.3 kódoló modellt, sebezhetőség-keresésre is élesítve
A kínai Zhipu AI (Z.ai) bemutatta a GLM-5.3 nyelvi modellt, amely ugyanazt az alapmodellt használja, mint elődje, a GLM-5.2, a fejlődés kizárólag kiterjesztett utótanításból (post-training) származik. A vállalat állítása szerint ez jelenleg a legerősebb nyílt súlyú kódoló modell, a legnagyobb javulást ügynökalapú (agent) feladatokban érte el. Zhipu közölte, hogy a modellt kifejezetten szoftveres sebezhetőségek felderítésére szánt adatokkal képezték, és állítása szerint a GLM-5.3 összefüggő kihasználási láncokat képes megtervezni. Kínai biztonsági csapatokkal együttműködve 269 projektben 2436 sebezhetőséget találtak, ezeket nyilvános nyilvántartásban dokumentálták. A modell elérhető a GLM Coding Plan előfizetésen, a súlyok biztonsági felülvizsgálat után két hét múlva válnak nyílt forráskódúvá.
-
2026. augusztus 19., szerda Kutatás
Kutatás: az AI-ügynökök memóriáját modellenként kell adagolni
A Hugging Face blogbejegyzése szerint az ALTK-Evolve rendszer lehetővé teszi, hogy egy AI-ügynök korábbi feladatvégzéseiből desztillált irányelveket építsen vissza a kontextusba, súlyfrissítés és emberi annotáció nélkül. A cég állítása szerint nyolc modellen tesztelve kiderült: az erős, még nem telített modellek (pl. DeepSeek-V3.2) a teljes irányelvkészlettől profitáltak legjobban, a gyengébb modellek (pl. gpt-oss-120b) egy szűk, magas megbízhatóságú maggal és feladatonkénti visszakereséssel jártak jól, míg más, már telítettnek tűnő modellek (pl. GLM-5) alig mutattak javulást. A vállalat szerint ez azt jelzi, hogy az ügynöki memória nem be- vagy kikapcsolható funkció, hanem modellenként kalibrálandó adag. Az eredmények saját belső méréseken alapulnak, független lektorálás nélkül.
-
2026. augusztus 21., péntek Eszközök
DeepSeek megnyitotta AI-ügynök keretrendszerét, a Harnesst
A DeepSeek nyílt forráskódúvá tette a DeepSeek Harness (dsh) nevű futtatókörnyezetet, amely MIT licenc alatt, fejlesztői előzetes verzióként érhető el autonóm AI-ügynökök építéséhez. A cég bejelentése és a GitHub-tárhely szerint a rendszer a Cordis meta-keretrendszerre épül, mikrokernel-architektúrát alkalmaz, így a modellillesztők, eszközregiszterek, sandbox-környezetek és felhasználói felületek egymástól független, cserélhető modulokként működnek, és deklaratív YAML vagy JSON konfigurációval válthatók a mag logika módosítása nélkül. Egy folyamatos eseménynaplózó alrendszer minden üzenetet, eszközhívást és tokenmetrikát rögzít visszajátszás és hibakeresés céljából. A 0.1-es előzetes verzió négy alapkonfigurációt kínál: Standard, Code, Minimal és Creator módot.
-
2026. augusztus 23., vasárnap Üzlet
Ulanqab: Belső-Mongólia lett Kína AI-adatközpont-fővárosa
A WIRED cikke szerint egy Goldman Sachs kutatási jegyzet alapján a mindössze 1,5 milliós lakosú Ulanqabban 2016 óta közel 100 adatközpont épült vagy van építés alatt, a bejelentett kapacitás összesen 12,5 gigawattra rúg, ennek több mint 70 százalékát az elmúlt egy évben jelentették be. Összehasonlításképp az OpenAI 500 milliárd dolláros Stargate projektje készen is csak 10 gigawattot ér el. A várost a hideg, magasan fekvő klíma, a Pekinghez közeli helyzet és az olcsó, szél-, nap- és szénenergiára épülő áramellátás teszi vonzóvá. A cikk szerint első ízben kínai AI-cégek, köztük a DeepSeek, a ByteDance, az Alibaba és a Xiaohongshu is saját infrastruktúrába fektetnek bérelt felhőkapacitás helyett. A projektek azonban komoly vízhiányba ütközhetnek, mivel a szárazságra hajlamos térségben a helyi vízművek már most is éjszakai korlátozásokra kényszerülnek.
-
2026. augusztus 23., vasárnap Modellek
DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra
A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.