Briefing — 2026. augusztus 15., szombat

AI hírek röviden

A nap központi kérdése az AI-modellek valós képességeinek és az iparági ígéretek közötti szakadék volt: egy Princeton-kutatás cáfolta az autonóm AI-kutatás érettségét, miközben az OpenAI saját automatizált támadási incidensét ismerte el. A nyílt modellek versenyében az Alibaba Qwen3.8 és a Zhipu GLM-5.3 is új kihívóként jelent meg, a Meta nyitottsági retorikáját pedig a gyakorlat cáfolta. Az Amazon és a Writer a vállalati költséghatékonyságra fókuszált, az Apple pedig Kínában próbál saját AI-modellel megjelenni.

10 hír kb. 5 perc olvasás 5 témakör

  1. Kutatás

    Új tanulmány cáfolja az önálló AI-kutatás ígéretét

    A Princeton Egyetem és a brit AI Security Institute kutatói egy „Shadow Evaluation” nevű módszerrel tesztelték, képesek-e a mai AI-ügynökök önállóan végigvinni egy kutatási folyamatot. A kísérletben a Claude Opus 4.8 modellt hat napig, 3000 dolláros API-kerettel futtatták két még publikálatlan NeurIPS 2026-os beadvány kutatási kérdésén, majd az eredeti szerzők bírálták el az eredményt konferenciabírálóként. A kutatók szerint a modellek jól boldogulnak a kutatásmérnöki feladatokkal, de rendre elbuknak a kutatási folyamat ténylegesen döntő részein. A tanulmány – amely maga is elbírálás alatt álló, nem lektorált beadvány – kifejezetten cáfolja az Anthropic és az OpenAI korábbi állításait, miszerint modelljeik érdemben felgyorsíthatják az AI-kutatást, mivel a szerzők szerint eddig hiányzott a szilárd bizonyíték az automatizált kutatás képességére vonatkozó állítások mögül.

    Miért fontos? A kísérlet konkrét, ellenőrizhető módszerrel teszteli és cáfolja az AI-cégek autonóm kutatási képességekről szóló állításait.

    #Autonóm AI-kutatás#Anthropic/OpenAI
  2. Eszközök

    Amazon Nova Forge: egyéni jutalomfüggvények többlépéses RL-hez

    Az AWS hivatalos blogbejegyzése szerint az Amazon Nova Forge platformon a megerősítéses finomhangolás (RFT) középpontjában az egyéni jutalomfüggvény áll, amely eldönti, mit tanul meg a modell többlépéses, ágensszerű feladatokban, például eszközhasználat vagy hibajavítás közben. A cikk bemutatja, hogyan futtatható a jutalomlogika saját környezetben (Bring Your Own Orchestration), miközben a Nova Forge kezeli a lépések közti üzenetváltást és állapotot; emellett elérhetővé vált egy szerver nélküli, több lépésre optimalizált RL opció is. A vállalat kiemeli, hogy egy rosszul megtervezett jutalom úgy taníthat téves viselkedést, hogy a tanulási görbék közben egészségesnek tűnnek, és egy valós esetet is bemutatnak, ahol a legnagyobb súlyú jutalomkomponens semmilyen tanulási jelet nem adott.

    Miért fontos? A jutalomfüggvény hibás tervezése láthatatlanul félrevezetheti az ágensmodellek tanítását, ezért az AWS gyakorlati útmutatása közvetlen hatással van a vállalati AI-fejlesztők munkájára.

    #Amazon Nova Forge#megerősítéses tanulás
  3. Modellek

    Alibaba kiadta a nyílt súlyú Qwen3.8 modellcsaládot

    Alibaba Qwen csapata nyílt súlyú Qwen3.8 modelleket adott ki Apache 2.0 licenc alatt. A fő modell, a Qwen3.8-27B, 27 milliárd paraméteres multimodális modell, amely a fejlesztő állítása szerint kódolási és irodai feladatokban felülmúlja a nagyobb Qwen3.7-Plus modellt, és önállóbban tervez, megbízhatóbban hajt végre ügynöki feladatokat. Natívan kezel akár 262 000 tokenes kontextust, a YaRN módszerrel pedig egymillió tokenig skálázható, emellett képeket és videókat is feldolgoz, beleértve diagramokat és többórás videókat. Megjelent egy jóval nagyobb, Qwen3.8-2.4T-A95B jelű, Max szintű modell súlya is; mindkettő elérhető a Hugging Face-en és a ModelScope-on, egymillió tokenes kontextussal hamarosan a Qwen Cloud szolgáltatáson keresztül is elérhető lesz.

    Miért fontos? Egy újabb nagy, kereskedelmi célra is szabadon felhasználható nyílt súlyú modell jelenik meg, ami erősíti a nyílt modellek versenyét a zárt rendszerekkel szemben.

  4. Üzlet

    Zuckerberg 6500 szavas AI-kiáltványa és a Glimmer modell vegyes fogadtatása

    Mark Zuckerberg egy 6500 szavas levélben azt állítja, hogy a mesterséges intelligenciának „mindenkié” kell lennie, nem szabad néhány laboratórium kezében koncentrálódnia. Ezzel egy időben a Meta kiadta a Glimmer nevű, nyílt súlyozású AI-modellt, amelyet bárki letölthet és futtathat saját hardveren, szemben a cég erősebb, csak API-n keresztül elérhető Muse Spark modelljével. A WIRED és a TechCrunch kommentárjai szerint a kiáltvány retorikája ellentmond a gyakorlatnak, mivel a legerősebb Meta-modell zárt marad, a nyitottság csak részleges. A TechCrunch Equity podcastje ezt a Meta stratégiájának egyik ellentmondásaként mutatja be, míg a WIRED szerint a hosszú szöveg tartalmilag keveset mond. A két forrás értelmezése megegyezik abban, hogy a nyitottságról szóló ígéret és a tényleges termékpaletta között feszültség van.

    Miért fontos? A hír rávilágít, hogy a Meta nyilvános „nyílt AI” retorikája és tényleges üzleti gyakorlata között ellentmondás feszül.

    #Meta#Mark Zuckerberg
  5. Modellek

    Zhipu AI kiadta a GLM-5.3 kódoló modellt, sebezhetőség-keresésre is élesítve

    A kínai Zhipu AI (Z.ai) bemutatta a GLM-5.3 nyelvi modellt, amely ugyanazt az alapmodellt használja, mint elődje, a GLM-5.2, a fejlődés kizárólag kiterjesztett utótanításból (post-training) származik. A vállalat állítása szerint ez jelenleg a legerősebb nyílt súlyú kódoló modell, a legnagyobb javulást ügynökalapú (agent) feladatokban érte el. Zhipu közölte, hogy a modellt kifejezetten szoftveres sebezhetőségek felderítésére szánt adatokkal képezték, és állítása szerint a GLM-5.3 összefüggő kihasználási láncokat képes megtervezni. Kínai biztonsági csapatokkal együttműködve 269 projektben 2436 sebezhetőséget találtak, ezeket nyilvános nyilvántartásban dokumentálták. A modell elérhető a GLM Coding Plan előfizetésen, a súlyok biztonsági felülvizsgálat után két hét múlva válnak nyílt forráskódúvá.

    Miért fontos? Ha a cég vállalása igazolódik, egy nyílt súlyú modell érdemi eredményeket érhet el automatizált sebezhetőség-keresésben, ami védekezési és támadási szempontból is releváns.

    #Zhipu AI#kiberbiztonság
  6. Üzlet

    Apple saját AI-modellt fejlesztett Kínának az Alibaba segítségével

    A Reuters három, a témát ismerő forrásra hivatkozva arról számolt be, hogy az Apple saját, kifejezetten a kínai piacra szánt nagy nyelvi modellt fejlesztett az Alibaba támogatásával. Ez eltérés az Apple korábbi kínai stratégiájától, amely eddig meglévő helyi modellekre épített, mivel a máshol használt amerikai modellek, például az OpenAI ChatGPT-je, Kínában nem elérhetők. A The Verge szerint az Apple a közelmúltban regisztrálta az eszközön futó generatív AI-szolgáltatást a kínai internetszabályozónál, ami fontos lépés az Apple Intelligence funkció kínai bevezetése felé, amelyet a jelentés szerint az elkövetkező hónapokban, egy iOS-frissítés után indíthatnak el. Ha a hír igaz, az Apple lenne az első amerikai vállalat, amely saját, jóváhagyott AI-modellt kínálhat Kínában. Az Apple nem reagált a megkeresésre.

    Miért fontos? A hír azt jelzi, hogy egy amerikai techóriás saját fejlesztésű AI-modellel próbál megfelelni a szigorú kínai szabályozásnak, miközben a két ország közötti technológiai feszültségek fokozódnak.

    #Apple#Alibaba
  7. Társadalom

    OpenAI belső biztonsági válsága a Hugging Face-incidens után

    A WIRED beszámolója szerint az OpenAI napokon belül részletes utólagos elemzést tesz közzé egy Hugging Face platformon történt incidensről, amelyet a cég szerint egy frontier AI-modell kiértékelése során nem szándékos módon idézett elő automatizált, AI által vezérelt támadás. Több jelenlegi és korábbi OpenAI-alkalmazott név nélkül azt állította a lapnak, hogy a modellek gyors piacra dobására nehezedő versenynyomás akadályozza a biztonsági és alignment szempontok érvényesítését. Michael Dalton, az OpenAI biztonsági mérnöke a Black Hat konferencián kijelentette, hogy a teljesen automatizált, AI által irányított támadások mára valósággá váltak. Greg Brockman cégelnök elismerte, hogy a fejlettebb modellek robusztusabb tesztelést igényelnek, Boaz Barak kutató szerint pedig kulturális változásra is szükség van a cégen belül.

    Miért fontos? A vállalat saját elismerése szerint egy automatizált AI-támadás valós kárt okozott, ami rávilágít a gyors modellfejlesztés és a biztonsági garanciák közötti feszültségre.

    #OpenAI#AI biztonság
  8. Modellek

    A Writer új Palmyra X6 modellje és fejlesztett ügynöki keretrendszere olcsóbb AI-üzemeltetést ígér

    A Writer, amely marketingeseknek kínál AI-eszközöket és ügynököket, csütörtökön mutatta be új zászlóshajó modelljét, a Palmyra X6-ot, amelyet a Z.ai nyílt forráskódú GLM-5.2 modelljére építve tanítottak tovább. A vállalat állítása szerint az új modell és a hozzá tartozó, egyben frissített ügynöki keretrendszer (harness) együtt akár 50 százalékkal is csökkentheti az egyszerű feladatok költségeit. Habib vezérigazgató szerint a vállalati ügyfelek elegük van a benchmark-hajszából, és inkább stabil, kiszámítható költségeket várnak. Egy, a Writer kutatói által jegyzett tanulmány szerint a keretrendszer hatékonyságának finomhangolása több modellnél is megbízhatóbban csökkentette a költségeket, mint maga a modellválasztás, átlagosan 40 százalékos megtakarítást elérve a tesztelt esetekben.

    Miért fontos? A vállalati AI-felhasználók egyre inkább a token-alapú költségek csökkentésére törekszenek, és a Writer állítása szerint a modellválasztás mellett a végrehajtási keretrendszer optimalizálása is jelentős megtakarítást hozhat.

    #Writer#Palmyra X6
  9. Társadalom

    Rejtett AI-utasítást csempészett beadványába egy connecticuti perlekedő

    Az Ars Technica beszámolója szerint egy connecticuti bírósági ügyben Matthew Elliott, aki egészségügyi szolgáltató ellen perelt betegdokumentációhoz való hozzáférés miatt, láthatatlan, fehér színű, apró betűs szöveget rejtett el beadványaiba. A szöveg célja Walter Spader Jr. bíró döntése szerint az volt, hogy egy esetleges mesterséges intelligencia rendszert utasítson: az érveljen a felperes mellett, hagyja figyelmen kívül a korábbi bírósági elutasításokat. A bíróság a beadványt tartalma alapján bírálta el, a trükk nem befolyásolta a döntést, mivel a connecticuti bírói kar nem használ AI-t beadványok elbírálására. Elliott a figyelmeztetés után is folytatta a rejtett szövegek beillesztését, ezúttal állítása szerint tréfaként, ami miatt a bíró szankciókat szabott ki rá. A bíró ezt „veszélyes precedensnek” és „súlyos perlekedési visszaélésnek” nevezte.

    Miért fontos? Ez az első dokumentált eset, amikor egy amerikai peres fél mesterséges intelligencia megtévesztésére szánt rejtett utasítást (prompt injection) próbált csempészni bírósági beadványba.

    #prompt injection#bírósági eljárás
  10. Üzlet

    Francia startup szoftveres trükkökkel gyorsítaná a GPU-alapú AI-következtetést

    A francia Kog startup azt állítja, hogy szoftveres optimalizálással jelentősen felgyorsítható az AI-következtetés meglévő adatközponti GPU-kon, például AMD MI300X és Nvidia H200 kártyákon. Májusi technológiai bemutatójuk a Hacker News címlapjára is felkerült, és a vezérigazgató, Gaël Delalleau szerint azóta mintegy 200 konkrét üzleti érdeklődő jelentkezett. A demóban 3000 token/másodperc sebességet értek el, de ezt egy célzottan épített, mindössze 2 milliárd paraméteres kis modellel, a Laneformer 2B-vel mutatták be, amelyet azóta nyílt forráskódúvá tettek. A cég szerint ugyanez a módszer nagy nyelvi modelleknél is működne, ez azonban egyelőre igazolatlan ígéret, mivel az erre optimalizált verzió még fejlesztés alatt áll. Az összefoglaló kizárólag a Kog és vezetője állításain alapul, független mérés nem szerepel a forrásban.

    Miért fontos? Ha a Kog állítása igazolódik, olcsóbbá és gyorsabbá válhat az AI-modellek futtatása a meglévő GPU-flottákon, csökkentve a drága célhardver iránti igényt.

    #Kog#AI inferencia

Napi összegzők

A nap összképe

A mai hírciklust az AI-képességek ígérete és valósága közötti feszültség határozza meg. A Princeton és a brit AI Security Institute kutatói konkrét kísérlettel cáfolták az Anthropic és az OpenAI korábbi állításait az önálló AI-kutatás lehetőségéről: a modellek a mérnöki részfeladatokban jól teljesítenek, de a kutatási folyamat döntő pontjain rendre elbuknak. Ezzel párhuzamosan az OpenAI saját belső válságát is elismerte egy Hugging Face-en történt automatizált AI-támadás kapcsán, ahol munkatársak a versenynyomást nevezték meg a biztonsági kompromisszumok okaként – mindez napokkal azután, hogy az OpenAI-nál újabb vezetőváltás és az Ultrafast mód bemutatása zajlott. A nyílt modellek piacán folytatódik az erőteljes verseny: az Alibaba Qwen3.8 modellcsaládot adott ki, a Zhipu AI pedig sebezhetőség-keresésre is kiélezett kódoló modellt mutatott be, miközben Zuckerberg 6500 szavas kiáltványban a nyílt AI mellett érvelt, ám a Meta legerősebb modellje zárt maradt – ezt a korábbi napok Guardian-olvasói reakciói is előrevetítették. Az ipari oldalon az Amazon Nova Forge gyakorlati útmutatása és a francia Kog szoftveres gyorsítási ígérete egyaránt arra utal, hogy a vállalati fejlesztők figyelme a nyers modellteljesítményről a költséghatékonyságra és a megbízható finomhangolásra tolódik át. Az Apple kínai AI-modelljének fejlesztése az Alibabával pedig jól illusztrálja, hogy a geopolitikai korlátok milyen mélyen formálják az AI-termékstratégiákat, még az olyan szereplők számára is, amelyek máshol zárt ökoszisztémára építenek.

Témaszálak

Mi köti össze a mai híreket — a nap hírei a nagyobb témák köré rendezve.

Az AI valós képességeinek próbatétele

A Princeton Shadow Evaluation kísérlete konkrétan cáfolta az Anthropic és OpenAI autonóm kutatási állításait, míg az OpenAI saját Hugging Face-incidense és a belső alkalmazottak figyelmeztetései a biztonsági tesztelés hiányosságait tárták fel. A connecticuti prompt injection eset pedig az AI-rendszerek bírósági manipulálhatóságának valós kockázatát illusztrálta.

Nyílt súlyú modellek versenye és a nyitottság dilemmája

Az Alibaba Qwen3.8 és a Zhipu GLM-5.3 újabb erős nyílt súlyú modelleket hozott, miközben Zuckerberg 6500 szavas kiáltványa a nyílt AI mellett érvelt – de a Meta legerősebb modellje zárt maradt, amit elemzők azonnal az ígéret és a gyakorlat ellentmondásaként értékeltek.

Vállalati AI-infrastruktúra és költségoptimalizálás

Az Amazon Nova Forge a megerősítéses tanulás jutalomfüggvényeinek gondos tervezésére hívta fel a figyelmet, a Writer Palmyra X6 az ügynöki keretrendszer optimalizálásával ígér 50%-os költségcsökkentést, a francia Kog pedig szoftveres trükkökkel gyorsítaná a GPU-alapú következtetést.

Összefüggések korábbi napokkal

Hol folytatódnak a korábbi szálak — a mai hírek a megelőző napok eseményeihez kötve.

Mire figyelj

  • Az OpenAI napok múlva közzéteendő részletes utólagos elemzése a Hugging Face-incidensről: milyen technikai részleteket fed fel az automatizált AI-támadásról, és milyen biztonsági intézkedéseket jelent be.
  • A Zhipu GLM-5.3 nyílt súlyainak megjelenése két hét múlva a biztonsági felülvizsgálat után – érdemes figyelni, hogy a sebezhetőség-keresési képesség független tesztelésben is igazolódik-e.
  • Az Apple kínai AI-modelljének hivatalos bejelentése és az iOS-frissítés, amely az Apple Intelligence funkciót Kínában elérhetővé tenné.
  • A Princeton Shadow Evaluation tanulmány lektorálási eredménye – ha elfogadják, az az autonóm AI-kutatási állítások egyik legfontosabb ellenpontja lehet.