2026. augusztus 23., vasárnap · Modellek
DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra
A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.
Miért fontos?
A hír azt mutatja, hogy a DeepSeek saját mérései szerint gyorsan felzárkózik a vezető nyugati modellekhez multimodális ügynöki feladatokban, bár ezt független teszt nem igazolta.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 23., vasárnap napi AI összefoglaló része.