← Vissza a listához
Valódi emberek. Valódi tartalom. Valódi üzleti döntések.

A Limen nem influenszer-lista, és nem ügynökségi katalógus. Itt ellenőrzött tartalomgyártók dolgoznak konkrét üzleti célokon, strukturáltan, átláthatóan.

Nem arcokat válogatsz, hanem megoldást kapsz: ajánlatokat olyan kreatoroktól, akik tudják, mit és miért kell szállítaniuk.

Ez nem közösségi oldal. Ez egy üzleti eszköz, emberekkel.

Csatlakozás →
A DeepSeek megint ott üt, ahol fáj: szemet kapott a filléres AI-agent

A DeepSeek megint ott üt, ahol fáj: szemet kapott a filléres AI-agent

A DeepSeek nem egy újabb chatbotot mutatott be. Szemet adott az egyik legolcsóbb agentmodelljének. A DeepSeek‑V4‑Flash‑Vision‑Exp már képeket, képernyőfotókat, dokumentumoldalakat, grafikonokat és más vizuális információkat is képes feldolgozni. Közben megmaradtak a V4 Flash szöveges, következtetési, programozási és eszközhasználati képességei. Legalábbis ezt állítja a DeepSeek.

LLM
#AI#LLM# DeepSeek#kepgeneralas

A modell ma jelent meg, kísérleti változatként, egyelőre API-n keresztül használható. A saját tesztjeik szerint a vizuális információkat is igénylő agentfeladatokban már a Claude Opus 4.8 közelében jár. Mindezt olyan áron kínálják, amely mellett a nyugati csúcsmodellek használata meglehetősen drága szórakozásnak kezd látszani.

LÉNYEG: a DeepSeek új modellje képeket és szöveget is fogad, egymillió tokenes kontextust kezel, képes külső eszközöket meghívni, és csúcsidőn kívül egymillió bemeneti token feldolgozása 0,22 dollárba kerül. A kimenet egymillió tokenenként 0,66 dollár. A teljesítményére vonatkozó látványos állítások egyelőre főként a DeepSeek saját mérésein alapulnak, ezért a pezsgőt még nem kell kibontani. A konkurenciának viszont már érdemes odanéznie.

Nem képgenerátorról beszélünk

A „Vision” név könnyen félreérthető. Ez a modell nem képeket készít, hanem képeket próbál megérteni.

Megmutathatunk neki egy képernyőfotót, egy beszkennelt dokumentumot, egy számlát, egy grafikont vagy egy weboldalról készült képet. A modell ezekből információkat olvashat ki, összefüggéseket kereshet, majd a rendelkezésére bocsátott eszközökkel további műveleteket végezhet.

Ez már jóval több annál, mint amikor egy chatbot megmondja, hogy mi látható egy fényképen.

Egy megfelelően felépített agent például észreveheti egy képernyőképen a hibát, átnézheti a kapcsolódó naplófájlokat, lekérdezheti a dokumentációt, majd javaslatot készíthet a javításra. Feldolgozhat egy vizuálisan bonyolult jelentést, kinyerheti belőle az adatokat, összevetheti azokat egy adatbázissal, és jelezheti az eltéréseket.

A kép ebben az esetben már nem illusztráció. Bemeneti adat.

Ez azért fontos, mert a céges információk jelentős része nem szép, tiszta szövegként érkezik. PDF-ekben, táblázatokban, képernyőfotókban, beszkennelt iratokban, grafikonokban és különféle kezelőfelületeken van szétszórva. Eddig ezek feldolgozásához gyakran külön OCR, dokumentumelemző és képfelismerő rétegeket kellett egymásra pakolni.

A multimodális modellek ezt a láncot kezdik rövidebbre zárni. Nem feltétlenül hibátlanul, de egyre használhatóbban.

Az árnál válik kellemetlenné a történet

A DeepSeek eddig sem abból élt, hogy udvariasan beállt a sor végére. Az egész üzleti stratégiája arra épül, hogy brutálisan lenyomja a használati költséget.

A V4‑Flash‑Vision‑Exp árazása megegyezik a szöveges V4 Flash árával. Csúcsidőn kívül:

  • egymillió bemeneti token 0,22 dollár;
  • egymillió kimeneti token 0,66 dollár;
  • a gyorsítótárból felhasznált egymillió token mindössze 0,007 dollár.

Csúcsidőben ennek nagyjából a dupláját kell fizetni.

Összehasonlításként a Claude Opus 4.8 normál API-ára egymillió bemeneti token esetén 5 dollár, a kimenetnél pedig 25 dollár. Ez nem jelenti azt, hogy a DeepSeek minden feladatban ugyanazt tudja. Nagyon nem. A két modell teljesítménye, stabilitása, biztonsági rendszere és szolgáltatási háttere között komoly különbségek lehetnek.

Az árkülönbség azonban akkor is brutális.

Csúcsidőn kívül a DeepSeek bemenete körülbelül huszonháromszor, a kimenete pedig közel harmincnyolcszor olcsóbb az Opus 4.8 normál áránál.

Van még egy fontos apróság: az Opus 4.8 már nem az Anthropic legfrissebb modellje, azóta megjelent az Opus 5. Ezért aki azt írja, hogy a DeepSeek utolérte a Claude jelenlegi csúcsmodelljét, az egyszerűen többet állít annál, mint amit a bejelentés bizonyít.

A valós állítás így hangzik: a DeepSeek saját tesztjei szerint az új modell bizonyos, vizuális megértést igénylő agentfeladatokban megközelíti az Opus 4.8 eredményeit.

Ez kevésbé látványos mondat, csak éppen igaz.

Egymillió token és 384 ezer tokenes válasz

A modell egymillió tokenes kontextusablakot kezel, a maximális kimenet pedig 384 ezer token lehet.

Papíron ez elképesztő mennyiség. Egyetlen kérésben hatalmas dokumentumcsomagok, forráskódok, korábbi beszélgetések és képi információk férhetnek el.

A „papíron” szó azonban itt fontos.

A nagy kontextusablak önmagában nem jelenti azt, hogy a modell minden egyes részletet pontosan megjegyez, helyesen súlyoz és hibátlanul kapcsol össze. Egy egymillió tokenes bemenetbe rengeteg zaj, egymásnak ellentmondó adat és félrevezető információ is bekerülhet.

A kontextus mérete nem ugyanaz, mint a kontextus megértése.

Ráadásul a képek feldolgozása sem ingyenes. A DeepSeek a képeket a felbontásuk alapján tokenekké alakítja, majd ezeket bemeneti tokenként számlázza ki. Ettől az ár még mindig alacsony maradhat, de a „filléres képfeldolgozás” költsége nagy mennyiségű, nagy felbontású dokumentumnál már nem feltétlenül lesz annyira jelentéktelen.

Az agent azért érdekes, mert nem áll meg a válasznál

A DeepSeek új modellje támogatja a tool callingot, a strukturált JSON-kimenetet, az OpenAI Responses API formátumát és az Anthropic API-val kompatibilis elérést is.

Magyarul: viszonylag könnyen beköthető olyan rendszerekbe, amelyek nemcsak beszélgetnek, hanem adatot keresnek, programokat futtatnak, API-kat hívnak vagy különböző vállalati műveleteket indítanak el.

Itt kezd elválni a chatbot az agenttől.

A chatbot megnézi a számlát, és elmondja, hogy mit lát rajta.

Az agent megnézi a számlát, kinyeri az adatokat, összeveti a megrendeléssel, ellenőrzi a beszállítót, majd előkészíti a könyvelési tételt.

A chatbot felismeri a hibát egy képernyőfotón.

Az agent megkeresi a kapcsolódó forráskódot, átnézi a naplókat, módosítja a programot, lefuttatja a teszteket, majd jelentést készít az eredményről.

Legalábbis akkor, ha az egész rendszert hozzáértő ember építette fel.

Ha nem, akkor az agent ugyanilyen lelkesedéssel végezhet el hibás, értelmetlen vagy kifejezetten veszélyes műveleteket is. Az olcsó modell nem javítja meg a rossz architektúrát, a hiányzó jogosultságkezelést és a hanyagul összedobott toolokat.

Csak olcsóbban és nagyobb sebességgel használja őket.

A benchmark nem szentírás

A DeepSeek több látványos eredményt is közölt. A modell az Agents’ Last Exam teszten 27,3, a Chartography mérésen 64,3, a ZeroBench Pass@5 értékelésén pedig 35 pontot ért el.

Ezek a számok önmagukban szinte semmit nem mondanak egy átlagos felhasználónak. Még egy fejlesztőnek sem feltétlenül.

Egy benchmark eredményét erősen befolyásolhatja a használt keretrendszer, a prompt, a mintavételezési beállítás, a rendelkezésre álló eszközök, a maximális próbálkozások száma és a modellnek adott gondolkodási keret.

A DeepSeek legalább közölte a fontosabb tesztbeállításokat. Ez korrekt. Ettől azonban a saját mérés még saját mérés marad.

A modell valódi értékét nem egy táblázat fogja eldönteni, hanem az, hogy több száz vagy több ezer éles feladaton mennyire pontos, mennyire kiszámítható, milyen gyakran hallucinál, mennyire jól használja az eszközöket, és hányszor kell utána embernek eltakarítania a romokat.

Egy olcsó modell, amelyik tízből kétszer rossz műveletet indít, drágább lehet egy olyan modellnél, amelyik tokenenként ötször annyiba kerül, de megbízhatóan dolgozik.

Az API-ár csak a számla egyik sora.

A modell szemet kapott. Ezzel együtt új támadási felületet is

Ha egy agent képes elolvasni egy dokumentumot vagy képernyőfotót, akkor a dokumentumban vagy a képen elhelyezett utasításokat is érzékelheti.

Egy ártatlannak látszó PDF, weboldal, diagram vagy képernyőkép tartalmazhat olyan szöveget, amely megpróbálja rávenni a modellt, hogy hagyja figyelmen kívül az eredeti szabályait, kérjen le bizalmas adatot, hívjon meg egy eszközt vagy hajtson végre jogosulatlan műveletet.

Ez a vizuális prompt injection egyik formája.

Minél többféle bemenetet ért egy agent, annál több helyről lehet megpróbálni manipulálni. A multimodalitás tehát nemcsak új képességet, hanem új támadási felületet is jelent.

Egy vállalati rendszerben ezért a kép, a PDF és a képernyőfotó ugyanúgy nem megbízható külső adat, mint egy ismeretlen weboldal szövege. A modell nem döntheti el saját hatáskörben, hogy egy dokumentumban talált mondat adat vagy végrehajtandó parancs.

A prompt nem lehet jogosultság.

Ezt sok fejlesztő addig nem érti meg, amíg az agent először meg nem tesz valamit, amit rohadtul nem kellett volna.

Egyelőre nincs letölthető csodafegyver

A V4‑Flash‑Vision‑Exp jelenlegi bejelentése az API-szolgáltatásról szól. A DeepSeek nem jelentette be, hogy ennek a konkrét vizuális változatnak a modelljei szabadon letölthetők és helyben futtathatók lennének.

Ezért most nem arról van szó, hogy holnaptól mindenki felrakhatja a saját számítógépére.

A modell ráadásul nevében is kísérleti. Ez általában azt jelenti, hogy változhat, lehetnek instabil részei, és akár rövid idő alatt le is cserélhetik egy újabb változatra. Éles rendszer alapját kizárólag azért ráépíteni, mert ma jól néz ki egy benchmarktáblázatban, elég bátor döntés lenne.

Érzékeny vállalati, egészségügyi vagy ügyféladatokat pedig nem küldünk automatikusan egy olcsó külső API-ba csak azért, mert technikailag lehetséges.

Az olcsóság nem adatvédelmi felmentés.

Most már nem az a kérdés, melyik AI beszél szebben

A valódi verseny egyre kevésbé arról szól, hogy melyik modell ír jobb e-mailt vagy választékosabb Facebook-posztot.

Az lesz az érdekes, hogy melyik modell képes látni, olvasni, keresni, döntést előkészíteni, eszközöket használni és hosszabb munkafolyamatokat végigvinni elfogadható hibaarány mellett.

A DeepSeek most egy ilyen modell árát nyomta le nagyon durván.

Lehet, hogy a független tesztek majd lehűtik a lelkesedést. Lehet, hogy a modell bizonyos feladatokon kiváló lesz, máshol pedig szétesik. Az is lehet, hogy a kísérleti változatot néhány héten belül egy sokkal jobb kiadás követi.

Egy dolgot viszont már most megmutatott: a képet értő AI-agent többé nem feltétlenül prémium szolgáltatás.

És amikor egy használható technológia ára ennyire gyorsan közelít a jelentéktelenhez, akkor nem maga a modell lesz a legértékesebb.

Hanem az a rendszer, amelyik képes úgy használni, hogy közben nem engedi elszabadulni.

Források: DeepSeek – hivatalos változásnapló és benchmarkok, DeepSeek – modellek és API-árak, Anthropic – Claude Opus 4.8 árazása

Hozzászólások

Betöltés…

    Session betöltése…