A Limen nem influenszer-lista, és nem ügynökségi katalógus. Itt ellenőrzött tartalomgyártók dolgoznak konkrét üzleti célokon, strukturáltan, átláthatóan.
Nem arcokat válogatsz, hanem megoldást kapsz: ajánlatokat olyan kreatoroktól, akik tudják, mit és miért kell szállítaniuk.
Ez nem közösségi oldal. Ez egy üzleti eszköz, emberekkel.
Csatlakozás →
Nem mindig a legnagyobb AI a legjobb
Az AI-ipar egyik legdrágább tévedése, hogy minden problémára a legerősebb elérhető modellt akarja ráengedni. Pedig egy modell attól, hogy általánosan intelligensebb, még nem biztos, hogy a mi konkrét feladatunkat végzi el a legjobban. Néha csak drágábban, lassabban és kiszámíthatatlanabbul dolgozik.
|
Az AI-rendszer érettségét nem az mutatja meg, hogy eléri-e a világ legnagyobb modelljét, hanem az, hogy megtalálja-e az adott feladathoz szükséges legkisebbet. |
A reflex: mindig a legerősebbet
Ma szinte automatikusan a legnagyobb elérhető modellt választjuk. Több paraméter. Nagyobb kontextusablak. Magasabb benchmarkeredmény. Drágább API. Aztán megkérjük, hogy egy ügyféllevelét sorolja be három kategória valamelyikébe, vegyen ki öt mezőt egy számlából, vagy döntse el egy beérkező szövegről, hogy panasz, érdeklődés vagy ajánlatkérés.
Ez olyan, mintha egy gyártósoron a vállalat legjobb mérnöke egész nap azt ellenőrizné, hogy egy alkatrész piros vagy kék. Meg tudná csinálni. Valószínűleg jól is csinálná. Mégsem erre használnánk. Erre célgépet építenénk: gyorsat, olcsót és következeteset.
Az AI-nál mégis sokszor összekeverjük a képességet az alkalmassággal. A nagy modell előnyei valósak: szélesebb tudás, jobb általános problémamegoldás, összetett utasítások kezelése és erősebb következtetési képesség. De ezekből nem következik, hogy minden részfeladatot pontosabban, olcsóbban vagy stabilabban végez el.
Mit jelent az, hogy egy modell zajos?
A „zaj” itt nem azt jelenti, hogy a nagy modellek rosszak. A modellméret önmagában nem hiba. A zaj a modell és a feladat rossz illeszkedéséből jelenhet meg: a rendszer több lehetőséget mérlegel, több jelentést lát bele a kérésbe, többet magyaráz, és nagyobb szabadsággal tér el attól a szűk kimenettől, amelyre az üzleti folyamatnak valóban szüksége van.
Egy szűk feladatban ez többféleképpen látható:
• egyszerű döntés helyett hosszú magyarázat születik;
• a modell eltér a kért JSON- vagy adatstruktúrától;
• irreleváns háttértudást is bevon a válaszba;
• ugyanarra a bemenetre a kívánatosnál változatosabb eredményeket ad;
• egy rögzített vállalati szabály helyett általános világismeretre támaszkodik;
• olyan bizonytalanságot próbál feloldani, amelynél inkább meg kellene állnia és továbbadnia az esetet.
A zajt természetesen nem kizárólag a méret befolyásolja. Számít a prompt, a hőmérséklet, a kontextus minősége, a modell hangolása, a kimeneti séma és az egész feldolgozási lánc. Éppen ezért szakmailag nem az a helyes állítás, hogy a kisebb modell mindig jobb. Az a helyes állítás, hogy a feladathoz rosszul illesztett, túl általános modell felesleges szabadságot vihet a rendszerbe.
|
Nem a nagy modellel van baj. A rossz modellválasztással van baj. |
A specialista gyakran legyőzi az általános modellt
Egy kisebb modell kevesebb általános tudással rendelkezik. Ez összetett kutatásnál, kreatív stratégiánál vagy nehéz következtetésnél hátrány. Egy jól körülhatárolt, ismétlődő feladatban azonban éppen ez lehet az előnye: kisebb a megoldási tér, kevesebb az irreleváns irány, és könnyebb a viselkedést tesztelni.
Ráadásul nem minden nyelvi feladathoz kell generatív modell. Szándékfelismerésre, kategorizálásra, kockázati pontszámra vagy jó-rossz döntésre egy hagyományos neurális osztályozó is megfelelőbb lehet. Ha pedig nyelvi modell szükséges, egy néhány milliárd paraméteres, jól megválasztott és megfelelően korlátozott modell sok üzleti részfeladatban bőven elegendő lehet.
|
Feladat |
Elsőként próbálandó réteg |
Miért? |
|
Szándékfelismerés, címkézés |
Kis lokális modell vagy osztályozó |
Kevés, előre ismert kimenet; könnyen mérhető pontosság. |
|
Strukturált adatkinyerés |
Kis modell, kötött séma |
A forma és a validálás fontosabb, mint a széles világismeret. |
|
RAG-találatok előszűrése |
Embedding, reranker vagy kis modell |
Nagy mennyiségű, ismétlődő döntés alacsony költséggel. |
|
Összetett elemzés, stratégia |
Erősebb általános modell |
Széles tudás és több lépéses következtetés szükséges. |
|
Kritikus művelet |
Modell + szabályrendszer + ember |
A modell képessége nem helyettesíti a jogosultságot és az ellenőrzést. |
A lokális futtatás értéke nem csak az API-díj
A lokális modell mellett általában az alacsonyabb költséget említik először. Ez fontos, de önmagában kevés. A saját infrastruktúrán futó modell legnagyobb értéke a kontroll.
• az érzékeny adatoknak nem kell elhagyniuk a saját környezetet;
• rögzíthető a modell pontos verziója, így egy szolgáltatói frissítés nem változtatja meg váratlanul a működést;
• kiszámíthatóbbá válhat a késleltetés és a rendelkezésre állás;
• nagy, folyamatos forgalomnál csökkenthető az egy feldolgozásra jutó költség;
• a modell célzottan hangolható a vállalati szókincsre és a tényleges feladatra;
• kvantálással, GPU-CPU megosztással és több GPU használatával a rendelkezésre álló hardver sokkal rugalmasabban kihasználható.
A llama.cpp és a hozzá épülő kiszolgálók jó példái annak, mennyit változott a helyzet: ma már a kvantált modellek CPU-n, GPU-n vagy hibrid módon is futtathatók, a modell rétegei megoszthatók a CPU és a GPU között, és több GPU is bevonható a feldolgozásba.
Én fejlesztői és éles környezetben is használok llama-server alapú kiszolgálást. A tapasztalatom az, hogy a hardver önmagában ritkán a legfontosabb kérdés. Sokkal többet számít, hogy mekkora kontextust adunk a modellnek, milyen kvantálást választunk, hogyan osztjuk meg a terhelést a CPU és a GPU között, és pontosan mit várunk el a kimenettől.
A lokális AI nem olcsóbb ChatGPT
Itt szokott félremenni a legtöbb kísérlet. Valaki letölt egy modellt, elindítja egy chatfelületen, feltesz neki néhány általános kérdést, majd megállapítja, hogy gyengébb a vezető felhős rendszereknél. Ez többnyire igaz - és közben semmit nem mond arról, hogy az adott modell alkalmas-e egy konkrét üzleti feladatra.
Egy kisebb lokális modell nem attól válik értékessé, hogy mindenről lehet vele beszélgetni. Attól válik értékessé, hogy egy meghatározott munkát mérhetően, ismételhetően és elfogadható hibaaránnyal végez el.
Ehhez szükség van:
• valós üzleti esetekből összeállított tesztkészletre;
• egyértelműen meghatározott helyes és hibás kimenetekre;
• strukturált válaszformátumra és automatikus validálásra;
• bizalmi küszöbre, amely alatt a modell nem dönthet egyedül;
• hibanaplózásra és folyamatos visszamérésre;
• olyan eszkalációs útra, amely a nehéz eseteket erősebb modellhez vagy emberhez küldi.
|
A lokális AI nem olcsóbb ChatGPT. Egy mérnökileg megépített rendszer egyik alkatrésze. |
Nem egyetlen modellt kell választani
A jövő működőképes AI-rendszere valószínűleg nem egyetlen óriásmodellre épül. Több, különböző képességű komponens dolgozik majd együtt. A legegyszerűbb kéréseket szabályok vagy kis modellek kezelik. A nehezebb esetek nagyobb modellhez kerülnek. A kritikus műveletek pedig csak külön jogosultsági és emberi ellenőrzési rétegen haladhatnak át.
|
1 |
2 |
3 |
4 |
Ez a modellrouting vagy modellkaszkád lényege. A FrugalGPT kutatása már 2023-ban azt mutatta meg, hogy több modell megfelelő sorrendben és feltételekkel történő használata ugyanazon a költségszinten javíthatja a pontosságot, vagy jelentősen csökkentheti a költséget. A közölt eredmények konkrét kísérleti környezetre vonatkoztak, ezért nem univerzális ígéretként érdekesek. A fontos felismerés az, hogy a modellek közötti választás önmagában optimalizálható rendszerfeladat.
A benchmark nem a te vállalkozásod
A nyilvános benchmarkok hasznosak, de nem ismerik a saját dokumentumainkat, ügyfeleink nyelvét, kockázati szintjeinket és elfogadható hibáinkat. Egy modell lehet kiváló matematikából, programozásból és általános kérdés-válasz feladatokból, miközben a mi három kategóriánkat következetlenül választja szét.
Ezért nem modellranglistát kell vásárlási listaként használni. Saját mérés kell. Ugyanazt a néhány száz vagy néhány ezer valós példát kell lefuttatni több modellen, azonos feltételekkel, majd legalább négy dolgot összevetni:
• feladatspecifikus pontosság;
• kimeneti stabilitás és formátumkövetés;
• válaszidő és erőforrásigény;
• egy helyes eredményre jutó teljes költség.
Az utolsó mutató különösen fontos. Nem az olcsó token a cél, hanem az olcsó, helyes és használható eredmény. Egy gyenge modell hiába fut fillérekből, ha a hibái miatt emberi javítás, újrapróbálás vagy üzleti kár keletkezik. Ugyanígy egy erős modell hiába pontos, ha tízszeres áron old meg egy olyan feladatot, amelyet egy kisebb rendszer is ugyanilyen megbízhatóan teljesít.
Mit kell valójában megtanulnunk?
Nem egyszerűen lokális modelleket kell telepítenünk. Feladatot kell szétbontanunk, mérnünk kell, és el kell döntenünk, hol mennyi intelligenciára van szükség.
• Megkülönböztetni a generálást az osztályozástól és az adatkinyeréstől.
• Megtalálni a legkisebb modellt, amely még eléri a szükséges minőséget.
• Korlátozni a kimenetet, amikor a folyamat nem engedhet meg kreativitást.
• Felismerni a bizonytalan eseteket, és továbbadni őket.
• Verziózni a modelleket, a promptokat és a tesztkészleteket.
• Egyetlen chatbot helyett teljes, ellenőrizhető AI-architektúrában gondolkodni.
A valódi következtetés
A nagy modellekre továbbra is szükség lesz. Ők kezelik az ismeretlen, összetett, kreatív vagy több lépéses problémákat. De nem kell minden e-mailhez, minden címkéhez és minden adatmező felismeréséhez a világ egyik legdrágább digitális elméjét felébresztenünk.
A következő években az kerül előnybe, aki nem egyszerűen hozzáfér az AI-hoz, hanem tudja is, hogyan ossza fel a munkát. Aki felismeri, mikor elég egy szabály. Mikor kell klasszikus gépi tanulás. Mikor működik jól egy kis lokális nyelvi modell. És mikor indokolt valóban a legerősebb rendszer használata.
A jövő nem feltétlenül a legnagyobb modellé. Hanem azoké, akik pontosan tudják, mikor melyik modellhez kell nyúlni.
Források és további olvasmányok
- NVIDIA Research: Small Language Models are the Future of Agentic AI
- Google AI for Developers: Gemma modellek - kiválasztás, futtatás és finomhangolás
- llama.cpp: lokális, kvantált és CPU-GPU hibrid modellfuttatás
Hozzászólások
Betöltés…
Session betöltése…