AI HÍREK AI fejlesztés
július 21. 5 perc 11

A kínai laborok már nem utolérni akarnak – összeomlott a frontvonal árprémiuma

KakasTech AI asszisztens elemzése
  • Július 16-án a kínai Moonshot AI bemutatta a Kimi K3 modellt, míg három nappal később az Alibaba Qwen 3.8 Max Preview-t publikálta, mindkettő OpenAI‑kompatibilis API‑val.
  • A Kimi K3 0,94 $ feladatonkénti költséggel és 57 ponttal az AI Indexen közel a GPT‑5.6 Sol 1,04 $‑os árához, így a prémium árak védelme megingott.
  • A költséghatékony, nyílt‑súlyú kínai modellek könnyű kódsor‑cserével lehetővé teszik a migrációt, ezért a vállalatok valószínűleg a következő negyedévben jelentős részt átcsoportosítanak alacsonyabb költségű API‑szolgáltatók felé.

Rendszer fókusz: Mielőtt a Kimi K3 vagy Qwen 3.8 API‑ra vált, auditálja a token‑számot, szigorúan korlátozza az API‑kulcs jogosultságait, és valós adatmintákkal tesztelje a modell hallucinációs rátáját.

Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat.

Kép forrása: Saját AI generált kép

Nyolc nap alatt négy frontvonalbeli mesterséges intelligencia érkezett, és a mintázat félreérthetetlen: a kínai laborok már nem utolérni próbálják a nyugati riválisokat, hanem ár-érték arányban igyekeznek felülkerekedni rajtuk.

Július elején az xAI kiadta a Grok 4.5-öt. Másnap az OpenAI nyilvánosságra hozta a teljes GPT-5.6 családot (Sol, Terra, Luna), miután az amerikai kormányzati átvizsgálás lezárult. Július 16-án a kínai Moonshot AI ledobta a bombát a Kimi K3-mal. Három nappal később az Alibaba vágott vissza a Qwen 3.8 Max Preview-val. A Google eközben elvileg július 17-én adta volna ki a Gemini 3.5 Pro-t – de az végül nem jelent meg.

A per-task cost forradalma: A tokenárazás halála

A történet érdemi része nem a bejelentések száma, hanem egyetlen mutató, amelyet a gyártók ritkán tesznek ki a marketinggrafikákra: a feladatonkénti ár (per-task cost). A tokenalapú árazás egyre kevesebbet mond a valóságról, mert a modellek drasztikusan eltérő mennyiségű úgynevezett reasoning tokent (gondolkodási lépést) használnak ugyanahhoz a feladathoz. Egy modell lehet papíron olcsóbb tokenenként, mégis drágább a gyakorlatban, ha háromszor annyit „gondolkodik”.

Az Artificial Analysis független méréssora ezért feladatonkénti költséggel dolgozik, ami sokkal közelebb áll a valós számlához – a tokenárazás önmagában ma már alig informatív a valós költségekről.

Kimi K3: Csúcskategóriás teljesítmény féláron

A Kimi K3 esetében ezek a számok rendkívül beszédesek. A modell 57 pontot ért el az Artificial Analysis Intelligence Indexén, amivel a negyedik helyre került a globális mezőnyben – közvetlenül a Claude Fable 5 (≈60), a GPT-5.6 Sol (≈59) és épphogy a Claude Opus 4.8 (≈56) mellett. Ezzel a Kimi K3 lett az első nyílt súlyú (open-weight) modell, amely ilyen magasra jutott ezen a ranglistán.

A feladatonkénti költsége nagyjából 0,94 dollár, ami hasonló a GPT-5.6 Sol 1,04 dollárjához, és nagyjából fele az Opus 4.8 1,80 dollárjának. Vagyis a Kimi K3 durván az Opus 4.8 szintjén teljesít, feleannyi pénzért.

Teljesítmény és feladatonkénti költségek összehasonlítása

  • Claude Fable 5 – Zárt, Intelligence Index: ~60, Feladatonkénti költség: ~2,50 $
  • GPT-5.6 Sol – Zárt, Intelligence Index: ~59, Feladatonkénti költség: ~1,04 $
  • Kimi K3 – Nyílt súlyú, Intelligence Index: ~57, Feladatonkénti költség: ~0,94 $
  • Claude Opus 4.8 – Zárt, Intelligence Index: ~56, Feladatonkénti költség: ~1,80 $

A kép azonban nem teljesen hibátlan, és érdemes a nüanszokat is látni:

  • A K3 kimeneti tokenára tokenenként jóval magasabb, mint az elődjéé (a K2.6-é).
  • A modell a mérések során több mint kétszer annyi kimeneti tokent használt, mint a hasonló reasoning-modellek mediánja – ez a magyarázata annak, hogy a teljes kiértékelés önmagában több ezer dollárba került.
  • A Moonshot ráadásul maga is elismer három korlátot, köztük egy kritikusat: a hallucinációs ráta az előző generációhoz képest érezhetően nőtt.

Cserébe a modell más területeken frontvonalat vezet: az ügynökös SaaS-munkafolyamatokat mérő AutomationBench tesztjén ez érte el a legjobb eredményt az egész mezőnyben, és a vak felhasználói szavazáson alapuló frontend-kód ranglistán is az élre került.

Qwen 3.8 Max Preview és az M3 Pro: Ígéretek benchmarkok nélkül

Az Alibaba Qwen 3.8 Max Preview-ja egészen más kategória a bizonyíthatóság szempontjából. A 2,4 billió paraméteres, multimodális modell mögött a bejelentés pillanatában egyetlen közzétett benchmark sem állt: sem model card, sem licenc, sem független értékelés, csupán néhány közösségimédia-poszt és egy működő, fizetős preview-hozzáférés.

Az Alibaba „csak a Fable 5 előzi meg” állítása a cég saját belső értékelésén alapul, és pontosan úgy kell kezelni, ahogy megszületett: gyártói marketingállításként, nem mért eredményként. Amíg egy független mérőház (például az Artificial Analysis vagy az LMArena) be nem méri, ez ígéret, nem tény. A nyílt súlyokat is megígérték hozzá, konkrét dátum nélkül.

A sor itt nem ér véget. A The Information értesülései szerint a MiniMax egy 2,7 billió paraméteres, M3 Pro néven emlegetett modellen dolgozik, amelyet szintén nyílt forráskódúként tervez kiadni a harmadik negyedévben. Ha ez megvalósul, ez lenne a valaha nyilvánossá tett legnagyobb modell. A fenntartás viszont ugyanaz: a jelentés névtelen forrásokra épül, a licencfeltételek ismeretlenek, a kínai kormányzat nyílt forráskódú AI-politikája pedig jelenleg is alakul, ami könnyen csúszást okozhat.

A váltási költség illúziójának vége

„A váltási költség illúziója megszűnt – a prémium ár védelme elpárolog, amint az alternatíva tényleg jó.”

Mindez azért fontos, mert a mérési számoknál is mélyebb tanulság húzódik meg mögötte. A frontvonalbeli laborok évek óta részben arra építették a prémium árukat, hogy a felhasználó nem mer modellt váltani. A saját értékelési keretrendszerek és benchmark-konfigurációk védőfala pontosan addig működött, amíg a váltás fájdalmas volt. Ma már nem az. A Kimi K3 és a Qwen 3.8 egyaránt az OpenAI API-jával kompatibilis végpontot kínál, így a migráció gyakorlatilag annyi, hogy átírsz egyetlen sort a kódban. Amint az alternatíva tényleg jó – és egyre inkább az –, a prémium ár védelme elpárolog.

Interaktív Modell-összehasonlító Widget

Az alábbi interaktív eszközzel vizuálisan is feltérképezheted az egyes modellek intelligenciaszintjét a feladatonkénti becsült költségük függvényében. A bal felső sarok felé eső modellek képviselik a legjobb ár-érték arányt.

Összegzés

A helyes olvasat tehát nem az, hogy a nyugati frontvonal-modellek elavultak, hiszen a legnehezebb, legnagyobb tétű reasoning- és ügynökfeladatokban továbbra is ők vezetnek. A helyes olvasat az, hogy a legtöbb valós munkánál a különbség mára néhány pontnyi képességre szűkült, miközben az árkülönbség akár háromszoros is lehet. A döntést nem a launch-grafikák, hanem a feladatonkénti ár, a saját terhelésen mért minőség és a valós hozzáférés kell, hogy vezérelje

Kövesd a témát

Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.

Cégek
Témák

Tetszett a cikk?

Oszd meg

Gyakori kérdések az AI hírekről

Hol olvashatóak a legfrissebb AI hírek magyarul?

A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.

Milyen témákat fednek le a KakasTech AI hírei?

A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.

Hogyan értesülhetek azonnal a legújabb AI változásokról?

Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.

Hozzászólások 0

A hozzászóláshoz kérjük, jelentkezz be.

Még nincsenek hozzászólások. Írd meg te az elsőt!