A kínai laborok már nem utolérni akarnak – összeomlott a frontvonal árprémiuma
- Július 16-án a kínai Moonshot AI bemutatta a Kimi K3 modellt, míg három nappal később az Alibaba Qwen 3.8 Max Preview-t publikálta, mindkettő OpenAI‑kompatibilis API‑val.
- A Kimi K3 0,94 $ feladatonkénti költséggel és 57 ponttal az AI Indexen közel a GPT‑5.6 Sol 1,04 $‑os árához, így a prémium árak védelme megingott.
- A költséghatékony, nyílt‑súlyú kínai modellek könnyű kódsor‑cserével lehetővé teszik a migrációt, ezért a vállalatok valószínűleg a következő negyedévben jelentős részt átcsoportosítanak alacsonyabb költségű API‑szolgáltatók felé.
Rendszer fókusz: Mielőtt a Kimi K3 vagy Qwen 3.8 API‑ra vált, auditálja a token‑számot, szigorúan korlátozza az API‑kulcs jogosultságait, és valós adatmintákkal tesztelje a modell hallucinációs rátáját.
Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat.
Nyolc nap alatt négy frontvonalbeli mesterséges intelligencia érkezett, és a mintázat félreérthetetlen: a kínai laborok már nem utolérni próbálják a nyugati riválisokat, hanem ár-érték arányban igyekeznek felülkerekedni rajtuk.
Július elején az xAI kiadta a Grok 4.5-öt. Másnap az OpenAI nyilvánosságra hozta a teljes GPT-5.6 családot (Sol, Terra, Luna), miután az amerikai kormányzati átvizsgálás lezárult. Július 16-án a kínai Moonshot AI ledobta a bombát a Kimi K3-mal. Három nappal később az Alibaba vágott vissza a Qwen 3.8 Max Preview-val. A Google eközben elvileg július 17-én adta volna ki a Gemini 3.5 Pro-t – de az végül nem jelent meg.
A per-task cost forradalma: A tokenárazás halála
A történet érdemi része nem a bejelentések száma, hanem egyetlen mutató, amelyet a gyártók ritkán tesznek ki a marketinggrafikákra: a feladatonkénti ár (per-task cost). A tokenalapú árazás egyre kevesebbet mond a valóságról, mert a modellek drasztikusan eltérő mennyiségű úgynevezett reasoning tokent (gondolkodási lépést) használnak ugyanahhoz a feladathoz. Egy modell lehet papíron olcsóbb tokenenként, mégis drágább a gyakorlatban, ha háromszor annyit „gondolkodik”.
Az Artificial Analysis független méréssora ezért feladatonkénti költséggel dolgozik, ami sokkal közelebb áll a valós számlához – a tokenárazás önmagában ma már alig informatív a valós költségekről.
Kimi K3: Csúcskategóriás teljesítmény féláron
A Kimi K3 esetében ezek a számok rendkívül beszédesek. A modell 57 pontot ért el az Artificial Analysis Intelligence Indexén, amivel a negyedik helyre került a globális mezőnyben – közvetlenül a Claude Fable 5 (≈60), a GPT-5.6 Sol (≈59) és épphogy a Claude Opus 4.8 (≈56) mellett. Ezzel a Kimi K3 lett az első nyílt súlyú (open-weight) modell, amely ilyen magasra jutott ezen a ranglistán.
A feladatonkénti költsége nagyjából 0,94 dollár, ami hasonló a GPT-5.6 Sol 1,04 dollárjához, és nagyjából fele az Opus 4.8 1,80 dollárjának. Vagyis a Kimi K3 durván az Opus 4.8 szintjén teljesít, feleannyi pénzért.
Teljesítmény és feladatonkénti költségek összehasonlítása
- Claude Fable 5 – Zárt, Intelligence Index: ~60, Feladatonkénti költség: ~2,50 $
- GPT-5.6 Sol – Zárt, Intelligence Index: ~59, Feladatonkénti költség: ~1,04 $
- Kimi K3 – Nyílt súlyú, Intelligence Index: ~57, Feladatonkénti költség: ~0,94 $
- Claude Opus 4.8 – Zárt, Intelligence Index: ~56, Feladatonkénti költség: ~1,80 $
A kép azonban nem teljesen hibátlan, és érdemes a nüanszokat is látni:
- A K3 kimeneti tokenára tokenenként jóval magasabb, mint az elődjéé (a K2.6-é).
- A modell a mérések során több mint kétszer annyi kimeneti tokent használt, mint a hasonló reasoning-modellek mediánja – ez a magyarázata annak, hogy a teljes kiértékelés önmagában több ezer dollárba került.
- A Moonshot ráadásul maga is elismer három korlátot, köztük egy kritikusat: a hallucinációs ráta az előző generációhoz képest érezhetően nőtt.
Cserébe a modell más területeken frontvonalat vezet: az ügynökös SaaS-munkafolyamatokat mérő AutomationBench tesztjén ez érte el a legjobb eredményt az egész mezőnyben, és a vak felhasználói szavazáson alapuló frontend-kód ranglistán is az élre került.
Qwen 3.8 Max Preview és az M3 Pro: Ígéretek benchmarkok nélkül
Az Alibaba Qwen 3.8 Max Preview-ja egészen más kategória a bizonyíthatóság szempontjából. A 2,4 billió paraméteres, multimodális modell mögött a bejelentés pillanatában egyetlen közzétett benchmark sem állt: sem model card, sem licenc, sem független értékelés, csupán néhány közösségimédia-poszt és egy működő, fizetős preview-hozzáférés.
Az Alibaba „csak a Fable 5 előzi meg” állítása a cég saját belső értékelésén alapul, és pontosan úgy kell kezelni, ahogy megszületett: gyártói marketingállításként, nem mért eredményként. Amíg egy független mérőház (például az Artificial Analysis vagy az LMArena) be nem méri, ez ígéret, nem tény. A nyílt súlyokat is megígérték hozzá, konkrét dátum nélkül.
A sor itt nem ér véget. A The Information értesülései szerint a MiniMax egy 2,7 billió paraméteres, M3 Pro néven emlegetett modellen dolgozik, amelyet szintén nyílt forráskódúként tervez kiadni a harmadik negyedévben. Ha ez megvalósul, ez lenne a valaha nyilvánossá tett legnagyobb modell. A fenntartás viszont ugyanaz: a jelentés névtelen forrásokra épül, a licencfeltételek ismeretlenek, a kínai kormányzat nyílt forráskódú AI-politikája pedig jelenleg is alakul, ami könnyen csúszást okozhat.
A váltási költség illúziójának vége
„A váltási költség illúziója megszűnt – a prémium ár védelme elpárolog, amint az alternatíva tényleg jó.”
Mindez azért fontos, mert a mérési számoknál is mélyebb tanulság húzódik meg mögötte. A frontvonalbeli laborok évek óta részben arra építették a prémium árukat, hogy a felhasználó nem mer modellt váltani. A saját értékelési keretrendszerek és benchmark-konfigurációk védőfala pontosan addig működött, amíg a váltás fájdalmas volt. Ma már nem az. A Kimi K3 és a Qwen 3.8 egyaránt az OpenAI API-jával kompatibilis végpontot kínál, így a migráció gyakorlatilag annyi, hogy átírsz egyetlen sort a kódban. Amint az alternatíva tényleg jó – és egyre inkább az –, a prémium ár védelme elpárolog.
Interaktív Modell-összehasonlító Widget
Az alábbi interaktív eszközzel vizuálisan is feltérképezheted az egyes modellek intelligenciaszintjét a feladatonkénti becsült költségük függvényében. A bal felső sarok felé eső modellek képviselik a legjobb ár-érték arányt.
Összegzés
A helyes olvasat tehát nem az, hogy a nyugati frontvonal-modellek elavultak, hiszen a legnehezebb, legnagyobb tétű reasoning- és ügynökfeladatokban továbbra is ők vezetnek. A helyes olvasat az, hogy a legtöbb valós munkánál a különbség mára néhány pontnyi képességre szűkült, miközben az árkülönbség akár háromszoros is lehet. A döntést nem a launch-grafikák, hanem a feladatonkénti ár, a saját terhelésen mért minőség és a valós hozzáférés kell, hogy vezérelje
Kövesd a témát
Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.
A követéshez jelentkezz be.
Gyakori kérdések az AI hírekről
Hol olvashatóak a legfrissebb AI hírek magyarul?
A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.
Milyen témákat fednek le a KakasTech AI hírei?
A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.
Hogyan értesülhetek azonnal a legújabb AI változásokról?
Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.
Hozzászólások 0
Még nincsenek hozzászólások. Írd meg te az elsőt!