DeepSeek V4 Flash: az olcsó modell, amely a saját, drágább testvérét is legyőzi az ügynök-teszteken
- 2024. július 31-én a kínai DeepSeek kiadta a V4‑Flash‑0731 frissített modelljét, 284 milliárd paraméterrel és 13 milliárd aktivált MoE‑architektúrával.
- A modell 82,7 pontot ért el a Terminal‑Bench 2.1‑en, 14,7 %-os előnyt szerezve a 72,1 pontot elért V4‑Pro‑Preview‑hoz képest, miközben tokenenként 0,14 $‑ba, 0,28 $‑ba kerül, az árak harmadát nyújtva.
- A nyílt súlyok MIT licenc alatt a Hugging Face‑en és az OpenAI Responses API‑val való támogatás miatt a fejlesztők gyorsan átállhatnak, erősítve a költséghatékony középkategóriás AI‑piacot.
Rendszer fókusz: Használjon szigorú token‑használati monitorozást és költség‑figyelmeztetéseket a DeepSeek V4‑Flash API‑hívásoknál, ellenőrizze a ‘thinking’ tokenek számlázását, és korlátozza az API‑kulcsok hozzáférését IP‑szintű whitelist‑el.
Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.
A kínai DeepSeek július 31-én hivatalosan is kiadta a V4 Flash modell frissített változatát, nyilvános bétaverzióban az API-n keresztül. A bejelentés érdekessége nem egy vadonatúj alaptechnológia, hanem az, hogy egy szándékosan olcsó, könnyű modell olyan eredményeket ér el az ügynökteszteken, amelyekkel a saját, nagyobb és drágább testvérmodelljét, a V4 Pro-t is megelőzi.
A modell architektúrája és mérete változatlan a korábbi V4-Flash-Preview-hoz képest – egy 284 milliárd paraméteres, ebből 13 milliárd aktivált paraméterrel dolgozó Mixture-of-Experts (MoE) rendszer, egymillió tokenes kontextusablakkal. Az egyetlen változás a poszttréning: a DeepSeek újratanította a modell viselkedését, és ezzel jelentős ugrást ért el az ügynök- és kódolási feladatokban.
Amikor az olcsóbb modell veri a drágábbat
A legfontosabb szám: a V4-Flash-0731 82,7 pontot ért el a Terminal-Bench 2.1 teszten, szemben a V4-Pro-Preview 72,1 pontjával – ez 14,7 százalékos előny a költséghatékony modell javára a prémium testvérével szemben.
Ez azért figyelemre méltó, mert a Terminal-Bench és a hasonló tesztek (például a Toolathlon 70,3 ponttal) valós, többlépcsős szoftvermérnöki és eszközhasználati feladatokat mérnek, nem pusztán lexikális tudást. Ez egy szoftverek működtetésére hangolt modell.
A DeepSeek több egyéb eredményt is közzétett:
- NL2Repo 54,2
- Cybergym 76,7
- DeepSWE 54,4
- Agent Last Exam 25,2
- DSBench-FullStack 68,7
A számokat a cég saját DeepSeek Harness rendszerével, minimális módban, maximális szinten mérte (top_p 0,95, temperature 1,0). Fontos árnyalat: az utolsó néhány teszt (Agent Last Exam, Automation Bench) szándékosan brutális, hosszú távú feladatsor, ahol a húszas értékek jelenleg az egész élvonalbeli (frontier) mezőnyben normálisnak számítanak – a teljesen autonóm, órákig tartó feladatvégrehajtást egyelőre senki sem oldotta meg.
Független megerősítésként az Artificial Analysis az Intelligence Indexen 50 pontot adott a 0731-es buildnek: ez tíz ponttal magasabb az áprilisi preview-nál, hattal a jóval nagyobb V4 Pro-nál, és egy szinten van a Gemini 3.6 Flash-sel.
Az igazi történet az árazás
A V4 Flash millió bemeneti tokenenként 0,14 dollárba, kimeneti tokenenként pedig 0,28 dollárba kerül – nagyjából a V4 Pro árának harmada (utóbbi 0,435, illetve 0,87 dollár). Összehasonlításképp: az Anthropic Opus 4.8 modellje, amely a legtöbb teszten vezet, 85,0 pontot ért el a Terminal-Bench 2.1-en – a V4 Flash 82,7 pontja mindössze 2,3 pont lemaradás, ennek a töredékéért. A nagy léptékben ügynökfeladatokat futtató csapatoknak ez a matek sokat számít.
Egy fontos részlet a költségvetéshez: a gondolkodási („thinking”) mód alapértelmezetten be van kapcsolva, és a kimeneti díjszabás szerint számláz, még akkor is, ha ezek a rejtett érvelési tokenek nem jelennek meg a végső válaszban. Emellett a DeepSeek árlistája egy jövőbeli csúcsidős szorzót is kilátásba helyezett (kétszeres díj pekingi idő szerint bizonyos idősávokban), aminek a bevezetési dátuma egyelőre nincs meghirdetve.
Fejlesztőbarát integráció és nyílt súlyok
A hivatalos kiadás API-oldali újdonsága, hogy a V4 Flash mostantól natívan támogatja az OpenAI Responses API formátumát, így az OpenAI ökoszisztémájára építő fejlesztők minimális kódmódosítással válthatnak át rá. A DeepSeek emellett kifejezetten a Codex-integrációhoz igazította a modellt. A modell azonosítója változatlan maradt (deepseek-v4-flash), tehát a meglévő integrációk automatikusan az új változatot kapják – nincs új végpont, nincs sémaváltás.
A stratégia egyértelmű: a DeepSeek a fejlesztők belépési küszöbét igyekszik minimálisra csökkenteni. A 0731-es súlyok ráadásul nyilvánosan elérhetők a Hugging Face-en, MIT licenc alatt.
Mit jelent ez a piacnak?
A V4 Flash jól illeszkedik abba a szélesebb iparági trendbe, amely a magas árú zászlóshajó-modellek kihívójaként a hozzáférhető, jó ár-érték arányú középkategóriát erősíti. A modell nem dominál minden teszten, de az értékajánlata világos: a magas teljesítménynek nem kell magas árral járnia. Egy olyan időszakban, amikor a kínai modellek sorra jelennek meg közel frontier-szintű teljesítménnyel a frontier-árak töredékéért, minden ilyen kiadás tovább élezi a nyílt forráskódú AI körüli vitát, és egyre nehezebbé teszi a zárt, prémium modellek felárának megindokolását.
Kövesd a témát
Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.
A követéshez jelentkezz be.
Gyakori kérdések az AI hírekről
Hol olvashatóak a legfrissebb AI hírek magyarul?
A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.
Milyen témákat fednek le a KakasTech AI hírei?
A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.
Hogyan értesülhetek azonnal a legújabb AI változásokról?
Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.
Hozzászólások 0
Még nincsenek hozzászólások. Írd meg te az elsőt!