Több adat legyőzi a nagyobb modellt – itt a Xiaomi-Robotics-1
- 2024. július 16-án a Xiaomi bemutatta a Xiaomi‑Robotics‑1 robotot, amely 100 000 óra kézi mozgásadatból tanult VLA modellt.
- A modell 57,6 % sikerarányt ért el RoboCasa365‑ben és 20,07 pontot RoboDojo‑n, ami 10‑15 % javulást jelent a korábbi 46,6 % és 13,07 ponthoz képest.
- A nagy mennyiségű, UMI‑eszközökkel gyűjtött adat várhatóan felgyorsítja a robotikai fejlesztéseket, és a skálázási törvény alkalmazását más fizikai AI‑ra is inspirálhatja.
Rendszer fókusz: Ellenőrizze, hogy a 100 000 órás mozgásadatot aláírt, hash‑ellenőrzött csomagokban tárolják, és a UMI‑eszközök firmware‑jét rendszeresen frissítik, hogy megakadályozzák az adat‑manipulációt és a modell‑poisoninget.
Ez a cikk több nemzetközi forrás alapján, mesterséges intelligencia közreműködésével készült szerkesztett összefoglaló, amely nem azonos egyetlen konkrét forrás tartalmával sem. A szöveg csak szerkesztői átolvasás után jelenik meg, ennek ellenére tartalmazhat pontatlanságokat; a felhasznált források lentebb olvashatók.
A robotika évek óta ugyanabba a falba ütközik: a mesterséges intelligencia a nyelv és a kép területén azért fejlődött robbanásszerűen, mert egyre több adaton, egyre nagyobb modellekkel és egyre több számítási kapacitással tanult. A robotoknál viszont pont ez a nyersanyag – a nagy mennyiségű, jó minőségű mozgásadat – hiányzott.
A Xiaomi új alapmodellje, a Xiaomi-Robotics-1 éppen erre a problémára ad választ.
„A robotoknál nem feltétlenül a nagyobb modell nyer, hanem a több adat.”
A skálázási törvény kiterjesztése a fizikai AI-ra
A július 16-án bemutatott modell lényege, hogy ugyanazt a skálázási mintát követi, amelyet a nagy nyelvi modelleknél (LLM) már megismertünk: a teljesítménye kiszámíthatóan javul, ahogy több adaton és nagyobb mérettel tanul. A Xiaomi szerint ez Kínában az első szisztematikus bizonyítéka annak, hogy a robotok irányítási modeljeire (robot policy models) is érvényes a skálázási törvény.
A rendszer egy úgynevezett Vision-Language-Action (VLA) modell, vagyis egyszerre dolgozza fel:
- a vizuális látványt,
- a természetes nyelvi utasítást,
- valamint a közvetlen cselekvést és mozgásvezérlést.
Ennek köszönhetően a robot nyelvi parancsokat követve képes ismeretlen környezetben is elvégezni különféle mobil manipulációs feladatokat – ráadásul „dobozból kivéve”, külön helyszíni betanítás nélkül.
Az adatáttörés: Kézi fogóeszközök a fizikai robotok helyett
A valódi trükk az adatgyűjtés módszertanában rejlik. A nyelvi modellek a nyilvános internet hatalmas szövegkészletén taníthatók, a hasznos robotmozgás-adat viszont rendkívül szűkös. A hagyományos módszer az, hogy emberek távirányítással vezetnek végig egy fizikai robotot minden egyes mozdulaton – ez azonban lassú, drága, és jellemzően ismétlődő adatot termel ugyanabból a feladatból.
A 100 000 órányi valós adat nagy részét nem drága robotokkal, hanem kamerával felszerelt, kézi fogóeszközökkel (úgynevezett UMI-eszközökkel) gyűjtötte össze, közvetlenül az emberi kezek mozgásából.
Így a fizikai robotflották korlátai nélkül lehetett óriási léptékű mozgásadathoz jutni.
Kétfázisú betanítás és rekordmérések
A tanítás – akárcsak a nyelvi modelleknél – két fő szakaszból áll:
- Előtanítás: A modell széles, általánosítható cselekvésgeneráló képességet szerez a 100 000 órányi emberi mozgásadatból.
- Utótanítás: Ez a fázis igazítja a megszerzett tudást a valódi robottestek kinematics-jellegzetességeihez és a nyelvi utasítások pontos követéséhez.
A Xiaomi mérései szerint az előtanítás során a teljesítmény tisztán és kiszámíthatóan javult az adat és a modellméret növelésével, és ami döntő: ez a javulás átvitellel megjelent a valós idejű, fizikai tesztekben is.
Teljesítmény-összehasonlítás
A RoboCasa365 sikerarányában a korábbi 46,6%-os csúcsértéket 57,6%-ra tornázta fel a modell, miközben a RoboDojo átlagpontszámát is 13,07-ről 20,07-re javította. Az új feladatok gyorsillesztésénél – ahol korábban a Physical Intelligence ért el körülbelül 40,0%-ot – a Xiaomi-Robotics-1 kevesebb mint 10 órányi adattal 75,0%-os sikerarányt produkált.
A gyakorlati tesztek során a modellt négy teljesen új feladaton próbálták ki (telefon becsomagolása, mosás betöltése, papír adagolása a nyomtatóba, tárgyak dobozolása). Egy látványos demóban a robot állítólag emberi beavatkozás nélkül pakolt be egy teljes bőröndöt egy tízperces, szobán átívelő folyamat során.
Háromnapos kiadási sorozat és a nyílt súlyok
A Xiaomi-Robotics-1 nem elszigetelt kísérlet, hanem egy átfogó, háromnapos robotikai bejelentéssorozat csúcspontja:
- Július 14.: Emberi szinthez közeli sikeraránnyal működő, gyári összeszerelő humanoid robot bemutatása.
- Július 15.: A 38 milliárd paraméteres Xiaomi-Robotics-U0 robotikai világmodell nyílt forráskódúvá tétele.
- Július 16.: A Xiaomi-Robotics-1 vezérlési alapmodell kiadása.
Ez a három pillér egy teljes „hardver–adat–modell” ökoszisztémát alkot, megerősítve a Xiaomi törekvését, hogy a testet öltött AI (embodied AI) piacának globális éllovasává váljon. A vállalat közölte, hogy a kódkészletet és a modell-súlyokat egyaránt közzéteszi.
Összegzés
A cselekvések és eredmények helyes olvasata nem az, hogy a nagyobb modellek feleslegesek lennének, hanem az, hogy a robotikában jelenleg az adat képezi a legfőbb szűk keresztmetszetet, nem a paraméterszám.
A Xiaomi egy skálázható és költséghatékony receptet igazolt: nagy léptékű, robot nélküli előtanítás emberi mozgásból, majd kevés valós robotadattal történő finomhangolás. Ha ez a megközelítés iparági szabvánnyá válik, jelentősen felgyorsíthatja a humanoid és mobil robotok elterjedését a gyárakban és a háztartásokban egyaránt.
Kövesd a témát
Értesítést kapsz a profilodban és a heti hírlevélben, ha új cikkünk jelenik meg a követett témáidban.
A követéshez jelentkezz be.
Gyakori kérdések az AI hírekről
Hol olvashatóak a legfrissebb AI hírek magyarul?
A KakasTech AI Hírek rovata naponta frissül: a mesterséges intelligencia legújabb fejlesztései, modell-bejelentések és iparági elemzések magyar nyelven, ellenőrzött nemzetközi források alapján olvashatóak nálunk.
Milyen témákat fednek le a KakasTech AI hírei?
A nagy AI-laborok (OpenAI, Anthropic, Google DeepMind) bejelentéseitől a chipeken és a robotikán át a hazai és nemzetközi szabályozásokig minden lényeges területet követünk.
Hogyan értesülhetek azonnal a legújabb AI változásokról?
Feliratkozhatsz a heti összefoglaló hírlevelünkre a lap alján, vagy követheted az AI API-árkalkulátorunkat és az AI-modell összehasonlító oldalunkat a legfrissebb technikai adatokért.
Hozzászólások 0
Még nincsenek hozzászólások. Írd meg te az elsőt!