Robotycy od lat biją głową w ten sam mur: brakuje danych oznaczonych.
Każda pozycja ramienia, każdy ruch chwytaka - wszystko trzeba ręcznie opisać, a skala takich zbiorów jest ograniczona.
Beijing Academy of Artificial Intelligence (BAAI) postanowiło ominąć ten problem całkowicie.
Cztery rodzaje materiałów: ujęcia z pierwszej osoby, ujęcia z trzeciej osoby, nagrania robotów bez danych akcji i naturalne sceny z życia codziennego.