Лондондық Humanoid компаниясы KinetIQ Ascend — гуманоидты роботтарды оқытудың жаңашыл тәсілін ұсынды, ол нақты өндірістік жағдайларда тікелей сынақ пен қателік әдісіне негізделген. Әзірлеушінің айтуынша, технология адам жылдамдығымен салыстырылатын немесе тіпті одан асып түсетін жылдамдықта манипуляциялардың дәлдігін 99,9%-ға дейін жеткізе алады.
KinetIQ Ascend қалай жұмыс істейді
KinetIQ Ascend Humanoid роботтарының негізінде жатқан KinetIQ фреймворкінің мүмкіндіктерін кеңейтеді. Негізгі айырмашылық — күшейтілген оқытуды (reinforcement learning, RL) пайдалану. Адам әрекеттерін пассивті көшіруден айырмашылығы, жүйе тапсырманы өз бетінше қайталайды, сәттілік немесе қателік туралы кері байланыс алады және осының негізінде өзінің мінез-құлық алгоритмдерін жақсартады.
Маңыздысы, Humanoid RL-ді тек симуляцияда ғана емес, нақты жабдықта және өндірістік сценарийлерде тәулік бойы іске қосады. Менің деректерім бойынша, бұл нақты екі қолды гуманоидты платформада орналастыру жағдайында оқытылған vision-language-action (VLA) модельдері үшін көруге негізделген толық RL-дің алғашқы жарияланған демонстрациясы. Бұл дағдыларды жетілдіру тәсілін түбегейлі өзгертеді.
Неліктен RL-ге ставка жасау ақталды
Бұрын Humanoid, көптеген бәсекелестер сияқты, роботтарды адам демонстрацияларын имитациялау арқылы оқытты. Алайда бұл әдістің түбегейлі шектеуі бар: демонстрацияларды көшіретін модель демонстратордан жылдамдығы мен сапасы бойынша асып кете алмайды және қателіктерден үйренбейді. Компанияның пікірінше, сенімділіктің соңғы пайыздары мен адамнан тыс жылдамдыққа көшу басқа тәсілді қажет етеді. KinetIQ Ascend нақты тапсырмаларда үздіксіз тәжірибе арқылы бұл алшақтықты жабады, бұл процесті үлкен тілдік модельдерді масштабтаумен салыстырады — оқыту неғұрлым ұзақ болса, сәттілік соғұрлым жоғары болады.
Тестілеу нәтижелері
Humanoid үш өндірістік тапсырма бойынша сынақтар жүргізді. Біріншісінде — робот контейнерден болат мойынтірек сақиналарын алып, оларды конвейерге орналастыруы керек еді. RL-оқытудан кейін өткізу қабілеті 42%-ға өсіп, базалық модельдегі 291-ге қарсы сағатына 412 сақинаға жетті. Екінші тапсырмада — затты контейнерден адамға беру — өткізу қабілеті 85%-ға өсті, эпизодтың орташа ұзақтығы 35%-ға төмендеді, ал сәттілік 80%-дан 98%-ға көтерілді. Үшіншісінде — үстелден контейнерді екі қолмен ерікті бағдарда көтеру — бірнеше күндік оқытудан кейін өткізу қабілеті сағатына 122-ден 279 контейнерге дейін өсті, эпизодтың орташа ұзақтығы 22,9 секундтан 12,8 секундқа дейін қысқарды, ал сәттілік 77,6%-дан 98,9%-ға көтерілді.
Компания өлшеулер ағымдағы базалық модельмен параллельді A/B-салыстыру арқылы жүргізілгенін, ескі базаға қарсы емес екенін атап өтеді. Бұл нақты өндірістік орталар үшін өте маңызды, мұнда нәтиже жарықтандыруға, объектілердің орналасуына немесе жабдықтың тозуына байланысты өзгеруі мүмкін.
Сарапшылық пікір
Humanoid-тың серпілісі — бұл робототехникадағы кезекті қадам ғана емес, парадигманың өзгеруі. Пассивті көшіруден нақты тапсырмаларда белсенді күшейтілген оқытуға көшу гуманоидты роботтарды зертханалардан жаппай зауыттарға шығаратын катализатор бола алады. Егер компания бұл тәсілді масштабтай алса, біз өнеркәсіптегі автоматтандырудың күрт жеделдеуіне куә боламыз.