AI sprawdzono w roli inżyniera robotów. Nowy benchmark testuje pracę w świecie fizycznym

RLE-Bench benchmark AI dla robotów

Naukowcy z Harvardu i Georgia Tech stworzyli RLE-Bench – otwarty benchmark sprawdzający, czy agenci AI potrafią projektować i uruchamiać fizyczne roboty. Narzędzie obejmuje 48 zadań wymagających łączenia programowania, uczenia maszynowego, mechaniki i rozumowania o prawach fizyki.

AI musi poradzić sobie z prawdziwym robotem

.Rozwój sztucznej inteligencji sprawił, że agenci kodujący potrafią coraz bardziej samodzielnie pisać i poprawiać programy. Dotychczas oceniano ich głównie w środowisku cyfrowym. Naukowcy z Harvardu i Georgia Tech postanowili sprawdzić, jak agenci AI radzą sobie z zadaniami, w których o powodzeniu decyduje także świat fizyczny. Badanie przeprowadzili naukowcy z Harvardzkiej Szkoły Inżynierii i Nauk Stosowanych im. Johna A. Paulsona oraz uczelni Georgia Tech.

Zespół kierowany przez Na Li, profesora elektrotechniki i matematyki stosowanej na Harvardzie, oraz Bo Daia, profesora Georgia Tech, opracował RLE-Bench. Jest to benchmark przeznaczony do oceny agentów AI wykonujących zadania typowe dla inżyniera zajmującego się uczeniem robotów.

W pracach uczestniczyli także doktorant Harvardu Haitong Ma oraz Chenxiao Gao i Rushi Qiang z Georgia Tech.

48 zadań dla agentów kodujących

.RLE-Bench zawiera 48 zadań sprawdzających, czy agenci ogólnego przeznaczenia potrafią wykonywać prace potrzebne do budowy i obsługi systemów robotycznych. Obejmują one między innymi tworzenie algorytmów sterowania i percepcji, projektowanie sprzętu oraz przygotowywanie interfejsów robotów.

Zadania podzielono na cztery obszary: sterowanie interaktywne, rozwój polityk działania, percepcję i estymację oraz projektowanie mechaniczne.

Benchmark ocenia więc nie tylko zdolność generowania kodu. Sprawdza także, czy agent potrafi rozumować o pomiarach, dynamice, stabilności, ograniczeniach sprzętowych oraz relacjach między oprogramowaniem a fizycznym urządzeniem.

„Benchmarki są ważne, ponieważ dają całej dziedzinie wspólną miarę. Pozwalają porównywać systemy w tych samych warunkach i wskazywać najważniejsze luki w ich możliwościach” – powiedziała Na Li.

Symulacja pokazuje ograniczenia AI

.Zadania RLE-Bench wykonywane są w środowiskach symulacyjnych. Agenci mogą tam generować, uruchamiać, analizować i poprawiać własne rozwiązania. Problemy zostały jednak zbudowane tak, aby uwzględniały ograniczenia znane z rzeczywistej robotyki.

Projekt może wyglądać poprawnie z punktu widzenia programu, a mimo to okazać się niestabilny po dodaniu ładunku. System może też nie zadziałać, jeśli agent błędnie oceni masę, moment obrotowy albo geometrię konstrukcji.

W jednym z zadań agent projektuje uniwersalną mobilną podstawę dla kilku ramion robotycznych. Konstrukcja musi pozwolić ramieniu sięgać przedmiotów umieszczonych na półce na różnych wysokościach. Sam zasięg nie wystarcza jednak do zaliczenia testu. Cały robot może bowiem przewrócić się podczas pracy.

„Agent może stworzyć coś, co wygląda rozsądnie pod względem obliczeniowym, ale analiza fizyki całego systemu ujawnia ważne scenariusze awarii” – wyjaśnił Haitong Ma.

Otwarty benchmark dla całej społeczności

.RLE-Bench jest projektem open source i został publicznie udostępniony. Dzięki temu zespoły badawcze mogą oceniać nowe systemy AI na wspólnym zestawie zadań.

Twórcy benchmarku podkreślają, że obecna wersja jest dopiero początkiem. W pracy inżyniera robotów znajdują się również zadania, których RLE-Bench jeszcze nie obejmuje, w tym nowe formy projektowania sprzętu, symulacja, integracja systemów, debugowanie, bezpieczeństwo i wdrażanie.

„RLE-Bench 1.0 to dopiero punkt wyjścia” – powiedziała Li. Badacze liczą, że naukowcy i praktycy robotyki będą dodawać zadania oparte na problemach spotykanych w ich własnej pracy. Celem wersji 2.0 ma być szersze pokazanie tego, co system AI musi potrafić, aby rzeczywiście działać jako inżynier zajmujący się uczeniem robotów.

Szymon Ślubowski

Materiał chroniony prawem autorskim. Dalsze rozpowszechnianie wyłącznie za zgodą wydawcy. 20 września 2026