IEEE Spectrum opisał 10 września 2026 r. kilka projektów, które wykorzystują duże zbiory danych dotykowych do uczenia robotów precyzyjnej manipulacji. Wyniki T-Rex oraz zespołów z Tsinghua University, Fudan University i University of Southern California pokazują, że dotyk może poprawić kontrolę chwytu tam, gdzie same kamery nie wystarczają. Głównymi przeszkodami pozostają różnice między czujnikami, niedobór danych i sposób łączenia sygnałów dotykowych z obrazem.
Dlaczego robotom nie wystarcza obraz z kamery
Modele wzrokowo-językowo-działaniowe (vision-language-action, VLA) rozszerzyły zakres zadań, które robot może wykonać w nieznanym wcześniej otoczeniu. Najpierw trenuje się je na dużych zbiorach obrazów, filmów i tekstu, a następnie dostraja na mniejszej liczbie demonstracji rejestrowanych podczas teleoperacji. Tak przygotowane systemy potrafią między innymi składać pranie, porządkować pomieszczenia i obsługiwać urządzenia kuchenne na podstawie obrazu oraz instrukcji w języku naturalnym.
Problemy pojawiają się przy pracy z małymi przedmiotami i materiałami, które zmieniają kształt. Podłączenie przewodu USB, przekręcenie klucza w zamku czy kontrolowanie ślizgającego się przedmiotu wymaga informacji o sile nacisku, poślizgu i dokładnym położeniu chwytu. Kamera nie przekazuje tych danych bezpośrednio, dlatego model może nie zauważyć błędu, który człowiek wykrywa przez dotyk.
Dane dotykowe różnią się od obrazu. Zamiast ciągłego strumienia pikseli czujnik często dostarcza sygnał tylko podczas kontaktu, a jego odczyty zależą od konstrukcji urządzenia. Model musi więc nauczyć się, kiedy taki sygnał ma znaczenie i jak szybko skorygować na jego podstawie ruch robota.
Jak T-Rex koryguje chwyt w czasie rzeczywistym
Zespół Trevora Darrella z University of California, Berkeley najpierw wstępnie wytrenował model na istniejących zbiorach, a następnie dodał wyspecjalizowany moduł dotykowy. Do jego uczenia wykorzystano 100 godzin danych wysokiej jakości, zebranych podczas pracy z ponad 200 przedmiotami domowymi. Opisany przez IEEE Spectrum zbiór T-Rex obejmuje demonstracje podstawowych działań:
- wycierania powierzchni,
- chwytania przedmiotów,
- obracania i skręcania,
- przelewania zawartości.
Samo dodanie czujnika nie rozwiązało problemu, ponieważ kontrola dotykowa wymaga szybszej reakcji niż typowy model VLA. Badacze rozdzielili więc sterowanie między dwa wyspecjalizowane moduły określane jako eksperci. Ekspert działania tworzy plan ruchu, natomiast ekspert dotykowy pracuje cztery razy szybciej i na bieżąco poprawia ten plan zgodnie z odczytami czujników.
Model dostrojono następnie na około 100 teleoperowanych demonstracjach bardziej złożonych czynności. Obejmowały one wkręcanie żarówki, nakładanie pasty na szczoteczkę oraz przekładanie jajka między tackami. W 12 zadaniach system osiągnął średnią skuteczność 65 proc., czyli prawie dwukrotnie wyższą niż najlepszy porównywany model VLA.
Wspólny format ma połączyć różne czujniki
Wynik T-Rex ma istotne ograniczenie. Dane zebrano przy użyciu jednego zestawu sprzętu, podczas gdy konstrukcje robotycznych dłoni i chwytaków znacznie się różnią. Jedne mają pięć sterowanych palców, inne korzystają z prostego chwytaka szczękowego, a czujniki mogą mierzyć zmianę rezystancji albo rejestrować kamerą odkształcenie miękkiej warstwy żelu.
Chengbo Yuan z Tsinghua University podjął próbę ograniczenia zależności modelu od konkretnego sprzętu. Jego zespół zgromadził ponad 3000 godzin danych z publicznie dostępnych zbiorów, obejmujących 21 typów czujników i różne konstrukcje robotów. Badacze przekształcili sygnały z każdego czujnika do wspólnego formatu, a następnie przypisali je do opisanych pozycji na szablonie ludzkiej dłoni.
Model niezależny od sprzętu uzyskał lepsze wyniki niż model bazowy również na urządzeniach, których nie widział podczas treningu. Projekt czerpał z doświadczeń inicjatywy Open X-Embodiment, która łączyła dane pochodzące z wielu robotów. Zespół Yuana prowadzi obecnie współpracę 80 instytucji, której celem jest zebranie większej liczby teleoperowanych demonstracji według ujednoliconej metody rejestracji i przetwarzania dotyku.
Fudan University zebrał ponad 30 000 godzin danych
Fudan University w Szanghaju i wywodząca się z niego firma NeoteAI przygotowały zbiór o rząd wielkości większy od wcześniejszych przedsięwzięć. Obejmuje on ponad 30 000 godzin demonstracji z zsynchronizowanymi danymi wzrokowymi i dotykowymi. Dane rejestrowano za pomocą własnego czujnika montowanego na różnych ramionach robotycznych oraz ręcznego chwytaka obsługiwanego przez ludzi.
Wytrenowany na tym materiale model nie ogranicza się do reagowania na kontakt. Przewiduje również, co robot powinien odczuwać w danym momencie, a następnie wykorzystuje prognozę do prowadzenia i oceny wykonywanej czynności. Według badaczy poprawiło to wyniki, ale materiał źródłowy nie podaje wartości liczbowych dla tego porównania.
Inną metodę skalowania danych opracowali badacze z University of Southern California. Model uczono na ponad 2700 demonstracjach codziennych manipulacji wykonanych ręcznym chwytakiem, który jednocześnie rejestrował obraz i nacisk. System powiązał widok chwytaka stykającego się z przedmiotem z ciśnieniem odczytanym w tej samej chwili. Dzięki temu może wywnioskować podstawowe informacje dotykowe z obrazu nawet dla robota bez odpowiedniego czujnika, a docelowo ma uzupełniać istniejące zbiory wzrokowe o wygenerowane dane dotykowe.
Więcej danych nie rozwiązuje wszystkich problemów
Nie wiadomo jeszcze, jak duży zbiór wystarczy do uzyskania nowych zdolności manualnych. Yuan ocenia, że dotychczasowe dane dotykowe przede wszystkim przyspieszają uczenie zadań, które roboty już potrafią wykonywać, takich jak podnoszenie i odkładanie przedmiotów. Zadania niemożliwe do wykonania bez dotyku mogą wymagać także nowych algorytmów, a nie wyłącznie większej liczby demonstracji.
Long Cheng z Chinese Academy of Sciences zwraca uwagę, że modele mogą ignorować rzadkie i przerywane sygnały dotykowe na rzecz ciągłego strumienia obrazu. Jego rozwiązanie najpierw przewiduje oczekiwany dotyk na podstawie obrazu, a potem porównuje prognozę z rzeczywistym odczytem. Duża różnica oznacza, że czujnik wykrył informację niewidoczną dla kamery, dlatego model wzmacnia taki sygnał i osłabia odczyty zgodne z przewidywaniem.
Metoda, której prezentację zapowiedziano na IROS 2026, osiągnęła średnio 62,8 proc. skuteczności w pięciu zadaniach wymagających intensywnego kontaktu. Ten sam model bez dotyku uzyskał 28,2 proc. Shunlin Lu z Fudan University i NeoteAI szacuje z kolei, że około 100 000 godzin danych z różnorodnych, rzeczywistych środowisk mogłoby otworzyć drogę do nowych możliwości, ale jest to prognoza, a nie potwierdzony próg.
Dla firm w Polsce oznacza to, że przy ocenie robotów do precyzyjnego montażu lub obsługi delikatnych przedmiotów trzeba analizować nie tylko model AI, lecz także typ czujnika i zgodność danych treningowych ze sprzętem. Opisane projekty pozostają pracami badawczymi, a źródło nie podaje cen, terminów komercyjnej dostępności ani kosztów zbierania danych dotykowych.
