Jak działa kamera 3D w robotyce? Technologie stereo, ToF i RGB-D

Kamera 3D pozwala robotowi analizować nie tylko wygląd otoczenia, lecz także odległość i przestrzenne położenie obiektów. Dzięki temu system może określić, jak daleko znajduje się człowiek, przeszkoda, produkt albo element konstrukcji, a następnie wykorzystać tę informację do nawigacji, chwytania, kontroli jakości lub wykonywania autonomicznych zadań.

W robotyce stosuje się kilka rodzajów kamer przestrzennych. Do najważniejszych należą kamery stereo, urządzenia wykorzystujące pomiar czasu przelotu światła ToF oraz kamery RGB-D łączące obraz kolorowy z mapą głębi. Poszczególne technologie różnią się zasadą działania, zakresem pomiarowym, odpornością na warunki oświetleniowe i wymaganiami obliczeniowymi.

Spis treści
Potrzebujesz pomocy w doborze robota lub systemu percepcji 3D?

Porozmawiaj z nami o zastosowaniu, integracji i możliwościach technicznych rozwiązania.

Skontaktuj się z LEDIO Robotics

Czym jest kamera 3D?

Kamera 3D jest czujnikiem umożliwiającym określenie odległości pomiędzy urządzeniem a obserwowanymi elementami otoczenia. Oprócz klasycznego obrazu może dostarczać mapę głębi, w której każdemu pikselowi przypisana jest informacja o odległości.

Dane te mogą zostać przekształcone w przestrzenną chmurę punktów. Robot otrzymuje wtedy współrzędne opisujące położenie powierzchni i obiektów w trzech wymiarach. Pozwala to analizować ich kształt, wielkość, orientację oraz wzajemne rozmieszczenie.

Czym różni się obraz RGB od obrazu głębi?

Klasyczny obraz RGB opisuje kolor i jasność poszczególnych pikseli. Umożliwia rozpoznawanie napisów, barw, tekstur, twarzy i cech wizualnych, ale sam nie dostarcza bezpośredniej informacji o odległości.

Obraz głębi przedstawia natomiast dystans pomiędzy kamerą a obserwowaną powierzchnią. Jaśniejsze i ciemniejsze wartości mogą reprezentować różne odległości, zależnie od sposobu wizualizacji. Połączenie obu rodzajów danych pozwala robotowi określić zarówno co widzi, jak i gdzie znajduje się dany obiekt.

Jak działa kamera stereo?

Kamera stereo wykorzystuje dwa obiektywy obserwujące tę samą scenę z nieco różnych pozycji. Zasada działania przypomina sposób, w jaki człowiek ocenia odległość za pomocą dwojga oczu. Ten sam punkt otoczenia znajduje się w innym miejscu na obrazie z lewej i prawej kamery, a różnica jego położenia umożliwia obliczenie głębi.

Odległość pomiędzy środkami obu kamer jest nazywana bazą stereo. Po prawidłowej kalibracji system zna parametry optyczne obiektywów oraz ich wzajemne położenie. Następnie obrazy są prostowane, czyli przekształcane tak, aby odpowiadające sobie punkty znajdowały się na tych samych poziomych liniach. Ułatwia to ich wyszukiwanie i porównywanie. Oficjalny pakiet ROS 2 stereo_image_proc przetwarza pary obrazów stereo, tworząc między innymi mapę dysparycji oraz chmurę punktów.

Kamera stereo oblicza głębię

Jak kamera stereo oblicza odległość?

  1. Lewa i prawa kamera rejestrują obraz tej samej sceny.
  2. System uwzględnia parametry kalibracyjne obu obiektywów.
  3. Obrazy są prostowane, aby odpowiadające sobie punkty znajdowały się na tych samych liniach.
  4. Algorytm wyszukuje te same fragmenty otoczenia na obu obrazach.
  5. Obliczana jest różnica położenia odpowiadających sobie punktów.
  6. Na podstawie tej różnicy, ogniskowej oraz bazy stereo wyznaczana jest odległość.
  7. Dla kolejnych pikseli powstaje mapa dysparycji, a następnie mapa głębi.
  8. Dane głębi mogą zostać przekształcone w przestrzenną chmurę punktów.

Czym jest dysparycja?

Dysparycja określa różnicę położenia odpowiadającego sobie punktu na obrazie z lewej i prawej kamery. Różnica ta wynika z paralaksy powstającej podczas obserwacji sceny z dwóch różnych punktów widzenia.

Zależność pomiędzy dysparycją i głębią jest odwrotna. Im mniejsza różnica położenia punktu pomiędzy obrazami, tym większa jest wyznaczona odległość. Oznacza to również, że dokładność systemu stereo zwykle pogarsza się wraz ze wzrostem dystansu od kamery.

W ROS 2 komponent DisparityNode może obliczać mapę dysparycji na podstawie dwóch wyprostowanych obrazów, a PointCloudNode przekształcać wynik w chmurę punktów przeznaczoną między innymi do wizualizacji w RViz i dalszego przetwarzania.

Najważniejsze elementy systemu stereo

Element Funkcja Znaczenie dla pomiaru głębi
Lewa kamera Rejestruje pierwszy obraz obserwowanej sceny. Stanowi jeden z dwóch punktów widzenia potrzebnych do obliczenia dysparycji.
Prawa kamera Rejestruje tę samą scenę z nieco przesuniętej pozycji. Umożliwia porównanie położenia odpowiadających sobie punktów.
Baza stereo Określa fizyczną odległość pomiędzy środkami obu kamer. Wpływa na użyteczny zakres pomiarowy i dokładność obliczanej głębi.
Kalibracja Wyznacza parametry optyczne kamer oraz ich wzajemne położenie. Jest niezbędna do prawidłowego przeliczenia pikseli na odległość przestrzenną.
Rektyfikacja Prostuje obrazy i wyrównuje odpowiadające sobie linie. Ogranicza obszar wyszukiwania odpowiadających punktów i upraszcza obliczenia.
Dopasowanie stereo Wyszukuje te same fragmenty sceny na lewym i prawym obrazie. Pozwala obliczyć dysparycję dla poszczególnych punktów lub obszarów.
Mapa dysparycji Przedstawia różnice położenia odpowiadających sobie pikseli. Stanowi podstawę do obliczenia mapy głębi.
Mapa głębi Przypisuje pikselom informację o odległości od kamery. Może być wykorzystywana do wykrywania przeszkód, pomiarów i analizy przestrzeni.
Chmura punktów Przedstawia otoczenie jako zbiór punktów posiadających współrzędne 3D. Umożliwia przestrzenną analizę obiektów i integrację z systemami robotycznymi.

Poprawne działanie kamery stereo wymaga dokładnej kalibracji. Nawet niewielki błąd we wzajemnym położeniu obiektywów może powodować nieprawidłowe dopasowania, przesunięcia mapy głębi oraz błędne współrzędne punktów. Pakiet image_pipeline w ROS 2 zawiera narzędzia do kalibracji kamer, prostowania obrazów oraz generowania map dysparycji i chmur punktów.

Jak działa kamera ToF?

Kamera ToF wykorzystuje aktywne źródło światła, najczęściej pracujące w zakresie podczerwieni, do pomiaru odległości pomiędzy urządzeniem a obserwowanymi powierzchniami. Skrót ToF pochodzi od angielskiego określenia Time of Flight, czyli czasu przelotu.

Kamera emituje światło, które odbija się od obiektów i wraca do matrycy czujnika. Na podstawie czasu powrotu sygnału albo przesunięcia fazowego modulowanego światła system oblicza odległość dla poszczególnych pikseli. W efekcie powstaje mapa głębi przedstawiająca przestrzenne położenie obserwowanych powierzchni.

W odróżnieniu od klasycznej kamery stereo system ToF nie musi wyszukiwać tych samych cech na dwóch obrazach. Pomiar głębi jest wykonywany aktywnie przez nadajnik i odbiornik światła. Kamery ToF mogą dzięki temu generować mapę odległości również dla powierzchni zawierających niewiele tekstury

Jak przebiega pomiar odległości ToF?

  1. Wbudowany nadajnik emituje światło podczerwone w kierunku obserwowanej przestrzeni.
  2. Światło dociera do obiektów znajdujących się przed kamerą.
  3. Część promieniowania odbija się od powierzchni i wraca do czujnika.
  4. Matryca rejestruje sygnał powracający dla poszczególnych pikseli.
  5. System mierzy czas przelotu albo przesunięcie fazowe odbitego światła.
  6. Na podstawie zmierzonej wartości obliczana jest odległość do powierzchni.
  7. Kolejne wyniki tworzą dwuwymiarową mapę głębi.
  8. Mapa głębi może zostać przekształcona w chmurę punktów 3D.
  9. Dane są przekazywane do systemu percepcji, nawigacji lub sterowania robotem.

W uproszczonym modelu odległość wynika z czasu potrzebnego światłu na przebycie drogi od kamery do obiektu i z powrotem. Ponieważ mierzony jest pełny czas podróży w obu kierunkach, wynik dzieli się przez dwa. W rzeczywistych kamerach sposób obliczenia zależy jednak od zastosowanej odmiany technologii ToF i konstrukcji czujnika.

Direct ToF i Indirect ToF – czym się różnią?

Technologie ToF można podzielić na bezpośredni pomiar czasu przelotu, określany jako dToF, oraz pośredni pomiar czasu przelotu, czyli iToF. Oba rozwiązania wykorzystują światło odbite od obiektu, ale w inny sposób wyznaczają odległość.

dToF mierzy bezpośrednie opóźnienie pomiędzy wysłaniem impulsu a wykryciem jego powrotu. iToF wykorzystuje natomiast światło modulowane i oblicza odległość na podstawie przesunięcia fazowego pomiędzy sygnałem emitowanym i odbieranym.

Cecha dToF – bezpośredni ToF iToF – pośredni ToF
Sposób pomiaru Bezpośrednie określanie czasu pomiędzy wysłaniem impulsu światła a jego powrotem. Pomiar przesunięcia fazowego modulowanego światła emitowanego i odbieranego.
Rodzaj emisji Krótkie impulsy świetlne. Światło modulowane w określony sposób i z określoną częstotliwością.
Wyznaczanie odległości Na podstawie bezpośrednio zmierzonego opóźnienia sygnału. Na podstawie różnicy fazy pomiędzy sygnałem nadanym i odebranym.
Typowe zastosowanie Pomiary wymagające większego zasięgu, czujniki odległości oraz niektóre systemy LiDAR. Kamery głębi generujące mapę odległości dla całej matrycy obrazu.
Główna zaleta Bezpośrednie powiązanie zmierzonego opóźnienia z odległością. Możliwość jednoczesnego uzyskania informacji o głębi dla wielu pikseli.
Możliwe ograniczenia Wymaga bardzo dokładnego pomiaru krótkich przedziałów czasu. Może być wrażliwy na niejednoznaczność zakresu, odbicia wielodrogowe i zakłócenia światła.

Najważniejsze elementy kamery ToF

Element Funkcja Znaczenie dla pomiaru
Źródło światła Emituje promieniowanie podczerwone w kierunku obserwowanej sceny. Zapewnia aktywne oświetlenie potrzebne do określenia odległości.
Układ optyczny nadajnika Rozprowadza światło na obszar znajdujący się przed kamerą. Wpływa na pole widzenia, równomierność oświetlenia i użyteczny zasięg.
Obiektyw odbiorczy Kieruje odbite światło na matrycę czujnika. Wpływa na pole widzenia, ostrość i ilość odbieranego sygnału.
Matryca ToF Rejestruje powracające światło dla poszczególnych pikseli. Pozwala utworzyć mapę głębi obejmującą całą obserwowaną scenę.
Układ synchronizacji Koordynuje pracę nadajnika, czujnika i pomiaru czasu lub fazy. Jest niezbędny do prawidłowego obliczenia odległości.
Procesor obrazu Przetwarza surowe pomiary i oblicza mapę głębi. Może wykonywać filtrację szumu, korekcję i usuwanie niewiarygodnych pikseli.
Kamera RGB Rejestruje klasyczny obraz kolorowy, jeżeli urządzenie jest kamerą RGB-D. Umożliwia połączenie odległości z kolorem, teksturą i rozpoznanym obiektem.
Interfejs komunikacyjny Przesyła obraz głębi, obraz RGB i inne dane do komputera robota. Musi zapewnić odpowiednią przepustowość i zgodność z oprogramowaniem.

Kamera ToF może obliczać odległość dla każdego piksela matrycy, dzięki czemu jednym pomiarem uzyskuje obraz całej obserwowanej przestrzeni. Przykładowe przemysłowe kamery ToF oferują różne tryby zasięgu, rozdzielczości i częstotliwości pracy, dlatego parametry należy dobierać do wielkości obiektu, prędkości robota oraz wymaganej dokładności.

W ROS 2 obraz głębi może zostać przetworzony na chmurę punktów, zarejestrowany względem obrazu kolorowego albo wykorzystany przez kolejne komponenty systemu percepcji. Służy do tego między innymi pakiet depth_image_proc.

Jak działa kamera światła strukturalnego?

Kamera światła strukturalnego wykorzystuje projektor, który wyświetla na obserwowanej powierzchni znany wzór, na przykład układ punktów, linii, pasów albo siatkę. Wzór może być emitowany światłem widzialnym lub podczerwonym, dzięki czemu w wielu urządzeniach pozostaje niewidoczny dla człowieka.

Kamera rejestruje sposób, w jaki wyświetlony wzór zmienia się po zetknięciu z powierzchnią obiektu. Linie i punkty ulegają przesunięciu albo deformacji zależnie od kształtu oraz odległości obserwowanej powierzchni. Znając parametry projektora, kamery i ich wzajemne położenie, system może obliczyć głębię metodą triangulacji.

W niektórych urządzeniach projektor współpracuje z dwiema kamerami stereo. Wyświetlany wzór tworzy wtedy dodatkową teksturę na jednolitych powierzchniach, na których klasyczny system stereo miałby trudność z odnalezieniem odpowiadających sobie punktów. Takie rozwiązanie jest określane między innymi jako stereo z projektowaną teksturą.

Jak przebiega pomiar światłem strukturalnym?

  1. Projektor emituje na obserwowaną powierzchnię znany wzór światła.
  2. Wzór układa się na obiektach znajdujących się w polu widzenia urządzenia.
  3. Kształt powierzchni powoduje przesunięcie i deformację wyświetlanych punktów lub linii.
  4. Jedna albo kilka kamer rejestruje zmieniony wzór.
  5. Algorytm identyfikuje poszczególne elementy wzoru na zarejestrowanym obrazie.
  6. System porównuje ich położenie z wzorcem wynikającym z kalibracji urządzenia.
  7. Na podstawie geometrii projektora i kamery obliczana jest odległość do powierzchni.
  8. Dla kolejnych pikseli tworzona jest mapa głębi.
  9. Mapa głębi może zostać przekształcona w przestrzenną chmurę punktów.

Systemy światła strukturalnego mogą korzystać z pojedynczego wzoru albo sekwencji kolejnych wzorów. Sekwencje pasów lub kodowanych układów pozwalają dokładniej ustalić, który fragment projekcji został zarejestrowany przez dany piksel kamery.

Najważniejsze elementy kamery światła strukturalnego

Element Funkcja Znaczenie dla pomiaru 3D
Projektor wzoru Wyświetla na scenie punkty, linie, pasy lub inny zakodowany układ. Tworzy znaną strukturę, której deformacja pozwala obliczyć głębię.
Źródło światła Generuje światło widzialne albo podczerwone wykorzystywane przez projektor. Wpływa na zasięg, jakość projekcji i możliwość pracy w określonych warunkach oświetleniowych.
Kamera odbiorcza Rejestruje wzór widoczny na powierzchniach otoczenia. Dostarcza obraz potrzebny do analizy przesunięcia i deformacji wzoru.
Druga kamera W niektórych konstrukcjach rejestruje scenę z dodatkowego punktu widzenia. Może umożliwiać aktywne dopasowanie stereo i zwiększać kompletność danych.
Baza pomiarowa Określa odległość pomiędzy projektorem i kamerą albo pomiędzy kamerami. Stanowi jeden z parametrów wykorzystywanych podczas triangulacji.
Kalibracja Opisuje parametry optyczne oraz wzajemne położenie projektora i kamer. Jest niezbędna do poprawnego przeliczenia obserwowanego wzoru na współrzędne 3D.
Algorytm dekodowania Rozpoznaje elementy wyświetlanego wzoru na obrazie kamery. Pozwala przyporządkować piksele obrazu do odpowiednich promieni projektora.
Procesor głębi Wykonuje triangulację, filtrację i ocenę wiarygodności danych. Generuje mapę głębi oraz usuwa część błędnych albo niepewnych pomiarów.
Interfejs komunikacyjny Przesyła obraz, mapę głębi i chmurę punktów do komputera robota. Wpływa na częstotliwość danych i możliwość ich przetwarzania w czasie rzeczywistym.

Zalety światła strukturalnego

  • Możliwość uzyskania gęstej mapy głębi dla obserwowanego obszaru.
  • Dobre odwzorowanie kształtu obiektów znajdujących się w niewielkiej lub średniej odległości.
  • Możliwość pomiaru jednolitych powierzchni pozbawionych naturalnej tekstury.
  • Tworzenie szczegółowych chmur punktów i modeli powierzchni.
  • Przydatność w chwytaniu, kontroli jakości i pomiarach wymiarowych.
  • Możliwość połączenia danych głębi z obrazem kolorowym.

Ograniczenia światła strukturalnego

  • Silne światło otoczenia może osłabiać widoczność projektowanego wzoru.
  • Powierzchnie błyszczące, przezroczyste lub bardzo ciemne mogą powodować brakujące albo błędne dane.
  • Zakres pomiarowy jest zwykle bardziej ograniczony niż w dalekosiężnych systemach LiDAR.
  • Ruch obiektu lub kamery może zakłócić pomiar wymagający rejestracji kilku kolejnych wzorów.
  • Kilka urządzeń projektujących wzory na ten sam obszar może powodować wzajemne zakłócenia.
  • Dokładność zależy od stabilnej kalibracji projektora i kamer.

Światło strukturalne bardzo dobrze sprawdza się podczas analizy obiektów znajdujących się w kontrolowanej przestrzeni, na przykład na stanowisku robotycznym. W pracy na zewnątrz albo przy intensywnym oświetleniu projekcja może być trudniejsza do odczytania. Na jakość danych wpływają również refleksyjność powierzchni, zasłonięcia i ruch analizowanego obiektu.

W ROS 2 mapa głębi uzyskana z takiego urządzenia może być prostowana, rejestrowana względem obrazu kolorowego oraz przekształcana w chmurę punktów przy użyciu komponentów pakietu depth_image_proc.

Czym jest kamera RGB-D?

Kamera RGB-D dostarcza jednocześnie klasyczny obraz kolorowy RGB oraz informację o głębi oznaczaną literą D od angielskiego słowa depth. Dzięki temu robot może analizować wygląd obiektu i równocześnie określać jego odległość, położenie oraz wymiary przestrzenne.

Określenie RGB-D nie opisuje jednej konkretnej metody pomiarowej. Głębia może być wyznaczana między innymi przez system stereo, technologię ToF albo światło strukturalne. Najważniejsze jest to, że urządzenie udostępnia obraz kolorowy i odpowiadające mu dane odległości.

Po prawidłowym dopasowaniu obu strumieni każdemu punktowi obrazu głębi można przypisać kolor z obrazu RGB. Pozwala to utworzyć kolorową chmurę punktów, w której punkty zawierają zarówno współrzędne przestrzenne X, Y i Z, jak i informację o kolorze. Pakiet ROS 2 depth_image_proc zawiera komponenty umożliwiające rejestrowanie obrazu głębi względem innej kamery oraz tworzenie chmur punktów typu XYZRGB.

Jakie dane może udostępniać kamera RGB-D?

Rodzaj danych Co przedstawia? Przykładowe wykorzystanie
Obraz RGB Kolor, jasność, teksturę, napisy i cechy wizualne obserwowanej sceny. Rozpoznawanie obiektów, osób, etykiet, kolorów i oznaczeń.
Obraz głębi Odległość pomiędzy kamerą a powierzchnią przypisaną do poszczególnych pikseli. Pomiar odległości, wykrywanie przeszkód i analiza położenia obiektów.
Obraz głębi dopasowany do RGB Dane głębi przeliczone do układu optycznego kamery kolorowej. Określanie odległości do obiektu rozpoznanego na obrazie RGB.
Obraz RGB dopasowany do głębi Kolor przeliczony do układu współrzędnych czujnika głębi. Nadawanie kolorów punktom utworzonym na podstawie obrazu głębi.
Chmura punktów XYZ Przestrzenne współrzędne punktów opisujących powierzchnie otoczenia. Analiza geometrii, pomiar wymiarów i wykrywanie wolnej przestrzeni.
Chmura punktów XYZRGB Współrzędne przestrzenne połączone z informacją o kolorze. Segmentacja obiektów, wizualizacja 3D i rozpoznawanie elementów sceny.
Informacja o kalibracji Parametry optyczne kamer, zniekształcenia obiektywów i wzajemne położenie czujników. Przeliczanie punktów pomiędzy obrazem RGB, mapą głębi i układem robota.
Znaczniki czasu Moment zarejestrowania poszczególnych obrazów i pomiarów. Synchronizacja danych RGB, głębi, IMU oraz ruchu robota.

ROS 2 umożliwia generowanie chmury punktów XYZRGB na podstawie obrazu głębi i obrazu kolorowego, pod warunkiem odpowiedniego dopasowania danych oraz dostępności informacji kalibracyjnych kamer.

Jak łączone są obraz RGB i mapa głębi?

Kamera kolorowa i czujnik głębi mogą znajdować się w różnych miejscach obudowy oraz posiadać inne pole widzenia, rozdzielczość i parametry optyczne. Oznacza to, że piksel obrazu głębi nie musi automatycznie odpowiadać pikselowi o tych samych współrzędnych na obrazie RGB.

Aby połączyć oba strumienie, system wykorzystuje kalibrację wewnętrzną i zewnętrzną. Kalibracja wewnętrzna opisuje właściwości poszczególnych kamer, natomiast kalibracja zewnętrzna określa ich wzajemne położenie i orientację. Następnie punkty głębi są przeliczane do układu optycznego kamery kolorowej albo odwrotnie.

Proces ten określa się jako rejestrację lub wyrównanie danych. W dokumentacji ROS 2 funkcje pakietu depth_image_proc obejmują reprojekcję obrazu głębi do układu innej kamery oraz tworzenie kolorowych chmur punktów.

Jak przebiega tworzenie kolorowej chmury punktów?

  1. Kamera kolorowa rejestruje obraz RGB obserwowanej sceny.
  2. Czujnik głębi wykonuje pomiar odległości do widocznych powierzchni.
  3. System odczytuje parametry kalibracyjne obu modułów.
  4. Piksele obrazu głębi są przeliczane na współrzędne przestrzenne X, Y i Z.
  5. Punkty przestrzenne są transformowane do układu optycznego kamery RGB.
  6. Każdemu poprawnie dopasowanemu punktowi przypisywany jest kolor odpowiedniego piksela.
  7. Punkty niewiarygodne, zasłonięte lub znajdujące się poza wspólnym polem widzenia są odrzucane.
  8. Powstaje kolorowa chmura punktów opisująca geometrię i wygląd otoczenia.
  9. Dane są przekazywane do algorytmów rozpoznawania, nawigacji lub manipulacji.

Nie wszystkie punkty mapy głębi muszą otrzymać prawidłowy kolor. Kamery obserwują scenę z nieco różnych pozycji, dlatego część powierzchni może być widoczna dla jednego modułu i zasłonięta dla drugiego. Błędy mogą pojawić się również na krawędziach obiektów, podczas ruchu oraz wtedy, gdy obrazy RGB i głębi nie zostały wykonane w tym samym momencie.

Co daje robotowi połączenie koloru i głębi?

  • Rozpoznanie rodzaju obiektu i jednoczesne określenie jego odległości.
  • Wyznaczenie przestrzennego położenia przedmiotu względem robota.
  • Analizę kształtu, koloru, wymiarów i orientacji obiektu.
  • Wykrywanie ludzi oraz określanie ich pozycji w przestrzeni.
  • Planowanie chwytu przez ramię robotyczne.
  • Rozróżnianie obiektów znajdujących się blisko siebie na obrazie.
  • Tworzenie kolorowych modeli 3D otoczenia.
  • Wspieranie systemów Visual SLAM i autonomicznej nawigacji.
  • Kontrolę jakości i pomiary przestrzenne produktów.
  • Łączenie obrazu z algorytmami sztucznej inteligencji.

Kamera RGB-D może na przykład rozpoznać karton na obrazie kolorowym, obliczyć jego odległość i orientację, a następnie przekazać współrzędne do ramienia robotycznego. W systemie mobilnym te same dane mogą służyć do wykrywania przeszkód, rozpoznawania ludzi oraz budowania lokalnego modelu przestrzeni.

Kamery wykorzystujące stereo mogą generować głębię wyrównaną względem obrazu RGB i kolorowe chmury punktów, jednak poprawność takiego połączenia zależy od konfiguracji sprzętu i kalibracji.

Porównanie kamer stereo, ToF, światła strukturalnego i RGB-D

Kamery stereo, ToF i światła strukturalnego wykorzystują odmienne metody określania głębi. System stereo oblicza odległość przez porównanie obrazu z dwóch punktów widzenia, ToF analizuje czas przelotu albo przesunięcie fazowe emitowanego światła, natomiast światło strukturalne mierzy deformację wzoru wyświetlanego na powierzchni.

Określenie RGB-D nie oznacza osobnej zasady pomiarowej. Opisuje urządzenie udostępniające jednocześnie obraz kolorowy RGB i dane głębi. Kamera RGB-D może więc wykorzystywać technologię stereo, ToF albo światła strukturalnego.

Kamery stereo wykorzystują triangulację na podstawie dwóch obrazów, systemy ToF aktywnie mierzą powrót emitowanego światła, a projektowana tekstura może uzupełniać brak naturalnych szczegółów powierzchni. ROS 2 pozwala następnie przetwarzać obraz głębi i obraz kolorowy na chmury punktów XYZ lub XYZRGB.

Najważniejsze różnice pomiędzy technologiami

Cecha Kamera stereo Kamera ToF Światło strukturalne Kamera RGB-D
Zasada działania Porównuje obrazy z dwóch kamer i oblicza głębię metodą triangulacji. Mierzy czas przelotu albo przesunięcie fazowe emitowanego i odbitego światła. Analizuje przesunięcie lub deformację wzoru wyświetlanego na powierzchni. Łączy obraz kolorowy z danymi głębi uzyskanymi jedną z dostępnych technologii pomiarowych.
Rodzaj systemu Może działać pasywnie albo korzystać z dodatkowego projektora tekstury. System aktywny wykorzystujący własne źródło światła. System aktywny z projektorem punktów, linii lub innych wzorów. Określenie rodzaju udostępnianych danych, a nie jednej konkretnej metody pomiaru.
Wymagania dotyczące tekstury Klasyczne stereo działa najlepiej na powierzchniach zawierających wyraźne szczegóły. Nie wymaga naturalnej tekstury do wykonania podstawowego pomiaru głębi. Projektor sam tworzy teksturę potrzebną do analizy powierzchni. Zależą od technologii zastosowanej w module głębi.
Wpływ oświetlenia Jakość może pogarszać się przy słabym świetle, odblaskach lub małym kontraście. Silne światło otoczenia może ograniczać użyteczny zasięg i jakość pomiaru. Intensywne światło może utrudniać kamerze odczytanie projektowanego wzoru. Zależy od sposobu uzyskiwania głębi oraz parametrów kamery RGB.
Pomiar ruchomych obiektów Możliwy, jeżeli obrazy są zsynchronizowane, a ekspozycja ogranicza rozmycie ruchu. Dobrze nadaje się do dynamicznych scen, jeżeli częstotliwość i czas ekspozycji są odpowiednie. Ruch może utrudniać pomiar, szczególnie gdy urządzenie rejestruje sekwencję kilku wzorów. Zależy od synchronizacji obrazu kolorowego i głębi oraz zastosowanej technologii.
Typowy zakres pracy Zależny od bazy stereo, ogniskowej, rozdzielczości i algorytmu dopasowania. Zależny od mocy emitera, częstotliwości modulacji, refleksyjności powierzchni i matrycy. Najczęściej wykorzystywane na krótkich i średnich dystansach w kontrolowanym otoczeniu. Zależy od konstrukcji modułu głębi zastosowanego w urządzeniu.
Dokładność w pobliżu kamery Może być wysoka, ale ogranicza ją minimalna dysparycja i geometria zestawu. Może zapewniać gęsty pomiar całej sceny, także na jednolitych powierzchniach. Często zapewnia szczegółowe odwzorowanie niewielkich obiektów i powierzchni. Wynika z parametrów zastosowanego czujnika głębi i jego kalibracji względem RGB.
Powierzchnie problematyczne Jednolite, powtarzalne, błyszczące, przezroczyste i słabo oświetlone. Błyszczące, przezroczyste, bardzo ciemne oraz powodujące odbicia wielodrogowe. Błyszczące, przezroczyste, bardzo ciemne i intensywnie oświetlone. Może dziedziczyć ograniczenia zarówno kamery RGB, jak i modułu głębi.
Wymagania obliczeniowe Dopasowywanie obrazów stereo może wymagać znacznej mocy obliczeniowej. Część obliczeń głębi może być wykonywana bezpośrednio przez czujnik lub kamerę. Wymaga dekodowania wzoru, triangulacji i filtracji danych. Dodatkowych obliczeń wymaga wyrównanie RGB i głębi oraz tworzenie kolorowej chmury punktów.
Najważniejsza zaleta Możliwość uzyskania głębi bez aktywnego oświetlenia sceny. Bezpośrednia mapa głębi dla całego pola widzenia bez wyszukiwania cech stereo. Szczegółowe dane również dla powierzchni pozbawionych naturalnej tekstury. Jednoczesna informacja o wyglądzie, rodzaju i przestrzennym położeniu obiektu.
Typowe zastosowania Nawigacja, Visual SLAM, drony, roboty mobilne i analiza otoczenia. Logistyka, wykrywanie ludzi, pomiar objętości, robotyka i automatyzacja. Bin picking, kontrola jakości, skanowanie, pomiary i planowanie chwytu. Rozpoznawanie obiektów, manipulacja, nawigacja, interakcja z człowiekiem i modele 3D.

Nie można wskazać jednej technologii najlepszej do wszystkich zastosowań. Kamera stereo może być dobrym rozwiązaniem dla robota pracującego na większym obszarze i korzystającego z Visual SLAM. ToF może zapewnić szybki i gęsty obraz głębi w dynamicznym środowisku, natomiast światło strukturalne dobrze sprawdza się podczas dokładnej analizy przedmiotów na stanowisku robotycznym.

Kamera RGB-D jest szczególnie użyteczna wtedy, gdy robot musi jednocześnie rozpoznawać obiekty i określać ich przestrzenne położenie. Ostateczne właściwości urządzenia zależą jednak od technologii zastosowanej w jego module głębi.

Parametry systemu stereo zależą między innymi od bazy, pola widzenia i rozdzielczości, natomiast kamery ToF wykonują aktywny pomiar głębi dla matrycy czujnika. Projektowana tekstura może poprawiać dane stereo na powierzchniach pozbawionych wyraźnych szczegółów.

Jak dobrać technologię do zadania robota?

  • Do Visual SLAM i obserwacji większej przestrzeni warto rozważyć kamerę stereo.
  • Do szybkiego pomiaru głębi całej sceny można zastosować kamerę ToF.
  • Do precyzyjnej analizy detali i chwytania obiektów przydatne jest światło strukturalne lub aktywne stereo.
  • Do rozpoznawania obiektów wraz z określaniem ich położenia najlepiej sprawdzi się urządzenie RGB-D.
  • Do pracy na zewnątrz należy sprawdzić odporność kamery na światło słoneczne i warunki atmosferyczne.
  • Do dynamicznych scen trzeba zweryfikować częstotliwość obrazu, czas ekspozycji i synchronizację czujników.
  • Do pomiarów przemysłowych należy ocenić dokładność, powtarzalność i możliwość kalibracji.
  • Do integracji z robotem trzeba sprawdzić sterowniki ROS 2, SDK, interfejs komunikacyjny i dostępne formaty danych.

Przed wyborem kamery warto przetestować ją na rzeczywistych obiektach i w docelowych warunkach oświetleniowych. Dane katalogowe nie zawsze pokazują zachowanie urządzenia na czarnych, błyszczących, przezroczystych albo poruszających się powierzchniach.

Jakie czynniki wpływają na dokładność kamery 3D?

Dokładność kamery 3D zależy nie tylko od technologii wykorzystanej do pomiaru głębi. Na jakość danych wpływają również odległość od obiektu, rozdzielczość czujnika, pole widzenia, kalibracja, warunki oświetleniowe, właściwości powierzchni oraz ruch kamery i obserwowanej sceny.

Inaczej zachowuje się kamera stereo, która musi odnaleźć odpowiadające sobie fragmenty dwóch obrazów, a inaczej kamera ToF wykorzystująca własne źródło światła podczerwonego. Dlatego przed wyborem urządzenia należy analizować nie tylko deklarowaną dokładność, ale również warunki, w których została ona zmierzona.

W systemach stereo na dokładność wpływają między innymi rozdzielczość, pole widzenia, odległość pomiędzy kamerami i jakość kalibracji. W kamerach ToF istotne są natomiast światło otoczenia, refleksyjność powierzchni, temperatura, odbicia wielodrogowe i możliwość interferencji z innymi czujnikami.

Najważniejsze źródła błędów pomiaru głębi

Czynnik Wpływ na dane 3D Szczególnie dotyczy
Odległość od obiektu Wraz ze wzrostem odległości może zmniejszać się dokładność, gęstość punktów oraz zdolność wykrywania niewielkich elementów. Kamery stereo, ToF i światła strukturalnego.
Kalibracja Błędne parametry optyczne lub niewłaściwe wzajemne położenie modułów powodują przesunięcia głębi i nieprawidłowe współrzędne przestrzenne. Wszystkie kamery 3D, szczególnie systemy stereo i RGB-D.
Baza stereo Większa odległość pomiędzy kamerami może poprawić pomiar dalszych obiektów, ale jednocześnie zwiększyć minimalny użyteczny dystans. Kamery stereo i aktywne stereo.
Rozdzielczość obrazu Wyższa rozdzielczość pozwala dokładniej określać położenie odpowiadających sobie punktów, ale zwiększa ilość danych i wymagania obliczeniowe. Kamery stereo i RGB-D.
Pole widzenia Bardzo szerokie pole widzenia obejmuje większą przestrzeń, ale może ograniczać liczbę pikseli przypadających na niewielki obiekt. Wszystkie technologie kamer 3D.
Brak tekstury Jednolite ściany, podłogi i powierzchnie bez charakterystycznych szczegółów utrudniają dopasowanie punktów pomiędzy obrazami. Pasywne kamery stereo i Visual SLAM.
Słabe oświetlenie Może powodować zaszumienie obrazu, wydłużenie ekspozycji i trudności z odnalezieniem cech wizualnych. Pasywne stereo i kamera RGB.
Silne światło otoczenia Światło słoneczne lub inne źródła podczerwieni mogą osłabiać widoczność projektowanego wzoru albo zwiększać szum pomiaru. ToF, światło strukturalne i aktywne stereo.
Powierzchnie błyszczące Mogą kierować światło poza odbiornik albo tworzyć odbicia niezwiązane z rzeczywistym położeniem powierzchni. ToF, światło strukturalne, stereo i RGB-D.
Powierzchnie przezroczyste Światło może przechodzić przez obiekt, odbijać się od powierzchni znajdującej się za nim albo tworzyć nieprawidłowe punkty. Wszystkie optyczne technologie pomiaru głębi.
Ciemne materiały Słabe odbicie światła zmniejsza poziom sygnału i może powodować brakujące lub niestabilne piksele głębi. ToF i światło strukturalne.
Ruch obiektu Zmiana położenia podczas ekspozycji lub pomiędzy kolejnymi obrazami może powodować rozmycie i błędne dopasowanie danych. Stereo, RGB-D i systemy wykorzystujące sekwencje wzorów.
Brak synchronizacji Obraz RGB i mapa głębi mogą przedstawiać scenę w różnych momentach, przez co kolor zostaje przypisany do niewłaściwego punktu. Kamery RGB-D i systemy wielosensorowe.
Odbicia wielodrogowe Światło odbija się od kilku powierzchni przed powrotem do czujnika, co może prowadzić do wyznaczenia nieprawidłowej odległości. Kamery ToF.
Interferencja czujników Światło emitowane przez inne urządzenie może zostać zarejestrowane jako część własnego pomiaru kamery. ToF, aktywne stereo i światło strukturalne.
Temperatura i drgania Zmiany mechaniczne i termiczne mogą wpływać na wzajemne ustawienie kamer oraz stabilność kalibracji. Szczególnie systemy stereo i precyzyjne stanowiska pomiarowe.

W przypadku pasywnego stereo problemy często pojawiają się na gładkich, jednolitych powierzchniach, ponieważ algorytm nie znajduje wystarczającej liczby charakterystycznych punktów. Projektor podczerwieni może stworzyć dodatkową teksturę, ale jego skuteczność może zmniejszać się w silnym świetle słonecznym.

W kamerach ToF silne światło otoczenia może zmniejszać stosunek sygnału do szumu, natomiast błyszczące i przezroczyste powierzchnie mogą powodować odbicia wielodrogowe albo brak wiarygodnego pomiaru. Podobne problemy mogą występować, gdy kilka aktywnych czujników pracuje jednocześnie w tym samym obszarze.

Jak poprawić jakość danych z kamery 3D?

  1. Dobrać kamerę do wymaganej odległości roboczej i wielkości obserwowanych obiektów.
  2. Zamontować urządzenie na stabilnej konstrukcji ograniczającej drgania i zmianę wzajemnego położenia modułów.
  3. Sprawdzić lub wykonać kalibrację kamer po zmianie mocowania, obiektywów albo konfiguracji stanowiska.
  4. Dostosować ekspozycję, czułość i częstotliwość obrazu do prędkości robota i warunków oświetleniowych.
  5. Zapewnić odpowiednią teksturę lub dodatkowe oświetlenie podczas korzystania z pasywnego systemu stereo.
  6. Ograniczyć bezpośrednie działanie silnego światła na aktywne czujniki podczerwieni.
  7. Testować kamerę na czarnych, błyszczących i przezroczystych materiałach występujących w docelowym środowisku.
  8. Synchronizować obraz RGB, mapę głębi, IMU i dane o ruchu robota.
  9. Stosować maski wiarygodności oraz usuwać piksele znajdujące się poza użytecznym zakresem pomiarowym.
  10. Wykorzystywać filtry przestrzenne i czasowe do ograniczania szumu bez nadmiernej utraty szczegółów.
  11. Unikać jednoczesnego kierowania kilku aktywnych projektorów na ten sam obszar albo zastosować mechanizmy ograniczające interferencję.
  12. Wykonać testy w rzeczywistych warunkach przed wdrożeniem kamery w systemie autonomicznym.

W systemach stereo większa rozdzielczość i szersza baza mogą poprawić dokładność, ale wpływają również na minimalny dystans, pole widzenia i ilość przetwarzanych danych. Z kolei stabilność kalibracji może pogorszyć się po uderzeniu, zmianie mocowania lub odkształceniu termicznym urządzenia.

Parametry katalogowe należy traktować jako wartości osiągane w określonych warunkach testowych. Rzeczywista dokładność może zmieniać się zależnie od oświetlenia, odległości i właściwości obserwowanych obiektów.

Kamera 3D a LiDAR – które rozwiązanie wybrać?

Kamera 3D i LiDAR umożliwiają robotowi analizowanie geometrii otoczenia, ale dostarczają danych w inny sposób. Kamera głębi tworzy obraz, w którym odległość jest przypisana do poszczególnych pikseli. Może również udostępniać obraz RGB, dzięki czemu robot otrzymuje informacje o kolorze, teksturze i wyglądzie obiektu.

LiDAR wykonuje pomiary odległości za pomocą światła laserowego i generuje skan albo przestrzenną chmurę punktów. Dane mogą zawierać również dodatkowe informacje, takie jak intensywność sygnału lub refleksyjność powierzchni. Czujniki tego rodzaju są często wykorzystywane do mapowania, lokalizacji, wykrywania przeszkód oraz autonomicznej nawigacji.

Nie należy zakładać, że jedna technologia jest zawsze lepsza. Kamera 3D może zapewnić szczegółowe dane o niewielkich obiektach znajdujących się blisko robota, natomiast LiDAR często lepiej sprawdza się podczas obserwacji większej przestrzeni i tworzenia stabilnego modelu geometrycznego otoczenia. Ostateczny wybór zależy od zasięgu, pola widzenia, warunków pracy i zadania robota.

ROS 2 umożliwia przekształcanie obrazów głębi w chmury punktów, a także konwersję chmur PointCloud2 do skanów LaserScan wykorzystywanych przez algorytmy lokalizacji i nawigacji. Dane LiDAR mogą natomiast zawierać między innymi zasięg, siłę sygnału oraz refleksyjność

Porównanie kamery 3D i LiDAR-u

Cecha Kamera 3D LiDAR
Podstawowy rodzaj danych Obraz głębi, obraz RGB, mapa dysparycji lub kolorowa chmura punktów. Skan odległości albo chmura punktów zawierająca dane geometryczne.
Sposób pomiaru Wykorzystuje stereo, ToF, światło strukturalne albo inną metodę obrazowania głębi. Mierzy odległość za pomocą emitowanej i odbieranej wiązki laserowej.
Kolor i tekstura Kamera RGB-D może dostarczać kolor, teksturę, napisy i cechy wizualne. Standardowy LiDAR koncentruje się przede wszystkim na odległości i geometrii, choć niektóre urządzenia udostępniają dodatkowe kanały pomiarowe.
Gęstość danych Może tworzyć gęsty obraz głębi obejmujący dużą liczbę pikseli w ograniczonym polu widzenia. Gęstość chmury zależy od liczby kanałów, rozdzielczości kątowej i częstotliwości skanowania.
Typowy obszar obserwacji Dobrze sprawdza się podczas analizy obiektów znajdujących się przed robotem lub ramieniem. Może obserwować szeroki obszar wokół robota, zależnie od konstrukcji i pola widzenia czujnika.
Praca w ciemności Aktywne kamery ToF i światła strukturalnego mogą działać bez światła widzialnego. Pasywne stereo wymaga odpowiedniej widoczności sceny. Pomiar odległości nie wymaga oświetlenia światłem widzialnym.
Silne światło słoneczne Może pogarszać działanie aktywnych projektorów podczerwieni i zwiększać szum obrazu. Odporność zależy od konstrukcji czujnika, długości fali, filtracji i warunków pracy.
Rozpoznawanie obiektów Bardzo przydatna, ponieważ może łączyć obraz RGB z przestrzennym położeniem przedmiotu. Umożliwia klasyfikację na podstawie kształtu i geometrii, ale zwykle nie dostarcza pełnej informacji wizualnej.
Mapowanie i lokalizacja Może wspierać Visual SLAM, Visual-Inertial SLAM oraz lokalną percepcję przestrzeni. Jest często wykorzystywany w LiDAR SLAM, lokalizacji i tworzeniu map 2D lub 3D.
Manipulacja robotyczna Dobrze nadaje się do lokalizacji produktów, planowania chwytu i kontroli ułożenia obiektów. Może wspierać pomiar większej przestrzeni, ale nie zawsze zapewnia wystarczającą gęstość punktów dla małych elementów.
Powierzchnie problematyczne Problemy mogą powodować szkło, lustra, ciemne materiały, brak tekstury i silne oświetlenie. Problemy mogą powodować szkło, powierzchnie lustrzane, słaba refleksyjność oraz niekorzystny kąt odbicia.
Wymagania obliczeniowe Przetwarzanie obrazu, dopasowanie stereo i analiza RGB mogą wymagać znacznej mocy obliczeniowej. Chmury punktów 3D również wymagają filtracji, transformacji i przetwarzania przestrzennego.
Typowe zastosowania Chwytanie, rozpoznawanie obiektów, kontrola jakości, analiza ludzi i Visual SLAM. Nawigacja, mapowanie, lokalizacja, inspekcja, omijanie przeszkód i pomiary przestrzenne.

Rzeczywiste właściwości obu rozwiązań zależą od konkretnej konstrukcji. Przykładowo zakres pracy stereo jest powiązany między innymi z bazą kamer, rozdzielczością i polem widzenia, a aktywne systemy głębi mogą tracić jakość w intensywnym świetle. Pomiary ToF są również zależne od refleksyjności, światła otoczenia i temperatury.

Kiedy lepiej wybrać kamerę 3D?

  • Gdy robot musi rozpoznawać rodzaj, kolor lub wygląd obiektu.
  • Gdy potrzebne jest dokładne położenie przedmiotu względem chwytaka.
  • Gdy analizowane są niewielkie obiekty znajdujące się blisko kamery.
  • Gdy system ma wykorzystywać sztuczną inteligencję do analizy obrazu.
  • Gdy potrzebna jest kontrola jakości, pomiar kształtu albo ocena ułożenia produktu.
  • Gdy robot rozpoznaje ludzi, gesty, etykiety lub oznaczenia.
  • Gdy wymagane są kolorowe modele 3D albo chmury punktów XYZRGB.
  • Gdy platforma korzysta z Visual SLAM lub Visual-Inertial SLAM.

Kiedy lepiej wybrać LiDAR?

  • Gdy najważniejsza jest dokładna geometria większego obszaru.
  • Gdy robot musi tworzyć mapę budynku, hali albo terenu.
  • Gdy wymagane jest szerokie pole obserwacji wokół platformy.
  • Gdy system ma działać niezależnie od oświetlenia światłem widzialnym.
  • Gdy robot wykorzystuje LiDAR SLAM i lokalizację względem mapy.
  • Gdy potrzebne jest wczesne wykrywanie przeszkód na trasie przejazdu.
  • Gdy urządzenie wykonuje inspekcję albo przestrzenne pomiary infrastruktury.
  • Gdy ważna jest powtarzalna informacja o odległości i położeniu powierzchni.

Dlaczego roboty często wykorzystują oba czujniki?

Kamera 3D i LiDAR mogą wzajemnie uzupełniać swoje możliwości. LiDAR dostarcza stabilnych informacji o geometrii i odległości, natomiast kamera pozwala analizować kolor, teksturę i znaczenie obserwowanych obiektów.

Przykładowo LiDAR może wykryć przeszkodę i określić jej położenie, a kamera rozpoznać, czy jest to człowiek, paleta, pojazd albo element wyposażenia. System nawigacyjny może wtedy uwzględnić zarówno geometrię przestrzeni, jak i kategorię obiektu.

Połączenie danych wymaga jednak poprawnej kalibracji wzajemnego położenia czujników, synchronizacji czasu oraz przeliczenia pomiarów do wspólnego układu współrzędnych. Dopiero wtedy punkty LiDAR-u i dane obrazu mogą zostać prawidłowo połączone.

W ROS 2 obrazy głębi mogą być przekształcane w chmury punktów, a chmury 3D rzutowane do postaci skanu wykorzystywanego przez algorytmy dwuwymiarowe. Ułatwia to integrację różnych źródeł danych w jednej architekturze robota.

Zastosowania kamer 3D w różnych typach robotów

Kamera 3D może pełnić różne funkcje zależnie od konstrukcji robota i realizowanego zadania. W robotach mobilnych wspiera wykrywanie przeszkód oraz analizę przestrzeni przed platformą. W robotach wyposażonych w manipulatory pozwala określać położenie, wymiary i orientację przedmiotów, natomiast w systemach inspekcyjnych może służyć do tworzenia modeli przestrzennych oraz wykrywania zmian w geometrii obiektów.

Szczególnie dużą wartość daje połączenie danych głębi z algorytmami rozpoznawania obrazu. System może wtedy nie tylko wykryć przedmiot, ale także określić jego rzeczywiste położenie w przestrzeni. Takie rozwiązania są wykorzystywane między innymi w nawigacji, kontroli jakości, robotycznym chwytaniu, inspekcji i tworzeniu cyfrowych modeli otoczenia.

Przykładowe zastosowania według rodzaju robota

Rodzaj robota Rola kamery 3D Przykładowe zadania
Roboty mobilne AMR Analizowanie wolnej przestrzeni, wykrywanie przeszkód oraz określanie ich odległości i wysokości. Autonomiczny transport, omijanie ludzi, przejazd przez drzwi i poruszanie się pomiędzy wyposażeniem.
Roboty magazynowe Rozpoznawanie palet, kartonów, pojemników, regałów i wolnych miejsc odkładczych. Kompletacja, inwentaryzacja, depaletyzacja, ocena zajętości regału i pomiar wymiarów przesyłek.
Ramiona robotyczne Wyznaczanie przestrzennego położenia, orientacji i kształtu przedmiotu względem chwytaka. Pick-and-place, sortowanie, pakowanie, montaż, obsługa maszyn i pobieranie elementów z pojemnika.
Roboty humanoidalne Analiza otoczenia znajdującego się przed robotem oraz określanie położenia ludzi i przedmiotów. Chodzenie w budynkach, sięganie po obiekty, współpraca z człowiekiem i wykonywanie zadań manipulacyjnych.
Roboty czworonożne Ocena kształtu terenu, wysokości przeszkód, schodów, krawędzi i wolnej przestrzeni. Inspekcja zakładów, poruszanie się w nierównym terenie i obserwacja trudno dostępnych obszarów.
Roboty usługowe Wykrywanie ludzi, mebli, drzwi i obiektów znajdujących się na trasie. Dostawy w hotelach, szpitalach i biurach, obsługa gości oraz bezpieczne poruszanie się w przestrzeni publicznej.
Roboty współpracujące Określanie położenia części, dłoni operatora i elementów stanowiska roboczego. Podawanie komponentów, kontrola ułożenia produktów i wspomaganie elastycznych procesów montażowych.
Drony Pomiar odległości do przeszkód oraz przestrzenna analiza otoczenia przed i pod urządzeniem. Lot wewnątrz budynków, omijanie przeszkód, Visual SLAM, inspekcja i tworzenie modeli 3D.
Roboty inspekcyjne Rejestrowanie geometrii powierzchni i porównywanie danych z kolejnych przejazdów. Kontrola instalacji, pomiar deformacji, dokumentacja techniczna i wykrywanie zmian w obiekcie.
Roboty sprzątające Wykrywanie przeszkód znajdujących się na różnych wysokościach oraz analiza krawędzi i stopni. Omijanie mebli, przewodów, ludzi i niewielkich obiektów pozostawionych na podłodze.
Roboty edukacyjne i badawcze Dostarczanie obrazu RGB, mapy głębi i chmury punktów do nauki programowania systemów percepcji. Rozpoznawanie obiektów, Visual SLAM, sztuczna inteligencja, nawigacja i projektowanie algorytmów chwytania.
Systemy kontroli jakości Pomiar kształtu, wysokości, objętości i położenia produktu. Kontrola kompletności, wykrywanie deformacji, pomiar wymiarów i porównywanie detalu z modelem referencyjnym.

W robotyce manipulacyjnej kamera 3D może dostarczać dane potrzebne do wyznaczenia chwytu i położenia przedmiotu. Przemysłowe systemy stereo są oferowane między innymi do zastosowań typu pick-and-place, natomiast przestrzenna percepcja może łączyć detekcję obiektu z jego rzeczywistą pozycją, rozmiarem i orientacją.

Kamera 3D nie musi realizować wszystkich zadań jednocześnie. W robocie mobilnym może być skierowana przed platformę i odpowiadać głównie za lokalne wykrywanie przeszkód. Druga kamera zamontowana przy chwytaku może natomiast służyć do dokładnej lokalizacji przedmiotów oraz kontroli przebiegu manipulacji.

Jak kamera 3D wspiera wykonanie autonomicznego zadania?

  1. Kamera rejestruje obraz RGB, obraz głębi albo oba strumienie jednocześnie.
  2. System usuwa niewiarygodne piksele i ogranicza dane do użytecznego zakresu pomiarowego.
  3. Mapa głębi zostaje przekształcona w chmurę punktów lub inną reprezentację przestrzeni.
  4. Algorytm wykrywa ludzi, przeszkody, produkty albo elementy stanowiska.
  5. Dla wykrytych obiektów określane są odległość, położenie i orientacja.
  6. Dane są przeliczane z układu kamery do układu współrzędnych robota.
  7. System planowania analizuje, czy robot może bezpiecznie dojechać, podejść albo sięgnąć do obiektu.
  8. Robot wykonuje przejazd, ruch ramienia albo inne zaplanowane działanie.
  9. Kamera obserwuje przebieg zadania i pozwala skorygować ruch po zmianie położenia obiektu.
  10. Po wykonaniu operacji system może sprawdzić jej rezultat i przejść do kolejnego zadania.

Dane z obrazu głębi mogą zostać przekształcone w chmurę punktów zawierającą współrzędne przestrzenne, a po połączeniu z obrazem kolorowym również informacje RGB. Tak przygotowane dane mogą być dalej wykorzystywane przez system rozpoznawania obiektów, nawigacji albo planowania chwytu.

Kamera na robocie czy nad stanowiskiem?

Kamera 3D może być zamontowana bezpośrednio na robocie, przy chwytaku albo nieruchomo nad stanowiskiem pracy. Każdy sposób montażu daje inne możliwości i wymaga innej kalibracji.

Kamera zamontowana na chwytaku porusza się razem z ramieniem i może obserwować przedmiot z bliskiej odległości. Rozwiązanie to określa się często jako eye-in-hand. Kamera nieruchoma, obserwująca całe stanowisko, jest natomiast nazywana układem eye-to-hand. Zapewnia szerszy widok obszaru roboczego, ale część obiektów może zostać zasłonięta przez ramię, chwytak lub inne wyposażenie.

Sposób montażu Najważniejsze zalety Typowe ograniczenia
Na chwytaku – eye-in-hand Kamera może zbliżyć się do obiektu, obserwować go z różnych stron i precyzyjnie kontrolować końcową fazę ruchu. Mniejsze pole obserwacji całego stanowiska, ruchomy przewód, drgania i konieczność kalibracji kamery względem chwytaka.
Nad stanowiskiem – eye-to-hand Stały widok całego obszaru roboczego oraz możliwość obserwowania wielu przedmiotów jednocześnie. Ryzyko zasłonięcia obiektu przez robota, większa odległość pomiarowa i konieczność kalibracji względem podstawy robota.
Na korpusie robota mobilnego Stała obserwacja przestrzeni przed platformą i możliwość wykorzystania danych podczas przejazdu. Martwe strefy blisko robota, drgania podczas jazdy i ograniczone pole widzenia po bokach oraz z tyłu.
Kilka kamer w różnych miejscach Większe pokrycie przestrzeni, ograniczenie zasłonięć i możliwość obserwacji obiektu z wielu kierunków. Większa złożoność synchronizacji, kalibracji, transmisji i łączenia danych.

Wybór sposobu montażu powinien wynikać z wielkości przestrzeni roboczej, dokładności wymaganej przy chwytaniu oraz częstotliwości zmian na stanowisku. Przemysłowe rozwiązania wizyjne wymagają sprawdzenia dokładności całego układu robot–kamera oraz ponownej kalibracji po zmianie położenia urządzenia.

Jak kamera 3D wspiera chwytanie i manipulację robotyczną?

Kamera 3D umożliwia robotowi określenie przestrzennego położenia, orientacji i wymiarów przedmiotu. Dane te są potrzebne, aby manipulator mógł zaplanować podejście chwytaka, bezpiecznie ominąć przeszkody, uchwycić obiekt i przenieść go do wyznaczonego miejsca.

Samo rozpoznanie przedmiotu na obrazie RGB nie wystarcza do wykonania chwytu. Robot musi również wiedzieć, jak daleko znajduje się obiekt, pod jakim kątem jest ułożony oraz czy wokół niego pozostaje wystarczająco dużo wolnej przestrzeni. Informacje te mogą pochodzić z mapy głębi albo chmury punktów utworzonej przez kamerę 3D.

W środowisku ROS 2 dane głębi mogą być przekształcane w chmury punktów, natomiast MoveIt 2 udostępnia narzędzia do planowania ruchu, obsługi sceny kolizyjnej i realizacji zadań typu pick-and-place

Jak przebiega chwytanie obiektu?

  1. Kamera RGB lub RGB-D rejestruje przedmioty znajdujące się w przestrzeni roboczej.
  2. Algorytm rozpoznaje obiekt przeznaczony do podniesienia.
  3. Mapa głębi albo chmura punktów określa jego przestrzenne położenie.
  4. System analizuje kształt, rozmiar i orientację przedmiotu.
  5. Generowane są możliwe pozycje i kierunki podejścia chwytaka.
  6. Odrzucane są chwyty nieosiągalne, niestabilne albo powodujące kolizję.
  7. Planista ruchu wyznacza trajektorię ramienia prowadzącą do pozycji przed chwytem.
  8. Chwytak zbliża się do obiektu i wykonuje zaplanowane zamknięcie.
  9. Robot podnosi przedmiot i sprawdza, czy chwyt został wykonany poprawnie.
  10. Manipulator przenosi obiekt do miejsca docelowego i kontrolowanie go odkłada.

Jeden przedmiot może posiadać wiele możliwych pozycji chwytu. System powinien ocenić między innymi osiągalność pozycji przez manipulator, kierunek podejścia, możliwość zamknięcia chwytaka oraz ryzyko kolizji z otoczeniem. Narzędzia MoveIt mogą filtrować propozycje chwytów na podstawie osiągalności i planować fazy podejścia, podniesienia oraz odsunięcia przedmiotu.

Jakie informacje z kamery 3D są potrzebne do chwytania?

Informacja Znaczenie dla systemu Wpływ na chwyt
Pozycja obiektu Określa współrzędne przedmiotu w przestrzeni roboczej. Pozwala skierować chwytak do właściwego miejsca.
Orientacja obiektu Opisuje obrót przedmiotu względem układu współrzędnych robota. Umożliwia odpowiednie ustawienie nadgarstka i chwytaka.
Kształt Przedstawia geometrię powierzchni i kontur przedmiotu. Pomaga wybrać stabilne miejsce kontaktu chwytaka.
Wymiary Określają szerokość, wysokość i głębokość obiektu. Pozwalają sprawdzić, czy przedmiot mieści się w zakresie chwytaka.
Widoczne powierzchnie Pokazują fragmenty przedmiotu dostępne z aktualnego punktu obserwacji. Umożliwiają generowanie kierunków podejścia niewymagających kontaktu z przeszkodami.
Położenie przeszkód Opisuje ściany pojemnika, blat, sąsiednie produkty i elementy maszyny. Pozwala zaplanować trajektorię bez kolizji.
Wolna przestrzeń Wskazuje obszary, przez które może przejść ramię i chwytak. Pomaga ocenić, czy możliwe jest podejście z wybranego kierunku.
Klasa obiektu Określa rodzaj rozpoznanego produktu lub komponentu. Pozwala dobrać właściwy chwytak, siłę chwytu i miejsce odkładania.
Pewność pomiaru Informuje, które piksele głębi lub punkty są wiarygodne. Ogranicza wykonywanie chwytów na podstawie zaszumionych albo niepełnych danych.

Pozycja obiektu wykryta w układzie optycznym kamery musi zostać przeliczona do układu podstawy robota albo manipulatora. W ROS 2 biblioteka tf2 przechowuje relacje pomiędzy układami współrzędnych i umożliwia transformowanie danych czujników pomiędzy nimi w określonym czasie.

Co może utrudniać poprawne chwytanie?To jest tytuł

  • Częściowe zasłonięcie obiektu przez inne przedmioty.
  • Brak danych głębi na powierzchniach błyszczących, czarnych lub przezroczystych.
  • Nieprawidłowa kalibracja kamery względem robota albo chwytaka.
  • Przesunięcie przedmiotu pomiędzy wykonaniem pomiaru a rozpoczęciem ruchu.
  • Zbyt mała liczba punktów opisujących niewielki element.
  • Błędne rozdzielenie stykających się przedmiotów w pojemniku.
  • Kolizja chwytaka ze ścianą pojemnika lub sąsiednim produktem.
  • Nieprawidłowo dobrana szerokość, siła albo rodzaj chwytaka.
  • Brak synchronizacji pomiędzy kamerą, ruchem robota i systemem sterowania.
  • Zmiana położenia kamery bez ponownego wykonania kalibracji.

W zadaniach takich jak pobieranie losowo ułożonych części z pojemnika pojedynczy obraz może nie przedstawiać całej geometrii przedmiotów. System może wtedy zmienić punkt obserwacji, wykonać kolejny pomiar albo wybrać obiekt, którego powierzchnia i otoczenie są najlepiej widoczne.

Planowanie powinno uwzględniać nie tylko sam chwyt, lecz także bezpieczne podejście, podniesienie przedmiotu i odsunięcie go od pozostałych elementów. MoveIt Task Constructor dzieli zadanie pick-and-place na kolejne etapy i umożliwia analizowanie alternatywnych rozwiązań ruchu.

Jak kamera 3D współpracuje z ROS 2?

Kamera 3D może być połączona z ROS 2 za pomocą sterownika udostępnionego przez producenta urządzenia albo pakietu rozwijanego przez społeczność. Sterownik odczytuje dane z kamery i publikuje je w postaci standardowych wiadomości ROS 2, dzięki czemu mogą być wykorzystywane przez kolejne moduły systemu robotycznego.

Kamera RGB-D może publikować osobno obraz kolorowy, obraz głębi, informacje kalibracyjne i chmurę punktów. System może następnie prostować obrazy, przeliczać głębię do układu kamery kolorowej, filtrować dane oraz transformować punkty do układu współrzędnych robota.

Pakiet sensor_msgs definiuje między innymi wiadomości Image, CameraInfo, PointCloud2 i Imu. Pakiet depth_image_proc służy natomiast do przetwarzania obrazów głębi, tworzenia chmur punktów i rejestrowania danych głębi względem innej kamery.

Najważniejsze dane publikowane przez kamerę 3D

Rodzaj danych Typ wiadomości lub mechanizm Zastosowanie w robocie
Obraz RGB sensor_msgs/msg/Image Rozpoznawanie obiektów, ludzi, napisów, kolorów, etykiet i cech wizualnych.
Obraz głębi sensor_msgs/msg/Image Pomiar odległości, wykrywanie przeszkód i tworzenie przestrzennej reprezentacji sceny.
Informacje o kamerze sensor_msgs/msg/CameraInfo Przechowywanie parametrów kalibracyjnych, modelu projekcji, zniekształceń i rozdzielczości obrazu.
Chmura punktów sensor_msgs/msg/PointCloud2 Analiza geometrii, segmentacja obiektów, mapowanie, nawigacja oraz planowanie chwytu.
Mapa dysparycji Dane generowane przez system stereo Obliczanie głębi na podstawie różnicy położenia punktów na obrazach lewej i prawej kamery.
Dane z IMU sensor_msgs/msg/Imu Śledzenie ruchu kamery, stabilizacja estymacji pozycji oraz Visual-Inertial SLAM.
Transformacje przestrzenne tf2 Przeliczanie danych z układu optycznego kamery do układu podstawy, ramienia lub mapy robota.
Znaczniki czasu Nagłówek wiadomości ROS 2 Synchronizacja obrazu RGB, głębi, IMU, odometrii oraz ruchu manipulatora.
Obraz skompresowany image_transport Ograniczenie ilości danych przesyłanych przez sieć lub pomiędzy komputerami robota.

Obraz RGB i obraz głębi są zwykle publikowane jako osobne strumienie. Każdemu z nich powinny towarzyszyć odpowiednie informacje CameraInfo. Zgodność znaczników czasu i układów współrzędnych jest szczególnie ważna, gdy dane mają zostać połączone w kolorową chmurę punktów albo wykorzystane do sterowania ruchomym robotem.

Wiadomość PointCloud2 może przechowywać wielowymiarowe punkty wraz z dodatkowymi informacjami, takimi jak kolor, intensywność lub inne pola zdefiniowane przez producenta i oprogramowanie przetwarzające.

Jak przebiega przetwarzanie danych z kamery?

  1. Sterownik kamery odczytuje obrazy RGB, dane głębi i informacje kalibracyjne.
  2. Dane są publikowane na odpowiednich tematach ROS 2.
  3. Obrazy mogą zostać wyprostowane w celu usunięcia zniekształceń optycznych.
  4. Obraz głębi jest filtrowany i ograniczany do użytecznego zakresu pomiarowego.
  5. Dane głębi mogą zostać przeliczone do układu optycznego kamery RGB.
  6. Na podstawie głębi oraz parametrów kamery tworzona jest chmura punktów.
  7. Punktom mogą zostać przypisane kolory pochodzące z obrazu RGB.
  8. Biblioteka tf2 przelicza dane do układu współrzędnych robota.
  9. Algorytmy percepcji wykrywają ludzi, przeszkody, produkty lub elementy stanowiska.
  10. Wynik jest przekazywany do systemu nawigacji, SLAM, planowania ruchu albo sterowania manipulatorem.

Przed utworzeniem chmury punktów obraz głębi powinien być prawidłowo wyprostowany i powiązany z informacjami kalibracyjnymi. Dokumentacja depth_image_proc wskazuje, że pakiet obsługuje między innymi konwersję jednostek, rejestrację obrazu głębi i tworzenie chmur punktów XYZ oraz XYZRGB.

Najważniejsze pakiety i narzędzia ROS 2

Pakiet lub narzędzie Główna funkcja Przykładowe zastosowanie
Sterownik producenta Komunikacja z kamerą i publikowanie danych w ROS 2. Udostępnianie obrazu RGB, głębi, IMU, chmury punktów i parametrów urządzenia.
image_transport Publikowanie i odbieranie obrazów przy użyciu różnych metod transportu. Przesyłanie danych surowych lub skompresowanych pomiędzy komputerami i węzłami.
image_proc Podstawowe przetwarzanie obrazu i prostowanie danych z kamery. Usuwanie zniekształceń obiektywu i przygotowanie obrazu do analizy.
stereo_image_proc Przetwarzanie pary obrazów stereo. Tworzenie mapy dysparycji, głębi i chmury punktów z dwóch kamer.
depth_image_proc Przetwarzanie obrazów głębi. Rejestracja głębi, konwersja jednostek i generowanie chmur punktów.
tf2 Zarządzanie układami współrzędnych i transformacjami w czasie. Przeliczanie pozycji obiektu z układu kamery do układu robota lub mapy.
RViz Wizualizacja danych robotycznych. Podgląd obrazu, chmury punktów, modelu robota i transformacji.
rosbag2 Rejestrowanie i późniejsze odtwarzanie tematów ROS 2. Zapisywanie obrazu, głębi, IMU i chmur punktów do testów oraz diagnostyki.

Stos image_pipeline obejmuje narzędzia do prostowania obrazów, przetwarzania danych stereo i generowania chmur punktów. image_transport powinien być stosowany podczas publikowania i odbierania obrazów, ponieważ umożliwia dobór odpowiedniej metody transportu bez zmiany podstawowej architektury aplikacji.

Podczas diagnostyki warto sprawdzić nie tylko obecność tematów, ale także częstotliwość publikacji, kodowanie obrazu, informacje CameraInfo, znaczniki czasu i kompletność transformacji. Obraz może być widoczny, a mimo to chmura punktów nie powstanie, jeżeli brakuje kalibracji albo zgodności pomiędzy strumieniami.

Jak kamera 3D wspiera SLAM i autonomiczną nawigację?

Kamera 3D może dostarczać robotowi danych potrzebnych do lokalizacji, tworzenia mapy, wykrywania przeszkód i aktualizowania informacji o wolnej przestrzeni. W zależności od zastosowanej technologii system wykorzystuje obrazy stereo, mapę głębi, kolorową chmurę punktów albo dane połączone z czujnikiem IMU.

W systemach Visual SLAM kolejne obrazy są analizowane w celu odnalezienia charakterystycznych punktów otoczenia i oszacowania ruchu kamery. Kamera głębi dostarcza dodatkowo informację o odległości, co ułatwia tworzenie przestrzennej mapy oraz określanie położenia przeszkód.

Przykładem rozwiązania wykorzystującego dane RGB-D jest RTAB-Map, opisywany w dokumentacji ROS 2 jako system SLAM działający w czasie rzeczywistym. Kamera głębi może również dostarczać dane do map kosztu systemu Nav2, który wykorzystuje je podczas omijania przeszkód i planowania ruchu.

Jak dane z kamery trafiają do systemu nawigacji?

  1. Kamera rejestruje obraz RGB, obraz głębi, obrazy stereo albo chmurę punktów.
  2. Sterownik publikuje dane na odpowiednich tematach ROS 2.
  3. Obrazy są prostowane, synchronizowane i łączone z informacjami kalibracyjnymi.
  4. Algorytm odrzuca niewiarygodne piksele oraz punkty znajdujące się poza użytecznym zakresem.
  5. Dane głębi są przekształcane w chmurę punktów albo skan wykorzystywany przez system nawigacji.
  6. Transformacje tf2 przeliczają pomiary z układu kamery do układu podstawy robota.
  7. System SLAM lub lokalizacji określa zmianę położenia robota względem mapy.
  8. Dane przestrzenne aktualizują lokalną mapę przeszkód i wolnej przestrzeni.
  9. Planista oraz sterownik ruchu analizują trasę i najbliższe otoczenie robota.
  10. Robot zwalnia, zatrzymuje się albo zmienia kierunek po wykryciu przeszkody.

Obraz głębi może zostać przekształcony w wiadomość LaserScan przy użyciu pakietu depthimage_to_laserscan. Tak przygotowane dane mogą być wykorzystane przez komponenty przeznaczone do lokalizacji i nawigacji laserowej. Alternatywnie kamera może publikować chmurę PointCloud2, która zostanie przetworzona przez przestrzenną warstwę mapy kosztu.

Rola kamery 3D w poszczególnych elementach autonomii

Element systemu Rola kamery 3D Przykładowy rezultat
Visual SLAM Śledzenie cech obrazu i szacowanie ruchu kamery pomiędzy kolejnymi klatkami. Pozycja robota oraz mapa charakterystycznych elementów otoczenia.
RGB-D SLAM Łączenie obrazu kolorowego z bezpośrednią informacją o głębi. Kolorowa mapa 3D oraz lokalizacja robota względem otoczenia.
Visual-Inertial SLAM Połączenie obrazu z pomiarami przyspieszeń i prędkości kątowych z IMU. Stabilniejsza estymacja ruchu podczas szybkich zmian położenia.
Wykrywanie przeszkód Określanie odległości i wysokości obiektów znajdujących się przed robotem. Aktualna informacja o przeszkodach na lokalnej mapie kosztu.
Wykrywanie wolnej przestrzeni Analiza obszaru pomiędzy kamerą a zarejestrowanymi powierzchniami. Oznaczenie miejsc, przez które robot może potencjalnie przejechać.
Analiza podłoża Pomiar wysokości, nachylenia, krawędzi, stopni i nierówności. Wykrywanie schodów, uskoków i powierzchni niedostępnych dla robota.
Rozpoznawanie semantyczne Łączenie klasy obiektu rozpoznanego na obrazie RGB z jego położeniem 3D. Rozróżnienie człowieka, palety, drzwi, pojazdu albo innej przeszkody.
Lokalna mapa kosztu Dostarczanie bieżących punktów reprezentujących przeszkody w pobliżu platformy. Zmiana prędkości, zatrzymanie albo lokalna korekta toru jazdy.
Planowanie przejazdu Aktualizowanie informacji o dostępnej i zajętej przestrzeni. Wyznaczenie nowej trasy po pojawieniu się przeszkody.

Nav2 może wykorzystywać dane LaserScan i PointCloud2 w warstwach mapy kosztu. Warstwa przeszkód przetwarza dane w reprezentacji dwuwymiarowej, natomiast warstwa wokselowa wykorzystuje informacje przestrzenne pochodzące między innymi z kamer głębi i innych czujników 3D.

Kamera 3D w mapie kosztu robota

Mapa kosztu jest reprezentacją przestrzeni używaną przez system nawigacyjny do oceny, przez które obszary robot może przejechać. Przeszkodom przypisywany jest wysoki koszt albo status obszaru niedostępnego, natomiast miejsca znajdujące się blisko przeszkód mogą otrzymać koszt podwyższony.

Dane z kamery 3D mogą być dodawane do lokalnej mapy kosztu jako chmura punktów. System wykorzystuje położenie punktów do zaznaczania przeszkód, a informacje o przestrzeni pomiędzy kamerą i wykrytą powierzchnią mogą służyć do usuwania nieaktualnych przeszkód z mapy.

Warstwa wokselowa Nav2 wykorzystuje przestrzenne śledzenie promieni i może przetwarzać dane z kamer głębi oraz innych czujników 3D. Wynik jest następnie przedstawiany w formie przydatnej do dwuwymiarowego planowania przejazdu.

Czy kamera 3D może zastąpić LiDAR w nawigacji?

W niektórych robotach kamera 3D może być głównym czujnikiem wykorzystywanym do lokalizacji i wykrywania przeszkód. Obraz głębi można przekształcić w skan laserowy, a chmurę punktów przekazać bezpośrednio do warstwy przestrzennej mapy kosztu. Nav2 może więc współpracować z systemami nawigacyjnymi opartymi na danych wizyjnych i głębi.

Nie oznacza to jednak, że kamera zawsze zastąpi LiDAR bez pogorszenia działania. Jej użyteczny zasięg, pole widzenia oraz odporność na światło, brak tekstury i właściwości powierzchni mogą być inne. Kamera umieszczona z przodu robota może również nie obserwować przestrzeni po bokach i z tyłu platformy.

W wielu konstrukcjach stosuje się oba rozwiązania. LiDAR odpowiada wtedy za mapowanie i lokalizację w większym obszarze, a kamera 3D uzupełnia system o dokładną analizę przestrzeni przed robotem, rozpoznawanie obiektów i wykrywanie przeszkód znajdujących się na różnych wysokościa

Jak dobrać kamerę 3D do robota?

Dobór kamery 3D powinien rozpocząć się od określenia zadania, które ma wykonywać robot. Inne wymagania będzie miała kamera przeznaczona do wykrywania przeszkód przed platformą mobilną, a inne urządzenie wykorzystywane do chwytania niewielkich elementów, kontroli jakości albo tworzenia mapy przestrzennej.

Najważniejsze jest dopasowanie użytecznego zakresu pomiarowego, pola widzenia, dokładności i częstotliwości danych do wielkości obiektów oraz prędkości robota. Kamera powinna dostarczać wiarygodną głębię dokładnie w tej przestrzeni, w której realizowane będzie zadanie. Bardzo duży zasięg nie będzie przydatny, jeżeli urządzenie nie potrafi poprawnie mierzyć przedmiotów znajdujących się blisko chwytaka.

W systemach stereo dokładność zależy między innymi od kalibracji, rozdzielczości, pola widzenia oraz odległości pomiędzy kamerami. Szersza baza stereo może poprawiać dokładność pomiaru dalszych obiektów, ale jednocześnie zwiększać minimalny dystans roboczy. W kamerach ToF znaczenie mają również światło otoczenia, temperatura i właściwości odbijające powierzchni.

Najważniejsze parametry przy wyborze kamery 3D

Parametr Co oznacza? Dlaczego jest ważny?
Technologia pomiaru Stereo, aktywne stereo, ToF, światło strukturalne albo inne rozwiązanie do obrazowania głębi. Wpływa na zasięg, dokładność, odporność na oświetlenie oraz rodzaj powierzchni, które mogą być prawidłowo mierzone.
Minimalny dystans Najmniejsza odległość, od której kamera może generować wiarygodne dane głębi. Ma kluczowe znaczenie przy chwytaniu przedmiotów i montażu kamery blisko przestrzeni roboczej.
Maksymalny dystans Największa odległość, dla której producent deklaruje użyteczny pomiar. Powinien odpowiadać zasięgowi potrzebnemu do nawigacji, inspekcji lub obserwacji stanowiska.
Dokładność głębi Określa, jak bardzo zmierzona odległość może różnić się od wartości rzeczywistej. Decyduje o przydatności kamery do pomiarów, chwytania i precyzyjnego pozycjonowania.
Powtarzalność Opisuje zgodność kolejnych pomiarów tego samego nieruchomego obiektu. Jest szczególnie ważna w kontroli jakości i powtarzalnych procesach przemysłowych.
Rozdzielczość głębi Liczba pikseli, dla których kamera może dostarczać informację o odległości. Wpływa na zdolność wykrywania niewielkich elementów i odwzorowania krawędzi obiektów.
Pole widzenia Zakres przestrzeni obserwowany przez kamerę w poziomie i pionie. Szerokie pole widzenia obejmuje większy obszar, ale może zmniejszać liczbę pikseli przypadających na niewielki przedmiot.
Częstotliwość obrazu Liczba map głębi lub obrazów rejestrowanych w ciągu sekundy. Wyższa częstotliwość jest potrzebna przy szybko poruszającym się robocie albo dynamicznych obiektach.
Rodzaj migawki Global shutter rejestruje całą klatkę jednocześnie, a rolling shutter odczytuje ją kolejno. Przy szybkim ruchu rodzaj migawki może wpływać na deformację obrazu i stabilność analizy przestrzennej.
Aktywne doświetlenie Projektor podczerwieni, emiter ToF albo inne własne źródło światła. Może poprawiać pomiar powierzchni bez tekstury, ale jednocześnie zwiększać podatność na światło słoneczne i interferencję.
Kamera RGB Moduł rejestrujący klasyczny obraz kolorowy. Jest potrzebny, gdy robot ma rozpoznawać kolory, etykiety, ludzi, napisy lub klasy obiektów.
Wbudowany IMU Czujnik przyspieszeń i prędkości kątowych zintegrowany z kamerą. Może wspierać Visual-Inertial SLAM i śledzenie dynamicznego ruchu urządzenia.
Synchronizacja Możliwość czasowego zsynchronizowania RGB, głębi, IMU oraz innych kamer. Zapobiega łączeniu danych zarejestrowanych w różnych momentach.
Interfejs komunikacyjny USB, Ethernet, GigE, PoE lub inny sposób przesyłania danych. Wpływa na długość przewodów, przepustowość, zasilanie oraz możliwość pracy w przemysłowej sieci robota.
Przepływ danych Ilość informacji przesyłanych przez kamerę w ciągu sekundy. Musi być obsługiwana przez interfejs, sieć, pamięć i komputer pokładowy.
Przetwarzanie pokładowe Możliwość wykonywania obliczeń głębi lub sztucznej inteligencji bezpośrednio w urządzeniu. Może zmniejszyć obciążenie głównego komputera i ilość przesyłanych danych.
ROS 2 i SDK Dostępność sterownika, bibliotek, API, dokumentacji oraz przykładów integracji. Decyduje o możliwości pobierania obrazu, głębi, chmury punktów, IMU i parametrów kamery.
Warunki środowiskowe Dopuszczalna temperatura, wilgotność, pył, wibracje i odporność obudowy. Parametry muszą odpowiadać miejscu pracy robota, szczególnie w przemyśle i na zewnątrz.
Masa, wymiary i pobór mocy Fizyczne wymagania urządzenia oraz jego zapotrzebowanie energetyczne. Są istotne w dronach, robotach mobilnych, humanoidalnych i kamerach montowanych na chwytaku.

Nie należy porównywać kamer wyłącznie na podstawie rozdzielczości obrazu. Dwie kamery o podobnej liczbie pikseli mogą znacząco różnić się minimalnym dystansem, dokładnością, polem widzenia i odpornością na warunki oświetleniowe.

W systemie stereo szersze pole widzenia może zmniejszać dokładność głębi, natomiast wyższa rozdzielczość i większa baza mogą ją poprawiać. Zwiększenie bazy wpływa jednak również na minimalną odległość pomiarową. Zależności te należy analizować łącznie, a nie jako osobne parametry.

Jak przeprowadzić dobór krok po kroku?

  1. Określić główne zadanie kamery: nawigacja, SLAM, wykrywanie przeszkód, chwytanie, inspekcja albo kontrola jakości.
  2. Wyznaczyć minimalną i maksymalną odległość pomiędzy kamerą a obserwowanymi obiektami.
  3. Ustalić najmniejszy element, który musi zostać poprawnie wykryty lub zmierzony.
  4. Dobrać pole widzenia do wielkości przestrzeni roboczej i miejsca montażu urządzenia.
  5. Określić wymaganą dokładność i powtarzalność pomiarów.
  6. Uwzględnić prędkość robota, ruch obiektów oraz wymaganą częstotliwość obrazu.
  7. Sprawdzić warunki oświetleniowe, w tym światło słoneczne i źródła podczerwieni.
  8. Przeanalizować właściwości powierzchni: kolor, połysk, przezroczystość i obecność naturalnej tekstury.
  9. Wybrać technologię stereo, ToF albo światła strukturalnego odpowiednią do środowiska.
  10. Sprawdzić możliwość stabilnego montażu oraz kalibracji kamery względem robota.
  11. Zweryfikować interfejs komunikacyjny, przepustowość oraz dostępne zasilanie.
  12. Ocenić obciążenie procesora, pamięci, sieci i akceleratora AI.
  13. Sprawdzić sterownik ROS 2, SDK, dokumentację i dostęp do surowych danych.
  14. Przetestować kamerę na rzeczywistych obiektach w docelowym środowisku.
  15. Ocenić nie tylko jakość obrazu, ale również stabilność całego zadania wykonywanego przez robota.

Kalibracja jest warunkiem prawidłowego powiązania obrazu z trójwymiarową przestrzenią. Stos image_pipeline w ROS 2 zawiera narzędzia do kalibracji, prostowania obrazów, przetwarzania stereo oraz tworzenia chmur punktów z obrazów głębi.

Dlaczego test praktyczny jest konieczny?

Dane katalogowe pozwalają zawęzić wybór, ale nie zastępują próby wykonanej w rzeczywistych warunkach. Kamerę należy przetestować na tych samych materiałach, w podobnym oświetleniu i z odległości odpowiadającej docelowemu stanowisku.

Podczas testu trzeba sprawdzić nie tylko średni błąd odległości. Ważna jest również kompletność mapy głębi, stabilność krawędzi, liczba brakujących pikseli, opóźnienie danych oraz zachowanie kamery po wprawieniu robota lub obiektu w ruch.

Temperatura, światło otoczenia i zmiany mechaniczne mogą wpływać na parametry pomiarowe kamery podczas jej eksploatacji. Dlatego test powinien obejmować również rozgrzanie urządzenia, dłuższą pracę oraz warunki możliwie zbliżone do późniejszego wdrożenia.

Zalety i ograniczenia kamer 3D w robotyce

Kamery 3D dostarczają robotowi informacji o odległości, kształcie i przestrzennym położeniu obiektów. W urządzeniach RGB-D dane geometryczne mogą być dodatkowo połączone z kolorem, teksturą i wynikami algorytmów rozpoznawania obrazu. Dzięki temu jeden system wizyjny może wspierać nawigację, manipulację, kontrolę jakości oraz interakcję z człowiekiem.

Rzeczywiste możliwości kamery zależą jednak od zastosowanej technologii, zakresu roboczego, oświetlenia i właściwości obserwowanych powierzchni. Kamera stereo, ToF i światła strukturalnego mogą reagować inaczej na te same warunki, dlatego ich zalety oraz ograniczenia należy oceniać w kontekście konkretnego zadania.

Najważniejsze zalety kamer 3D

  • Dostarczanie informacji o odległości dla wielu punktów obserwowanej sceny.
  • Tworzenie map głębi i przestrzennych chmur punktów.
  • Określanie położenia, orientacji, kształtu i wymiarów przedmiotów.
  • Możliwość połączenia geometrii z kolorem, teksturą i klasą rozpoznanego obiektu.
  • Wykrywanie przeszkód znajdujących się na różnych wysokościach.
  • Wspieranie chwytania, sortowania, pakowania i pobierania części z pojemników.
  • Możliwość działania w czasie rzeczywistym podczas ruchu robota.
  • Przydatność w Visual SLAM, mapowaniu i lokalnej analizie przestrzeni.
  • Bezkontaktowy pomiar obiektów i powierzchni.
  • Możliwość kontroli wymiarów, kompletności i ułożenia produktów.
  • Kompaktowa konstrukcja ułatwiająca montaż na robocie, chwytaku albo stanowisku.
  • Integracja z ROS 2, systemami sztucznej inteligencji i bibliotekami przetwarzania chmur punktów.

Istotną zaletą obrazu głębi jest jego uporządkowana struktura. Informacja o odległości jest przypisana do pikseli obrazu, dzięki czemu można ją stosunkowo łatwo połączyć z obrazem RGB oraz wynikami detekcji obiektów.

W ROS 2 dane głębi mogą być rejestrowane względem obrazu kolorowego i przekształcane w chmury punktów XYZ albo XYZRGB. Ułatwia to wykorzystanie jednego źródła danych przez systemy rozpoznawania, nawigacji i manipulacji.

Najważniejsze ograniczenia kamer 3D

  • Ograniczony zakres pomiarowy zależny od konstrukcji i technologii urządzenia.
  • Spadek dokładności i gęstości danych wraz ze wzrostem odległości.
  • Problemy z powierzchniami przezroczystymi, lustrzanymi, błyszczącymi lub bardzo ciemnymi.
  • Brakujące dane na krawędziach obiektów i w miejscach częściowo zasłoniętych.
  • Podatność aktywnych systemów podczerwieni na silne światło słoneczne.
  • Trudności pasywnego stereo na powierzchniach pozbawionych naturalnej tekstury.
  • Możliwość wzajemnego zakłócania się kilku aktywnych kamer.
  • Błędy powodowane ruchem, rozmyciem obrazu albo brakiem synchronizacji strumieni.
  • Konieczność utrzymywania prawidłowej kalibracji kamer i ich mocowania.
  • Martwe strefy wynikające z pola widzenia i miejsca montażu urządzenia.
  • Znaczna ilość danych obciążająca procesor, pamięć i interfejs komunikacyjny.
  • Konieczność filtrowania punktów niewiarygodnych przed wykorzystaniem ich do sterowania robotem.

Ograniczenia nie występują z jednakową intensywnością we wszystkich urządzeniach. W systemach stereo dokładność zależy między innymi od rozdzielczości, pola widzenia, bazy kamer, kalibracji i jakości tekstury obserwowanej sceny. Szersze pole widzenia może obejmować większy obszar, ale jednocześnie zmniejszać dokładność przestrzenną

W kamerach ToF na wynik mogą wpływać dodatkowe źródła światła, refleksyjność materiału oraz temperatura urządzenia. Silne światło otoczenia zwiększa szum mapy głębi, natomiast zmiany temperatury mogą powodować dryft pomiaru.

Czy kamera 3D zawsze zapewnia kompletny obraz otoczenia?

Kamera 3D rejestruje wyłącznie powierzchnie widoczne z aktualnego punktu obserwacji. Nie mierzy fragmentów zasłoniętych przez inne obiekty ani obszarów znajdujących się poza jej polem widzenia. Pojedyncza kamera zamontowana z przodu robota nie zapewnia więc pełnej obserwacji przestrzeni po bokach i z tyłu platformy.

Problem zasłonięć jest szczególnie istotny podczas pobierania losowo ułożonych części z pojemnika. Górne przedmioty mogą częściowo zakrywać elementy znajdujące się niżej, dlatego system nie zawsze dysponuje pełnym modelem ich kształtu. Robot może wówczas wykonać dodatkowy pomiar, zmienić pozycję kamery albo wybrać najlepiej widoczny przedmiot.

W bardziej rozbudowanych konstrukcjach stosuje się kilka kamer rozmieszczonych w różnych miejscach lub łączy kamerę 3D z LiDAR-em, czujnikami odległości i enkoderami robota. Zwiększa to pokrycie przestrzeni i odporność systemu, ale wymaga dokładnej synchronizacji, kalibracji oraz przeliczenia danych do wspólnego układu współrzędnych.

Kiedy zastosowanie kamery 3D jest najbardziej uzasadnione?

Warunek lub potrzeba Dlaczego kamera 3D jest przydatna?
Robot musi chwytać przedmioty Dane głębi pozwalają określić pozycję, orientację i dostępne kierunki podejścia chwytaka.
Obiekty zmieniają położenie System może aktualizować ich współrzędne bez stosowania sztywnych punktów bazowych.
Potrzebna jest analiza kształtu Chmura punktów przedstawia geometrię powierzchni, a nie wyłącznie jej wygląd na płaskim obrazie.
Robot rozpoznaje ludzi lub produkty Obraz RGB pozwala rozpoznać obiekt, a głębia określić jego rzeczywistą pozycję.
Występują przeszkody na różnych wysokościach Kamera może wykrywać elementy niewidoczne dla pojedynczego dwuwymiarowego skanera.
Stanowisko produkcyjne często się zmienia System wizyjny może dostosować ruch robota do aktualnego rozmieszczenia elementów.
Wymagana jest kontrola kompletności Dane RGB i 3D mogą służyć do sprawdzania obecności, liczby i ułożenia komponentów.
Tworzony jest model przestrzenny Kolejne pomiary mogą zostać połączone w mapę lub model 3D otoczenia.

Zastosowanie kamery 3D jest szczególnie uzasadnione wtedy, gdy robot musi podejmować decyzje na podstawie rzeczywistego położenia obiektów, a nie tylko wcześniej zapisanych współrzędnych. Kamera nie usuwa jednak potrzeby właściwego zaprojektowania stanowiska, oświetlenia, chwytaka i procesu sterowania.

Najlepsze rezultaty daje rozwiązanie dobrane do konkretnego zakresu roboczego i sprawdzone na rzeczywistych materiałach. Dane katalogowe powinny być punktem wyjścia, natomiast ostateczna ocena powinna wynikać z testu całego zadania wykonywanego przez robota. Zewnętrzne warunki i zmiany zachodzące w czasie eksploatacji mogą wpływać na parametry głębi.

Najczęściej zadawane pytania o kamery 3D w robotyce

Kamery 3D są wykorzystywane w robotach mobilnych, manipulatorach, systemach kontroli jakości i autonomicznych platformach badawczych. Poniżej odpowiadamy na najczęstsze pytania dotyczące ich działania, możliwości oraz ograniczeń.

Co to jest kamera 3D w robotyce?

Kamera 3D to czujnik umożliwiający określanie odległości do powierzchni znajdujących się w polu widzenia. Robot może dzięki niej analizować nie tylko wygląd obiektów, ale również ich położenie, kształt, wymiary i orientację w przestrzeni.

Czym kamera 3D różni się od zwykłej kamery RGB?

Zwykła kamera RGB rejestruje kolor i jasność obrazu, ale sama nie dostarcza bezpośredniej informacji o odległości. Kamera 3D tworzy dodatkowo mapę głębi, w której poszczególnym pikselom przypisana jest odległość od urządzenia.

Czy kamera RGB-D jest osobną technologią pomiaru głębi?

Nie. Określenie RGB-D oznacza urządzenie dostarczające jednocześnie obraz kolorowy RGB i dane głębi. Moduł głębi może wykorzystywać między innymi stereo, aktywne stereo, technologię ToF albo światło strukturalne.

Co to jest mapa głębi?

Mapa głębi jest obrazem, w którym wartość piksela reprezentuje odległość do obserwowanej powierzchni. Na jej podstawie można wykrywać przeszkody, mierzyć położenie obiektów oraz tworzyć przestrzenną chmurę punktów.

Czym różni się kamera stereo od kamery ToF?

Kamera stereo oblicza głębię przez porównanie obrazów zarejestrowanych z dwóch punktów widzenia. Kamera ToF wykorzystuje własne źródło światła i określa odległość na podstawie czasu przelotu albo przesunięcia fazowego sygnału odbitego od powierzchni.

Czy kamera 3D może pracować w całkowitej ciemności?

Aktywne kamery ToF, światła strukturalnego i aktywnego stereo mogą wykonywać pomiar bez oświetlenia światłem widzialnym, ponieważ korzystają z własnego emitera, zwykle podczerwonego. Pasywne stereo potrzebuje natomiast odpowiednio widocznej i zróżnicowanej tekstury sceny.

Czy kamera 3D może działać na zewnątrz?

Może, ale urządzenie musi być przeznaczone do takich warunków. Silne światło słoneczne może zmniejszać skuteczność aktywnych projektorów podczerwieni, dlatego należy sprawdzić deklarowany zakres pracy, odporność środowiskową i zachowanie kamery w rzeczywistym oświetleniu.

Dlaczego kamera 3D ma problemy ze szkłem i błyszczącymi powierzchniami?

Przezroczyste i refleksyjne materiały mogą przepuszczać, załamywać albo kierunkowo odbijać światło wykorzystywane do pomiaru. W rezultacie kamera może wskazywać powierzchnię znajdującą się za szkłem, generować nieprawidłową głębię albo nie zwrócić wiarygodnych danych.

Czy kamera 3D prawidłowo wykrywa czarne obiekty?

Zależy to od materiału, technologii kamery, odległości i warunków oświetleniowych. Bardzo ciemne powierzchnie mogą pochłaniać znaczną część emitowanego światła, przez co aktywne systemy głębi otrzymują słabszy sygnał i generują mniej kompletną mapę.

Czy kamera 3D może tworzyć chmurę punktów?

Tak. Na podstawie mapy głębi i parametrów kalibracyjnych kamery można obliczyć współrzędne X, Y i Z punktów reprezentujących widoczne powierzchnie. Po połączeniu danych z obrazem RGB może powstać kolorowa chmura punktów XYZRGB.

Do czego robot wykorzystuje kamerę 3D?

Kamera 3D może wspierać wykrywanie przeszkód, autonomiczną nawigację, SLAM, rozpoznawanie ludzi, lokalizację produktów, planowanie chwytu, kontrolę jakości i tworzenie modeli przestrzennych. Jej konkretna funkcja zależy od miejsca montażu i oprogramowania robota.

Czy kamera 3D może zastąpić LiDAR?

W niektórych zastosowaniach tak, na przykład podczas lokalnej analizy przestrzeni przed robotem lub nawigacji opartej na obrazie głębi. Nie jest jednak uniwersalnym zamiennikiem LiDAR-u, ponieważ oba czujniki różnią się zasięgiem, polem widzenia oraz odpornością na warunki środowiskowe.

Dlaczego kamera 3D wymaga kalibracji?

Kalibracja opisuje parametry optyczne urządzenia oraz wzajemne położenie kamer, projektora i robota. Bez prawidłowej kalibracji odległości, chmura punktów i pozycje wykrytych obiektów mogą zostać wyznaczone niepoprawnie.

Czy po zmianie mocowania kamery trzeba wykonać ponowną kalibrację?

Jeżeli zmieniło się położenie kamery względem robota, chwytaka albo stanowiska, należy ponownie wyznaczyć odpowiednią transformację. Nawet niewielkie przesunięcie urządzenia może powodować zauważalny błąd podczas precyzyjnego chwytania lub pomiaru.

Jakie parametry są najważniejsze przy wyborze kamery 3D?

Należy sprawdzić przede wszystkim minimalny i maksymalny dystans, dokładność, powtarzalność, rozdzielczość głębi, pole widzenia oraz częstotliwość obrazu. Istotne są także warunki środowiskowe, synchronizacja, interfejs komunikacyjny, dostępność SDK i sterownika ROS 2.

Czy większa rozdzielczość zawsze oznacza dokładniejszy pomiar?

Nie. Rozdzielczość wpływa na liczbę rejestrowanych szczegółów, ale dokładność głębi zależy również od technologii, optyki, kalibracji, bazy stereo, odległości i jakości sygnału. Kamerę należy oceniać na podstawie całego zestawu parametrów.

Czy kamera 3D może współpracować z ROS 2?

Tak, pod warunkiem dostępności odpowiedniego sterownika lub SDK. Kamera może publikować między innymi obrazy RGB i głębi, informacje kalibracyjne, dane IMU oraz chmury punktów w standardowych formatach ROS 2.

Czy sztuczna inteligencja może analizować dane z kamery 3D?

Tak. Model AI może rozpoznać obiekt na obrazie RGB, a mapa głębi określić jego rzeczywistą odległość i położenie przestrzenne. Połączenie obu źródeł danych jest wykorzystywane między innymi w robotycznym chwytaniu, nawigacji i interakcji z człowiekiem.

Czy jedna kamera 3D wystarczy do obserwowania całego otoczenia robota?

Zwykle nie. Kamera obserwuje wyłącznie powierzchnie znajdujące się w jej polu widzenia i nie widzi obszarów zasłoniętych przez inne obiekty. Pełniejsze pokrycie przestrzeni może wymagać kilku kamer albo połączenia kamery z LiDAR-em i innymi czujnikami.

Jak sprawdzić, czy kamera 3D nadaje się do konkretnego robota?

Urządzenie należy przetestować w docelowym zakresie odległości, oświetleniu i na rzeczywistych materiałach. Trzeba ocenić kompletność mapy głębi, stabilność pomiarów, opóźnienie danych oraz skuteczność całego zadania, na przykład nawigacji lub chwytania.

Podsumowanie – jaką rolę pełni kamera 3D w robotyce?

Kamera 3D jest jednym z podstawowych czujników wykorzystywanych do przestrzennej percepcji robota. Pozwala określać odległość do powierzchni, analizować kształt obiektów, wykrywać przeszkody oraz tworzyć mapy głębi i chmury punktów. W przypadku urządzeń RGB-D dane geometryczne mogą zostać połączone z obrazem kolorowym, dzięki czemu robot otrzymuje jednocześnie informacje o wyglądzie i położeniu przedmiotu.

Pomiar głębi może być realizowany na kilka sposobów. Kamera stereo porównuje obrazy z dwóch punktów widzenia, system ToF wykorzystuje światło emitowane przez urządzenie, natomiast światło strukturalne analizuje wzór projektowany na obserwowaną powierzchnię. Każda technologia ma własne zalety i ograniczenia, dlatego nie istnieje jeden rodzaj kamery odpowiedni do wszystkich robotów.

Kamery 3D są wykorzystywane między innymi w autonomicznej nawigacji, Visual SLAM, robotycznym chwytaniu, sortowaniu, kontroli jakości, analizie ludzi i tworzeniu modeli przestrzennych. Obraz głębi może zostać przekształcony w chmurę punktów XYZ, a po dopasowaniu do obrazu kolorowego również w chmurę XYZRGB. Takie operacje są obsługiwane przez komponenty pakietu ROS 2 depth_image_proc.

W robotach mobilnych dane PointCloud2 pochodzące z kamery głębi mogą zasilać przestrzenną warstwę mapy kosztu Nav2. Pozwala to wykrywać przeszkody znajdujące się na różnych wysokościach i uwzględniać je podczas planowania przejazdu. Kamera 3D może uzupełniać LiDAR albo w wybranych zastosowaniach pełnić funkcję głównego czujnika lokalnej percepcji.

Jakość danych zależy jednak od odległości, kalibracji, oświetlenia, ruchu i właściwości obserwowanych powierzchni. Problemy mogą powodować między innymi szkło, materiały błyszczące, bardzo ciemne obiekty, silne światło słoneczne i wzajemne zakłócanie się aktywnych czujników. W kamerach ToF dodatkowe światło może zwiększać szum pomiaru i ograniczać możliwość poprawnego odczytania odbitego sygnału.

Z tego powodu wybór kamery powinien wynikać z rzeczywistego zadania robota, a nie wyłącznie z parametrów katalogowych. Urządzenie należy sprawdzić w docelowym zakresie odległości, przy właściwym oświetleniu oraz na materiałach występujących w danym procesie. Dopiero test kompletnego systemu pozwala ocenić, czy kamera zapewnia dostatecznie dokładne i stabilne dane do nawigacji, chwytania albo kontroli jakości.

Najważniejsze wnioski

  • Kamera 3D pozwala robotowi określać odległość i przestrzenne położenie obiektów.
  • Stereo, ToF i światło strukturalne wykorzystują odmienne metody wyznaczania głębi.
  • RGB-D oznacza połączenie obrazu kolorowego z danymi głębi, a nie osobną zasadę pomiarową.
  • Mapa głębi może zostać przekształcona w chmurę punktów XYZ lub XYZRGB.
  • Dane z kamery mogą wspierać SLAM, nawigację, wykrywanie przeszkód i planowanie ruchu.
  • W manipulatorach kamera 3D pomaga określać pozycję, orientację i dostępne miejsca chwytu.
  • Dokładność zależy od odległości, kalibracji, oświetlenia i właściwości powierzchni.
  • Jedna kamera nie zapewnia pełnej obserwacji obszarów zasłoniętych ani znajdujących się poza jej polem widzenia.
  • Kamera 3D i LiDAR często uzupełniają się w jednym systemie percepcji.
  • Ostateczny wybór urządzenia powinien zostać potwierdzony testem w rzeczywistym środowisku pracy.

Rozwój kamer głębi, przetwarzania obrazu i sztucznej inteligencji sprawia, że roboty mogą coraz dokładniej interpretować przestrzeń i reagować na zmiany zachodzące w otoczeniu. Kamera 3D nie jest jednak samodzielnym systemem autonomii. Pełne rozwiązanie wymaga również odpowiedniego oprogramowania, kalibracji, mocy obliczeniowej oraz integracji danych z pozostałymi czujnikami i układami sterowania robota.

Szukasz robota wyposażonego w kamerę 3D?

LEDIO Robotics pomaga firmom, szkołom, uczelniom i zespołom badawczym w doborze robotów wyposażonych w kamery 3D, LiDAR, ROS 2, SDK oraz narzędzia umożliwiające tworzenie własnych aplikacji.

Pomagamy ocenić dostęp do danych z czujników, możliwości programowania, dokumentację techniczną oraz przydatność konkretnego robota do nawigacji, mapowania, badań, edukacji i wdrożeń przemysłowych.

Źródła i dokumentacja techniczna

Artykuł został opracowany na podstawie dokumentacji technicznej ROS 2, Nav2, MoveIt 2 oraz producentów systemów obrazowania 3D. Poniższe materiały pozwalają rozszerzyć wiedzę o przetwarzaniu obrazu głębi, kamerach stereo, technologii ToF i integracji czujników z systemami robotycznymi.

  1. ROS 2 – depth_image_proc

    Dokumentacja komponentów przeznaczonych do przetwarzania obrazu głębi, rejestracji danych oraz tworzenia chmur punktów XYZ i XYZRGB.

    Otwórz dokumentację depth_image_proc
  2. ROS 2 – image_pipeline

    Zestaw narzędzi do kalibracji kamer, prostowania obrazów, przetwarzania stereo i obsługi danych wizyjnych w ROS 2.

    Otwórz dokumentację image_pipeline
  3. ROS 2 – sensor_msgs

    Opis standardowych wiadomości wykorzystywanych do publikowania obrazów, danych kalibracyjnych, chmur punktów oraz pomiarów IMU.

    Otwórz dokumentację sensor_msgs
  4. Nav2 – Voxel Layer

    Dokumentacja przestrzennej warstwy mapy kosztu, która może przetwarzać dane PointCloud2 pochodzące między innymi z kamer głębi.

    Otwórz dokumentację Nav2
  5. MoveIt 2 – pick-and-place

    Materiał opisujący planowanie chwytania, podejścia do obiektu, podnoszenia i odkładania z wykorzystaniem MoveIt Task Constructor.

    Otwórz dokumentację MoveIt 2
  6. Basler – czynniki wpływające na pomiar ToF

    Informacje dotyczące wpływu oświetlenia, temperatury, refleksyjności powierzchni i odbić wielodrogowych na jakość pomiaru głębi.

    Otwórz dokumentację Basler
  7. Luxonis – dokładność pomiaru stereo

    Dokumentacja wyjaśniająca wpływ bazy stereo, rozdzielczości, pola widzenia, dysparycji i odległości na dokładność danych głębi.

    Otwórz dokumentację Luxonis

Dokumentacja poszczególnych kamer i pakietów może być aktualizowana. Podczas projektowania systemu robotycznego należy zawsze sprawdzić wymagania właściwe dla konkretnego modelu urządzenia, wersji ROS 2 oraz środowiska pracy.