Ein anderer Ansatz für das robotergestützte Bin Picking
Industrielles Bin Picking basierte traditionell auf fest installierten 3D-Kameras, vordefinierten Greifpunkten, detaillierter Kalibrierung und relativ kontrollierten Behälterpositionen. Diese Methoden können in strukturierten Anwendungen gute Ergebnisse liefern, doch ihre Leistung kann weniger vorhersehbar werden, wenn Teile zufällig ausgerichtet oder teilweise verdeckt sind oder wenn sich die Position des Behälters verändert.
Inbolt verfolgt einen anderen Ansatz und positioniert eine 3D-Vision-Kamera direkt am Roboterarm. Statt sich auf eine feste Ansicht des Arbeitsbereichs zu verlassen, kann der Roboter sein Vision-System mit dem Endeffektor bewegen und sein Verständnis des Werkstücks kontinuierlich aktualisieren.
Meiner Ansicht nach ist diese Architektur besonders bedeutsam, weil die Kamera Teil des Bewegungssystems des Roboters wird, anstatt ein separates Erfassungsgerät zu bleiben. Dadurch verändert sich, wie der Roboter auf Veränderungen im physischen Arbeitsbereich reagieren kann.
On-Arm-Vision für unstrukturierte Umgebungen
Das Inbolt-System verwendet proprietäre KI-Modelle zusammen mit Echtzeit-3D-Vision, um geeignete Greifmöglichkeiten zu erkennen. Das System ist nicht von einem einzigen vordefinierten Greifpunkt abhängig. Es kann verschiedene zugängliche Oberflächen bewerten und bestimmen, wie der Roboter an das Bauteil heranfahren kann.
Dies ist nützlich, wenn Bauteile sich überlappen, drehen oder von Zyklus zu Zyklus unterschiedliche Oberflächen freigeben. Statt jede mögliche Ausrichtung explizit programmieren zu müssen, bewertet das Vision-System die aktuelle Szene und erstellt eine geeignete Greifstrategie.
Die angegebene Produktionsleistung liegt bei weniger als 1 Sekunde Verarbeitungszeit pro Greifvorgang, bei Greiferfolgsraten von bis zu 95 % in laufenden Fertigungsumgebungen.
Dreistufiger Closed-Loop-Betrieb
Die Lösung folgt einem kontinuierlichen Prozess der Wahrnehmung und Korrektur, anstatt das Greifen als Abfolge isolierter programmierter Bewegungen zu behandeln.
1. Eine greifbare Oberfläche identifizieren
Das 3D-Vision-System analysiert die zufällig angeordneten Bauteile und identifiziert einen zugänglichen Bereich zum Greifen. Der Roboter kann je nach sichtbarer Geometrie des Teils unterschiedliche Greifansätze auswählen.
2. Das Bauteil nach dem Greifen lokalisieren
Nachdem der Roboter das Bauteil gegriffen hat, kann das Vision-System das Objekt erneut analysieren und seine tatsächliche Position und Ausrichtung bestimmen. Dies liefert zusätzliche Informationen nach dem anfänglichen Greifvorgang.
3. Die Platzierbewegung korrigieren
Während sich der Roboter zum Ziel bewegt, kann die KI die Trajektorie kontinuierlich anhand der aktualisierten Objektposition verfeinern. Diese Fähigkeit zur Lokalisierung in der Hand hilft dabei, während des Greifens entstandene Abweichungen auszugleichen.
Diese Closed-Loop-Architektur ist meiner Meinung nach einer der wichtigeren technischen Aspekte des Systems. Ein erfolgreicher Greifvorgang bedeutet nicht zwangsläufig das Ende des Wahrnehmungsproblems; die Überprüfung des Teils nach dem Greifen gibt dem Roboter eine weitere Möglichkeit, die Positionierung vor dem Platzieren zu korrigieren.
Reduzierung fester Vision-Infrastruktur
Eine herkömmliche Bin-Picking-Zelle kann fest installierte Kameras erfordern, die über oder um den Arbeitsbereich herum positioniert sind. Solche Installationen können zusätzlichen Aufwand für mechanische Halterungen, Kalibrierung, Verkabelung und Konfiguration verursachen.
Mit einer am Roboterarm montierten Kamera kann sich dasselbe Vision-System zwischen verschiedenen Betrachtungspositionen bewegen. Dadurch lässt sich der Umfang der dedizierten Vision-Hardware für Anwendungen mit mehreren Behältern oder wechselnden Arbeitsplatzlayouts reduzieren.
Die Architektur macht das Vision-System außerdem weniger abhängig von einer einzigen festen Perspektive. Dies kann nützlich sein, wenn der Roboter ein Bauteil während des Greifprozesses aus verschiedenen Winkeln inspizieren muss.
Leistungs- und Produktionsaspekte
Nach Angaben von Inbolt wurde das System in mehr als fünf Fabriken eingesetzt und hat an diesen Produktionsstandorten eine hohe Verfügbarkeit und einen hohen Durchsatz erreicht. Das Unternehmen berichtet von Greiferfolgsraten von bis zu 95 % und durchschnittlichen Verarbeitungszeiten von weniger als einer Sekunde pro Greifvorgang.
Diese Zahlen sollten als anwendungsspezifisch und nicht als universelle Leistungsspezifikationen betrachtet werden. Die tatsächlichen Ergebnisse hängen von Faktoren wie Bauteilgeometrie, Oberflächenbeschaffenheit, Befüllung des Behälters, Roboterkonfiguration, Greiferausführung, Beleuchtung, Zyklusanforderungen und dem Grad der Verdeckung von Teilen ab.
Für Industrieingenieure ist diese Unterscheidung wichtig. Die Vision-Leistung sollte letztlich anhand der vollständigen Roboterzelle und nicht nur anhand des Vision-Algorithmus bewertet werden.
KI und 3D-Lagebestimmung
Das System läuft auf NVIDIA-Hardware und verwendet die KI-basierten Roboterführungsmodelle von Inbolt zur Lagebestimmung in Echtzeit und zur Korrektur der Trajektorie.
Das technische Ziel besteht nicht einfach darin, ein Objekt zu erkennen. Das System muss bestimmen, wo sich das Objekt befindet, wie es ausgerichtet ist, ob ein Greifvorgang physisch zugänglich ist und wie sich der Roboter nach dem Aufnehmen des Teils bewegen sollte.
Dadurch wird die Kombination aus 3D-Wahrnehmung, Lagebestimmung, Roboterbewegung und Rückkopplungsregelung wichtiger als die isolierte Bilderkennung.
Wo diese Architektur einen Mehrwert bieten kann
Der Ansatz eignet sich gut für Anwendungen, bei denen die Präsentation der Teile nur schwer standardisiert werden kann. Beispiele sind zufällig geladene Bauteile, Behälter, die ihre Position verändern können, variable Teilausrichtungen und Produktionsumgebungen, in denen mehrere Teilegeometrien bearbeitet werden müssen.
Ein weiterer potenzieller Vorteil ist der Einsatz an mehreren Stationen. Wenn sich dieselbe Roboter- und Vision-Architektur für unterschiedliche Behälter und Teilefamilien konfigurieren lässt, können Engineering-Teams möglicherweise den Umfang der für jeden Arbeitsplatz benötigten dedizierten Vision-Infrastruktur reduzieren.
Aus Sicht der Automatisierung liegt der interessanteste Vorteil daher nicht einfach im schnelleren Greifen. Es geht vielmehr um die Möglichkeit, den mechanischen und programmiertechnischen Aufwand zu reduzieren, der erforderlich ist, um die Leistung bei Veränderungen der physischen Umgebung aufrechtzuerhalten.
Aus Sicht der Entwicklung
Die Entwicklung von On-Arm-3D-Vision spiegelt einen umfassenderen Wandel in der industriellen Robotik wider: Die Wahrnehmung wird immer enger mit der Roboterbewegung integriert.
Traditionelle Automatisierung versucht häufig, Variabilität durch Vorrichtungen, feste Kamerapositionen, eine kontrollierte Teilepräsentation und vordefinierte Trajektorien zu eliminieren. KI-basierte Vision verfolgt den entgegengesetzten Ansatz, indem sie dem Roboter ermöglicht, mehr Variationen wahrzunehmen und sie durch Software und Rückkopplung auszugleichen.
Das macht eine solide mechanische Konstruktion, die Auswahl des Greifers, die Roboterprogrammierung oder die Prozessentwicklung nicht überflüssig. Stattdessen verändert sich, wo ein Teil der Komplexität gehandhabt wird. Bei Anwendungen mit tatsächlich variabler Teilepräsentation kann es ein praktischer Engineering-Kompromiss sein, einen Teil dieser Komplexität von mechanischen Einschränkungen in die Echtzeit-Wahrnehmung und Bewegungssteuerung zu verlagern.
Fazit
Die Bin-Picking-Lösung von Inbolt zeigt, wie On-Arm-3D-Vision und KI mit einer Closed-Loop-Robotersteuerung für weniger strukturierte Materialhandhabungsanwendungen kombiniert werden können. Die angegebene Verarbeitungszeit von unter einer Sekunde, die Greiferfolgsrate von bis zu 95 % und der Einsatz in mehreren Fabriken deuten auf einen Fokus auf die Produktion und nicht auf Labordemonstrationen hin.
Das zentrale technische Konzept ist die kontinuierliche Wechselwirkung zwischen Wahrnehmung und Roboterbewegung: Das System erkennt die verfügbare Greifmöglichkeit, überprüft das Bauteil nach dem Greifen und passt die Platziertrajektorie nach Bedarf an. Dieser Ansatz kann eine anpassungsfähigere Alternative zu Bin-Picking-Architekturen bieten, die stark von fest installierten Kameras und vordefinierten Greifbedingungen abhängen.
