L'unité de mesure inertielle (IMU), qui comprend des accéléromètres, des gyroscopes et des magnétomètres, peut collecter en temps réel les données d'accélération et de vitesse angulaire des mouvements articulaires avec un taux de rafraîchissement de plus de 1000Hz. Il fournit des paramètres de mouvement dynamique pour l'estimation de la position du poignet et aide les données visuelles à compléter l'étalonnage des coordonnées spatiales. L'encodeur installé dans le moteur servo du robot calcule le déplacement commun en enregistrant l'angle de la rotation du moteur, avec une exactitude de moins de 0.1 °, qui peut exactement dépister la trajectoire de mouvement du poignet et du bras, fournissant la référence précise de coordonnée du mouvement de membre pour la conversion de perspective. Dans certaines applications haut de gamme, un module VSLAM (Visual Simultaneous Localization and Mapping) est également intégré, qui réalise l'auto-localisation du robot et la modélisation environnementale grâce à un algorithme SLAM auto-développé, prend en charge la détection de fermeture de boucle en temps réel et la localisation assistée par ancre spatiale, et améliore en outre la stabilité de l'estimation de la position du poignet dans des environnements complexes.
La technologie Wrist World doit traiter d’immenses volumes de données visuelles et sensorielles, ce qui impose des exigences strictes en matière de vitesse de calcul et d’efficacité de la transmission des données. L'unité de calcul de bord adopte un SOC (système sur puce) performant, intègre un moteur indépendant de CNN (réseau neuronal convolutif), et peut réaliser le traitement localisé des données en temps réel pour éviter des problèmes de retard provoqués par transmission de nuage. Cette unité prend en charge le calcul parallèle multi-thread, qui peut traiter simultanément plusieurs flux vidéo et données de capteurs, le prétraitement complet de l'image, l'extraction de fonctionnalités et les opérations de conversion de perspective, garantissant que le retard dans la génération de l'image à la première personne est contrôlé au niveau milliseconde. L'interface de communication ultra-rapide relie chaque composant à l'unité de calcul par le type-c d'USB ou les connecteurs d'interface d'Ethernet, soutenant un taux de transmission de données d'au moins 10Gbps, et est compatible avec le cadre de développement ROS/ROS2 pour assurer la transmission efficace des données visuelles, des données de capteur, et des instructions de calcul. Certaines solutions intégreront des connecteurs Ethernet industriels pour améliorer encore la capacité anti-interférence et mieux s'adapter aux scénarios de fonctionnement industriels.
Le fonctionnement précis du robot doit être complété par des composants exécutifs, et l'effet de fonctionnement dépend de la vérification des composants de rétroaction. Comme noyau de la commande commune, le moteur servo a la capacité à haute précision de contrôle de position avec un temps de réponse de moins de 5ms. Combiné avec l'encodeur, il peut réaliser le mouvement précis du poignet et du bras, assurant l'exactitude de l'exécution d'action sous la direction de la perspective de la première personne. Le capteur tactile installé à la fin de la main du robot peut collecter des données tactiles telles que la force de préhension et la pression de contact, qui non seulement peut rétroaction l'effet de l'opération et aider l'apprentissage auto-supervisé pour optimiser la stratégie d'action, mais peut également fournir des données de corrélation tactile-visuel de la scène de fonctionnement pour la conversion de perspective.
Le harnais de fil est divisé en harnais de fil de puissance et harnais de fil de signal. Le harnais de fil de puissance fournit l'appui à forte intensité de puissance pour le moteur servo pour assurer la puissance stable sous le travail à haute intensité. Le faisceau de câbles de signal transmet avec précision les données de rétroaction des capteurs tactiles et des codeurs, avec un retard de transmission contrôlé au niveau de la microseconde, garantissant l'efficacité du calibrage en boucle fermée de l'apprentissage auto-supervisé. Compte tenu des caractéristiques de mouvement haute fréquence de l'articulation du poignet du robot, les connecteurs et les faisceaux de fils doivent avoir une flexibilité et une résistance à la fatigue extrêmement fortes, et répondre aux exigences de miniaturisation et de conception anti-interférence pour éviter un mauvais contact pendant le mouvement. Ses performances affectent directement l'effet de contrôle de l'erreur de conversion de perspective de la technologie Wrist World. Un système de connexion de haute qualité peut aider à réduire l'erreur de conversion de perspective de plus de 42,4%, devenant un support clé pour réaliser des opérations précises.
Système logiciel clé-Le cerveau central du traitement des données et de la prise de décision intelligente
Si les composants matériels sont les os et les muscles de la technologie Wrist World, le système logiciel est son cerveau de base, qui complète le traitement des données et la prise de décision intelligente grâce à la collaboration multi-modules, réalisant des fonctions essentielles telles que la conversion de perspective, l'apprentissage auto-supervisé et la reconstruction spatiale.
En tant que plate-forme centrale pour l'intégration de l'information, le système de fusion de données multimodal est responsable de recevoir des données multi-sources telles que la vision, le positionnement et la posture, en éliminant les erreurs de différents appareils grâce à l'étalonnage des données et aux algorithmes de fusion, et en formant un ensemble de données unifié. En termes de synchronisation et d'étalonnage des données, le système adopte la technologie de synchronisation d'horodatage pour unifier les flux de données des caméras, IMU, encodeurs et autres appareils sur le même axe temporel, en évitant les écarts de coordonnées spatiales causés par le retard des données. Dans le même temps, il corrige la distorsion de la caméra et les erreurs de capteur grâce à des algorithmes d'étalonnage pour assurer la cohérence de toutes les données. Dans la liaison de fusion de données multi-sources, des algorithmes tels que le filtrage de Kalman et l'estimation bayésienne sont utilisés pour fusionner les informations environnementales des données visuelles, les données de mouvement de l'IMU et les données de position du codeur en un vecteur d'état spatial unifié, fournissant des données d'entrée complètes et précises pour le modèle du monde 4D.
Le système de modèle du monde 4D est le noyau de la technologie du monde de poignet. Il construit un modèle de scène dynamique et interactif en fusionnant des données spatiales 3D et des informations de dimension temporelle, qui est également la logique de base pour réaliser la conversion de perspective. En termes de reconstruction spatiale 3D, le système construit un modèle 3D de la scène d'opération par couture de nuage de point et algorithmes de reconstruction de maille basés sur les données de profondeur des caméras binoculaires et des capteurs de TOF, reconstituant exactement la disposition environnementale, la forme 3D de la cible d'opération, et la relation positionnelle spatiale des membres du robot. La modélisation de dimension de temps intègre les données de mouvement d'IMU et d'encodeur pour enregistrer les changements de série de temps des actions de robot, construit un modèle dynamique de trajectoire de mouvement, capture le processus complet de mouvement du poignet de la position initiale à la position d'opération, et fournit l'appui dimensionnel-temps de continuité d'action pour la conversion de perspective. En tant que lien clé, l'algorithme de conversion de perspective extrait et génère l'image d'opération à la première personne à partir de la perspective du poignet à partir de l'image globale à la troisième personne en utilisant des algorithmes de transformation de perspective et de synthèse de vue basés sur le modèle spatial 3D et les données de trajectoire de mouvement. En apprenant les règles visuelles de la conversion de perspective humaine, l'algorithme peut automatiquement compenser les informations des zones occluses, assurant l'intégrité et la précision de l'image à la première personne.
Le système d'apprentissage auto-supervisé est la clé pour que la technologie Wrist World se débarrasse de la dépendance à l'annotation manuelle. Il réalise l'optimisation autonome de l'estimation de la position du poignet et de la précision de conversion de perspective grâce à des algorithmes intégrés. Dans le lien d'extraction de caractéristiques non supervisé, le système utilise des modèles d'apprentissage en profondeur tels que le réseau de neurones convolutionnels (CNN) et le modèle Transformer pour extraire automatiquement les caractéristiques clés d'un grand nombre d'images à la troisième personne non étiquetées, y compris le contour du poignet, les caractéristiques de cible d'opération, les informations de texture environnementale, etc., et construit une base de données de fonctionnalités complète. Le mécanisme d'étalonnage en boucle fermée compare l'image générée à la première personne avec l'image réelle collectée par la caméra locale du poignet, calcule l'erreur de conversion de perspective, ajuste les paramètres du modèle du monde 4D grâce à l'algorithme de rétropropagation et optimise la précision de la conversion de perspective. En même temps, combiné avec les données de rétroaction du capteur tactile, il vérifie l'efficacité de l'action d'opération, corrige indépendamment le modèle d'estimation de position de poignet, et forme un apprentissage en boucle fermée de la collecte de données-optimisation de modèle-amélioration d'exactitude. En outre, le module d'apprentissage par transfert peut transférer la capacité de conversion de perspective apprise à de nouveaux scénarios de fonctionnement, ajuster rapidement les paramètres du modèle grâce à une petite quantité de données d'adaptation de scène, améliorer l'adaptabilité de la scène de la technologie et réduire le coût de formation dans de nouveaux scénarios.
Le système de contrôle en temps réel assume la responsabilité du centre de planification pour l'exécution de la commande, qui combine l'image à la première personne après conversion de perspective avec des commandes d'opération pour conduire le robot à accomplir des actions précises. En termes de planification de mouvement, le système planifie la trajectoire de mouvement du poignet et de la main en fonction de la position cible et des informations environnementales dans l'image à la première personne, évite les risques de collision et assure la fluidité et la précision des actions de fonctionnement. Dans l'émission de commande et le lien de rétroaction, le système convertit les commandes d'action planifiées en signaux de commande du moteur servo et les émet en temps réel, et en même temps reçoit les données de rétroaction de l'encodeur et du capteur tactile, ajuste dynamiquement les paramètres d'action, Et s'assure que l'exactitude d'opération répond aux exigences prévues.
Mécanisme de liaison inter-module-Opération technique coordonnée
Le fonctionnement efficace de la technologie Wrist World repose en fin de compte sur la collaboration transparente entre les composants matériels et les systèmes logiciels, formant un mécanisme de liaison de processus complet de collecte-traitement-modélisation-conversion-exécution-optimisation.
Au cours de la phase de collecte de données, les caméras panoramiques externes et les dispositifs de perception de la profondeur collectent de manière synchrone des images globales à la troisième personne et des données spatiales 3D. L'IMU et les encodeurs capturent en temps réel l'état du mouvement et les informations de position du poignet du robot. Ces données multi-sources sont transmises à l'unité informatique de périphérie par le biais d'interfaces de communication à grande vitesse, et le système de fusion de données multimodal complète l'étalonnage et l'intégration synchrones pour fournir un ensemble de données unifié et précis pour un traitement ultérieur.
Dans l'étape de modélisation et de conversion, l'ensemble de données intégré est entré dans le système de modèle de monde 4D pour construire un modèle de scène dynamique comprenant des dimensions spatiales et temporelles. Sur la base de ce modèle, l'algorithme de conversion de perspective génère une image d'opération à la première personne combinée avec des données de trajectoire de mouvement du poignet, et effectue en même temps un étalonnage préliminaire à travers l'image réelle collectée par la caméra locale du poignet pour assurer la précision de l'image.
Dans l'étape d'apprentissage et d'optimisation, le système d'apprentissage auto-supervisé compare les différences entre l'image à la première personne générée et l'image réelle, combine le retour d'opération du capteur tactile, optimise indépendamment l'algorithme de conversion de perspective et le modèle d'estimation de position du poignet et améliore continuellement la précision des données. L'ensemble du processus ne nécessite pas d'intervention d'annotation manuelle, réalisant une mise à niveau itérative autonome.
Enfin, dans l'étape d'exécution et de rétroaction, le système de contrôle en temps réel planifie des commandes d'opération précises basées sur l'image optimisée à la première personne et les émet vers le servomoteur pour conduire le robot à accomplir des actions telles que saisir et retourner. Pendant le processus d'exécution, chaque capteur collecte en continu des données et ajuste dynamiquement les paramètres d'action pour s'assurer que l'effet de fonctionnement répond aux exigences attendues.
L'avantage principal de ce mécanisme de liaison est de réaliser le fonctionnement en boucle fermée de la collecte de données-traitement intelligent-optimisation autonome-exécution précise. Il résout non seulement fondamentalement le goulot d'étranglement des données rares de la première personne, mais améliore également sans interruption l'exactitude de système par l'apprentissage auto-supervisé, fournissant le support technique fiable pour des robots dans les domaines avec des conditions extrêmement élevées d'exactitude d'opération telle que la fabrication de précision et la chirurgie médicale, Et ouvrant également une nouvelle direction pour le développement de la technologie de perception spatiale de robot.
