Robotique agentique et la promesse du raisonnement incarné

La promesse agentique rencontre un monde où l'action prend du temps, coûte des ressources et ne peut pas toujours être annulée. L'apprentissage, la vérification des hypothèses et la construction d’un monde limité sont des conditions préalables à une autonomie utile.
S'abonner
9 min de lecture
Chris von Csefalvay
Chris von Csefalvay
Distinguished Engineer, Robotics Intelligence CoE, HCLTech
9 min de lecture
microphone microphone Listen à article
30s Backward
0:00 0:00
30s Forward
Robotique agentique et la promesse du raisonnement incarné

Un robot peut exécuter une tâche soigneusement définie de manière remarquable, mais éprouver des difficultés dès qu’un changement apparemment mineur survient. Un composant arrive dans un emballage différent, une surface réagit autrement ou un objet est partiellement caché. Pour la personne qui supervise le travail, la variation peut paraître banale. Pour le système, elle peut invalider les conditions dans lesquelles son comportement a été conçu. L’entreprise est alors confrontée à un choix connu : restreindre davantage l’environnement, faire intervenir une personne ou investir du temps à concevoir une nouvelle exception.

Cette difficulté explique en partie l’intérêt pour la robotique agentique. L’ambition des agents est de construire des systèmes capables de percevoir leur environnement, de poursuivre des objectifs et d’agir pour transformer le monde qui les entoure. En logiciel, cela peut signifier utiliser des outils, recueillir de l’information et coordonner une séquence d’actions. pousse cette ambition jusqu’au travail physique. Un agent peut organiser une tâche, décider des compétences spécialisées à solliciter et réviser le plan au fur et à mesure de l’arrivée de nouvelles observations. Le robot fournit les moyens d’exécuter ce plan.

L’action physique change toutefois l’économie. Une tentative mobilise de l’équipement, consomme de l’énergie et prend du temps. Une erreur peut endommager un composant ou exposer une personne à des risques, et annuler une instruction logicielle ne permet pas de restaurer un objet brisé. Une autonomie utile doit donc tenir compte du coût d’acquisition des connaissances autant que de celui de l’exécution du travail. Jusqu’où le système peut-il apprendre d’une tentative ? Quelles incertitudes peut-il examiner avant de bouger ? Quand doit-il s’arrêter et demander de l’aide ?

Le monde que le système construit est une représentation de travail continuellement révisée de ce qui compte pour sa tâche : où se trouvent les objets, comment ils se comportent et quelles relations conditionnent une action. Elle sera inévitablement incomplète. La question utile devient alors : cette incomplétude peut-elle être identifiée et réduite lorsqu’elle a un impact sur le travail ? Cela confère à la simulation un rôle allant au-delà de la préparation au déploiement. À côté de l’observation et de l’expérience physique, elle devient un moyen d’explorer l’environnement tout au long de l’exploitation, chaque source de preuve aidant à en examiner une autre.

Ces questions relient trois promesses de la robotique agentique : apprendre au-delà de la conception initiale, remettre en question les prémisses derrière l’action et rendre l’exploration productive à l’intérieur de limites définies. Ensemble, elles décrivent comment les entreprises pourraient exploiter des systèmes autonomes dans des environnements changeants.

Émergence et apprentissage au-delà de la conception initiale

La robotique en entreprise a souvent reposé sur la définition à l’avance des comportements acceptables. Cette approche demeure précieuse lorsque la tâche et ses conditions sont suffisamment stables. Sa limite apparaît lorsque les réponses utiles sortent du cadre des exemples, procédures ou éventualités connus du concepteur. Il faut alors qu’une personne découvre une réponse praticable et la rende disponible au système.

L’émergence offre une autre possibilité. L’interaction de capacités existantes avec une situation inconnue peut produire une stratégie utile que personne n’a explicitement fournie. Un système pourrait découvrir un ordre différent pour manipuler des objets, combiner deux compétences pour accomplir une tâche ou identifier une observation qui facilite une décision difficile. Qualifier ce comportement d’émergent explique son origine, mais ne dit rien sur sa valeur d’usage. Un succès accidentel et une découverte réutilisable peuvent ressembler à la première tentative.

Imaginons un robot manipulant un composant qui glisse à répétition au moment du transfert. Une procédure fixe pourrait simplement répéter la même prise jusqu’à un seuil donné. Un système agentique pourrait enquêter sur l’échec, comparer différents points de contact en simulation et demander une autre vue du composant. Si une stratégie révisée fonctionne, la question suivante est de savoir si elle fonctionne dans toutes les conditions importantes. La connaissance que l’on souhaite conserver inclut ces conditions, et non simplement l’action ayant réussi par hasard.

Cela instaure une relation continue entre expérience physique et exploration. L’action fournit des observations sur ce qui se passe réellement. La simulation donne l’espace pour tester des alternatives sans engager du matériel à chaque fois. Les agents peuvent organiser cette enquête, identifier les informations manquantes et conserver les résultats éprouvés. La simulation reste un modèle avec ses propres limites, de sorte que les résultats prometteurs doivent revenir à la preuve physique avant de servir à fonder des affirmations sur la performance réelle.

Apprendre de cette façon donne au système une source d’instructions au-delà de ses formateurs humains. Les personnes peuvent démontrer ce qu’elles savent et décrire les circonstances rencontrées. Elles ne peuvent enseigner de façon exhaustive des situations encore jamais vécues. L’expérience peut révéler des liens absents du matériel de formation initial, à condition que le système puisse les explorer et distinguer une réelle amélioration d’un simple coup de chance. L’entreprise gagne ainsi une façon de transformer une exception en connaissance exploitable par la suite.

Il n’est pas nécessaire non plus qu’un seul modèle réunisse toutes les capacités. Différents agents pourraient examiner des explications concurrentes, recourir à des modèles spécialisés et partager des découvertes validées. Le répertoire qui en résulterait inclurait des programmes de contrôle, des représentations révisées et des procédures réutilisables. ASPIRE, une recherche de NVIDIA et de collaborateurs universitaires, en donne une première illustration : le système utilise des rétroactions d’exécution pour affiner les programmes de contrôle de robot et conserver les modifications validées dans une bibliothèque de compétences réutilisables. Cela illustre un mécanisme d’accumulation d’expérience à travers les tâches, tandis que les exigences d’une application de production demeurent une question d’ingénierie distincte.

La promesse économique découle de la réutilisation. Résoudre une situation nouvelle une fois peut éviter de devoir répéter des explorations coûteuses à l’avenir. Les entreprises devraient rechercher cette accumulation de connaissances utiles, en plus de la performance immédiate sur la tâche. Un système qui exécute la tâche du jour mais oublie tout ce qu’il a appris laisse beaucoup de valeur potentielle inexploitée.

Remettre en question les prémisses derrière l’action

Accumuler de l’expérience n’est utile que si le système peut reconnaître quand un savoir antérieur ne s’applique plus. Une procédure peut rester cohérente sur le plan interne tandis que le monde autour d’elle évolue. Les matériaux changent, l’équipement s’use et l’agencement évolue. Une défaillance qui en découle peut alors ressembler à une mauvaise exécution même si l’action a été réalisée comme prévu.

Toute décision robotique repose sur des hypothèses. Une prise dépend d’une estimation de la position, de la forme et du matériau. Un trajet planifié suppose que l’espace est libre. Un processus dépend d’attentes concernant l’équipement et les intrants. Certaines hypothèses sont explicites dans un modèle, d’autres découlent des données d’entraînement ou de la façon dont une tâche est décrite. L’opérateur humain, le modèle spécialisé et l’agent coordonnateur peuvent tous les partager. L’accord rassure, mais ne garantit pas que la représentation partagée reste fidèle à la réalité.

Revenons au composant qui glisse. Le système pourrait supposer qu’une force de préhension insuffisante en est la cause et continuer de l’augmenter. Si la cause réelle est un changement du matériau de surface, cette réaction peut aggraver le problème ou endommager la pièce. Avant de choisir une autre action, le système doit examiner l’explication à la base de son choix. Quelle observation appuie le diagnostic ? Qu’est-ce qui pourrait aussi expliquer le résultat ? Quelle information distinguerait ces possibilités ?

Une peut intégrer cet examen au travail courant. L’agent pourrait demander une autre vue par caméra, comparer les mouvements attendus et observés, commander une simulation ou consulter une personne concernant un changement de matériau. Chaque option a un but : obtenir une preuve susceptible de modifier la décision. Davantage d’observations n’est pas nécessairement mieux. La bonne observation est celle qui lève une incertitude conséquente à un coût jugé acceptable.

L’agent coordonnateur doit aussi être soumis à cette vérification. Déléguer l’exécution à un spécialiste ne rend pas pour autant la compréhension du superviseur plus fiable. Si celui-ci pose le problème de façon erronée, chaque spécialiste peut très bien agir dans le mauvais cadre. Un système conçu pour remettre en question les prémisses a donc besoin d’un moyen de revoir la description de la tâche et sa propre représentation, ainsi que le comportement des outils individuels.

C’est une forme d’adaptation plus exigeante que le simple choix entre des réponses prédéfinies. Dans un flux de travail fondé sur un monde fixe, le concepteur a déjà décidé quelles variations importent. La robotique agentique ouvre la possibilité de vérifier si ces catégories restent adéquates. Le système peut découvrir qu’une propriété jusqu’alors ignorée influe sur la manipulation, ou qu’une relation entre objets a changé. La révision de son modèle devient partie intégrante du travail, dans les limites d’autorité et d’exigences de preuve établies pour la tâche en question.

Pour l’entreprise, le bénéfice concret est une façon de gérer le décalage après le déploiement. Un système capable de localiser une hypothèse périmée peut orienter le processus de réapprentissage ou de nouvelle cartographie vers la véritable source de l’échec. Cela peut réduire les interventions répétées et les changements inutiles ailleurs dans le processus. Cela rend aussi l’adaptation plus compréhensible pour ceux qui supervisent l’exploitation : ils peuvent examiner ce qui a changé dans la compréhension du système et pourquoi le changement a été accepté.

La promesse dépend du maintien de la visibilité de l’incertitude. Une explication révisée doit rester provisoire jusqu’à ce que la preuve l’appuie. Lorsqu’une ambiguïté importante ne peut être résolue par le système, faire intervenir une personne devient une conséquence logique du raisonnement. Poursuivre avec assurance en s’appuyant sur une hypothèse non fondée ne fait qu’accroître le coût de l’échec lorsqu’il surviendra.

Apprendre par exploration encadrée

Apprendre et réviser les hypothèses modifie ce que l’entreprise doit concevoir. L’ambition est d’opérer dans un domaine défini tout en laissant le système affiner sa compréhension de ce domaine. Le déploiement n’exige pas une description complète de toutes les situations futures. Il requiert cependant une définition claire de ce que le système peut faire en découvrant les éléments manquant à cette description.

L’entreprise établit des objectifs, des ressources et des limites d’autorité. Elle détermine quelles observations les agents peuvent obtenir, quels outils ils peuvent utiliser et quels changements nécessitent l’intervention humaine. Elle définit également les preuves requises avant qu’un comportement nouvellement découvert ne soit autorisé en exploitation physique. Ces décisions ouvrent un espace concret à l’exploration. Sans elles, le système se retrouve soit freiné à chaque étape utile, soit doté d’une liberté que l’exploitation ne saurait raisonnablement absorber.

Une tâche de manutention en fabrication permet de rendre la distinction concrète. Les agents pourraient tester des prises alternatives en simulation, construire une meilleure représentation géométrique à partir des observations et comparer les conséquences d’un changement dans la séquence des opérations. Ces activités n’exigent pas toutes le même niveau d’autorité que l’envoi de commandes à une machine. Une proposition peut être explorée en profondeur avant de devenir une procédure exécutable, et une telle procédure reste régie par des limites sur les mouvements, les forces et l’accès à l’espace de travail.

De plus grands groupes d’agents pourraient se répartir cette enquête. Certains pourraient cartographier la géométrie, d’autres examiner les relations physiques ou comparer des plans. Leurs conclusions alimenteraient des représentations de travail de l’environnement, y compris les dépendances et incertitudes pertinentes pour la tâche. Le défi est de rendre ces représentations compatibles. Les preuves contradictoires doivent être résolues, les découvertes doivent être assorties de conditions d’application et une restriction doit subsister lorsqu’un agent délègue une partie du travail à un autre.

L’expertise humaine fixe la compréhension initiale de la tâche et de la réalité, ainsi que les limites à l’intérieur desquelles elles peuvent évoluer. Les agents assumeraient de plus en plus la cartographie et la révision, mais la responsabilité d’ingénierie demeure celle des personnes qui définissent comment le savoir est accepté et utilisé. Il faut donc veiller à la cohérence entre une découverte et l’action qu’elle autorise. Une explication plausible, un essai simulé réussi et la preuve d’une performance physique fiable soutiennent chacun différents types de décisions.

La sécurité rend cette liberté productive possible. La simulation peut permettre une exploration vaste, alors que la machinerie physique demeure assujettie à des limites opérationnelles applicables et à des fonctions de sécurité validées. La robotique agentique pourrait favoriser une exploitation plus sécuritaire lorsque le pouvoir d’enquêter est séparé du pouvoir d’agir. L’adaptabilité ne doit pas se faire au détriment de la sécurité : l’apprentissage émergent et l’adaptation peuvent aider les systèmes à identifier et à répondre à des risques imprévus à l’intérieur des contrôles établis.

Lorsqu’un système peut examiner un changement, réviser la représentation pertinente et proposer une réponse appuyée, les humains peuvent concentrer leur attention sur les décisions nécessitant leur expertise. La productivité dépend de la qualité de cette investigation et de la transférabilité de ses résultats vers une exploitation fiable. Les limites doivent également permettre au système de s’arrêter, de conserver ses observations et d’impliquer une personne lorsque poursuivre l’action autonome excéderait ses connaissances ou son autorité. La robotique agentique offre une colonne vertébrale dynamique pour des systèmes capables d’apprendre et de s’adapter au-delà des limites de ce qu’ont prévu les humains, tout en conservant un jugement humain là où c’est nécessaire.

D’une autonomie encadrée à l’intelligence incarnée

La robotique agentique offre aux entreprises un moyen de transformer l’expérience en capacité, de garder ouvertes les bases de l’action à la révision et de s’adapter à de nouvelles circonstances. Tandis que les robots passent de cellules de travail relativement prévisibles et d’usines manufacturières à un monde dynamique peuplé d’acteurs imprévisibles, cette adaptabilité devient une passerelle vers la déployabilité réelle.

La robotique agentique porte la promesse d’offrir cette adaptabilité grâce à une capable elle-même d’apprendre et de devenir plus compétente par réflexion. Nous avons vu les agents progresser rapidement, des premières implémentations à des systèmes capables de gérer des processus de plus en plus complexes à long terme.

Des recherches récentes sur le mauvais alignement agentique mettent en lumière les risques, tandis que les travaux sur les stratégies d’atténuation suggèrent qu’au moins certains modes d’échec peuvent être réduits. Les entreprises capables de tirer parti de la puissance du raisonnement agentique pour des intelligences incarnées y gagneront non seulement en efficacité, mais aussi en sécurité, en adaptation et en une toute nouvelle façon d’apprendre par l’expérience plutôt que par la prescription.

Partager
IA AI et GenAI Article Robotique agentique et la promesse du raisonnement incarné