Skip to content

Odyssey-3 apprend à jouer à GTA V à partir de deux heures de vidéo, puis monte à cheval dans Red Dead Redemption 2

Odyssey, l’entreprise spécialisée dans les modèles du monde fondée en 2023 par Oliver Cameron et Jeff Hawke, a dévoilé Odyssey-3 le 15 septembre. Le concept repose sur un modèle préentraîné unique qui comprend le fonctionnement du monde physique, auquel sont greffés de petits « décodeurs d’actions » pour piloter un corps donné : un bras robotique, un humanoïde, une voiture, un drone ou un personnage de jeu vidéo. C’est le résultat obtenu dans les jeux vidéo qui a retenu notre attention. Une politique de déplacement entraînée sur environ deux heures de séquences de GTA V a permis de monter à cheval dans Red Dead Redemption 2 et de conduire une moto dans Sleeping Dogs, sans aucun entraînement sur ces deux jeux. Annonce d’Odyssey.

Une politique Odyssey-3 montant à cheval en pleine nature dans Red Dead Redemption 2, avec les touches WASD sur lesquelles elle appuie affichées en surimpression

Odyssey-3 monte à cheval dans Red Dead Redemption 2 avec une politique entraînée uniquement sur GTA V. La surimpression indique les touches sur lesquelles elle appuie. Image : Odyssey.

Un modèle, de nombreux corps

Odyssey-3 est un transformeur de diffusion autorégressif entraîné sur ce que l’entreprise décrit comme une vaste collection d’observations visuelles, dans le but d’apprendre un modèle général et causal du fonctionnement du monde. Ce modèle reste figé. Pour chaque incarnation, Odyssey entraîne un petit décodeur d’actions sur des paires observation-action. Le rôle de ce décodeur est de traduire l’état interne du modèle du monde en commandes adaptées au corps concerné.

L’entreprise affirme que le modèle figé concentre l’essentiel de la compréhension, ce qui permet aux décodeurs de n’avoir besoin que de très peu de données. Les bras robotiques apprennent à partir de quelques dizaines d’heures de démonstrations, et l’annonce montre l’un d’eux se reprendre après avoir raté une saisie, puis récupérer un objet tombé dans une orientation inhabituelle. Les humanoïdes, dans le cadre d’un travail mené avec Flexion, apprennent à partir de quelques dizaines d’heures de téléopération. Les drones apprennent à rejoindre des points de passage à partir de quelques dizaines d’heures de vol simulé. Le chiffre concernant la conduite est le plus concret : une politique entraînée sur 20 heures de conduite simulée a parcouru environ 77 % de la distance obtenue entre les interventions du conducteur de sécurité sur des routes indiennes très fréquentées par une politique entraînée sur des images réelles. Tous ces résultats sont des affirmations du fournisseur issues de ses propres démonstrations, et aucun n’a été reproduit en dehors d’Odyssey.

Quantité de données nécessaire à chaque décodeur d’actionsSelon Odyssey. Le modèle du monde lui-même est partagé et figé.BRAS ROBOTIQUESQuelques dizaines d’heuresde démonstrationsHUMANOÏDESQuelques dizaines d’heuresde téléopérationVOITURES20 heures simulées77 % du résultat réelDRONESQuelques dizaines d’heuresde vol simuléJEUXEnviron 2 heuresde séquences de GTA VPolitique de GTA V transférée à Red Dead Redemption 2 et Sleeping DogsPersonnage, véhicule et monde différents. Aucun entraînement supplémentaire sur l’un ou l’autre jeu.

L’agent de jeu voit des pixels et appuie sur des touches

Le décodeur de jeu est entraîné sur des enregistrements de parties associés aux entrées clavier et souris qui les ont produits. Lors de l’exécution, la politique observe les images récentes, génère des frappes au clavier et des mouvements de souris, puis regarde ce qui se passe. Elle ne dispose d’aucune API vers le jeu et n’a pas accès à son état. Elle joue comme le ferait une personne sur un ordinateur portable, ce qui explique aussi la petite surimpression WASD dans un coin des vidéos de démonstration : il s’agit des touches sur lesquelles elle appuie.

Odyssey fait état de sessions prolongées dans GTA V comprenant de la conduite, des fusillades et des combats au corps à corps. C’est le résultat du transfert qui est le plus saisissant. Une politique de mobilité entraînée sur environ deux heures de séquences de GTA a déplacé un personnage à cheval dans Red Dead Redemption 2 — un autre jeu, avec un personnage, un véhicule et un monde différents — et conduit une moto dans Sleeping Dogs. Deux heures, ce n’est rien. Cela signifie que le décodeur n’apprend pas tant « GTA » qu’à associer la notion de déplacement dans un environnement du modèle du monde à quatre touches et une souris.

Une politique Odyssey-3 courant dans une rue brumeuse de Los Santos au crépuscule dans GTA V, avec une surimpression WASD indiquant que la touche W est enfoncée

La même politique dans GTA V, le jeu sur lequel elle a réellement été entraînée. Image : Odyssey.

L’annonce montre également le modèle générer des environnements et permettre à des agents de les explorer, avec l’idée qu’un simulateur suffisamment performant peut entraîner les agents qui évoluent en son sein, tandis que les échecs de ces agents révèlent ce que le simulateur représente mal. Cette boucle constitue le véritable produit. Les robots, les voitures et les jeux ne sont que des démonstrations prouvant que la boucle fonctionne. Odyssey indique qu’elle publiera le modèle dans les semaines à venir, sans préciser sous quelle forme.

Un robot à deux bras plongeant les mains dans une caisse bleue remplie de provisions sur une table en bois, dans l’une des démonstrations de manipulation robotique d’Odyssey

Le même modèle figé pilote un robot à deux bras chargé d’une tâche impliquant une caisse de provisions. Image : Odyssey.

Pourquoi cela nous concerne

Nous avons couvert cette année trois actualités consacrées aux modèles du monde, et elles suivent des directions différentes. MIRA a remplacé le moteur de jeu et généré une partie jouable directement à partir du modèle. Atlas de World Labs génère, reconstruit et simule le monde lui-même. Odyssey-3 ne touche pas au moteur et joue à l’intérieur. Parmi les trois, c’est l’approche qui peut s’appliquer à un jeu que vous avez déjà créé.

Tous les jeux conçus dans notre Créateur de jeux fonctionnent dans un navigateur et utilisent le clavier et la souris, soit exactement l’interface employée par cette politique. Un agent capable de se déplacer dans GTA V à partir de deux heures de vidéo pourrait très probablement parcourir un petit jeu créé par un utilisateur avec encore moins de données. Cela donnerait un testeur qui ne s’ennuie jamais, n’a pas besoin d’instructions et peut vous dire en une minute si vos commandes sont cohérentes. Nous consacrons déjà beaucoup d’efforts à cette question, car les caméras inversées et les sauts qui répondent mal sont les raisons les plus fréquentes pour lesquelles un nouveau jeu est abandonné. Un agent peu coûteux signalant « je n’ai pas réussi à franchir la première porte » avant même qu’un humain ne voie le jeu changerait notre manière de tester.

Cela fonctionne aussi dans l’autre sens. Si le déplacement dans un monde 3D se transfère aussi facilement d’un jeu à l’autre, alors le modèle du monde de l’agent joueur est en passe de devenir une technologie banalisée. La partie déterminante sera le décodeur : la manière dont un jeu expose ses commandes, la lisibilité de ses retours et la capacité d’un agent à comprendre qu’il a effectué la bonne action. Ce sont les mêmes propriétés qui rendent un jeu jouable par une personne. Concevoir pour l’agent et concevoir pour le joueur pourraient finalement être une seule et même tâche.

Références