ACE ROBOTICS a annoncé que son modèle mondial open-source Kairos a obtenu des résultats de premier plan sur quatre benchmarks mondiaux d'intelligence incarnée : RoboTwin 2.0, LIBERO-Plus, WorldModelBench Robot et DreamGen. Au 12 juin 2026, Kairos s'est classé premier parmi les modèles mondiaux évalués et les systèmes vision-langage-action (VLA) sur les classements publics de ces benchmarks, en tête dans des capacités clés telles que la manipulation robotique complexe, la généralisation au niveau de la scène, la modélisation du monde physique et le transfert zéro-shot. Le projet est disponible ouvertement sur GitHub, Hugging Face et ModelScope, offrant aux chercheurs et développeurs un accès public au modèle, aux résultats des benchmarks et aux documents techniques.
L'intelligence incarnée fait face à un défi fondamental : la généralisation. Les robots doivent fonctionner de manière fiable dans des environnements inconnus, en s'adaptant à de nouveaux éclairages, agencements, objets, incarnations et conditions réelles bruyantes. Alors que les modèles VLA ont été une approche dominante en mappant directement les entrées perceptuelles et linguistiques aux actions du robot, ACE ROBOTICS estime que les modèles mondiaux offrent une voie plus évolutive en apprenant explicitement la dynamique sous-jacente du monde physique. Kairos est conçu pour valider cette approche.
L'un des résultats les plus significatifs de Kairos provient de LIBERO-Plus, un benchmark de généralisation au niveau de la scène proposé par l'Institut d'Innovation de Shanghai avec l'Université Fudan, l'Université Tongji et l'Université Nationale de Singapour. Il évalue la robustesse sous sept variables réelles : angle de caméra, incarnation du robot, instruction langagière, éclairage, arrière-plan, bruit du capteur et disposition spatiale. Kairos a obtenu un score global de 89,0, se classant premier parmi tous les modèles mondiaux et systèmes VLA évalués, surpassant les modèles VLA de premier plan tels que ACoT-VLA (88,0), Pi 0.5 (85,7) et ProGAL-VLA (85,5), ainsi que le modèle mondial Being-H0.7 (84,8). Il a montré une forte robustesse environnementale, avec des performances quasi maximales sur l'éclairage (97,7), le bruit (96,8) et l'arrière-plan (95,8). Selon ACE ROBOTICS, c'est la première fois qu'une approche de modèle mondial surpasse les principaux systèmes VLA sur LIBERO-Plus pour la généralisation au niveau de la scène, indiquant une voie où les robots s'adaptent aux maisons, usines, espaces de vente au détail et autres environnements avec beaucoup moins de réentraînement spécifique à l'environnement.
Sur WorldModelBench Robot, un benchmark de modélisation physique proposé par des chercheurs de UC Berkeley, UC San Diego, NVIDIA et MIT, Kairos-4B a obtenu un score global de 9,30, se classant premier. Avec seulement 4 milliards de paramètres, il a surpassé des systèmes plus grands comprenant Lingbot de 28 milliards de paramètres, Cosmos 3 de 16 milliards de paramètres, Abot-PhysWorld de 14 milliards de paramètres et Wan 2.2 de 5 milliards de paramètres, établissant un nouveau record d'efficacité paramétrique. Kairos a égalé le meilleur score de suivi d'instructions (2,36) du Cosmos 3 de 16 milliards de paramètres avec environ un quart des paramètres, un gain d'efficacité quadruple. Il a obtenu 4,96 en adhérence à la physique, avec des notes parfaites en mécanique newtonienne et gravité, et un score parfait en qualité temporelle.
ACE ROBOTICS attribue les performances de Kairos à son architecture native unifiée « compréhension-génération-prédiction multimodale », qui intègre la compréhension, la génération et la prédiction du monde au sein d'un seul backbone partageant un état mondial global. Cela réduit la perte d'informations et la latence de coordination pour une modélisation physique plus cohérente, une prédiction à plus long horizon et une planification d'actions plus fiable. ACE ROBOTICS a introduit cette architecture pour la première fois en décembre 2025, et l'industrie dans son ensemble converge désormais vers une voie similaire : le Cosmos 3.0 de NVIDIA, introduit en 2026, adopte une conception à système unique comparable. Construit sur cette base, Kairos-4B est le premier modèle mondial incarné capable de piloter directement un robot physique sur l'appareil, fermant la boucle de perception à action sans latence de traduction intermédiaire.
Kairos s'est également classé premier sur DreamGen Bench, un benchmark dirigé par NVIDIA avec l'Université de Washington, UC Berkeley et UCLA, mesurant dans quelle mesure les données synthétiques générées par les modèles mondiaux se transfèrent à des objets, comportements et environnements inédits. Kairos s'est classé premier à la fois en adhérence physique moyenne (AVG_PA 0,538) et en score global moyen (AVG_Score 0,618), et a mené mondialement en exécution de nouveaux comportements et en adaptation à de nouveaux environnements. Sur RoboTwin 2.0, un benchmark de manipulation à deux bras proposé par l'Université Jiao Tong de Shanghai et l'Université de Hong Kong avec le Laboratoire d'IA de Shanghai, Kairos a obtenu un score de 96,1 % — un résultat de pointe. Sur les 50 tâches complexes à deux bras du benchmark, il a obtenu 96,9 % dans les scénarios propres et 95,2 % dans les scénarios randomisés, devant les modèles VLA tels que G0.5 (93,2) et starVLA (88,3) et les modèles mondiaux incluant AIM (93,1), Fast-WAM (91,8) et MotuBrain (96,0).
Ensemble, ces résultats valident la direction technique de Kairos dans les dimensions clés de l'intelligence incarnée, soutenant l'objectif d'ACE ROBOTICS de faire passer les robots de l'imitation de tâches à la compréhension du monde physique, au raisonnement à long terme et à l'exécution dans le monde réel. Ces résultats surviennent alors qu'ACE ROBOTICS accélère sa commercialisation, ayant levé plusieurs centaines de millions de dollars américains lors de tours de financement au premier semestre 2026, dont un récent tour Angel+ soutenu par des investisseurs tels que Dachen Caizhi, Shenzhen Capital Group et le Fonds d'Innovation Scientifique et Technologique de Shanghai, avec l'actionnaire existant Guoxiang Capital de SenseTime augmentant sa participation. Les fonds serviront à soutenir la recherche continue sur les modèles mondiaux et les solutions intégrées matériel-logiciel pour des secteurs tels que le commerce de détail intelligent, la sécurité et l'inspection, le tourisme et l'hôtellerie. « L'intelligence incarnée est la prochaine ère de l'IA, et un modèle mondial est la clé pour la débloquer », a déclaré Wang Xiaogang, président d'ACE ROBOTICS. « Notre mission est de donner à chaque robot un cerveau capable. »

