Retour au blog

GPT-6 Astra en Robotique : Comment les Modèles Multimodaux Apprennent dans le Monde Physique en 2026

Salut HaWkers, en septembre 2026, une collection publique d'expériences menées avec GPT-6 Astra a réuni des dizaines de démonstrations dans des simulateurs et sur des robots réels. Le signal le plus intéressant n'est pas une vidéo spectaculaire : c'est le changement d'architecture. Au lieu d'entraîner une politique différente pour chaque tâche, les chercheurs placent un modèle multimodal au cœur d'une boucle d'observation, d'action, de vérification et de correction.

Mais qu'est-ce qui distingue une démonstration convaincante d'un système que vous pourriez utiliser en toute sécurité ? Dans cet article, nous allons comprendre le fonctionnement de cette boucle, lire les chiffres sans céder au battage médiatique et construire un petit contrôleur auditable et limité afin d'expérimenter cette idée sans accorder une liberté sans restriction à l'IA.

Ce Qui a Changé dans la Robotique Multimodale

Les robots industriels traditionnels fonctionnent très bien lorsque l'environnement, la pièce et la séquence sont connus. La difficulté apparaît lorsque la position de l'objet, la caméra, l'outil ou l'instruction change. Une politique spécialisée peut alors nécessiter de nouvelles données, un ajustement fin et une nouvelle série de validations. Un modèle vision-langage, ou VLM, propose une interface différente : il reçoit des images, l'état du robot, l'objectif et l'historique récent, puis choisit l'action suivante parmi les outils autorisés.

GPT-6 Astra a été lancé par OpenAI au début du mois de septembre comme un modèle destiné aux tâches longues, à l'utilisation d'ordinateurs, à la science et à l'exécution d'outils. La page officielle de GPT-6 Astra indique que le modèle est arrivé dans l'API et met en avant des progrès dans les tâches agentiques. Cela n'en fait pas automatiquement une politique robotique. Pour atteindre le monde physique, il faut encore un harness : le logiciel qui traduit les observations, restreint les commandes, exécute les mouvements et renvoie le résultat au modèle.

Le dépôt Awesome Astra Embodied AI, apparu parmi les projets populaires du jour, rassemble des cas de contrôle zero-shot, d'apprentissage en contexte, de replay entre le monde réel et la simulation, ainsi que de création d'environnements d'entraînement. Cette collection est utile comme carte de l'écosystème, pas comme benchmark unique. Chaque démonstration utilise un matériel, une caméra, un contrôleur, une limite d'appels et un critère de réussite différents.

Cette distinction est essentielle. Le modèle n'envoie pas directement du courant au moteur. Il choisit une intention ou une pose ; des couches déterministes la convertissent en trajectoire, respectent les limites et interrompent le mouvement lorsqu'une condition dangereuse apparaît. Le progrès réside dans la capacité à interpréter une situation nouvelle et à sélectionner des actions. La sécurité reste la responsabilité du système dans son ensemble.

La Boucle Observer, Décider, Agir et Vérifier

Un contrôleur agentique peut être compris comme une machine à états. La caméra et les capteurs produisent une observation. Le modèle choisit une action structurée. Un validateur rejette les valeurs impossibles. Le contrôleur exécute uniquement l'étape approuvée. Enfin, une nouvelle observation confirme si le système a progressé.

type RobotAction =
  | { kind: "move"; x: number; y: number; z: number; speed: number }
  | { kind: "grip"; closed: boolean }
  | { kind: "stop"; reason: string }

type Observation = {
  imageId: string
  joints: number[]
  forceNewtons: number
  emergencyStop: boolean
}

// Le modèle ne peut choisir que des actions de cette union discriminée.
// Le texte libre n'est jamais transmis directement au matériel.
async function chooseAction(observation: Observation): Promise<RobotAction> {
  if (observation.emergencyStop) {
    return { kind: "stop", reason: "Parada de emergência acionada" }
  }

  return modelDecision(observation) // Sortie structurée et validée par le SDK
}

Ce petit contrat élimine déjà une immense catégorie de problèmes. Le modèle n'obtient ni terminal, ni accès au réseau, ni méthode générique execute. Il reçoit des capacités explicites. L'article sur les agents IA autonomes et le développement logiciel explore la même idée dans le logiciel : une autonomie utile naît d'outils étroits, d'un état observable et de critères de conclusion clairs.

L'étude In-Context Robot Learning with VLM Agents, publiée le 16 septembre, décrit GPT-Policy avec trois composants : un compilateur de contexte qui préserve les transitions visuelles pertinentes, un VLM qui propose des actions et un contrôleur restreint qui vérifie, exécute et rapporte le résultat. Le modèle apprend au cours de la tâche à partir d'exemples et de retours, sans modifier durablement ses poids.

Il s'agit d'apprentissage en contexte, et non d'entraînement en ligne. Si l'on redémarre la session sans son historique, l'adaptation disparaît. Son avantage est la rapidité : une démonstration peut immédiatement orienter un nouveau comportement. Sa limite est tout aussi importante : un contexte mal sélectionné, des images ambiguës ou un retour incomplet peuvent entraîner une mauvaise décision qui paraît pourtant plausible.

Ce Que les Expériences Ont Réellement Mesuré

L'évaluation indépendante de RoboCurve avec des bras YAM aide à remplacer les impressions par des chiffres. Dans une tâche consistant à placer un bloc rouge dans un bol, Astra a réussi 19 tentatives sur 20, soit 95 %. Pour l'insertion d'une pièce circulaire dans un logement, il n'en a réussi que 2 sur 20, soit 10 %. Le même modèle, le même type de bras et des résultats radicalement différents.

Ce contraste montre pourquoi « contrôle des robots » reste une formule beaucoup trop large. Amener un objet jusqu'à une zone tolérante exige de la perception et de la planification, mais accepte une erreur de quelques centimètres. L'insertion d'une pièce exige un alignement précis, du contact, une correction continue et un contrôle de la force. Le raisonnement visuel peut localiser la destination et tout de même échouer sur le dernier millimètre.

Dans l'expérience du bol, la moyenne annoncée était de 2,5 minutes et le coût estimé de 0,94 dollar par exécution. Pour la pièce, elle atteignait 3,4 minutes et 1,36 dollar. Ce sont les chiffres du dispositif testé, avec les tarifs catalogue, les pauses et les outils spécifiques ; ils ne constituent pas une prévision universelle du coût industriel. En outre, chaque tentative a été évaluée par une personne, et les auteurs eux-mêmes signalent des limites, notamment des tests effectués à des jours différents et, en partie, sur des dispositifs distincts.

Une autre recherche, RoboICL, a étudié des démonstrations structurées. Sur cinq configurations contrôlées, trois exemples ont fait passer le score moyen de 0,34 à 0,88 pour la tâche consistant à placer des bouteilles dans une boîte, et de 0,04 à 0,82 pour la construction d'une tour. Lorsque l'évaluation de la tour a été étendue à 50 configurations, la moyenne est tombée à 0,598. Le gain est important, mais cette baisse hors du petit ensemble montre que la généralisation doit encore être mesurée, et non présumée.

Comment Construire un Garde-Fou Avant le Premier Mouvement

Le premier filtre doit être géométrique et déterministe. Définissez le volume autorisé, limitez la vitesse et la force, bloquez les déplacements brusques et transformez toute valeur non numérique en arrêt. Ce code doit s'exécuter en dehors du modèle et avoir la priorité sur lui.

const workspace = {
  x: [-0.45, 0.45],
  y: [-0.30, 0.30],
  z: [0.02, 0.55],
  maxSpeed: 0.12,
} as const

function inside(value: number, [min, max]: readonly [number, number]) {
  return Number.isFinite(value) && value >= min && value <= max
}

function validateAction(action: RobotAction): RobotAction {
  if (action.kind !== "move") return action

  const poseIsSafe =
    inside(action.x, workspace.x) &&
    inside(action.y, workspace.y) &&
    inside(action.z, workspace.z) &&
    action.speed > 0 &&
    action.speed <= workspace.maxSpeed

  // Échec fermé : toute valeur située hors de l'enveloppe provoque un arrêt.
  return poseIsSafe
    ? action
    : { kind: "stop", reason: "Ação fora do envelope seguro" }
}

Le deuxième filtre est temporel. Au lieu d'accepter une longue trajectoire créée d'un seul coup, exécutez des étapes courtes et observez à nouveau l'environnement. Si une personne entre dans la zone, si l'objet glisse ou si la caméra perd son repère, la séquence doit être interrompue. La capacité à replanifier n'est utile que lorsque chaque nouvelle planification reste elle-même limitée.

Le troisième filtre est opérationnel : budget d'étapes, durée maximale, nombre d'échecs consécutifs et validation humaine pour les actions irréversibles. Une machine qui ne sait pas quand s'arrêter transforme une petite imprécision en risque cumulatif. C'est pourquoi « je n'ai pas pu confirmer » doit être un résultat valide et fréquent.

Une Mémoire des Démonstrations Sans Entraîner le Modèle

Une démonstration utile n'est pas une simple vidéo. Elle doit associer l'observation, l'action exécutée et sa conséquence. Conserver toutes les images coûte cher et peut ensevelir le modèle sous des informations répétitives. Ne garder qu'un résumé textuel élimine les détails spatiaux. Le compromis consiste à sélectionner les moments de changement : avant le contact, après la fermeture de la pince, pendant une correction et au moment de confirmer la réussite.

type EpisodeStep = {
  observationId: string
  action: RobotAction
  outcome: "progress" | "stalled" | "unsafe" | "success"
}

function selectContext(steps: EpisodeStep[], limit = 12): EpisodeStep[] {
  // Préserve les échecs, la réussite et les changements de résultat ; réduit les images répétées.
  const important = steps.filter((step, index) => {
    const previous = steps[index - 1]
    return !previous || step.outcome !== previous.outcome || step.outcome !== "progress"
  })

  return important.slice(-limit)
}

Cette sélection doit être versionnée avec la tâche. Si le firmware, la position de la caméra ou l'outil change, une ancienne démonstration peut enseigner des coordonnées incompatibles. Les métadonnées comme le modèle du robot, l'étalonnage, l'unité de mesure et la version du contrôleur ne sont pas de la bureaucratie : elles font partie des données.

Il est également judicieux de séparer la mémoire d'exécution de la mémoire d'évaluation. Si le prompt indique à l'agent quelle action a obtenu une bonne note dans le benchmark, celui-ci peut apprendre à exploiter l'évaluateur au lieu d'exécuter l'intention. RoboICL conserve les récompenses, les étiquettes de réussite et les métriques en dehors de la requête de génération d'actions. C'est un choix sain pour réduire la fuite du critère d'évaluation.

Télémétrie, Replay et Audit

Une exécution physique doit être reproductible, au moins sur le plan logique. Enregistrez l'identifiant de l'observation, l'action proposée, la décision du validateur, l'action réellement envoyée, l'état ultérieur et les temps. N'enregistrez pas le raisonnement privé du modèle ; conservez les entrées, les sorties et les décisions de votre système.

type AuditEvent = {
  runId: string
  step: number
  proposed: RobotAction
  approved: RobotAction
  observationId: string
  recordedAt: string
}

async function appendAudit(event: AuditEvent) {
  // En production, utilisez un stockage append-only avec une durée de conservation définie.
  await auditStore.insert({
    ...event,
    recordedAt: new Date().toISOString(),
  })
}

async function runStep(observation: Observation, runId: string, step: number) {
  const proposed = await chooseAction(observation)
  const approved = validateAction(proposed)
  await appendAudit({ runId, step, proposed, approved, observationId: observation.imageId, recordedAt: "" })
  return robotController.execute(approved)
}

Grâce à ce journal, vous pouvez reconstruire la raison pour laquelle le bras s'est arrêté, comparer les versions du prompt et rejouer les mêmes décisions dans un simulateur. Vous pouvez aussi mesurer des indicateurs moins spectaculaires que le taux final de réussite : combien d'interventions humaines ont eu lieu, combien de commandes ont été bloquées, combien de temps le robot est resté sans repère visuel et à quelle étape les échecs se concentrent.

La confidentialité relève de la même architecture. Les caméras peuvent filmer des visages, des écrans et des documents. Définissez des zones masquées, une courte durée de conservation, un contrôle des accès et une finalité explicite. Si une image n'est pas nécessaire au débogage ou à la sécurité, ne la conservez pas par défaut.

Un Plan de Test Réalisable en Une Semaine

Commencez dans le simulateur avec une tâche à large tolérance, comme le déplacement d'un cube entre deux zones. Créez de 20 à 50 variations d'éclairage, de position et d'éléments perturbateurs. Exécutez une référence sans exemple, puis une autre avec une, deux et trois démonstrations. Mesurez la réussite, le nombre d'étapes, les blocages et la durée, tout en conservant le même budget pour tous les essais.

Passez ensuite en shadow mode sur le robot réel : le modèle propose des actions, mais un contrôleur connu reste aux commandes. Comparez les propositions aux trajectoires permises et déterminez combien d'entre elles seraient rejetées. Ce n'est qu'ensuite que vous pourrez autoriser des mouvements réels à faible vitesse, dans une zone vide, avec un arrêt physique accessible et une personne responsable de la session.

Les critères de promotion doivent être définis avant le test. Par exemple : aucune violation de l'enveloppe, au moins 90 % de réussite sur 50 variations simples, deux interventions au maximum pour dix exécutions et un arrêt sûr dans 100 % des scénarios où un capteur est absent. Ne modifiez pas l'objectif après avoir vu une belle vidéo.

L'objectif de la première semaine n'est pas de prouver l'existence d'une intelligence générale. Il s'agit de découvrir si le système conserve un comportement prévisible face à des variations contrôlées. Un échec bien documenté vaut davantage qu'une démonstration impossible à reproduire.

Perspectives : le Modèle N'est Qu'une Pièce du Robot

Les résultats de septembre 2026 suggèrent que les modèles multimodaux généralistes peuvent réduire le coût de l'enseignement de nouvelles tâches. Ils interprètent des démonstrations, écrivent de petits contrôleurs et s'adaptent à des interfaces qui ne figuraient pas dans un entraînement spécifique. Ils rapprochent ainsi le langage, la vision et l'action d'une manière que les politiques fermées conçues pour une tâche unique ne peuvent pas offrir.

Dans le même temps, une performance de 95 % sur une tâche et de 10 % sur une autre montre que la dernière étape physique reste difficile. Le contact, la précision, la latence et la récupération après une erreur ne disparaissent pas simplement parce que la planification s'est améliorée. La voie la plus prometteuse n'est pas de remplacer toute la pile par un modèle, mais de combiner la flexibilité du VLM avec des limites géométriques, un contrôle classique, des capteurs, la simulation, la télémétrie et une supervision humaine proportionnelle au risque.

Si vous souhaitez tester cette architecture, traitez chaque capacité comme une permission, chaque mouvement comme une hypothèse et chaque observation ultérieure comme une vérification. C'est ainsi qu'une démonstration de laboratoire commence à devenir une ingénierie fiable.

Allez, on y va! 🦅

📚 Vous Voulez Suivre Ce Qui Arrive?

Cet article a traité de GPT-6 Astra en robotique, mais l'écosystème évolue chaque semaine et tout ne devient pas un article ici.

Sur X, je partage ce que je teste, les coulisses de mes projets et les nouveautés qui apparaissent avant de devenir des publications.

Suivez-Moi La-Bas

👉 Suivre @jeffbruchado sur X

💡 Du contenu quotidien sur le développement, la carrière et les outils que j'utilise réellement

Commentaires (0)

Cet article n'a pas encore de commentaires. Soyez le premier!

Ajouter des commentaires