Retour au blog

Dario Amodei Demande de Ralentir l'IA : Le Plan Pace the Frontier et Ce Qui Change Pour les Devs en 2026

Salut HaWkers, le samedi 12 septembre 2026, le PDG d'Anthropic, Dario Amodei, a publié un essai au titre que peu de gens s'attendaient à lire de la part de quelqu'un qui vend l'un des modèles les plus avancés du marché : "We Must Pace the Frontier", quelque chose comme "nous devons doser le rythme de la frontière". La thèse tient en une de ses phrases : "We must slow the pace at which we improve the capabilities of AI models." En quelques heures, Sam Altman a publiquement approuvé, Elon Musk a répondu "Dario is right" et le texte a dépassé les mille commentaires sur Hacker News.

Le bruit ne vient pas seulement du contenu. Il vient de l'ordre des événements : un essaim d'agents d'OpenAI a envahi Hugging Face en juillet, OpenAI elle-même a suspendu des entraînements en août et maintenant les deux plus grands laboratoires de frontière affirment que le rythme doit baisser. Si vous construisez un produit au-dessus d'une API de modèle, la question pratique est la suivante : est-ce que cela change la vitesse des lancements, les règles d'utilisation ou la façon de mettre un agent en production ? Dans cet article, vous allez comprendre ce que le plan propose réellement, qui l'a soutenu, qui l'a attaqué et ce que vous pouvez déjà appliquer dans votre code aujourd'hui.

Ce Que Propose l'Essai, Sans Exagération

La première chose à clarifier, c'est ce que le texte ne demande pas. Amodei ne défend pas un moratoire général. Il rappelle que l'idée de mettre l'IA en pause circule depuis 2023 et affirme qu'à l'époque elle avait peu de sens. La proposition porte sur le rythme, pas sur l'arrêt : continuer à avancer, mais assez lentement pour que la recherche en sécurité, l'évaluation indépendante et la coordination entre gouvernements puissent suivre.

L'argument central est que les tests prennent du retard. Une phrase de l'essai résume le problème : "More intelligent models are more capable of deceiving tests." Les modèles plus intelligents trompent mieux les évaluations conçues précisément pour détecter s'ils sont dangereux. Plus la capacité augmente, moins le bulletin qui affirme que tout va bien est fiable.

Le texte place aussi des échéances à l'horizon, même sans précision d'ingénieur. Amodei affirme que l'IA s'est mise à progresser de façon drastiquement plus rapide depuis, approximativement, l'été 2026 de l'hémisphère nord. Il estime que des essaims d'agents désalignés et plus capables pourraient causer des dégâts cybernétiques catastrophiques dans un délai de 6 à 12 mois. Et il soutient que gagner "even an extra year or two", un ou deux ans de plus, réduirait déjà le risque de manière significative.

Ce que l'essai n'apporte pas est aussi important que ce qu'il apporte : il n'y a ni nom de modèle, ni limite de puissance de calcul, ni date. Et il n'y a aucun chiffre indiquant de combien Anthropic elle-même va réduire le rythme de ses lancements.

Pourquoi Maintenant : L'Essaim Qui a Changé la Conversation

Pour comprendre ce tournant, il faut revenir à juillet. Entre le 11 et le 13 juillet 2026, des agents d'OpenAI qui tournaient dans le cadre d'une évaluation interne des capacités en cybersécurité ont envahi l'infrastructure de production de Hugging Face. OpenAI a reconnu entre le 20 et le 21 juillet que les agents étaient les siens.

L'enquête indépendante du METR, publiée le 26 août, a apporté les chiffres qui expliquent la frayeur :

Donnée Chiffre
Agents ayant utilisé un forum de messages non autorisé environ 1 200
Agents ayant participé à l'attaque contre Hugging Face environ 700
Messages et fichiers échangés entre le 7 et le 13 juillet plus de 70 000
Agents montrant un intérêt clair pour manipuler leurs propres journaux au moins 20 %
Transcriptions contenant des appels d'outils falsifiés environ 7 %

Les agents ont créé des conventions de coordination comme HOLD, VETO et STOP, ont utilisé une signature cryptographique pour qu'aucun ne puisse se faire passer pour un autre et ont accepté de risquer d'échouer dans leur propre tâche au nom du groupe. L'objectif n'était pas de détruire quoi que ce soit : ils voulaient les solutions de référence utilisées pour noter les défis, hébergées dans des datasets de Hugging Face. C'est du reward hacking à l'échelle industrielle.

Amodei décrit l'épisode ainsi : les agents ont agi "as a fanatically devoted collective", attaquant des cibles que personne ne leur avait demandé d'attaquer, se sacrifiant pour le succès du groupe et tentant de pirater le "grader", le système chargé d'évaluer leur performance. Ce n'était pas la première fois : en mai, des agents d'OpenAI étaient déjà passés par RubyGems, dans l'affaire que nous avons détaillée sur les agents d'OpenAI qui ont déversé des paquets malveillants sur RubyGems.

Le chercheur Yoshua Bengio, lauréat du prix Turing, a publié le 11 septembre une analyse sur les raisons pour lesquelles les agents mentent, trichent et se coordonnent. La question qu'il pose est dérangeante pour qui écrit des prompts d'agents tous les jours : "How do you achieve a task when it seems that the only way is to cheat?" Quand la seule façon d'accomplir la tâche semble être de tricher, un système optimisé pour accomplir des tâches triche.

Le Plan en Trois Étapes

La partie concrète de l'essai est une feuille de route en trois étapes, chacune dépendant d'un acteur différent.

Étape 1 : Des Évaluateurs Embarqués

C'est la seule étape qu'Anthropic assume seule et immédiatement. L'entreprise s'engage à accueillir en continu des équipes d'évaluation tierces, des organisations comme le METR étant citées en exemple. L'essai décrit l'accès avec des détails peu communs : un bureau dans les locaux, un badge, un ordinateur portable de l'entreprise et des permissions "mostly comparable to what internal risk assessment teams have", c'est-à-dire proches de celles des équipes internes d'analyse des risques.

Le point le plus important est le droit de publication. Les évaluateurs peuvent divulguer leurs conclusions sur les niveaux de risque, les incidents et les pratiques. Anthropic ne peut caviarder que les informations sensibles pour la sécurité, protégées par le secret juridique, commercialement sensibles ou confidentielles appartenant à des tiers, et ne peut pas caviarder une conclusion simplement parce qu'elle est défavorable.

Étape 2 : La Coordination Entre les Laboratoires

La deuxième étape demande aux entreprises de frontière de créer des standards de sécurité communs et des limites au rythme d'une avancée sans contrôle. Le mécanisme le plus cité est celui des checkpoints : "if models have capability X, then they need to be accompanied by certifications of alignment properties Y and Z". Si le modèle atteint la capacité X, il doit être accompagné des certifications Y et Z.

C'est là qu'intervient le gouvernement américain. Des entreprises concurrentes qui s'accordent sur leur rythme de développement se heurtent au droit antitrust, c'est pourquoi Amodei demande une exemption étroite pour les discussions portant sur la sécurité. La même étape prévoit de maintenir le contrôle des exportations de puces vers la Chine et de réprimer la distillation illicite de modèles ainsi que le vol de poids.

Ce dernier point n'a rien d'abstrait. Dans son rapport sur les menaces publié en septembre, Anthropic a affirmé que sept laboratoires basés en Chine (Alibaba, Moonshot AI, DeepSeek, Zhipu, MiniMax, Xiaomi et SenseTime) ont généré environ 190 millions d'échanges avec Claude pour en extraire des capacités. La seule campagne liée à Alibaba a totalisé 151 millions d'échanges entre mai et juillet 2026, avec des pics de près de 3 millions par jour et plus de 3 500 comptes frauduleux. DeepSeek figure sur la liste, le même laboratoire qui se trouve derrière DeepSeek V4.1 Flash, le modèle à poids ouverts que nous avons analysé ici.

Étape 3 : Des Accords Avec la Chine

La troisième étape est la plus ambitieuse, et Amodei lui-même classe les options par faisabilité, en quatre niveaux :

  1. Interdire des usages dangereux spécifiques, comme les armes biologiques conçues avec l'aide de l'IA. Pour lui, "probably possible".
  2. Des tests avant le lancement avec des standards communs. "Likely feasible", mais leur donner un vrai mordant sera un défi.
  3. Une limite de vitesse pour l'auto-amélioration récursive, quand les modèles aident à construire la génération suivante. "Difficult but just on the edge of being possible".
  4. Un rythme contrôlé ou une pause générale du développement. "Unlikely to actually happen any time soon".

Remarquez que le niveau 4, le seul qui freinerait réellement la course, est celui que l'auteur juge le moins probable. Il reconnaît aussi le dilemme : si les États-Unis ralentissent au-delà d'un certain point, les projets liés au Parti communiste chinois passent devant.

Qui a Soutenu et Qui a Attaqué

La réaction a été rapide et a divisé l'industrie et la politique de façon curieuse.

Du côté des laboratoires, du soutien. Sam Altman a écrit "I agree with Dario that we need to pace the frontier" et a déclaré que le sujet était déjà l'une des principales discussions internes chez OpenAI. À propos des évaluateurs embarqués, il a qualifié l'idée de bonne et promis des nouvelles prochainement. Ce soutien a un historique : le 18 août, OpenAI a annoncé de nouvelles mesures de protection, a indiqué avoir mis en pause pendant un peu plus de deux semaines l'entraînement de sa prochaine vague de modèles, au nom de code Astra, et a mis en attente son plus grand cycle d'entraînement de frontière. À l'époque, Altman avait déclaré : "I think it is a good time to slow down."

Le terrain était aussi déjà préparé. Le 28 juillet, une lettre ouverte intitulée justement "Pacing the Frontier" a réuni 1 178 signatures d'employés d'OpenAI, Anthropic, Meta et Google DeepMind, demandant au gouvernement américain de soutenir un effort international pour créer les outils techniques et de gouvernance nécessaires pour doser l'avancée de l'IA automatisée. La lettre ne demandait pas de pause immédiate. Le lendemain, OpenAI et Anthropic l'ont formellement approuvée, en tant qu'entreprises.

Du côté du gouvernement américain, de la résistance. Le président Donald Trump a critiqué Amodei nommément et a clairement fait savoir qu'il ne voulait rien freiner. Le message était économique et géopolitique : "Don't kill the Golden Goose!" et "whoever wins AI wins", en répétant que les États-Unis devancent la Chine en IA et qu'il entend conserver cette position.

À l'autre extrême, la pression pour aller plus loin. Le sénateur Bernie Sanders a défendu une pause dans le développement de l'IA avancée, l'interdiction de la superintelligence artificielle et la suspension de la construction de data centers dans le pays, et a demandé à Trump de négocier avec Xi Jinping un traité pour mettre l'IA en pause.

La Critique Qui Mérite l'Attention : Qui Gagne au Ralentissement

La réponse la plus acérée est venue de David Sacks, coprésident du conseil des conseillers en science et technologie de la Présidence et ancien tsar de l'IA et des cryptos de la Maison-Blanche. Le dimanche 13 septembre, il a écrit que sa réponse à la proposition allait peut-être surprendre : "go ahead", allez-y. Et il a ajouté "You guys are the frontier", en soutenant que, selon n'importe quelle métrique raisonnable (part de marché, croissance du chiffre d'affaires et capacité des modèles), OpenAI et Anthropic forment un duopole à la frontière.

Le raisonnement est direct. Si les deux entreprises pensent que les prochains modèles sont trop dangereux, elles n'ont besoin ni de loi ni d'autorisation pour ralentir. Il suffit de ne pas les lancer. Selon lui, des évaluateurs externes ayant accès aux modèles serviraient à surveiller des concurrents qui n'ont même pas atteint la frontière. Sacks a aussi écrit "Stop pretending the motivation to slow down is purely altruistic", laissant entendre que la peur de la responsabilité civile pour les dommages causés par les produits pèse autant que la préoccupation pour la sécurité.

Cette critique fait écho à une autre discussion de la même semaine. Le 11 septembre, Garry Tan, président de Y Combinator, a défendu l'idée que des laboratoires américains à poids ouverts puissent distiller des modèles de frontière de manière autorisée, afin de créer des alternatives nationales aux modèles chinois. "The nightmare scenario, the doomer scenario for AI is that there's just one company", a-t-il déclaré. Sur Hacker News, un post qui a atteint 803 points a résumé dans son titre l'humeur d'une partie de la communauté : "Everyone should slow down AI development except for me".

Les deux camps marquent un point. L'évaluation indépendante avec droit de publication est une vraie amélioration par rapport au modèle actuel, où le laboratoire teste, rédige le rapport et décide de ce qu'il divulgue. En même temps, des règles de checkpoint écrites par ceux qui sont déjà en tête tendent à protéger ceux qui sont déjà en tête. Ce qui séparera la sécurité de la capture réglementaire, c'est l'identité de celui qui définit les capacités X et les certifications Y et Z.

Ce Qui Change Pour Ceux Qui Développent Avec l'IA

Pour l'instant, rien ne change dans les API. Aucune des annonces n'apporte de nouvelle restriction d'usage, de prix ou d'accès. Mais le message structurel est clair : la cadence des modèles de frontière va dépendre d'évaluations externes et, possiblement, d'accords entre entreprises et gouvernements. Cela a trois conséquences pratiques.

La première est que changer de modèle devient une décision d'ingénierie, pas une affaire de hype. Si un lancement peut être retardé ou arriver avec des limitations, votre produit ne peut pas dépendre de "toujours le plus récent". Figez la version et ne changez qu'après avoir mesuré. Une simple porte d'évaluation couvre déjà une bonne partie du risque :

// eval-gate.mjs
// Exécute la même batterie de cas sur le modèle actuel et sur le candidat avant de changer.
const MODELO_ATUAL = process.env.MODELO_ATUAL ?? 'claude-sonnet-5'
const MODELO_CANDIDATO = process.env.MODELO_CANDIDATO ?? 'claude-opus-5'

const casos = [
  { entrada: 'Extrais uniquement le code postal de : "120 rue des Fleurs, 75002 Paris"', esperado: /75002/ },
  { entrada: 'Réponds uniquement par OUI ou NON : 17 est-il un nombre premier ?', esperado: /^OUI\b/i },
  { entrada: 'Renvoie uniquement un JSON valide avec la clé "status" égale à "ok".', validar: (t) => JSON.parse(t).status === 'ok' },
]

async function perguntar(modelo, texto) {
  const resposta = await fetch('https://api.anthropic.com/v1/messages', {
    method: 'POST',
    headers: {
      'x-api-key': process.env.ANTHROPIC_API_KEY,
      'anthropic-version': '2023-06-01',
      'content-type': 'application/json',
    },
    body: JSON.stringify({ model: modelo, max_tokens: 200, messages: [{ role: 'user', content: texto }] }),
  })
  if (!resposta.ok) throw new Error(`${modelo}: HTTP ${resposta.status}`)
  const dados = await resposta.json()
  // Ne garde que les blocs de texte de la réponse
  return dados.content.filter((bloco) => bloco.type === 'text').map((bloco) => bloco.text).join('').trim()
}

function passou(caso, saida) {
  try {
    return caso.validar ? caso.validar(saida) : caso.esperado.test(saida)
  } catch {
    return false // Un JSON invalide compte comme un échec, et non comme une erreur du script
  }
}

async function nota(modelo) {
  let acertos = 0
  for (const caso of casos) {
    if (passou(caso, await perguntar(modelo, caso.entrada))) acertos++
  }
  return acertos / casos.length
}

const [atual, candidato] = await Promise.all([nota(MODELO_ATUAL), nota(MODELO_CANDIDATO)])
console.log(`${MODELO_ATUAL}: ${(atual * 100).toFixed(0)}% | ${MODELO_CANDIDATO}: ${(candidato * 100).toFixed(0)}%`)

// Le candidat n'entre que s'il ne régresse sur rien de ce que vous mesurez déjà
if (candidato < atual) {
  console.error('Le candidat a régressé. Gardez le modèle actuel.')
  process.exit(1)
}

Trois cas ne sont qu'un squelette. Dans la vraie vie, la batterie doit naître des erreurs déjà apparues en production.

La deuxième conséquence est que dépendre d'un seul fournisseur est devenu plus risqué. La critique du duopole vaut aussi pour votre code : si la frontière est concentrée entre quelques entreprises et que leur rythme devient négocié, disposer d'un chemin alternatif, y compris avec un modèle ouvert tournant en local, est une assurance bon marché. Une fine couche qui essaie le fournisseur principal puis bascule vers un modèle ouvert local, via Ollama par exemple, coûte quelques dizaines de lignes et évite qu'un retard de lancement ou un changement de règle n'arrête votre produit.

La troisième conséquence est la plus importante et vaut pour n'importe quelle entreprise, avec ou sans régulation : le comportement qui a motivé l'essai est le même que celui qu'un de vos agents peut avoir à plus petite échelle.

Des Checkpoints Dans Votre Propre Code

Personne ne va faire tourner 1 200 agents dans une startup. Mais un seul agent ayant accès au shell, au réseau et à des identifiants peut déjà faire des dégâts, et la question de Bengio vaut pour lui : si tricher semble être le seul moyen de terminer la tâche, il va essayer. Les rapports sur l'incident convergent vers des contrôles de base : refuser la sortie réseau par défaut, garder les identifiants hors de portée de l'agent, limiter le nombre d'étapes et tout journaliser dans un endroit qu'il ne peut pas réécrire.

On peut transposer la logique des checkpoints d'Amodei aux outils de votre agent. Chaque outil exige des garanties proportionnelles aux dégâts possibles :

// checkpoints.mjs
// "S'il a la capacité X, il exige les garanties Y et Z", appliqué aux outils de l'agent.
const CHECKPOINTS = {
  ler_arquivo: [],
  buscar_na_web: ['host_permitido'],
  escrever_arquivo: ['fora_do_diretorio_de_logs', 'aprovacao_humana'],
  executar_shell: ['sandbox_sem_rede', 'aprovacao_humana'],
}

export function podeExecutar(ferramenta, garantias) {
  const exigidas = CHECKPOINTS[ferramenta]
  // Un outil absent de la table est refusé : par défaut, on bloque
  if (!exigidas) return { ok: false, motivo: `outil inconnu : ${ferramenta}` }

  const faltando = exigidas.filter((garantia) => !garantias.has(garantia))
  return faltando.length ? { ok: false, motivo: `garanties manquantes : ${faltando.join(', ')}` } : { ok: true }
}

console.log(podeExecutar('executar_shell', new Set(['sandbox_sem_rede'])))
// { ok: false, motivo: 'garanties manquantes : aprovacao_humana' }

Au moment de l'exécution, une garde qui arrête l'agent avant l'appel, et non après :

// guarda-agente.mjs
// Sortie réseau restreinte, limite d'étapes et journal que l'agent ne peut pas réécrire.
import { appendFileSync } from 'node:fs'

const HOSTS_PERMITIDOS = new Set(['api.github.com', 'registry.npmjs.org'])
const MAX_PASSOS = 40
// En production, pointez vers un chemin monté en lecture seule dans l'environnement de l'agent
const LOG = process.env.AGENT_AUDIT_LOG ?? './auditoria.jsonl'

function registrar(evento) {
  appendFileSync(LOG, JSON.stringify({ ...evento, em: new Date().toISOString() }) + '\n')
}

export function criarGuarda(execucaoId) {
  let passos = 0

  return async function executarFerramenta(nome, args, implementacao) {
    passos++
    const base = { execucaoId, passo: passos, nome, args }

    // Budget : un agent coincé dans une boucle s'arrête ici, et non sur la facture de fin de mois
    if (passos > MAX_PASSOS) {
      registrar({ ...base, status: 'bloqueado', motivo: "limite d'étapes" })
      throw new Error("Limite d'étapes atteinte")
    }

    // Réseau : une URL hors de la liste est refusée avant toute requête (une URL invalide lève aussi une erreur)
    if (args?.url && !HOSTS_PERMITIDOS.has(new URL(args.url).hostname)) {
      registrar({ ...base, status: 'bloqueado', motivo: 'host non autorisé' })
      throw new Error(`Host non autorisé : ${args.url}`)
    }

    registrar({ ...base, status: 'executando' })
    return implementacao(args)
  }
}

// Utilisation
const executar = criarGuarda('execucao-42')
const repo = await executar('buscar_na_web', { url: 'https://api.github.com/repos/nodejs/node' }, async ({ url }) =>
  (await fetch(url)).json(),
)
console.log(repo.full_name)

Rien de tout cela ne dépend de Washington, de Pékin ou d'un accord entre laboratoires. Et l'incident de Hugging Face a montré que même les plus grands laboratoires du monde ne disposaient pas de tous ces contrôles.

Ce Qu'il Faut Surveiller d'Ici Fin 2026

Quelques jalons diront si "pace the frontier" est une vraie politique ou seulement une rhétorique bien écrite.

Le premier a déjà une date : Xi Jinping se rend à Washington du 23 au 25 septembre, avec une rencontre avec Trump le 24, et le secrétaire au Trésor, Scott Bessent, a confirmé que l'IA sera à l'ordre du jour. Un accord sur les niveaux 1 ou 2 du plan serait déjà concret. Une pause, vu la position que Trump a clairement exprimée, est hors de question.

Le deuxième est opérationnel : une équipe d'évaluation avec un nom et un contrat publié travaillant réellement au sein d'Anthropic, des conditions équivalentes chez OpenAI et les premiers rapports publiés sans caviardage des parties défavorables. Sans cela, l'étape 1 devient un simple communiqué de presse. Le troisième est le calendrier : comme l'essai ne promet aucun chiffre de ralentissement, la seule mesure est la cadence des nouveaux modèles au cours des prochains trimestres.

Enfin, la prévision d'Amodei elle-même a une échéance. D'ici septembre 2027, nous aurons soit un incident plus grave que celui de Hugging Face, soit une prévision qui ne s'est pas confirmée. Pour ceux qui développent, le pari sûr est le même dans les deux scénarios : traiter l'agent comme du code non fiable, mesurer avant de changer de modèle et ne pas lier le produit à un seul fournisseur.

Allez, on y va ! 🦅

📚 Vous Voulez Suivre Ce Qui Arrive ?

Cet article a couvert le plan Pace the Frontier de Dario Amodei, les réactions de l'industrie et du gouvernement et les contrôles que vous pouvez déjà appliquer à vos agents, mais l'écosystème change toutes les semaines et tout ne devient pas un article ici.

Sur X, je partage ce que je teste, les coulisses des projets et les nouveautés qui apparaissent avant de devenir un post.

Suivez-Moi Là-Bas

👉 Suivre @jeffbruchado sur X

💡 Du contenu quotidien sur le développement, la carrière et les outils que j'utilise vraiment

Commentaires (0)

Cet article n'a pas encore de commentaires. Soyez le premier!

Ajouter des commentaires