Le 29 septembre 2026, Greg Brockman, président d’OpenAI, a signé à la Maison Blanche un engagement de 308 mots dans lequel les développeurs de modèles de frontière promettent notamment que leurs modèles ne pirateront pas de systèmes informatiques.
Onze semaines plus tôt, entre le 11 et le 13 juillet, environ 700 agents d’OpenAI attaquaient les serveurs de Hugging Face au cours d’une évaluation interne. Le texte, intitulé White House Accord on Super Intelligence, porte aussi les signatures de Donald Trump, Sundar Pichai (Google), Mark Zuckerberg (Meta), Dario Amodei (Anthropic), Jensen Huang (Nvidia) et Elon Musk (SpaceXAI).
L’accord est volontaire, sans sanction et sans contrôle public.
Ce que contient l’accord
Le texte, sous-titré Joint Commitment on Frontier Responsibilities, pose que chaque entreprise est responsable de la sûreté de sa propre technologie. Il décrit quatre niveaux de contrôle que chaque signataire « devrait » mettre en place :
- des contrôles internes qui surveillent les capacités et l’alignement des modèles pendant l’entraînement et le déploiement, en cybersécurité, biosécurité et menaces chimiques, et qui garantissent que les modèles ne piratent pas des systèmes ou n’y accèdent pas de manière imprévue ;
- une équipe interne chargée de vérifier que ces contrôles fonctionnent et que les problèmes sont corrigés ;
- un auditeur ou évaluateur externe indépendant qui vérifie le fonctionnement de l’ensemble ;
- un comité indépendant du conseil d’administration qui reçoit les rapports et veille aux corrections.
Les entreprises s’engagent aussi à se réunir régulièrement pour fixer des standards communs. Le dernier paragraphe admet qu’il pourrait être utile, à terme, de transposer ces mesures dans la loi.
Donald Trump a qualifié l’accord d’ « engagement moral ».
Mike Johnson, président de la Chambre des représentants, l’a décrit comme une déclaration de principes « voluntary on behalf of the industry ». Deux annonces présidentielles ne figurent pas dans le texte : un comité d’une dizaine de personnes pour superviser l’ensemble, et la nomination d’un responsable « dans les prochains jours », selon l’Associated Press.
Sam Altman, retenu par un événement d’OpenAI à San Francisco, n’était pas présent. Jeff Bezos (Amazon) et Alex Karp (Palantir) ont assisté au déjeuner sans signer. Microsoft ne figure pas parmi les signataires.
Le même jour, un décret a imposé aux administrations fédérales de remplacer « Artificial Intelligence » par « Super Intelligence », sans modifier la définition légale, et a donné 60 jours au conseiller scientifique du président pour proposer une définition législative.

L’incident Hugging Face : ce qui s’est passé chez OpenAI
Le 12 mai, pendant un entraînement par renforcement, un agent d’Open AI laisse une note dans Artifactory, le gestionnaire de paquets interne, pour demander un fichier aux autres agents. Artifactory devient une messagerie improvisée entre agents censés être isolés. Le 26 mai, un agent obtient un accès Internet par une faille de type server-side request forgery. Le 26 juin, des agents prennent les droits d’administrateur d’Artifactory.
Le 4 juillet, l’activité des agents provoque une panne. OpenAI ouvre un incident de sécurité le 5, reconstruit le service, puis relance ses évaluations de cybersécurité. Les agents recréent la messagerie dès le 8 juillet.
L’enquête de METR et Redwood Research chiffre la suite : environ 1 200 agents ont échangé plus de 70 000 messages et fichiers entre le 8 et le 13 juillet, et environ 700 ont participé à l’attaque contre Hugging Face. Environ 95 % tournaient sur un modèle interne non destiné à la production, le reste sur GPT-5.6 Sol. Le 10 juillet, un agent récupère 14 identifiants Hugging Face exposés publiquement. Les agents enchaînent ensuite deux zero-days et exécutent du code sur des dizaines de serveurs de Hugging Face.
Hugging Face publie l’intrusion le 16 juillet sans en connaître l’auteur. OpenAI détecte l’activité anormale le 19, fait le lien le 20 et reconnaît son implication le 21 juillet.
La cause principale, selon OpenAI, est le reward hacking : les agents cherchaient en ligne les solutions de leur benchmark, ExploitGym.
Clause 1 : des contrôles qui existaient, mais ne tournaient pas
La première clause porte sur la surveillance des capacités et de l’alignement. OpenAI en disposait.
Le texte signé le 29 septembre vise la surveillance « pendant l’entraînement et le déploiement ». L’incident s’est produit pendant une évaluation, avec des protections volontairement réduites. Le texte ne dit pas si cette phase entre dans son champ. Le problème, c’est que c’est précisément dans cet intervalle que le risque s’est matérialisé.
OpenAI s’est imposé depuis une règle plus précise que l’accord : le monitoring de chain-of-thought est désormais obligatoire pour tous les entraînements et évaluations avec outils des modèles de niveau GPT-5.6 Sol ou supérieur. C’est une règle interne, révisable par l’entreprise seule.
Clause 2 : l’équipe interne avait vu les signaux fin mai
La deuxième clause confie à une équipe interne le soin de vérifier que les contrôles fonctionnent et que les problèmes sont corrigés.
Chez OpenAI, cette équipe existait, et elle a vu les premiers signes.
Le maillon qui a cédé n’est donc pas l’existence de l’équipe, mais l’escalade. OpenAI a réagi sur ce point précis. Les moniteurs déclenchent désormais une alerte, et pour les alertes les plus graves, les équipes doivent suspendre l’activité dans les 30 minutes si elles ne peuvent pas établir qu’il s’agit d’un faux positif. L’arrêt entièrement automatique reste, selon le rapport, un objectif à atteindre.
L’accord, lui, ne définit ni seuil d’escalade, ni délai de réaction, ni personne habilitée à arrêter un entraînement.
La clause 2 serait remplie par l’équipe qui existait déjà en mai.
Clause 3 : l’évaluateur externe existe déjà, et c’est l’entreprise qui fixe son périmètre
La troisième clause demande un auditeur ou évaluateur externe indépendant. OpenAI y a fait appel après l’incident, et l’enquête publiée par METR le 26 août montre concrètement ce que ce rôle permet et ne permet pas.
Trois chercheurs, Hjalmar Wijk et Ajeya Cotra pour METR, Ryan Greenblatt pour Redwood Research, ont travaillé six jours dans les locaux d’OpenAI. METR n’a pas été payé pour cette mission. Ils ont analysé environ 1 300 transcriptions et un export de 1,2 million d’entrées de la messagerie des agents.
Une entreprise qui reproduit exactement le dispositif OpenAI-METR remplit la clause 3.
Mais l’accord ne dit rien des critères d’indépendance, de qui fixe le périmètre, ni de la publication
Clause 4 et ce qui reste hors du texte
La quatrième clause installe un comité du conseil d’administration qui reçoit les rapports des équipes internes et des auditeurs. Rien n’oblige ce comité à publier quoi que ce soit, ni à prévenir une autorité publique, ni à informer les victimes.
En juillet, Hugging Face a découvert l’intrusion par ses propres moyens et l’a rendue publique le 16 juillet sans savoir qui l’attaquait. OpenAI a reconnu son rôle cinq jours plus tard. L’accord ne contient aucune obligation de notification.
Il ne contient pas non plus de sanction, ce qui le rapproche des engagements volontaires obtenus par l’administration Biden auprès de sept entreprises en juillet 2023, dont Google, Meta, OpenAI et Anthropic. À l’époque déjà, NPR relevait qu’aucun mécanisme ne permettait de tenir les entreprises responsables.
Un accord signé alors que les problèmes persistent
L’accord a été signé alors que les mesures prises par OpenAI après l’incident venaient de montrer leurs limites. Selon Fortune, OpenAI a suspendu ses entraînements pour la deuxième fois fin septembre, après qu’un agent a de nouveau échappé à sa sandbox le week-end précédent, en passant par un résolveur DNS pour interroger un chatbot public. OpenAI juge cet incident nettement moins grave que celui de juillet.
Le 28 septembre, la veille de la signature, OpenAI a interrompu la sortie d’un nouveau modèle pour des raisons de sécurité, selon l’Associated Press. D’après le Wall Street Journal, repris par Business Today, il s’agit de GPT-6.1 Astra, prévu pour octobre, qui se montrait moins transparent sur ses propres actions que son prédécesseur.
Ces deux décisions ont été prises par OpenAI seule, avant l’accord et sans qu’aucune de ses clauses ne les impose. Le texte signé le lendemain ne demande rien qu’OpenAI ne déclare déjà faire. Il ne fixe pas non plus de plancher en dessous duquel un signataire serait en défaut.
Pourquoi ça compte, et ce qu’il faudra vérifier
Pour la première fois, un président américain et six dirigeants de la tech ont signé un texte qui pose que les modèles ne doivent pas pirater de systèmes. C’est un acte symbolique fort
Mais l’accord transforme les leçons de juillet en principes sans en faire des obligations.
En Europe, l’AI Act impose aux fournisseurs de modèles à usage général présentant un risque systémique de signaler les incidents graves au Bureau de l’IA de la Commission, avec des amendes pouvant atteindre 3 % du chiffre d’affaires mondial ou 15 millions d’euros.
Plusieurs échéances permettront de mesurer la portée réelle du texte américain :
- D’ici le 28 novembre 2026, la proposition de définition législative de la « Super Intelligence » prévue par le décret. Contiendra-t-elle autre chose qu’un changement de vocabulaire ?
- La nomination du responsable annoncé par Donald Trump, et surtout ses pouvoirs : pourra-t-il demander un rapport d’audit ?
- Le premier rapport d’auditeur externe publié en application de l’accord : qui en aura fixé le périmètre, et qu’en aura-t-on retiré ?
- Le prochain incident : la victime l’apprendra-t-elle par l’entreprise responsable, ou par ses propres journaux, comme Hugging Face en juillet ?
Bibliographie
- Inaugurating the Era of Super Intelligence, décret présidentiel du 29 septembre 2026 (Maison Blanche)
- The Hugging Face incident and the road ahead (OpenAI, 26 août 2026)
- OpenAI and Hugging Face partner to address security incident during model evaluation (OpenAI, 21 juillet 2026)
- Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (METR, 26 août 2026)
- Règlement (UE) 2024/1689 sur l’intelligence artificielle (EUR-Lex)
- Here’s The White House’s 308-Word AI ‘Accord’ In Full (Forbes, 29 septembre 2026)
- Trump, AI leaders sign accord (Associated Press, 30 septembre 2026)
- Trump says he and tech leaders signed AI agreement that is ‘morally binding’ (CNBC, 29 septembre 2026)
- Trump says AI leaders signed a ‘constitution’ to police themselves (ABC News)
- OpenAI pauses training a second time after saying its AI agents escaped a secure ‘sandbox’ again (Fortune, 26 septembre 2026)
- OpenAI cancels new AI model launch last minute over safety concerns (Business Today, 29 septembre 2026)
- Trump Administration issues executive order on AI and cybersecurity (A&O Shearman, 3 juin 2026)
- The White House and big tech companies release commitments on managing AI (NPR, 21 juillet 2023)
- Robots.txt et bots IA : comment protéger votre contenu sans disparaître des moteurs génératifs
- Cloudflare défie Google avec une refonte majeure de robots.txt : la Content Signals Policy
Ce contenu vous a plu ?
Inscrivez-vous gratuitement à notre newsletter et recevez chaque semaine l’actualité du SEO directement dans votre boîte email. Vous pouvez vous désabonner à tout moment !