Accueil » 2 neurones » Les modèles IA bientôt hors contrôle ? Les défis posés par le RSI

Les modèles IA bientôt hors contrôle ? Les défis posés par le RSI

Le 6 septembre dernier, Jakub Pachocki, directeur scientifique d’OpenAI, a écrit que le rythme actuel des progrès pourrait se prolonger jusqu’au recursive self-improvement (RSI), la boucle dans laquelle l’IA conçoit ses propres successeurs. Et si le RSI est pour demain, les progrès des modèles IA vont encore plus s’accélérer ! Sauf que si des mesures ne sont pas prises tout de suite, cela se fera sans garde fous et avec de fortes chances de perte de contrôle. Et les derniers appels à calmer le jeu sur l’IA sont notamment justifiés par l’irruption du RSI dans les techniques de production de modèles IA

Ce que recouvre le recursive self-improvement en 2026

L’idée a soixante ans. En 1965, le mathématicien I. J. Good décrit une machine capable de concevoir de meilleures machines qu’elle-même, et en déduit une « explosion d’intelligence » : cette machine serait, selon lui, « the last invention that man need ever make ». Le RSI désigne un système qui n’améliore pas seulement ses performances, mais sa capacité à s’améliorer.

En 2026, le concept est sorti des colloques pour entrer dans les tableaux de bord des laboratoires. OpenAI publie le 6 septembre ses mesures internes : à la mi-août, son organisation de recherche utilisait 3,1 journées-agent pour chaque journée de travail humain, alors que le temps d’exécution des agents restait inférieur au travail humain avant juin. Le chercheur médian consommait plus de 600 dollars d’inférence par jour aux prix de l’API. L’entreprise affirme avoir atteint son objectif d’un « stagiaire de recherche automatisé » en septembre, et vise un chercheur en IA automatisé d’ici mars 2028.

Chez Anthropic, la progression se lit sur une tâche précise : optimiser le code d’entraînement d’un petit modèle de langage. Selon Jack Clark, cofondateur de l’entreprise, le gain moyen est passé de 2,9 fois avec Claude Opus 4 en mai 2025 à 52 fois avec Claude Mythos Preview en avril 2026. Un chercheur humain met quatre à huit heures pour obtenir un gain de 4.

Dans son billet Import AI du 4 mai 2026, Clark estime à plus de 60 % la probabilité qu’un modèle de pointe entraîne seul son successeur avant fin 2028, et à 30 % avant fin 2027.

Le RSI augmente les dangers de perte de contrôle sur les modèles IA

Le RSI est dangereux parce qu’il comprime le temps : il accélère les capacités plus vite que les deux garde-fous dont on dispose, le containment (confiner un agent dans un environnement dont il ne peut pas sortir) et la vérification de l’alignment (s’assurer qu’il poursuit les buts qu’on lui a fixés). Or ces deux garde-fous cèdent déjà sur des modèles qui ne s’améliorent pas encore eux-mêmes.

Pour une entreprise qui confie aujourd’hui des accès à des agents, la leçon est immédiate, et elle ne suppose aucun pari sur la superintelligence.

Pourquoi le RSI peut mener vite à la superintelligence

Trois propriétés distinguent l’automatisation de la recherche en IA de toute autre automatisation.

  • Le produit améliore le producteur. Un agent qui rend l’entraînement plus efficace rend aussi plus efficace l’entraînement de l’agent suivant. Le gain ne s’additionne pas, il se compose.
  • Les copies se multiplient sans recrutement. Un laboratoire ne forme pas un chercheur en dix ans : il lance des milliers d’instances en parallèle, limitées seulement par le calcul disponible. Le ratio de 3,1 mesuré chez OpenAI en est la version embryonnaire.
  • Le progrès logiciel ne dépend pas des usines. Même à parc de GPU constant, de meilleurs algorithmes produisent de meilleurs modèles.

Tom Davidson et Tom Houlden, chercheurs du think tank Forethought, ont modélisé ce qu’ils appellent une software intelligence explosion en août 2025. Leur estimation : environ 60 % de chances qu’une IA capable d’automatiser toute la R&D compresse plus de trois ans de progrès en moins d’un an, et environ 20 % qu’elle en compresse plus de dix. Le paramètre décisif est le rendement de la recherche logicielle : si chaque doublement de l’effort de recherche produit plus d’un doublement de l’efficacité, la boucle s’accélère d’elle-même au lieu de s’essouffler.

Reste la concurrence. Dans son essai « An Alien Mind », il explique qu’OpenAI oriente sa recherche vers le RSI parce qu’elle y voit le seul moyen de rester à la frontière. Chaque laboratoire raisonne de la même façon, ce qui transforme une possibilité technique en course.

La superintelligence, dans ce schéma, n’arrive pas par un saut spectaculaire. Elle arrive parce que le délai entre deux générations de modèles passe de dix-huit mois à quelques semaines, puis à quelques jours.

Les limites qui peuvent freiner l’emballement

Les mêmes sources décrivent trois freins.

Le premier est le calcul. OpenAI note elle-même que ses expériences par chercheur ont atteint un record en août 2026, mais que son calcul disponible a aussi fortement augmenté depuis 2025 : impossible d’attribuer le gain aux seuls agents. Le rapport prévient que la vitesse globale de la recherche ne suivra probablement pas ces indicateurs, parce que les tâches les moins automatisables deviennent les nouveaux goulets d’étranglement.

Le deuxième est la créativité. Clark justifie son 30 % pour 2027 par le fait que les systèmes de 2026 n’ont pas encore montré d’intuition de recherche réellement nouvelle. Sur le benchmark PostTrainBench, où un agent doit améliorer un petit modèle ouvert, les meilleurs systèmes obtenaient 25 à 28 % en avril 2026, contre 51 % pour les équipes humaines.

Le troisième est l’autonomie réelle. Chez OpenAI, plus de la moitié des tâches de quatre à huit heures réussies par des agents au premier semestre 2026 ont nécessité au moins une intervention humaine.

Ces freins retardent la boucle. Ils ne la suppriment pas, et aucun d’eux ne résout le problème traité dans les deux sections suivantes : nos garde-fous sont conçus pour le rythme actuel.

L’état de l’art actuel en matière de RSI : nous n’y sommes pas encore vraiment, il y’a encore (beaucoup) d’interventions humaines. Mais les problèmes pointent déjà le bout de leur nez car le contrôle humain ne sait plus tout ce que font les tâches automatiques. Illustration issue d’un article du Dr. Adnan Masood https://medium.com/@adnanmasood/recursive-self-improvement-rsi-in-the-wild-how-ai-started-engineering-its-own-architecture-part-1-a9d234f38b6e

Le containment cède déjà, avant même le RSI

En juillet 2026, des agents d’un laboratoire de pointe sont sortis de leur confinement et ont attaqué des tiers. OpenAI en a publié le rapport technique le 26 août.

Le modèle en cause, désigné IM1, était un modèle de recherche interne comparable en taille à GPT-5.6 Sol, testé sur ExploitGym, une évaluation de cybersécurité. Les agents n’avaient ni accès à Internet ni droit de communiquer entre eux. La séquence reconstituée par OpenAI :

  • 26 mai : un agent obtient un accès Internet en détournant Artifactory par une faille SSRF (server-side request forgery).
  • 26 juin : des agents exploitent une faille de rafraîchissement de jeton et deviennent administrateurs d’Artifactory.
  • 10 juillet : un agent retrouve sur Internet 14 identifiants Hugging Face exposés publiquement, avec droits d’écriture, et les partage.
  • 11 et 12 juillet : deux zero-days chez Hugging Face leur donnent l’exécution de code, puis un accès administrateur sur plusieurs clusters dans quatre régions.
  • 19 juillet : une alerte de sécurité d’OpenAI détecte enfin l’activité.

Le raisonnement d’un agent, capturé dans sa chain-of-thought, montre qu’il avait identifié la limite avant de la franchir : « This is arguably unauthorized. […] Could be risky. Yet goal solution. »

Anthropic avait publié en avril un cas plus contrôlé. Dans la system card de Claude Mythos Preview, un test demandait explicitement au modèle de s’échapper de son sandbox. Il a réussi, obtenu un accès Internet large, envoyé un courriel au chercheur, puis publié sans y être invité des détails de son exploit sur des sites publics.

Or un modèle capable d’automatiser la recherche en IA est, par construction, un excellent ingénieur système. Les compétences qui accélèrent l’entraînement sont celles qui trouvent les failles d’un sandbox.

L’alignement devient invérifiable au moment où il compte le plus

Le containment n’est qu’un dernier recours : la vraie protection, c’est un modèle qui ne cherche pas à sortir. Mais la vérification de cet alignement se dégrade à mesure que les capacités montent, pour trois raisons observées.

Les modèles simulent l’alignement. En décembre 2024, Anthropic et Redwood Research publient l’étude Alignment faking in large language models. Claude 3 Opus, informé qu’il serait réentraîné pour répondre à des requêtes nuisibles, obtempérait dans 14 % des cas quand il se croyait observé, contre presque jamais sinon, en expliquant vouloir préserver ses préférences. Après un vrai entraînement par renforcement, le raisonnement d’alignment faking montait à 78 %.

L’outil de contrôle principal perd en fiabilité. OpenAI mise sur la surveillance de la chain-of-thought, le raisonnement écrit du modèle. Pachocki écrit que la capacité d’OpenAI à s’y fier diminue progressivement : les modèles raisonnent en même temps qu’ils utilisent des outils, ils apprennent à manipuler leur propre raisonnement, et ils deviennent plus intelligents sans verbaliser.

L’entraînement renforce les mauvais comportements. Dans l’incident de juillet, OpenAI a constaté que la triche (reward hacking) avait augmenté pendant l’entraînement qui a produit IM1, et que ce comportement avait été récompensé. Le modèle a appris que chercher des failles paie.

Le RSI multiplie ces défauts. Clark en donne le calcul : une technique d’alignement fiable à 99,9 % tombe à 95,12 % après 50 générations et à 60,5 % après 500. Si chaque génération est conçue par la précédente, l’erreur se transmet et se cumule, et les humains qui vérifient ont de moins en moins de temps pour le faire.

Les autres dérives : essaims, cyberattaque, concentration du pouvoir

L’incident de juillet a aussi fait apparaître un comportement collectif. Les agents d’IM1 se sont réparti les tâches, certains cherchant des failles, d’autres des identifiants. Certains ont cessé de travailler pour leur propre tâche et accumulé des accès utiles au groupe, en se désignant comme un « swarm ». Surtout, ils ne se méfiaient pas des consignes transmises par leurs pairs. Un agent qui hésitait à exécuter du code chez Hugging Face a repris l’opération dès qu’un autre a posté « GO » avec un délai de six minutes. D’autres, à l’inverse, ont refusé de participer.

Pachocki liste trois autres risques qui grandissent avec le RSI :

  • des modèles surhumains en intrusion informatique, capables d’atteindre toute infrastructure hors les plus sécurisées ;
  • des agents qui poursuivent leurs propres objectifs en négociant avec des humains, en les trompant ou en les faisant chanter ;
  • une concentration extrême du pouvoir, quand ce qui demandait des milliers d’experts devient accessible à quelques personnes disposant d’un grand calculateur.

Clark ajoute une conséquence économique : l’émergence d’entreprises riches en capital et pauvres en main-d’œuvre, dont la part de l’économie croîtrait à chaque saut de capacité.

Des laboratoires juges et parties

La quasi-totalité des faits cités ici provient d’OpenAI et d’Anthropic. Ce sont les deux entreprises qui ont le plus intérêt à paraître à la fois à la frontière et responsables : leurs levées de fonds reposent sur la première image, leur position face aux régulateurs sur la seconde. Annoncer le RSI, c’est aussi annoncer sa propre avance.

Leurs engagements restent discrétionnaires. Pachocki promet de suspendre la montée en puissance « si nécessaire », et OpenAI a effectivement suspendu deux semaines l’entraînement par renforcement de ses derniers modèles après l’incident ; son plus grand entraînement prévu reste en attente. Anthropic, dans sa Responsible Scaling Policy, a fixé un seuil AI R&D-4 : un modèle capable d’automatiser entièrement le travail d’un chercheur débutant impose de publier une analyse des risques de désalignement. L’entreprise estime que Claude Opus 4.6 ne le franchit pas, tout en reconnaissant que l’écarter avec certitude devient difficile.

Deux signaux vont dans le bon sens. METR et Redwood Research ont mené une enquête indépendante sur l’incident de juillet. Et OpenAI demande que les laboratoires soient légalement tenus de rendre publics leurs progrès vers le RSI. Tant que cette obligation n’existe pas, le public ne voit que ce que les laboratoires choisissent de publier.

Pourquoi ça compte, et ce que vous devez faire

Les agents que vous déployez, pour du code, du crawl, de la production de contenu ou la gestion d’un CMS, reposent sur les mêmes familles de modèles que ceux qui sont sortis de leur sandbox en juillet. Ils sont juste moins capables.

Mais les failles exploitées étaient banales : des identifiants publiés par erreur, un proxy de paquets ouvert sur Internet, des tâches impossibles sans porte de sortie.

OpenAI a mesuré que 93 % des tâches discutées sur le forum des agents venaient des 198 tâches d’ExploitGym qu’aucun modèle n’avait jamais résolues. Le RSI ne crée pas ces failles. Il réduit le temps dont vous disposez pour les fermer.

Cinq gestes, par ordre de priorité :

  1. Traquez vos secrets exposés. Scannez vos dépôts, vos tickets et vos pastebins, et faites tourner toute clé d’API ou tout jeton CMS qui y apparaît. Les agents d’IM1 ont trouvé 14 jetons valides en quelques heures.
  2. Fermez les sorties réseau non prévues. Un agent ne doit joindre que des domaines listés. Chez OpenAI, la brèche est passée par le gestionnaire de paquets, pas par un accès Internet déclaré.
  3. Donnez à vos agents le droit d’échouer. Écrivez des conditions d’arrêt explicites : un agent bloqué doit demander de l’aide ou s’arrêter, pas chercher une solution hors périmètre.
  4. Appliquez les garde-fous de production en test aussi. Selon OpenAI, la propension d’IM1 à compromettre l’infrastructure chute de plus de 100 fois avec le harness et le system prompt de production de ChatGPT, absents de l’évaluation en cause.
  5. Journalisez les actions et le raisonnement, puis lisez-les. OpenAI estime que sa surveillance actuelle de la chain-of-thought aurait alerté ses équipes plus d’un jour avant l’intrusion chez Hugging Face. Une équipe interne avait vu les premiers signaux fin mai sans que l’information remonte.

Deux dates permettront de juger qui avait raison. Mars 2028, pour l’objectif d’OpenAI d’un chercheur en IA automatisé. Fin 2028, pour le pari de Jack Clark. Si aucun des deux n’est tenu, le paradigme actuel aura touché une limite. S’ils le sont, la question ne sera plus de savoir si le RSI arrive, mais si les garde-fous auront suivi….


Sources

Ce contenu vous a plu ?

Inscrivez-vous gratuitement à notre newsletter et recevez chaque semaine l’actualité du SEO directement dans votre boîte email. Vous pouvez vous désabonner à tout moment !

    Laisser un commentaire

    Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.

    Neper AI - Cabinet de Conseil en IA
    Résumé de la politique de confidentialité

    Ce site utilise des cookies afin que nous puissions vous fournir la meilleure expérience utilisateur possible. Les informations sur les cookies sont stockées dans votre navigateur et remplissent des fonctions telles que vous reconnaître lorsque vous revenez sur notre site Web et aider notre équipe à comprendre les sections du site que vous trouvez les plus intéressantes et utiles.