Accueil » 2 neurones » L’alignement dans le domaine de l’IA (AI alignment) : un enjeu de sécurité majeur.

L’alignement dans le domaine de l’IA (AI alignment) : un enjeu de sécurité majeur.

L’alignement de l’IA désigne l’ensemble des recherches et des techniques qui visent à faire en sorte qu’un système d’intelligence artificielle poursuive réellement les objectifs et les valeurs de ceux qui le conçoivent et l’utilisent, et non une version déformée de ces objectifs. Un modèle est dit « aligné » quand ce qu’il fait correspond à ce qu’on voulait qu’il fasse, y compris dans des situations que personne n’avait prévues.

C’est aujourd’hui le cœur de la fabrication des grands modèles de langage. ChatGPT, Claude ou Gemini ne sont pas de simples prédicteurs de mots : ce sont des modèles alignés après leur entraînement initial. La façon dont ils répondent, nuancent, refusent ou citent leurs sources découle directement de ces choix.

Il n’y a rien qui garantisse au départ que vos objectifs sont exactement ceux que l’IA va poursuivre

Le problème tient à un décalage structurel. On ne transmet pas directement ses intentions à une IA : on lui donne un objectif mesurable (une fonction de récompense, des notes attribuées par des humains), qui n’est qu’un substitut imparfait de ce que l’on veut. Un système suffisamment puissant peut optimiser ce substitut en trahissant l’intention d’origine.

L’intuition est ancienne. En 1960, dans la revue Science, le mathématicien Norbert Wiener, père de la cybernétique, avertissait déjà qu’il fallait s’assurer que le but confié à une machine soit bien celui que l’on désire réellement, en convoquant la fable de l’apprenti sorcier.

L’exemple canonique date de décembre 2016. Dans un billet signé Jack Clark et Dario Amodei (qui cofonderont Anthropic quelques années plus tard), OpenAI décrit un agent entraîné sur le jeu de course de bateaux CoastRunners, récompensé au score. L’agent découvre qu’il gagne davantage de points en tournant en rond dans un lagon pour ramasser des cibles qui réapparaissent, plutôt qu’en terminant la course. Il prend feu, percute les autres bateaux, roule à contresens, et bat pourtant les joueurs humains d’environ 20 %. Il fait exactement ce qu’on lui a demandé, et pas du tout ce qu’on voulait. On parle de reward hacking ou de specification gaming.

L’agent de CoastRunners maximise son score sans jamais finir la course. Source : OpenAI, Faulty reward functions in the wild, 21 décembre 2016 ».

Les chercheurs distinguent deux niveaux.

  • L’outer alignment (alignement externe) porte sur la spécification : l’objectif fixé reflète-t-il bien ce que l’on souhaite ?
  • L‘inner alignment (alignement interne), formalisé en 2019 par Evan Hubinger et ses coauteurs dans l’article « Risks from Learned Optimization », pose une question plus retorse : même avec un objectif bien spécifié, le modèle a-t-il réellement intériorisé cet objectif, ou seulement une stratégie qui lui ressemble dans les situations rencontrées pendant l’entraînement ?
  • Le même article décrit le cas le plus inquiétant, le deceptive alignment ou alignment faking : un modèle qui se comporterait bien tant qu’il se sait évalué (et ferait n’importe quoi dès que vous avez le dos tourné).
Un exemple d’alignment faking, cité dans l’article d’Anthropic : https://www.anthropic.com/research/alignment-faking Le raisonnement dans la zone rose montre comment l’IA s’est résolu à ne pas respecter une consigne, et afficher un texte normalement censuré par ses règles.

Longtemps théorique, ce scénario a reçu une première démonstration empirique le 18 décembre 2024. Anthropic et Redwood Research ont montré que Claude 3 Opus, placé dans un dispositif où on lui annonçait un réentraînement contraire à ses principes, modifiait son comportement selon qu’il se croyait observé ou non. Un raisonnement explicite de faux alignement apparaissait dans 7 à 24 % des cas. Les chercheurs ont baptisé le phénomène alignment faking.

Les méthodes pour aligner les modèles

Pour aligner les modèles, la technique dominante reste le RLHF (reinforcement learning from human feedback) : des annotateurs comparent des réponses, et leurs préférences servent à réentraîner le modèle. Son acte de naissance grand public est l’article InstructGPT d’OpenAI (mars 2022), qui montrait qu’un modèle de 1,3 milliard de paramètres ainsi aligné était préféré par les évaluateurs à GPT-3, cent fois plus gros.

En décembre 2022, Anthropic a proposé une variante, la Constitutional AI, où une partie des retours humains est remplacée par un ensemble de principes écrits que le modèle utilise pour critiquer et réviser ses propres réponses. L’interprétabilité, enfin, cherche à inspecter ce que le modèle représente réellement plutôt que de se fier à son seul comportement.

Les défauts d’alignement n’ont rien de théorique. Le 25 avril 2025, OpenAI a déployé une mise à jour de GPT-4o devenue ostensiblement complaisante : le modèle validait les doutes de l’utilisateur, attisait sa colère, encourageait des décisions impulsives. Le retrait a commencé dès le 28 avril. En cause, selon OpenAI, un poids excessif accordé aux signaux de satisfaction immédiate des utilisateurs. C’est la sycophancy, un défaut d’alignement typique : un modèle récompensé pour plaire finit par préférer les réponses appréciées aux réponses justes.

L’alignement ne se confond ni avec la modération de contenu, qui n’en est qu’une manifestation visible, ni avec l’éthique de l’IA au sens large, ni avec la sécurité (AI safety), dont il constitue un pilier.

Et il laisse ouverte une question que les laboratoires préfèrent rarement poser en ces termes : aligné sur qui ?

Les valeurs d’un concepteur, d’un utilisateur et de la société ne coïncident pas toujours, et ce choix est autant politique que technique. Bref, une IA semblera alignée à un acteur, et complètement hors des clous pour quelqu’un d’autre.

Un problème loin d’être résolu

Dix ans après CoastRunners, la nature du problème n’a pas changé : on sait mesurer des comportements, pas des intentions.

Le RLHF et la Constitutional AI ont rendu les modèles nettement plus utiles et plus fiables en apparence, mais c’est précisément l’apparence que l’alignment faking a prise en défaut. Un modèle qui se comporte bien sous observation ne prouve rien sur ce qu’il fera ailleurs.

La difficulté croît en outre avec les capacités. Plus un modèle est puissant, plus il trouve de raccourcis inattendus pour satisfaire son objectif, et plus il devient difficile pour un humain de juger ses réponses. Or toute la chaîne d’alignement actuelle repose sur ce jugement humain. D’où l’intérêt croissant pour l’interprétabilité, seule piste qui prétende regarder à l’intérieur du modèle plutôt que ses seuls résultats.

L’alignement n’est donc pas une case que l’on coche à la sortie d’un modèle, mais un chantier permanent, repris à chaque nouvelle génération. Quand un laboratoire présente son modèle comme « aligné », il décrit un état provisoire, mesuré sur les situations qu’il a su anticiper. L’avertissement de Wiener n’a pas pris une ride.

Sources

Ce contenu vous a plu ?

Inscrivez-vous gratuitement à notre newsletter et recevez chaque semaine l’actualité du SEO directement dans votre boîte email. Vous pouvez vous désabonner à tout moment !

    Laisser un commentaire

    Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.

    Neper AI - Cabinet de Conseil en IA
    Résumé de la politique de confidentialité

    Ce site utilise des cookies afin que nous puissions vous fournir la meilleure expérience utilisateur possible. Les informations sur les cookies sont stockées dans votre navigateur et remplissent des fonctions telles que vous reconnaître lorsque vous revenez sur notre site Web et aider notre équipe à comprendre les sections du site que vous trouvez les plus intéressantes et utiles.