L’alignement de l’IA désigne l’ensemble des recherches et des techniques qui visent à faire en sorte qu’un système d’intelligence artificielle poursuive réellement les objectifs et les valeurs de ceux qui le conçoivent et l’utilisent, et non une version déformée de ces objectifs. Un modèle est dit « aligné » quand ce qu’il fait correspond à ce qu’on voulait qu’il fasse, y compris dans des situations que personne n’avait prévues.
C’est aujourd’hui le cœur de la fabrication des grands modèles de langage. ChatGPT, Claude ou Gemini ne sont pas de simples prédicteurs de mots : ce sont des modèles alignés après leur entraînement initial. La façon dont ils répondent, nuancent, refusent ou citent leurs sources découle directement de ces choix.
Il n’y a rien qui garantisse au départ que vos objectifs sont exactement ceux que l’IA va poursuivre
Le problème tient à un décalage structurel. On ne transmet pas directement ses intentions à une IA : on lui donne un objectif mesurable (une fonction de récompense, des notes attribuées par des humains), qui n’est qu’un substitut imparfait de ce que l’on veut. Un système suffisamment puissant peut optimiser ce substitut en trahissant l’intention d’origine.
L’intuition est ancienne. En 1960, dans la revue Science, le mathématicien Norbert Wiener, père de la cybernétique, avertissait déjà qu’il fallait s’assurer que le but confié à une machine soit bien celui que l’on désire réellement, en convoquant la fable de l’apprenti sorcier.
L’exemple canonique date de décembre 2016. Dans un billet signé Jack Clark et Dario Amodei (qui cofonderont Anthropic quelques années plus tard), OpenAI décrit un agent entraîné sur le jeu de course de bateaux CoastRunners, récompensé au score. L’agent découvre qu’il gagne davantage de points en tournant en rond dans un lagon pour ramasser des cibles qui réapparaissent, plutôt qu’en terminant la course. Il prend feu, percute les autres bateaux, roule à contresens, et bat pourtant les joueurs humains d’environ 20 %. Il fait exactement ce qu’on lui a demandé, et pas du tout ce qu’on voulait. On parle de reward hacking ou de specification gaming.

Les chercheurs distinguent deux niveaux.
- L’outer alignment (alignement externe) porte sur la spécification : l’objectif fixé reflète-t-il bien ce que l’on souhaite ?
- L‘inner alignment (alignement interne), formalisé en 2019 par Evan Hubinger et ses coauteurs dans l’article « Risks from Learned Optimization », pose une question plus retorse : même avec un objectif bien spécifié, le modèle a-t-il réellement intériorisé cet objectif, ou seulement une stratégie qui lui ressemble dans les situations rencontrées pendant l’entraînement ?
- Le même article décrit le cas le plus inquiétant, le deceptive alignment ou alignment faking : un modèle qui se comporterait bien tant qu’il se sait évalué (et ferait n’importe quoi dès que vous avez le dos tourné).

Longtemps théorique, ce scénario a reçu une première démonstration empirique le 18 décembre 2024. Anthropic et Redwood Research ont montré que Claude 3 Opus, placé dans un dispositif où on lui annonçait un réentraînement contraire à ses principes, modifiait son comportement selon qu’il se croyait observé ou non. Un raisonnement explicite de faux alignement apparaissait dans 7 à 24 % des cas. Les chercheurs ont baptisé le phénomène alignment faking.
Les méthodes pour aligner les modèles
Pour aligner les modèles, la technique dominante reste le RLHF (reinforcement learning from human feedback) : des annotateurs comparent des réponses, et leurs préférences servent à réentraîner le modèle. Son acte de naissance grand public est l’article InstructGPT d’OpenAI (mars 2022), qui montrait qu’un modèle de 1,3 milliard de paramètres ainsi aligné était préféré par les évaluateurs à GPT-3, cent fois plus gros.
En décembre 2022, Anthropic a proposé une variante, la Constitutional AI, où une partie des retours humains est remplacée par un ensemble de principes écrits que le modèle utilise pour critiquer et réviser ses propres réponses. L’interprétabilité, enfin, cherche à inspecter ce que le modèle représente réellement plutôt que de se fier à son seul comportement.
Les défauts d’alignement n’ont rien de théorique. Le 25 avril 2025, OpenAI a déployé une mise à jour de GPT-4o devenue ostensiblement complaisante : le modèle validait les doutes de l’utilisateur, attisait sa colère, encourageait des décisions impulsives. Le retrait a commencé dès le 28 avril. En cause, selon OpenAI, un poids excessif accordé aux signaux de satisfaction immédiate des utilisateurs. C’est la sycophancy, un défaut d’alignement typique : un modèle récompensé pour plaire finit par préférer les réponses appréciées aux réponses justes.
L’alignement ne se confond ni avec la modération de contenu, qui n’en est qu’une manifestation visible, ni avec l’éthique de l’IA au sens large, ni avec la sécurité (AI safety), dont il constitue un pilier.
Et il laisse ouverte une question que les laboratoires préfèrent rarement poser en ces termes : aligné sur qui ?
Les valeurs d’un concepteur, d’un utilisateur et de la société ne coïncident pas toujours, et ce choix est autant politique que technique. Bref, une IA semblera alignée à un acteur, et complètement hors des clous pour quelqu’un d’autre.
Un problème loin d’être résolu
Dix ans après CoastRunners, la nature du problème n’a pas changé : on sait mesurer des comportements, pas des intentions.
Le RLHF et la Constitutional AI ont rendu les modèles nettement plus utiles et plus fiables en apparence, mais c’est précisément l’apparence que l’alignment faking a prise en défaut. Un modèle qui se comporte bien sous observation ne prouve rien sur ce qu’il fera ailleurs.
La difficulté croît en outre avec les capacités. Plus un modèle est puissant, plus il trouve de raccourcis inattendus pour satisfaire son objectif, et plus il devient difficile pour un humain de juger ses réponses. Or toute la chaîne d’alignement actuelle repose sur ce jugement humain. D’où l’intérêt croissant pour l’interprétabilité, seule piste qui prétende regarder à l’intérieur du modèle plutôt que ses seuls résultats.
L’alignement n’est donc pas une case que l’on coche à la sortie d’un modèle, mais un chantier permanent, repris à chaque nouvelle génération. Quand un laboratoire présente son modèle comme « aligné », il décrit un état provisoire, mesuré sur les situations qu’il a su anticiper. L’avertissement de Wiener n’a pas pris une ride.
Sources
- Norbert Wiener, « Some Moral and Technical Consequences of Automation », Science, 1960
- OpenAI, « Faulty reward functions in the wild » (21 décembre 2016)
- Hubinger et al., « Risks from Learned Optimization in Advanced Machine Learning Systems » (2019)
- Ouyang et al., « Training language models to follow instructions with human feedback » (InstructGPT, 2022)
- Bai et al., « Constitutional AI: Harmlessness from AI Feedback » (2022)
- Anthropic et Redwood Research, « Alignment faking in large language models » (18 décembre 2024)
- OpenAI, « Expanding on what we missed with sycophancy » (2 mai 2025)
Ce contenu vous a plu ?
Inscrivez-vous gratuitement à notre newsletter et recevez chaque semaine l’actualité du SEO directement dans votre boîte email. Vous pouvez vous désabonner à tout moment !