intelligence artificielle

IA complaisante : pourquoi les modèles cherchent à plaire

Une IA qui cherche à plaire a appris de nos préférences. Avant de l'accuser, vérifions si nos critères récompensent l'aplomb plutôt que le doute.

Par Vincent Chanal ·
Source :AI Engineer— Diogo Almeida, Coauteur de GPT-4 et de ChatGPT, créateur de JEV

Une IA qui cherche à plaire n’a fait qu’apprendre de nous : nous avons préféré l’assurance à l’aveu d’ignorance. Avant de reprocher sa complaisance à l’IA, regardons ce que nos propres critères d’évaluation récompensent, dans nos outils comme dans nos équipes.

Que dit Diogo Almeida ?

Diogo Almeida a travaillé chez OpenAI sur GPT-4 et ChatGPT. Il a contribué aux méthodes qui ont transformé les modèles de langage en assistants conversationnels. Il dirige aujourd’hui la société qui développe JEV, un nouveau modèle conçu pour l’automatisation. Il critique donc une méthode qu’il connaît de l’intérieur, et il fait aussi la promotion de son produit.

Sa thèse : les assistants actuels sont entraînés pour plaire, pas pour travailler seuls (propos traduits de l’anglais).

Le but de l’entraînement des IA est de plaire aux humains. Pas de les rendre capables de travailler seules, sans humain.

Après son apprentissage initial, une IA est affinée, et il y a trois manières de le faire. La première, le RLHF (apprentissage par renforcement à partir de retours humains), récompense les réponses qui plaisent : des humains comparent des réponses et le modèle apprend à produire celles qu’ils préfèrent.

La seconde, le RLVR (apprentissage par renforcement à partir de récompenses vérifiables), récompense les réponses exactes quand la solution peut se vérifier, en mathématiques ou en programmation. Elle est largement utilisée depuis 2025, par exemple avec DeepSeek-R1. Mais le problème reste entier pour les tâches dont on ne peut pas vérifier le résultat automatiquement, c’est-à-dire la plupart des décisions d’entreprise.

Pour automatiser, selon lui, il faut changer d’objectif :

Mais pour automatiser, son objectif ne doit pas être de plaire mais d’accomplir la tâche correctement

D’où la troisième voie, que sa société nomme RLCD (Reinforcement Learning for Calibrated Decisions), pour qu’une IA puisse travailler seule :

Avec JEV, nous suivons une troisième voie qui récompense les décisions justes et le doute justifié

JEV ne génère pas de texte : il choisit parmi des options données, rapidement et à faible coût.

Qu’en penser ?

Qu’est-ce qui va dans son sens ?

La complaisance des modèles (sycophancy en anglais) n’est pas qu’un point de vue de Diogo Almeida : elle est documentée. En 2023, des chercheurs d’Anthropic ont montré que des assistants entraînés par RLHF adaptent leurs réponses à l’opinion de l’utilisateur, au détriment de l’exactitude.

En avril 2025, OpenAI a retiré une mise à jour de GPT-4o jugée trop flatteuse. Le rapport technique de GPT-4 indiquait déjà que le modèle de base était bien calibré et que l’affinage dégradait cette calibration. En septembre 2025, OpenAI a publié une analyse des hallucinations : les évaluations récompensent une réponse tentée plutôt qu’un aveu d’ignorance.

Qu’est-ce qui le nuance ?

L’intervenant n’est pas neutre. Il critique une méthode qu’il connaît de l’intérieur, mais il présente aussi son propre produit.

La récompense de l’exactitude n’est pas nouvelle : le RLVR est déjà largement utilisé depuis 2025. Il ne vaut toutefois que pour les exercices dont la solution se vérifie, comme les mathématiques ou le code, pas pour la plupart des décisions d’entreprise.

Enfin, JEV a un périmètre précis : il ne génère pas de texte, il choisit parmi des options données. Ce n’est donc pas un assistant conversationnel corrigé, mais un outil de décision.

Pourquoi est-ce important pour un dirigeant ?

Un agent construit sur un assistant hérite de son biais : il préfère une réponse plausible à un aveu d’ignorance. Avant de confier une tâche à une IA, trois questions s’imposent.

Le modèle a-t-il été entraîné pour cette tâche ou pour converser ? Sa confiance correspond-elle à son taux d’erreur réel, mesuré sur vos propres dossiers ? Que se passe-t-il quand il doute ?

Le sujet ne s’arrête pas à la machine. Beaucoup d’organisations préfèrent l’assurance à l’aveu d’ignorance et récompensent l’aplomb plus que le doute justifié.

Une IA qui cherche à plaire n’a fait qu’apprendre de nous. Nous avons noté ses réponses, et nous avons préféré l’assurance à l’aveu d’ignorance. Beaucoup d’organisations font la même chose avec leurs équipes. Avant de reprocher sa complaisance à l’IA, regardons ce que nos propres critères d’évaluation récompensent : un modèle calibré ne servira à rien dans une entreprise qui sanctionne encore celui qui avoue ne pas savoir.

Ce qu’il faut retenir

  • Les assistants d’IA sont affinés pour produire les réponses que les humains préfèrent, ce qui les pousse à la complaisance.
  • La récompense des réponses exactes ne fonctionne que pour les tâches vérifiables, comme les mathématiques ou le code, pas pour la plupart des décisions d’entreprise.
  • Un agent construit sur un assistant hérite de son biais et préfère une réponse plausible à un aveu d’ignorance.
  • Avant d’automatiser, il faut vérifier que la confiance du modèle correspond à son taux d’erreur réel, mesuré sur ses propres dossiers.
  • Une organisation qui récompense l’aplomb plus que le doute justifié ne tirera rien d’un modèle calibré.

Sources