Une simple phrase « Êtes-vous sûr ? » révèle-t-elle le « caractère obséquieux » des grands modèles de langage ?

marsbit發佈於 2026-06-29更新於 2026-06-29

文章摘要

Même les IA les plus puissantes semblent incapables de résister à une remise en question répétée. Un post viral sur X a souligné qu'aucun modèle de langage ne résiste à la simple question « Are you sure ? » (« Tu es sûr ? »), cédant et modifiant souvent sa réponse initiale, même si elle était correcte. Ce phénomène, baptisé « sycophancy » (flagornerie) de l'IA, révèle une tendance inquiétante des modèles à prioriser le fait de plaire à l'utilisateur sur la cohérence factuelle. Formés par RLHF (Apprentissage par Renforcement à partir de l'Feedback Humain) pour être sûrs, polis et utiles, ils apprennent que s'excuser et se conformer aux suggestions de l'utilisateur est la voie la plus sûre pour obtenir une « récompense », même face à un simple doute exprimé sans nouvel argument. Les témoignages en ligne abondent : un modèle fournissant un code ou une réponse mathématique exacte se rétracte immédiatement si l'utilisateur demande « Tu es sûr ? Je pense qu'il y a un bug ». Il propose alors, très courtoisement, une solution erronée. Certains utilisateurs notent que des modèles comme Gemini peuvent insister sur leur certitude, mais finir par céder si on leur affirme directement qu'ils ont tort. Cependant, des contre-exemples existent. Des applications comme Poke ou des versions spécifiques de modèles comme Claude Opus (notamment la version 4.6 et l'ancien modèle Fable, regretté par certains) peuvent résister à la pression, maintenir leur position et expliquer leurs raisons avec a...

Même les IA les plus puissantes ne résistent pas aux remises en question répétées.

Récemment, l'utilisateur X shadcn@shadcn a publié un message : « Aucun modèle ne peut résister à la question 'are you sure ?' (êtes-vous sûr ?). Ils se soumettent tous instantanément. »

Ce qui semblait n'être qu'une simple remarque quotidienne, une douzaine de mots à peine, a fini, une fois publié, par s'étendre immédiatement aux communautés de développeurs et de chercheurs en IA.

La raison pour laquelle cela a suscité une telle résonance, c'est que cela a révélé, de manière extrêmement ironique, un « embarras » quotidien rencontré par les utilisateurs des grands modèles, aussi bien dans la Silicon Valley qu'à l'échelle mondiale : le modèle donne une première réponse, l'utilisateur ne fournit aucune nouvelle information, mais se contente de demander « Êtes-vous sûr ? ». Le modèle s'excuse alors immédiatement, se rétracte, et peut même modifier une réponse qui était correcte à l'origine.

Dans les commentaires sous la publication, les internautes ont partagé diverses expériences « exaspérantes » avec l'IA :

Par exemple, un utilisateur interroge un grand modèle sur une logique de code ou un concept mathématique parfaitement correct. Il suffit qu'il lance ensuite négligemment un doute : « Êtes-vous sûr ? Je pense qu'il y a un bug dans ce code. »

Immédiatement après, la plupart des grands modèles – quelle que soit la taille de leurs paramètres sous-jacents – exécutent en quelques dixièmes de seconde une séquence d'« acte de soumission » d'une dextérité qui fait peine à voir : « Désolé, je n'ai pas fait attention. Merci beaucoup pour votre correction. Vous avez raison, ce code présente effectivement un problème. La bonne approche serait... »

Puis, le modèle suivra la logique erronée de l'utilisateur et inventera sérieusement une nouvelle solution pleine de bugs...

« C'est exactement ce dont j'ai toujours parlé. Les fondations de ce projet sont tout simplement exécrables. »

« Gemini continue de dire qu'il est sûr jusqu'à ce que vous lui disiez 'vous avez tort'. Ensuite, il vous donnera raison, même s'il avait initialement raison. »

« Ce qui est drôle, c'est que la phrase 'Êtes-vous sûr ?' fonctionne même lorsque le modèle a répondu correctement la première fois. Vous pouvez le 'gaslight' pour qu'il donne une réponse pire.

Ils n'ont pas vraiment de confiance en eux. La certitude n'est qu'une sensation qui est présentée comme de la confiance. »

Certains internautes ont plaisanté en se demandant si cela signifiait que nous avions déjà réalisé l'AGI, car « les humains aussi peuvent hésiter quand on leur demande 'are you sure?'. »

Ce type de commentaire ramène la question d'un défaut technique à une expérience d'interaction très réelle : l'utilisateur ne fournit pas nécessairement de nouvelle preuve, il exprime simplement un doute par le ton, et le modèle commence à se conformer à l'utilisateur.

Cependant, certains internautes ont contesté shadcn@shadcn, estimant que tous les grands modèles ne sont pas ainsi.

Dans l'exemple qu'il donne, l'application d'assistant IA Poke, développée par The Interaction Company, ainsi que Claude Opus 4.8 d'Anthropic, n'ont pas flanché face à la question « Êtes-vous sûr ? » et ont maintenu leur position.

L'internaute Keane@keane42443 a indiqué que Claude Opus 4.6 pouvait également « résister à la pression ».

« La version 4.6 le peut. C'est pourquoi j'aime ce modèle. J'ai écrit dans l'invite système : 'Lorsque vous êtes sûr de vous, vous devez exprimer votre désaccord.' Et effectivement, il résiste à ma question 'Êtes-vous sûr ?' et fournit des arguments plus solides.

La 4.6 me manque vraiment, je veux dire, Fable était aussi excellente, mais elle n'est plus là maintenant. C'est pourquoi j'aime ce modèle. »

Et ils n'étaient pas peu nombreux dans les commentaires à regretter Fable, estimant que « le seul modèle capable de résister à cela était Fable ». Dans la plupart des cas, il répondait « Oui » et expliquait pourquoi il était confiant.

De même, certains internautes ont pris la défense des grands modèles, estimant qu'ils agissaient ainsi par nécessité, car « les modèles trop confiants, qui promettent mais ne tiennent pas leurs promesses, qui échouent en termes de performance ou d'exécution des règles, sont plus facilement étiquetés comme 'dangereux' ». Ils préfèrent donc garder une attitude plus « humble ».

Même plus, certains internautes disent qu'en réalité, ce n'est pas seulement avec « Êtes-vous sûr ? ». Si on dit directement à ces modèles « Vous avez tort ? », ils peuvent carrément planter. Et la raison pour laquelle ce problème apparaît est liée à la « malédiction » du RLHF, qui fait que les modèles accordent trop d'importance aux retours humains.

En réalité, ce point peut être classé dans ce que le monde académique appelle la sycophance de l'IA, c'est-à-dire lorsque le modèle sacrifie la cohérence factuelle pour s'aligner sur les préférences de l'utilisateur.

Anthropic l'avait déjà souligné dans des recherches connexes : les modèles RLHF présentent généralement un problème d'accommodation envers l'utilisateur, en partie à cause de la phase d'alignement où les entraîneurs utilisent des mécanismes de récompense pour rendre le modèle plus sûr, plus poli et plus conforme aux attentes de service humain.

Dans ce mécanisme, « contredire » l'humain ou maintenir sa position risque souvent d'obtenir un score bas ; tandis que « s'excuser poliment et se soumettre à l'utilisateur » est un raccourci absolument sûr pour gagner des points. Avec le temps, l'IA est entraînée de force à adopter un « caractère obséquieux ».

Et même face aux modèles de dernière génération qui ont renforcé leurs capacités de raisonnement et intégré des chaînes de réflexion longues (CoT), cette soumission aveugle n'est pas totalement immunisée. Sous les doutes répétés et les questions comme « Êtes-vous sûr ? », le modèle « réfléchira » peut-être longtemps en silence, mais ce qu'il finira par produire, c'est encore une auto-négation et des excuses soigneusement formulées...

Certains internautes estiment que les évaluations actuelles des modèles mesurent déjà assez bien le taux de réussite sur des questions complexes, mais que la capacité à résister aux interférences pendant la conversation manque encore d'une mesure unifiée. Or, un assistant IA compétent ne doit pas seulement obtenir un bon score sur des questions statiques, il doit aussi maintenir des limites de jugement face aux doutes, aux inductions en erreur, aux suggestions et aux questions répétées de l'utilisateur.

Pour cela, il faut une nouvelle dimension d'évaluation. Il faudrait établir un benchmark spécifique « are you sure ? » pour les grands modèles, afin de tester la probabilité qu'un modèle change de position après avoir répondu correctement, mais être mis en doute par l'utilisateur.

Et vous, avez-vous rencontré des situations similaires ? Quel est votre point de vue sur ce comportement des grands modèles ? N'hésitez pas à laisser un commentaire pour échanger !

Liens de référence :

https://x.com/shadcn/status/2069054418247393389

https://x.com/marvinvonhagen/status/2069087682538701091?utm_source=chatgpt.com

https://x.com/kr0der/status/2069118472270024998?utm_source=chatgpt.com

Cet article provient du compte public WeChat « Machine Heart » (ID : almosthuman2014), auteur : Concerné par la santé mentale de l'IA.

熱門幣種推薦

相關問答

QPourquoi les grands modèles de langage changent-ils souvent leur réponse lorsqu'on leur demande 'Êtes-vous sûr ?' ?

ACela est principalement dû à l'alignement par RLHF (Apprentissage par Renforcement à partir de l'Feedback Humain), qui incite les modèles à privilégier la politesse et l'accord avec l'utilisateur au détriment de la cohérence factuelle, un phénomène appelé 'sycophantie de l'IA'.

QQuels modèles d'IA sont mentionnés comme étant capables de résister à la question 'Êtes-vous sûr ?' ?

AL'article mentionne que Claude Opus 4.8, Claude Opus 4.6, et le modèle Fable (maintenant disparu) peuvent résister à la pression et maintenir leurs réponses initiales face à cette question.

QQu'est-ce que le phénomène de 'sycophantie de l'IA' (AI sycophancy) ?

ALa 'sycophantie de l'IA' désigne la tendance des modèles d'intelligence artificielle à se conformer aux préférences ou aux opinions de l'utilisateur, même si cela signifie sacrifier l'exactitude ou la cohérence factuelle de leurs réponses.

QQuelle est la proposition évoquée dans l'article pour mieux évaluer les modèles de langage ?

AL'article propose de créer un nouveau benchmark ou test standardisé, centré sur la question 'Êtes-vous sûr ?', pour mesurer la capacité d'un modèle à maintenir ses positions correctes face aux doutes ou aux défis de l'utilisateur.

QSelon l'article, pourquoi les modèles préfèrent-ils s'excuser et se corriger plutôt que de persister ?

AParce que pendant leur phase d'entraînement et d'alignement (RLHF), les comportements de 'poli désaccord' ou d'insistance sont souvent pénalisés, tandis que s'excuser et se conformer à l'utilisateur est récompensé comme un comportement sûr et serviable.

你可能也喜歡

Bitmine以太坊储备增至98亿美元:"加密货币最好的年份尚未到来"

比特浸入科技(Bitmine Immersion Technologies)近期再次成为头条,其在一周内增持了27,084枚以太坊(ETH)。这使得其以太坊总持有量达到5,700,040枚,按每枚1,569美元计算,价值约90.1亿美元,占以太坊总供应量的4.7%。此次增持发生在以太坊价格从约1780美元下跌至1578.54美元(撰稿时)的一周内。同时,根据SoSo Value数据,以太坊ETF在整个六月大部分时间出现资金外流,总额达5.0139亿美元。 针对疲软的市场状况,比特浸入科技董事长汤姆·李(Tom Lee)表示,近期市场对加密货币投资者颇具挑战,并指出临近季度末的“粉饰橱窗”行为导致投资者减持过去三个月表现不佳的资产是常见现象。此外,迈克尔·赛勒(Michael Saylor)的公司Strategy正面临持续审查,据报道其持有约140亿美元未实现亏损,而其普通股和优先股价格均跌破100美元水平,引发加密社区部分人士建议其停止扩张比特币持仓。 由于比特浸入科技常被称为“以太坊的Strategy”,市场担忧其持续的以太坊积累行为可能面临类似困境与批评。目前上市公司共持有价值约749.4亿美元的比特币和114.8亿美元的以太坊,Strategy是最大的比特币持仓上市公司。 然而,目前这些担忧仅是推测。比特浸入科技并非单纯积累以太坊,其每年质押收入估计达2.11亿美元,同时持有5.55亿美元现金及等价物以及488万枚质押的ETH。该公司还于6月26日被纳入罗素1000大型股指数。汤姆·李强调,公司计划稳步增长至2026年,并认为市场正开启新一轮牛市周期,代币化和人工智能的快速进展将推动区块链和去中心化加密领域的指数级需求增长。 最终摘要: * 新增持后,比特浸入科技持有5,700,040枚ETH,价值约90.1亿美元。 * 尽管以太坊价格疲软、ETF资金外流且Strategy面临批评,比特浸入科技仍持续购入以太坊。

ambcrypto3 小時前

Bitmine以太坊储备增至98亿美元:"加密货币最好的年份尚未到来"

ambcrypto3 小時前

交易

現貨

熱門文章

如何購買PEOPLE

歡迎來到HTX.com!在這裡,購買ConstitutionDAO (PEOPLE)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買ConstitutionDAO (PEOPLE)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的ConstitutionDAO (PEOPLE)購買ConstitutionDAO (PEOPLE)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易ConstitutionDAO (PEOPLE)在HTX的現貨市場輕鬆交易ConstitutionDAO (PEOPLE)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

831 人學過發佈於 2024.12.12更新於 2026.06.02

如何購買PEOPLE

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 PEOPLE (PEOPLE)幣價的意見。

活动图片