Un article d'ingénierie des prompts accepté à l'ICML 2026, la polémique fait rage en ligne

marsbitXuất bản vào 2026-07-15Cập nhật gần nhất vào 2026-07-15

Tóm tắt

Le papier intitulé "Verbalized Sampling" (VS), accepté à ICML 2026, suscite un vif débat. Sa proposition centrale est simple : en modifiant simplement l'invite (prompt) pour demander à un LLM de générer des réponses tout en verbalisant leurs probabilités estimées, on peut significativement augmenter la diversité des sorties et atténuer l'effondrement des modes (mode collapse), un problème récurrent où les modèles produisent des réponses trop conventionnelles. Les auteurs attribuent la racine du problème non pas aux algorithmes d'alignement, mais à un "biais de typicalité" dans les données de préférence humaines utilisées pour l'entraînement, qui favorisent les réponses familières. Leur méthode, testée sur plusieurs modèles et ensembles de données, multiplierait la diversité par 1,6 à 2,1 dans des tâches créatives sans nuire à l'exactitude ou à la sécurité. Sur Reddit, les réactions sont partagées. Les critiques soulignent que l'idée semble triviale, manque de robustesse théorique par rapport à une nouvelle méthode algorithmique, et pourrait relever de la suroptimisation expérimentale. Les défenseurs rétorquent que la recherche valable ne se juge pas à sa complexité, mais à sa rigueur, sa reproductibilité et l'importance de son insight – ici, identifier la cause profonde du problème. Ils comparent cela à l'émergence du "Chain-of-Thought" (CoT), une simple invite devenue un champ de recherche fondamental. Le débat reflète une évolution potentielle de la discipline, où l'ingén...

De nos jours, on peut publier un article sur l'ingénierie des prompts à l'ICML ???

Récemment, un internaute a partagé sur Reddit un article venant d'être accepté pour l'ICML 2026. Le post est immédiatement devenu viral, et le nombre de commentaires a explosé.

Mais tout le monde était perplexe : C'est possible ?

Sans proposer de nouvel algorithme d'optimisation, ni avoir entraîné un nouveau grand modèle, les auteurs n'ont fait qu'une chose —

Modifier le Prompt.

L'article propose une méthode appelée Verbalized Sampling (VS) qui, simplement en ajustant l'instruction, permet d'améliorer significativement la diversité des sorties des grands modèles de langage, atténuant ainsi le problème de Mode Collapse (effondrement des modes) qui perturbe depuis longtemps les LLM.

Cela semble présenter une valeur pratique considérable, mais est-il juste qu'une simple astuce de Prompt puisse être acceptée dans une conférence prestigieuse ?

Examinons d'abord l'article avant de juger.

Un article ICML très controversé

Avez-vous déjà eu cette impression que l'IA devient de plus en plus homogène ?

Demandez-lui dix fois de « raconter une blague », les réponses sont souvent très similaires. Et ce n'est pas seulement le cas pour les tâches créatives, mais aussi pour répondre aux questions, générer du code...

Ce phénomène est connu dans le milieu universitaire sous le nom d'effondrement des modes.

En bref, le modèle a tendance à privilégier les réponses classiques, les plus probables et les plus sûres, et à rejeter les idées créatives alternatives.

Par le passé, pour résoudre ce problème, la plupart des chercheurs pensaient d'abord à ajuster les paramètres d'échantillonnage, modifier les algorithmes de décodage, ré-entraîner, etc. Mais cet article prend une voie différente : il demande directement au modèle de sortir également son propre processus d'échantillonnage.

Par exemple, reprenons la blague précédente. Les auteurs modifient l'instruction pour demander au modèle :

Génère 5 blagues, et attribue une valeur de probabilité possible à chaque blague.

Le modèle peut alors produire des réponses plus riches et moins répétitives.

Cela semble très simple, et c'est en fait la contribution principale de cet article — la méthode d'échantillonnage verbalisé des probabilités. Pas besoin de fine-tuning, il suffit de changer la façon de poser la question pour augmenter considérablement la diversité du contenu.

Cependant, dans l'article, les auteurs appuient cette idée par un processus de démonstration rigoureux.

Ils répondent d'abord à la cause fondamentale de l'uniformité des modèles.

Par le passé, le milieu académique attribuait ce problème à des facteurs algorithmiques, comme un modèle de récompense imparfait ou une pénalité KL mal calibrée. Cet article approfondit l'investigation et estime que la véritable racine du problème réside dans les données de préférence elles-mêmes.

Ils proposent le concept de biais de typicalité. Du point de vue de la psychologie cognitive, les annotateurs humains ont une préférence naturelle pour les textes familiers, fluides et conventionnels. Lorsqu'ils attribuent des scores, ils donnent naturellement des notes plus élevées aux réponses stéréotypées et grand public.

Ainsi, même avec un modèle de récompense et un algorithme d'optimisation parfaits, si les données de préférence humaine utilisées pour l'entraînement contiennent un biais de typicalité, le modèle aligné souffrira toujours d'un effondrement des modes.

Pour vérifier cela, les auteurs ont effectué des tests répétés sur cinq ensembles de données de préférence et différents modèles de base, et la conclusion est restée cohérente.

Après avoir compris ce point, les auteurs estiment que puisque le problème est enraciné dans les données d'entraînement, il suffit de concevoir une solution au niveau de l'inférence pour le corriger. Ainsi, en demandant dans le Prompt au modèle de produire une distribution de probabilité complète, on peut réveiller la distribution de sortie plurielle que le modèle possédait originellement pendant la phase de pré-entraînement, et retrouver la diversité.

Il ne restait plus qu'à tester cette méthode dans divers scénarios. Les résultats montrent que dans les tâches d'écriture créative, la diversité est 1,6 à 2,1 fois supérieure à celle d'un prompt standard, sans pour autant réduire la précision factuelle du contenu ou le niveau de sécurité du modèle.

De plus, plus le modèle est puissant et plus son nombre de paramètres est élevé, plus l'amélioration de la diversité apportée par la VS est importante.

Ainsi, même si la méthode proposée dans cet article est finalement simple, l'ICML l'a tout de même acceptée.

La polémique fait rage sur Reddit

Mais sous le post original, les avis sur cet article sont partagés.

De nombreux internautes estiment qu'auparavant, l'ICML était réservée à des innovations techniques comme de nouveaux modèles, algorithmes ou théories. Se concentrer uniquement sur le Prompt et l'optimisation du processus d'inférence ne correspond pas à une recherche sérieuse en apprentissage automatique.

En comparaison, l'innovation de ce travail semble un peu légère et présente plusieurs problèmes :

Premièrement, des méthodes similaires d'écriture d'instructions ne sont pas uniques, certains affirmant même qu'ils écrivaient déjà leurs prompts de cette façon hier. Deuxièmement, la théorie n'est pas facile à vérifier, car un prompt peut devenir inefficace avec un autre modèle, contrairement à un algorithme plus stable. Troisièmement, l'échelle expérimentale est limitée, ce qui ne suffit pas à prouver qu'il s'agit d'une règle universelle.

Certains internautes comparent même la situation actuelle dans le domaine de l'apprentissage automatique à la crise académique qu'a traversée le milieu de la psychologie il y a une dizaine d'années.

À l'époque, de nombreux chercheurs avaient une faible base en statistiques et abusaient des outils statistiques, conduisant à des conclusions non reproductibles dans de nombreux articles et à une grave crise de confiance dans le secteur. Aujourd'hui, l'industrie de l'apprentissage automatique est aussi fortement dépendante des expériences empiriques et néglige souvent un soutien théorique rigoureux.

La concurrence interne pousse à la course aux nouvelles méthodes, mais il existe une tendance généralisée au surajustement des paramètres et à l'amélioration artificielle des scores sur des benchmarks. Beaucoup de prétendues innovations algorithmiques n'ont pratiquement aucune valeur pratique par rapport aux modèles de référence matures, et sont présentées comme des résultats innovants sur la base d'améliorations minimes d'indicateurs.

En substance, ces problèmes de publication d'articles sont dus au manque de clarté des normes professionnelles suite à l'expansion rapide de la discipline.

Mais les partisans estiment que la recherche scientifique ne consiste pas à comparer la complexité des méthodes. Tant que l'hypothèse est claire, les expériences sont suffisantes et les résultats sont stables et reproductibles, cela peut très bien constituer une recherche de qualité.

Par exemple, cet article explique clairement ce qu'est l'effondrement des modes et avance que le véritable problème réside dans le biais de typicalité des préférences. Ce point de vue est plus important que le Prompt lui-même.

L'un des auteurs a lui-même répondu dans les commentaires, indiquant que cet article, bien qu'apparemment simple, impliquait en réalité un processus de traitement très complexe.

L'ensemble du travail comprend une analyse complète de la source du problème, une nouvelle attribution théorique, une dérivation mathématique, des expériences quantitatives multidimensionnelles, ce n'est pas un travail superficiel de réglage de prompt.

Beaucoup ont également mentionné le CoT (Chain-of-Thought). Lorsque le CoT est apparu pour la première fois, il s'agissait essentiellement d'une simple instruction :

Réfléchissons étape par étape.

Mais aujourd'hui, presque toutes les méthodes de raisonnement peuvent être rattachées au CoT. Cela montre précisément que l'ingénierie des prompts n'est plus simplement l'écriture d'instructions ; elle devient une nouvelle méthode pour étudier le comportement des modèles.

Au cours des dix dernières années, la recherche en apprentissage automatique s'est principalement concentrée sur l'entraînement. Mais aujourd'hui, certaines techniques d'utilisation au stade de l'inférence commencent également à occuper une place centrale dans la recherche en apprentissage automatique.

Peut-être que dans les prochaines années, nous verrons de plus en plus d'articles de ce type. Ils n'ajoutent pas une seule ligne de code d'entraînement ni un seul paramètre de modèle, mais peuvent néanmoins repousser les limites des capacités des grands modèles.

Présentation de l'équipe de recherche

Enfin, jetons un coup d'œil à l'équipe de recherche.

Ce travail est le fruit d'une collaboration entre l'équipe de Weiyan Shi de la Northeastern University, le Manning Lab de Stanford et l'Université de Virginie-Occidentale. Jiayi Zhang, Simon Yu et Derek Chong sont les premiers auteurs conjoints.

Jiayi Zhang a obtenu son bachelor à l'Université du Michigan avec un triple diplôme en informatique, mathématiques et linguistique, puis a poursuivi un master en informatique à la Northeastern University.

Un autre de ses articles, accepté à la conférence NLP de premier plan NAACL 2024, intitulé « Analyzing the Role of Semantic Representations in the Era of Large Language Models », s'intéresse également aux représentations sémantiques et aux grands modèles de langage.

Simon Yu prépare actuellement un doctorat à la Northeastern University. Ses recherches portent principalement sur les mécanismes d'alignement et d'apprentissage par renforcement dans les grands modèles. Il a obtenu son master et son bachelor à l'Université d'Édimbourg et a publié plusieurs articles dans des conférences de premier plan.

En plus de cet article, un autre de ses articles, « Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents », a également été accepté pour l'ICML 2026.

Derek Chong est diplômé d'un master de l'Université de Stanford et est actuellement chercheur au Stanford Artificial Intelligence Laboratory. Ses recherches se concentrent principalement sur les grands modèles de langage et le NLP.

Il a trois ans d'expérience en tant que fondateur de startup et a travaillé en tant que scientifique appliqué chez Ello, participant au développement et à la mise en œuvre de l'IA dans l'industrie. Il possède donc à la fois des bases théoriques solides et une riche expérience pratique sur le terrain.

Références :[1]https://www.reddit.com/r/MachineLearning/comments/1uv1xb3/promptengineering_paper_accepted_to_icml_r/

[2]https://www.linkedin.com/in/jiayizx/[3]https://simonucl.github.io/[4]https://www.linkedin.com/in/derekch/

Cet article provient du compte WeChat « 量子位 » (Qubit), auteur : 关注前沿科技 (Suivre les technologies de pointe)

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QQuel est le nom de la méthode présentée dans l'article pour améliorer la diversité des sorties des grands modèles de langage ?

ALa méthode présentée s'appelle "Verbalized Sampling" (VS), qui consiste à ajuster les prompts pour que le modèle génère une distribution de probabilités complète, augmentant ainsi la diversité des réponses.

QPourquoi les réponses des modèles de langage deviennent-elles souvent similaires et répétitives selon l'article ?

ASelon l'article, cette tendance, appelée "effondrement modal" (Mode Collapse), est principalement due au biais de typicalité dans les données de préférence humaines utilisées pour l'entraînement, où les annotateurs favorisent inconsciemment des réponses familières et conventionnelles.

QQuel argument est avancé dans l'article pour justifier qu'une simple technique de prompt puisse mériter une publication dans une conférence prestigieuse comme l'ICML ?

AL'article souligne que le travail inclut une analyse théorique approfondie, une attribution causale (biais de typicalité), des dérivations mathématiques et des expériences quantitatives rigoureuses, dépassant le simple ajustement de prompt et offrant une contribution scientifique significative.

QQuelle analogie est faite par certains commentateurs en ligne concernant l'état actuel de la recherche en apprentissage automatique ?

ACertains commentateurs comparent la situation actuelle en apprentissage automatique à la crise de réplication qu'a connue la psychologie il y a une dizaine d'années, critiquant une dépendance excessive aux expériences empiriques et un manque de fondements théoriques rigoureux.

QQuel exemple historique de technique de prompt est cité dans l'article pour illustrer l'importance croissante de l'ingénierie des prompts ?

AL'article cite la méthode "Chain-of-Thought" (CoT), qui a débuté avec un simple prompt "Let's think step by step", comme exemple fondateur montrant que l'ingénierie des prompts est devenue une méthode de recherche cruciale pour comprendre et améliorer le comportement des modèles.

Nội dung Liên quan

Các trader Bitcoin thiệt hại 100 triệu USD do giá BTC giảm 3.000 USD trong 12 giờ

Vào ngày cuối cùng của tháng 7, giá Bitcoin đã giảm mạnh, mất gần 3.000 USD chỉ trong 12 giờ do biến động dữ dội, chạm mức thấp nhất trong hai tuần. Sự sụt giảm này đã đảo ngược xu hướng tăng trưởng trước đó, khiến mức tăng hàng tháng của BTC thu hẹp từ gần 10% xuống còn 4,5%. Vốn hóa thị trường của Bitcoin cũng giảm từ 1,3 nghìn tỷ USD xuống 1,26 nghìn tỷ USD. Trên thị trường phái sinh, các nhà giao dịch sử dụng đòn bẩy cao với vị thế mua (long) chịu tổn thất nặng nề. Dữ liệu cho thấy có tới 100 triệu USD vị thế mua bị thanh lý, cao gấp bốn lần so với ngày trước đó. Tổng cộng, gần 360 triệu USD các vị thế đòn bẩy trong toàn bộ thị trường tiền điện tử đã bị xóa sổ, trong đó vị thế mua chiếm 65%. Một yếu tố chính ảnh hưởng đến tâm lý thị trường là sự chậm trễ trong quá trình lập pháp ở Mỹ. Dự luật CLARITY Act, được kỳ vọng sẽ cung cấp khuôn khổ pháp lý rõ ràng cho ngành công nghiệp tiền điện tử, đang bị tắc nghẽn tại Thượng viện. Việc thiếu tiến triển này khiến xác suất dự luật được thông qua vào năm 2026 giảm mạnh từ hơn 80% (vào tháng 2) xuống còn khoảng 30%, làm dấy lên lo ngại về sự thiếu vắng khung quy định cần thiết cho sự tăng trưởng dài hạn của thị trường.

cryptonews.ruVừa rồi

Các trader Bitcoin thiệt hại 100 triệu USD do giá BTC giảm 3.000 USD trong 12 giờ

cryptonews.ruVừa rồi

Tại sao sự chiết khấu tiền mã hóa tại Nga lại khiến các thành viên thị trường lo ngại

Thị trường cảnh báo: giảm giá tiền mã hóa tại Nga có thể là một trong những hậu quả đáng chú ý đầu tiên của quy định mới. Do các lệnh trừng phạt, nguy cơ bị chặn và cơ sở hạ tầng phân tán, tiền kỹ thuật số ở Nga có thể được định giá thấp hơn so với trên các sàn giao dịch nước ngoài. Các rủi ro chính dẫn đến chiết khấu này bao gồm: hạn chế trừng phạt làm giảm khả năng tiếp cận cơ sở hạ tầng bên ngoài; khả năng tài sản bị đóng băng; và thiếu một kho lưu ký kỹ thuật số thống nhất, khiến việc quản lý và lưu thông tài sản phức tạp hơn. Cơ sở hạ tầng phân tán theo đề xuất của Ngân hàng Trung ương Nga được coi là nguồn rủi ro chính, có khả năng tạo ra khoảng cách giá giữa thị trường trong nước và quốc tế. Khung pháp lý mới cho thị trường tiền mã hóa đang được hình thành, nhưng các lệnh trừng phạt quốc tế liên quan đến cuộc xung đột ở Ukraine vẫn là yếu tố bên ngoài trọng yếu. Chúng ảnh hưởng đến mức chiết khấu thông qua nguy cơ bị chặn tài sản, khả năng tiếp cận hạn chế với các sàn giao dịch nước ngoài và việc rút vốn khó khăn hơn. Các chuyên gia nhấn mạnh rằng nếu không có một cơ sở hạ tầng minh bạch, rủi ro về chiết khấu cục bộ sẽ vẫn còn tồn tại.

cryptonews.ruVừa rồi

Tại sao sự chiết khấu tiền mã hóa tại Nga lại khiến các thành viên thị trường lo ngại

cryptonews.ruVừa rồi

Các thợ đào tiền mã hóa Nga không được loại khỏi cơ chế 'dùng hay không cũng phải trả tiền'

Chính phủ Nga không loại trừ các công ty khai thác tiền điện tử (miner) khỏi cơ chế định giá điện mới "take-or-pay" (lấy hoặc trả), theo thông tin từ Bộ Năng lượng. Cơ chế này, dự kiến áp dụng từ năm 2027, yêu cầu các doanh nghiệp công nghiệp có công suất trên 670 kW thanh toán dựa trên công suất tối đa đã đăng ký, thay vì lượng điện thực tế tiêu thụ. Đặc biệt, các trung tâm dữ liệu và công ty khai thác tiền điện tử được xếp vào nhóm riêng và sẽ phải áp dụng cơ chế này trong mọi trường hợp. Mức thanh toán tối thiểu được đề xuất cho họ là 90% công suất đăng ký, cao hơn mức 70% áp dụng cho các nhóm khác. Bộ Năng lượng cho biết các sửa đổi gần đây chủ yếu nhằm miễn trừ cho các công ty tiện ích (cấp nước, nhiệt), những đơn vị phản đối vì chi phí tăng cao có thể đẩy giá lên cho người dân. Giới khai thác tiền điện tử, đại diện là công ty "Algorithm", đã phản đối kế hoạch này. Họ cảnh báo rằng chi phí năng lượng tăng sẽ khiến mô hình khai thác ở Nga trở nên kém cạnh tranh so với các công ty Mỹ và có thể không còn khả thi trong 2-3 năm tới. Thay vào đó, họ đề xuất vai trò cân bằng lưới điện, sẵn sàng tăng giảm tiêu thụ điện theo nhu cầu của hệ thống.

cryptonews.ru2 phút trước

Các thợ đào tiền mã hóa Nga không được loại khỏi cơ chế 'dùng hay không cũng phải trả tiền'

cryptonews.ru2 phút trước

Giao dịch

Giao ngay

Bài viết Nổi bật

VERONA là gì

I. Giới thiệu Dự án VERONA là một blockchain được xây dựng cho mọi người, ở mọi nơi thông qua việc trừu tượng hóa chuỗi. Sử dụng lớp Trừu tượng Hóa Tổng quát, VERONA tự phân biệt mình bằng cách tích hợp các chức năng blockchain phức tạp, chẳng hạn như tài khoản, chữ ký và khả năng tương tác, trực tiếp ở cấp độ giao thức. Cách tiếp cận này cho phép tham gia vào các ứng dụng blockchain mà không cần phải hiểu các công nghệ cơ bản.1) Thông tin cơ bản Tên: VERONA (VERONA)III. Liên kết liên quan Liên kết trang web chính thức: https://xion.burnt.com/ Tài liệu trắng: https://xion.burnt.com/whitepaper.pdf Các trình khám phá: https://explorer.burnt.com/ Mạng xã hội: https://x.com/burnt_xion Lưu ý: Giới thiệu dự án đến từ các tài liệu được công bố hoặc cung cấp bởi đội ngũ dự án chính thức, chỉ để tham khảo và không cấu thành lời khuyên đầu tư. HTX không chịu trách nhiệm cho bất kỳ tổn thất trực tiếp hoặc gián tiếp nào phát sinh.

Tổng lượt xem 529Xuất bản vào 2026.06.22Cập nhật vào 2026.06.22

VERONA là gì

NES là gì

I. Giới thiệu Dự ánNesa là nền tảng và hệ sinh thái AI phi tập trung lớn nhất, được hỗ trợ bởi một lớp AI ưu tiên quyền riêng tư Layer 1. Công nghệ suy diễn mã hóa độc quyền của nó hỗ trợ một loạt các khối lượng công việc và phục vụ cho các khách hàng doanh nghiệp Fortune 500 trong các ngành như bán lẻ, chăm sóc sức khỏe và CNTT.II. Thông tin TokenTên token: NES(Nesa)III. Liên kết liên quanWebsite:https://nesa.ai/Explorers:https://bscscan.com/address/0x3131f6B80C26936aB03F7d9D29Eb4Ddf36AC3FB5Twitter:https://x.com/nesaorgGhi chú: Giới thiệu dự án đến từ các tài liệu được công bố hoặc cung cấp bởi đội ngũ dự án chính thức, chỉ mang tính tham khảo và không cấu thành lời khuyên đầu tư. HTX không chịu trách nhiệm cho bất kỳ tổn thất trực tiếp hoặc gián tiếp nào phát sinh.

Tổng lượt xem 310Xuất bản vào 2026.06.24Cập nhật vào 2026.06.24

NES là gì

ANSEM là gì

I. Giới thiệu Dự ánBlack Bull ($ANSEM) là một memecoin minh bạch, do cộng đồng điều hành trên Solana, được xây dựng dựa trên một niềm tin: tiến về phía trước bất kể điều gì. Dự án này ưu tiên giao diện người dùng và hoàn toàn có thể xác minh — trang web của nó đọc dữ liệu trực tiếp trên chuỗi và dữ liệu thị trường từ Solana, bao gồm giá, thanh khoản, khối lượng, vốn hóa thị trường và phân phối người nắm giữ, vì vậy bất kỳ ai cũng có thể kiểm tra các tuyên bố mà không cần đăng nhập và không thu thập dữ liệu người dùng. Ngoài token, nó còn cung cấp Ansem-call Radar, các Pods thanh khoản cộng đồng không giữ hộ trên PumpSwap, và một terminal meme dựa trên trình duyệt. $ANSEM là một token SPL tiêu chuẩn của Pump.fun (6 chữ số thập phân) giao dịch với SOL và USDC.II. Thông tin TokenKý hiệu Token: ANSEM (Black Bull)III. Liên kết liên quanWebsite:https://www.blackbullsol.com/X: https://x.com/blknoiz06Địa chỉ Hợp đồng: https://solscan.io/token/9cRCn9rGT8V2imeM2BaKs13yhMEais3ruM3rPvTGpumpGhi chú: Giới thiệu dự án đến từ các tài liệu được công bố hoặc cung cấp bởi đội ngũ dự án chính thức, chỉ để tham khảo và không cấu thành lời khuyên đầu tư. HTX không chịu trách nhiệm cho bất kỳ tổn thất trực tiếp hoặc gián tiếp nào phát sinh.

Tổng lượt xem 786Xuất bản vào 2026.07.01Cập nhật vào 2026.07.01

ANSEM là gì

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của G (G) được trình bày dưới đây.

活动图片