Un plastron de tortue ou un omoplate de bœuf repose sur la table, les fissures traversant les caractères gravés, quelques traits manquent encore.
Pour confirmer un seul caractère inconnu, le chercheur doit souvent feuilleter des centaines, voire des milliers d'empreintes, comparer les formes avec les inscriptions sur bronze, les écritures des Royaumes combattants et le sigillaire, puis chercher des exemples d'usage dans les textes anciens et les articles modernes. Les preuves sont dispersées dans des bases de données de différentes époques, supports et provenances, une série de vérifications pouvant durer plusieurs jours.
Récemment, une équipe conjointe dirigée par l'Université des sciences et technologies de Huazhong a présenté AlphaOracle, le premier système d'intelligence artificielle simulant le processus d'expertise des spécialistes, pour assister les experts dans le travail fastidieux de déchiffrement des inscriptions oraculaires.

Lien de l'article : https://doi.org/10.1016/j.xinn.2026.101462
Matériel supplémentaire : https://arxiv.org/abs/2607.17849
Code source : https://github.com/Yuliang-Liu/AlphaOracle
Démo : http://vlrlabmonkey.xyz:7685/?lan=zh
AlphaOracle examine d'abord l'évolution historique de la forme du caractère oracle, puis revient au contexte complet de la formule divinatoire et aux inscriptions similaires pour le vérifier en combinant le contexte, enfin consulte les textes anciens et la littérature de recherche pour corroborer les preuves, formant ainsi une chaîne de preuves complète.
Chaque étape de l'analyse de déchiffrement d'AlphaOracle est accompagnée de ses sources, des réponses candidates et d'un indice de confiance, facilitant la vérification point par point par les experts, offrant une assistance intelligente pratique, efficace et fiable. L'article a été accepté par The Innovation.
Contexte de la recherche
Les inscriptions oraculaires ont laissé sur des os et carapaces datant de plus de 3000 ans les guerres, activités agricoles, maladies, sacrifices, phénomènes célestes et décisions quotidiennes de la dynastie Shang. Plus de 150 000 fragments d'os oraculaires ont été découverts, contenant au moins 4500 caractères différents, dont environ 1500 ont été déchiffrés de manière relativement fiable.
Les quelque 3000 caractères restants sont comme une porte non encore ouverte, derrière laquelle se cachent le sens des mots du chinois ancien, les noms de lieux, de clans, ainsi que les détails du fonctionnement de la société Shang. Le déchiffrement des inscriptions oraculaires rend à nouveau visibles la langue, les concepts et la vie sociale de nos ancêtres il y a plus de trois millénaires, et rend également vivant et brillant le fil historique ininterrompu de la civilisation chinoise.

Les inscriptions oraculaires enregistrent les scènes de vie de la société Shang, constituent un trésor culturel précieux pour la nation chinoise et sont également une base importante pour explorer les sources de la civilisation chinoise.
Cependant, le processus de déchiffrement et d'interprétation des inscriptions oraculaires est difficile et fastidieux. Lorsqu'ils déchiffrent des caractères non résolus, les experts analysent généralement les formes variantes historiques du caractère, recherchent des matériaux contextuels et textuels probants dans de vastes corpus de référence, et vérifient les hypothèses en combinant plusieurs inscriptions et textes transmis. Ce processus exige non seulement des chercheurs une vaste accumulation de connaissances et une riche expérience, mais aussi qu'ils collectent, organisent et comparent de manière répétée une grande quantité de documents sur le long terme.
Bien que les recherches menées de manière indépendante par les experts aient obtenu de nombreux résultats importants, ce modèle consomme beaucoup de temps et de ressources humaines. De plus, le processus d'évaluation repose souvent sur le jugement subjectif de l'expert, dépend fortement des connaissances personnelles du chercheur, rend difficile l'atteinte d'un consensus et est difficile à mettre en œuvre à grande échelle.
Le développement rapide des technologies d'intelligence artificielle ouvre de nouvelles possibilités pour assister les experts dans l'interprétation des anciens caractères. Les travaux de recherche précédents prédisaient généralement le caractère chinois moderne correspondant en se basant sur la forme isolée du caractère oracle.
Cependant, ces méthodes s'appuient essentiellement sur des informations visuelles, combinant rarement l'usage contextuel du texte et les textes transmis pour une corroboration croisée. Par conséquent, bien que certains résultats de sortie puissent sembler plausibles au niveau de la forme, ils manquent de preuves linguistiques et historiques, offrant une aide très limitée aux experts.
Ces défis indiquent qu'il est urgent de construire un cadre de calcul capable de relier les différentes étapes du déchiffrement, de simuler le processus de raisonnement des experts, et de l'étendre à l'analyse de corpus à grande échelle, afin que les déductions soient fondées sur des preuves complètes et vérifiables.
Points forts du travail
L'équipe propose AlphaOracle, le premier système d'intelligence artificielle simulant complètement le processus d'interprétation des experts, transformant partiellement le flux de recherche des caractères anciens, difficile à mettre à l'échelle et dépendant de l'expérience personnelle, en un cadre de travail calculable, vérifiable, répétable et collaboratif.
AlphaOracle intègre un grand nombre d'empreintes d'os oraculaires, de copies dessinées, de textes classiques transmis et plus de vingt mille articles de recherche connexes. Les résultats candidats et les sources des preuves générés pendant le processus d'analyse sont entièrement conservés, aboutissant finalement à un rapport d'assistance à l'interprétation traçable et vérifiable, que les experts peuvent examiner et discuter point par point.
Aider les chercheurs à découvrir rapidement des indices, à rassembler des preuces et à comparer différentes interprétations à partir de matériaux dispersés et complexes, cette approche technologique permet à l'intelligence artificielle d'avoir le potentiel de pénétrer le cœur de la recherche sur les caractères anciens.
Dans une évaluation à laquelle ont participé 86 experts du domaine et chercheurs doctorants, 78,7 % des participants ont donné une évaluation plutôt élevée à AlphaOracle, estimant qu'il permettait en moyenne d'économiser environ 64 % du temps d'analyse.
Méthode de recherche
AlphaOracle suit la logique de l'interprétation réelle par les experts, enchaînant séquentiellement l'analyse des empreintes d'os oraculaires, l'analyse de l'évolution des formes de caractères, la recherche contextuelle et l'évaluation du contexte, la vérification par les textes classiques transmis et la recherche moderne.
Le système propose d'abord plusieurs interprétations candidates à partir de l'évolution du caractère complet, de la structure des composants et des relations de forme à travers les époques. Ensuite, il examine la distribution et l'usage de ces candidats dans différentes formules divinatoires à partir d'un vaste corpus de matériaux oraculaires. Enfin, il recherche des supports ou des questionnements supplémentaires dans les textes anciens et la recherche académique moderne, formant ainsi une chaîne de preuves complète.

Processus de déchiffrement d'AlphaOracle : analyse d'abord l'empreinte, puis réalise successivement l'analyse morphologique, l'alignement contextuel et la vérification documentaire, formant finalement un rapport de preuves pouvant être vérifié par les experts.
Première étape : Analyse de l'empreinte
Après avoir entré une empreinte d'inscription oracle originale, le système effectue d'abord la détection des caractères, leur classification et la reconstruction de la phrase. Le modèle de détection localise d'abord chaque caractère oracle, puis un classifieur identifie les caractères déjà déchiffrés, et transmet les caractères non déchiffrés encore controversés aux modules suivants.
Ensuite, le système considère chaque caractère comme un nœud, utilise un réseau de neurones graphiques combiné aux informations spatiales pour déterminer simultanément le début, la fin de la phrase et les relations de connexion entre les caractères, puis restaure l'ordre de lecture en conséquence. Finalement, le modèle d'analyse d'empreinte décompose l'empreinte d'os oracle en plusieurs phrases indépendantes avec un ordre de lecture et des résultats préliminaires de reconnaissance de caractères.
Deuxième étape : Analyse morphologique
Une fois les images des caractères individuels et l'ordre de lecture clarifiés, le système commence à proposer plusieurs hypothèses de déchiffrement possibles pour les caractères non résolus, à partir de deux directions : l'évolution diachronique et la structure interne.
Le réseau d'évolution des formes utilise un modèle de diffusion pour simuler le changement des formes anciennes vers les formes postérieures, et identifie et agrège les résultats générés à plusieurs reprises ;
Le réseau d'évolution des composants décompose les éléments constitutifs de la forme du caractère oracle et les mappe en séquences IDS (Ideographic Description Sequences) de caractères chinois, déduisant les caractères chinois correspondants en fonction de la combinaison des composants ;
Le réseau d'évolution des périodes historiques place sur une même ligne temporelle les stades des inscriptions oraculaires, des inscriptions sur bronze, des écritures des Royaumes combattants, du sigillaire et de la cursive officielle (lishu) pour comparer les degrés de similitude.
Les trois modèles experts fournissent chacun des candidats et leurs probabilités, le système pondère en fonction de la fiabilité des modèles, détermine si le caractère a déjà une interprétation reconnue, puis conserve pour les caractères non résolus plusieurs réponses de déchiffrement possibles avec leurs indices de confiance respectifs.
Troisième étape : Alignement contextuel
Les hypothèses de déchiffrement données par l'analyse morphologique doivent encore être testées dans le contexte de la phrase et des exemples similaires doivent être recherchés dans d'autres empreintes connexes.
Le système recherche d'abord toutes les occurrences connues du caractère cible dans des ressources numérisées telles que *Heji* (Collection d'inscriptions oraculaires), *Moben Daxi* (Grande série de copies d'inscriptions oraculaires) et *Jiaoshi Zongji* (Collection générale de collation et interprétation des inscriptions oraculaires), en se basant sur les informations d'image et de texte. Ensuite, il utilise un modèle de langue masquée (MLM) entraîné spécifiquement pour les inscriptions oraculaires pour analyser les combinaisons contextuelles avant/après.
Lors de l'entraînement, le modèle apprend à compléter les caractères masqués en fonction du contexte oracle connu. Lors de l'inférence, d'une part, il réorganise les multiples candidats fournis par le module morphologique, jugeant lequel s'intègre le plus naturellement dans la phrase, et d'autre part, il propose indépendamment des candidats sémantiques.
L'alignement contextuel comprend également un modèle d'explication, affiné par apprentissage supervisé et par apprentissage par renforcement basé sur les retours, utilisé pour synthétiser l'usage du même caractère dans différentes formules divinatoires et générer une explication en chinois moderne facilitant la vérification par les chercheurs.
Quatrième étape : Corroboration documentaire
Les candidats de déchiffrement filtrés par la forme et le contexte sont ensuite soumis à une corroboration supplémentaire à l'aide de textes classiques transmis et d'articles de recherche modernes.
Les matériaux utilisés par le système comprennent 25 textes classiques anciens transmis et 23 755 articles de recherche moderne faisant autorité, couvrant le *Shuowen Jiezi*, les textes pré-Qin et des Han, ainsi que des ouvrages spécialisés tels que *Guwenzi Gulin*, *Jiaguwen Gulin*, *Jiaguwen Zilin*, etc.
Lors de la recherche, il intègre dans la requête les variantes graphiques et les synonymes, tout en cherchant des matériaux pertinents via les voies sémantique du texte et visuelle de l'image.
Le degré de pertinence des différents documents, l'autorité de la source, le type de document et l'ancienneté influencent tous le poids de la preuve. Chaque matériau conserve les informations bibliographiques et la raison de la recherche, facilitant la consultation de l'original par les chercheurs.
Le rapport synthétique final présente successivement les preuves basées sur la forme, les exemples contextuels et les preuves documentaires, indique l'interprétation actuellement la plus soutenue et sa crédibilité, et conserve clairement les divergences non résolues.
En résumé, AlphaOracle formule lui-même des hypothèses, collecte des preuves pertinentes pour chaque hypothèse, puis les présente aux chercheurs.
L'ensemble du processus implique peu de jugements nécessaires de la part du système, mais il ne remplace pas l'expert pour le jugement final. Son rôle central est d'aider les chercheurs à découvrir plus efficacement des indices, à vérifier des preuves et à comparer différentes interprétations, en laissant le pouvoir de décision final aux chercheurs.
Résultats expérimentaux et évaluation par les experts
Le déchiffrement des inscriptions oraculaires manque d'un référentiel unifié reconnu. Par conséquent, l'article décompose le grand problème en plusieurs tâches mesurables et évalue AlphaOracle à la fois sur les performances de ses composants et sur sa valeur d'usage pour les experts.

Dans l'expérience d'analyse des formes de caractères, l'équipe de recherche a adopté le paramètre « simulation de caractère non déchiffré », utilisant 88 caractères connus n'ayant jamais été vus pendant la phase d'entraînement comme ensemble de test. La précision Top-1 d'AlphaOracle a atteint 23,1%.
Dans l'analyse contextuelle, le système a atteint une précision de 56,1% pour restaurer les caractères masqués à partir de formules divinatoires incomplètes, et a pu sélectionner l'interprétation la plus conforme au contexte parmi les résultats candidats fournis par l'analyse morphologique avec une précision de 95,2%, dépassant respectivement les meilleures performances de base des grands modèles généraux de 22,2% et 65,4%.
Dans l'évaluation globale de l'explication, utilisant comme tâche proxy l'explication en chinois moderne, AlphaOracle a obtenu des scores BLEU, ROUGE et METEOR de 0,491, 0,586 et 0,659 respectivement.
Il est important de noter que les modèles généraux tels que GPT-5, Gemini 2.5 Pro et DeepSeek ont été utilisés dans l'article avec une configuration zero-shot, sans affinage sur les données du domaine des inscriptions oraculaires. Ces résultats soulignent donc l'importance des corpus spécialisés et des processus adaptés au domaine pour cette tâche.

Résultats spécifiques de l'évaluation par les experts humains
Dans l'évaluation pratique de l'utilisation par les experts, 86 experts et chercheurs doctorants dans les domaines des inscriptions oraculaires, de l'intelligence artificielle et des domaines connexes ont participé anonymement à l'évaluation du système.
Parmi eux, 78,7% des participants ont estimé que le système était « utile » ou « très utile », et ont estimé qu'il permettait en moyenne d'économiser environ 64% du temps d'analyse. Dans une évaluation modulaire sur une échelle de 5 points, les quatre parties - analyse d'empreinte, analyse morphologique, alignement contextuel et recherche de preuves documentaires - ont obtenu des scores moyens de 4,20, 4,44, 4,38 et 4,01 respectivement.
Dans l'étape de recherche documentaire, 42 caractères oraculaires ont été sélectionnés au hasard pour une vérification manuelle, le taux de rappel était de 90,2% et la précision de 74,8%. Cela signifie que le système présente la plupart des matériaux de valeur, mais qu'il inclut encore des documents que les experts doivent exclure.
Pour les chercheurs, cela réduit le coût de consultation des documents et leur laisse plus de temps pour le jugement des preuves.
L'article a également organisé une « arène humaine » en double aveugle, où des spécialistes seniors en inscriptions oraculaires du Musée du Palais, du Musée de Shanghai, de l'Académie chinoise des sciences sociales, des universités de Tsinghua, Fudan, Nanjing, Jilin, Zhengzhou, Henan, Henan Normal, Capital Normal, Southwest, Ocean University of China, du Laboratoire clé du ministère de l'Éducation pour le traitement de l'information sur les inscriptions oraculaires, ainsi que des institutions académiques de Corée, du Japon et des États-Unis, ont effectué 210 tests à l'aveugle sur la tâche d'explication contextuelle.
Les résultats montrent qu'AlphaOracle a obtenu le taux de préférence le plus élevé à 45,2%, DeepSeek à 34,8%, Gemini 2.5 Pro à 12,9% et GPT-5 à 7,1%.
Déchiffrement spécifique de caractères difficiles
AlphaOracle a abordé le caractère oracle controversé de longue date dans l'empreinte « Tun Nan 307 »

(Les premières recherches l'interprétaient souvent comme « 卒 »). En combinant la forme, les formules divinatoires et les matériaux documentaires, AlphaOracle l'a interprété comme une variante graphique du caractère « 勞 » (láo, fatigue/travail), fournissant des preuves supplémentaires pour son interprétation en tant que nom de lieu ou de clan.



De plus, l'article rapporte les résultats de la désambiguïsation pour 22 variantes graphiques controversées. Certaines analyses ont déjà été intégrées dans des bases de données académiques faisant autorité sur les inscriptions oraculaires, démontrant le potentiel de l'intelligence artificielle pour assister les experts dans l'examen efficace des caractères controversés et faire avancer les discussions académiques.
Conclusion
AlphaOracle, en imitant la méthode de recherche des experts humains, intègre l'évolution des formes des caractères oraculaires, la distribution des formules divinatoires et les matériaux documentaires dans une même chaîne de preuves, aidant les chercheurs à découvrir des indices, à trouver des documents et à vérifier des matériaux, améliorant ainsi l'efficacité du déchiffrement des inscriptions oraculaires.
Simultanément, il ouvre une voie plus proche de la pratique réelle pour la recherche computationnelle sur les caractères anciens. La machine ne doit pas seulement fournir une réponse finale de bout en bout sans fondement, mais doit plutôt fournir une assistance probante fiable à chaque étape du flux de travail du chercheur.
Une telle approche peut également être étendue à d'autres domaines d'écritures anciennes, établissant des méthodes d'assistance, d'organisation et de recherche par IA plus systématiques pour la recherche dispersée et complexe sur les caractères anciens.
La recherche sur les caractères anciens ne peut finalement se passer du jugement humain. Les machines excellent à formuler rapidement des hypothèses, à effectuer des recherches, à faire des comparaisons et des synthèses à partir de vastes quantités de matériaux, tandis que les chercheurs sont responsables de peser les preuves et de prendre les décisions finales.
À l'avenir, ce qui mérite le plus d'être attendu, c'est précisément ce type de scénario de recherche où les deux se complètent : l'intelligence artificielle élargit l'étendue de la recherche de matériaux, et l'érudition humaine préserve la profondeur du jugement académique, permettant à davantage d'informations historiques endormies dans les os oraculaires et les anciens caractères d'être redécouvertes.
Référence : https://doi.org/10.1016/j.xinn.2026.101462
Cet article provient du compte WeChat officiel « 新智元 » (New Zhiyuan), auteur : ASI启示录 ; éditeur : LRST






