На столе лежит черепаший панцирь или лопаточная кость быка, трещины пересекают вырезанные надписи, а в нескольких иероглифах недостает штрихов.
Исследователь, желающий подтвердить значение одного незнакомого знака, часто должен пересматривать сотни и тысячи эстампов (трэнскрипций), сравнивать начертания с надписями на бронзовых сосудах, знаками периода Воюющих царств и малыми печатями, а затем искать примеры употребления в древних книгах и современных научных статьях. Доказательства разбросаны по разным эпохам, носителям и базам данных, и один цикл проверки может длиться несколько дней.
Недавно совместная команда из Хуачжунского университета науки и технологий и других организаций представила первую систему искусственного интеллекта AlphaOracle, имитирующую процесс экспертной интерпретации, для помощи специалистам в трудоемкой работе по дешифровке оракульных надписей.

Ссылка на статью: https://doi.org/10.1016/j.xinn.2026.101462
Дополнительные материалы: https://arxiv.org/abs/2607.17849
Код: https://github.com/Yuliang-Liu/AlphaOracle
Демо: http://vlrlabmonkey.xyz:7685/?lan=zh
AlphaOracle сначала изучает историческую траекторию эволюции формы оракульного знака, затем возвращается к полному контексту надписи и аналогичным оракульным текстам для проверки с учетом контекста и, наконец, обращается к древним книгам и исследовательской литературе для дополнительного подтверждения, формируя полную цепочку доказательств.
Каждый шаг анализа интерпретации в AlphaOracle сопровождается указанием источника, возможных вариантов ответа и степенью достоверности, что облегчает экспертам поштучную проверку, обеспечивая удобную, эффективную и надежную интеллектуальную поддержку. Статья принята к публикации в журнале «The Innovation».
Исследовательский контекст
Оракульные надписи сохранили для нас войны, сельскохозяйственные работы, болезни, жертвоприношения, небесные явления и повседневные решения эпохи династии Шан на костях более чем трехтысячелетней давности. Обнаружено более 150 тысяч фрагментов оракульных костей, содержащих как минимум 4500 различных графем (знаков), из которых примерно 1500 получили относительно надежную интерпретацию.
Оставшиеся около 3000 с лишним знаков похожи на еще не открытую дверь, за которой скрываются значения ранних китайских слов, географические названия, названия родов, а также детали функционирования общества эпохи Шан. Дешифровка оракульных надписей позволяет вновь сделать ясным язык, представления и социальную жизнь наших предков более чем трехтысячелетней давности, а также делает яркой и сверкающей непрерывную историческую нить китайской цивилизации.

Оракульные надписи запечатлели картину жизни общества династии Шан, являются драгоценным культурным сокровищем китайской нации и важной основой для изучения истоков китайской цивилизации.
Однако процесс дешифровки и интерпретации оракульных надписей сложен и трудоемок. При интерпретации нерасшифрованных знаков эксперты обычно анализируют исторические варианты формы иероглифа, извлекают из огромного референсного корпуса контекстуальные и текстовые материалы для сопоставления, а также проверяют соответствующие гипотезы, сочетая несколько надписей и переданные древние тексты. Этот процесс требует от исследователя как обширных знаний и богатого опыта, так и длительного сбора, систематизации и многократного сравнения большого объема документальных материалов.
Хотя независимые исследования экспертов принесли множество важных результатов, такая модель требует значительных временных и человеческих затрат, а связанный с ней процесс оценки часто зависит от субъективного суждения специалиста, сильно опирается на личную эрудицию исследователя, затрудняет достижение единого мнения и масштабирование.
Стремительное развитие технологий искусственного интеллекта открывает новые возможности для помощи экспертам в интерпретации древних письмен. Предыдущие исследовательские работы обычно предсказывали соответствующий современный китайский иероглиф на основе изолированной формы оракульного знака.
Однако такие методы в основном полагаются лишь на визуальную информацию, редко сочетая анализ контекстуального употребления в тексте и переданных древних текстов для перекрестного подтверждения. Поэтому, хотя некоторые результаты на уровне формы могут казаться правдоподобными, они не имеют доказательной базы на лингвистическом и историческом уровнях, и помощь, которую они могут оказать экспертам, весьма ограничена.
Эти вызовы показывают, что необходимо создать вычислительную структуру, способную охватить все этапы дешифровки, имитировать процесс рассуждений эксперта и расширить ее для анализа крупномасштабных корпусов, сделав соответствующие выводы основанными на всесторонней и проверяемой доказательной базе.
Основные достижения работы
Команда предложила первую систему искусственного интеллекта AlphaOracle, полностью имитирующую процесс экспертной интерпретации, частично преобразующую трудно масштабируемый, зависящий от личного опыта процесс исследования древних письмен в проверяемую, воспроизводимую и совместную вычислительную структуру.
AlphaOracle объединяет крупномасштабные эстампы (трэнскрипции) оракульных надписей, копии, переданные древние каноны и более 20 тысяч связанных исследований. Все промежуточные кандидаты и источники доказательств, возникающие в процессе анализа, полностью сохраняются и в конечном итоге объединяются в вспомогательный отчет по исследованию, допускающий отслеживание и проверку, который эксперты могут по пунктам проверять и обсуждать.
Помогая ученым быстро находить ключи в разрозненных и обширных материалах, собирать доказательства и сравнивать различные толкования, этот технический подход позволяет искусственному интеллекту потенциально войти в ключевой этап исследования древних письмен.
В оценке, в которой участвовали 86 экспертов в данной области и исследователей-докторантов, 78,7% участников дали AlphaOracle высокую оценку и считают, что она в среднем может сэкономить около 64% времени анализа.
Методология исследования
AlphaOracle следует логике реального исследования эксперта, последовательно связывая анализ оракульного эстампа, анализ эволюции формы, поиск примеров употребления и оценку контекста, проверку по переданным древним текстам и современным исследованиям.
Система сначала на основе анализа эволюции целого знака, структуры компонентов и межэпохальных связей форм предлагает несколько возможных интерпретаций-кандидатов, затем проверяет этих кандидатов на крупномасштабном материале оракульных надписей, изучая их распределение и употребление в различных оракульных текстах, и, наконец, находит дальнейшую поддержку или возражения в древних канонах и современных научных исследованиях, формируя полную цепочку доказательств.

Процесс интерпретации AlphaOracle: сначала анализ эстампа, затем последовательное выполнение морфологического анализа, выравнивания контекста и проверки по литературе, в итоге формирование отчета с доказательствами для проверки экспертами.
Первый шаг: Анализ эстампа
После ввода исходного эстампа оракульной надписи система сначала выполняет детекцию символов, классификацию и восстановление предложений. Модель детекции сначала локализует каждый символ оракульного письма и через классификатор распознает уже интерпретированные знаки, а спорные неинтерпретированные знаки передает последующим модулям.
Затем система рассматривает каждый символ как узел, использует графовую нейронную сеть в сочетании с пространственной информацией, одновременно определяя начало, конец предложения и связи между символами, и на этой основе восстанавливает порядок чтения. В итоге модель анализа эстампа разбивает оракульный эстамп на несколько независимых предложений с порядком чтения и предварительными результатами распознавания символов.
Второй шаг: Морфологический анализ
Имея четкое изображение отдельного знака и порядок чтения, система начинает предлагать несколько возможных гипотез дешифровки для неинтерпретированного знака по двум направлениям: диахронической эволюции и внутренней структуры.
Сеть анализа эволюции формы использует диффузионную модель для имитации изменений древней формы в сторону более поздних начертаний, распознает и суммирует результаты многократной генерации;
Сеть анализа эволюции компонентов разбирает составные части оракульного знака, сопоставляет их с последовательностями IDS (Ideographic Description Sequences) китайских иероглифов и на основе комбинации компонентов предполагает соответствующий китайский иероглиф;
Сеть анализа эволюции по историческим периодам помещает оракульные надписи, надписи на бронзе, письменность периода Воюющих царств, малые печати и официальное письмо на одну временную линию, сравнивая степень сходства.
Три экспертные модели дают свои кандидаты и вероятности, система взвешивает их в соответствии с надежностью моделей, определяет, имеет ли знак общепризнанную интерпретацию, и для неинтерпретированных знаков сохраняет несколько возможных вариантов дешифровки и соответствующую степень достоверности.
Третий шаг: Выравнивание контекста
Гипотезы дешифровки, предложенные морфологическим анализом, также проверяются в контексте предложения, и в других связанных эстампах ищутся похожие случаи.
Система сначала извлекает все известные случаи употребления целевого символа из оцифрованных материалов, таких как «Свод оракульных надписей» (甲骨文合集), «Большая серия копий оракульных надписей» (甲骨文摹本大系) и «Общий свод сверки и толкования оракульных надписей» (甲骨文校释总集), на основе информации об изображении и тексте, затем использует языковую модель с маскированием, обученную на оракульных надписях, для анализа сочетаемости в контексте.
При обучении модель учится восстанавливать замаскированные знаки на основе известного контекста оракульных надписей; при выводе она, с одной стороны, переупорядочивает несколько кандидатов, предложенных морфологическим модулем, определяя, какой из них лучше всего подходит в предложение, а с другой стороны, самостоятельно предлагает семантических кандидатов.
Выравнивание контекста также включает модель объяснения, которая после контролируемой тонкой настройки и обучения с подкреплением на основе обратной связи используется для обобщения употребления одного и того же знака в разных оракульных текстах и генерации объяснений на современном китайском языке для удобства проверки исследователями.
Четвертый шаг: Подтверждение по литературе
Кандидаты дешифровки, отобранные по форме и контексту, затем дополнительно подтверждаются с использованием переданных древних текстов и современных исследовательских статей.
Используемые системой материалы включают 25 древних переданных текстов и 23 755 авторитетных современных исследований, охватывающих «Шовэнь цзецзы» (说文解字), каноны эпох до Цинь и династий Хань, а также такие специализированные труды, как «Гувэньцы голинь» (古文字诂林), «Цзягувэнь голинь» (甲骨文诂林), «Цзягувэнь цзылинь» (甲骨文字林).
При поиске она также включает в запрос варианты написания и близкие по смыслу слова, одновременно ищет связанные материалы как по семантике текста, так и по изображению формы.
Степень релевантности разных текстов, авторитетность источника, тип литературы и хронологическая удаленность влияют на вес доказательств, каждая запись сохраняет библиографическую информацию и причину поиска, чтобы облегчить исследователям обращение к оригиналу.
Итоговый комплексный отчет последовательно представляет основания по форме, примеры употребления в контексте и литературные доказательства, указывает на наиболее поддерживаемый в настоящее время вариант чтения и его достоверность, а также четко сохраняет нерешенные разногласия.
В целом, AlphaOracle сама выдвигает гипотезы, собирает соответствующие доказательства для каждой гипотезы, а затем представляет их исследователю.
В ходе этого процесса система делает лишь необходимый минимум суждений, но не заменяет эксперта в принятии окончательного решения; ее ключевая роль заключается в том, чтобы помочь исследователю более эффективно обнаруживать ключи, проверять доказательства и сравнивать различные толкования, оставляя окончательное право принятия решения за исследователем.
Экспериментальные результаты и оценка экспертов
Поскольку для интерпретации оракульных надписей нет общепризнанного единого эталона, в статье большая проблема разбита на несколько измеримых задач, и AlphaOracle оценивается как с точки зрения производительности компонентов, так и с точки зрения практической ценности для экспертов.

В эксперименте по анализу формы исследовательская группа использовала настройку «имитация неинтерпретированного знака», взяв 88 известных знаков, не встречавшихся на этапе обучения, в качестве тестового набора. Точность Top-1 AlphaOracle достигла 23,1%.
В анализе контекста точность системы в восстановлении замаскированных знаков из неполных оракульных текстов составила 56,1%, и она смогла с точностью 95,2% выбрать из кандидатов, предложенных морфологическим анализом, интерпретацию, более соответствующую контексту, что выше, соответственно, на 22,2% и 65,4%, чем у наилучших базовых моделей общего назначения.
В комплексной оценке объяснений, где в качестве замещающей задачи использовалась интерпретация на современном китайском языке, показатели BLEU, ROUGE и METEOR у AlphaOracle достигли 0,491, 0,586 и 0,659 соответственно.
Следует отметить, что в статье универсальные модели, такие как GPT-5, Gemini 2.5 Pro и DeepSeek, использовались в режиме «zero-shot» (без предварительного обучения), без тонкой настройки на данных области оракульных надписей. Поэтому соответствующие результаты показывают важность специализированных корпусов и доменно-ориентированного процесса для данной задачи.

Конкретные результаты опроса оценки экспертами-людьми
В оценке практического использования экспертами 86 экспертов в области оракульных надписей, искусственного интеллекта и смежных областей, а также исследователей-докторантов анонимно приняли участие в оценке системы.
78,7% участников сочли систему «полезной» или «очень полезной» и оценили, что она может сэкономить в среднем около 64% времени анализа. В модульной оценке по 5-балльной шкале средние баллы за четыре части — анализ эстампа, анализ формы, выравнивание контекста и поиск литературных оснований — составили 4,20, 4,44, 4,38 и 4,01 соответственно.
На этапе поиска по литературе было проведено ручное выборочное тестирование по 42 знакам оракульных надписей, результативность (recall) составила 90,2%, точность (precision) — 74,8%. Это означает, что система предоставляет большую часть ценных материалов, но среди них все еще могут встречаться литературные источники, которые экспертам необходимо исключить.
Для исследователей это снижает затраты на просмотр литературы, экономя больше времени для суждений о доказательствах.
В статье также была организована слепая оценка «Арена человека», в которой старшие специалисты по оракульным надписям из Музея Гугун, Шанхайского музея, Китайской академии общественных наук, Университета Цинхуа, Фуданьского университета, Нанкинского университета, Цзилиньского университета, Чжэнчжоуского университета, Хэнаньского университета, Хэнаньского педагогического университета, Педагогического университета столицы, Юго-Западного университета, Китайского океанического университета, Ключевой лаборатории обработки информации об оракульных надписях при Министерстве образования, а также соответствующих академических сообществ Кореи, Японии и США провели 210 слепых тестов на задачу контекстуального объяснения.
Результаты показали, что AlphaOracle получила наибольшее предпочтение — 45,2%, DeepSeek — 34,8%, Gemini 2.5 Pro — 12,9%, GPT-5 — 7,1%.
Конкретная интерпретация спорных знаков
AlphaOracle, обратившись к эстампу «Туньнань 307» (屯南307), в отношении спорного оракульного знака

(в ранних исследованиях его часто интерпретировали как «цзуй» 卒), объединив данные по форме, примерам употребления и литературные материалы, интерпретировал его как вариант написания иероглифа «лао» 勞 (труд), добавив доказательства для его толкования как географического названия или названия рода.



Кроме того, в статье сообщаются результаты разрешения неоднозначности 22 спорных вариантов написания, часть анализа уже включена в авторитетные академические базы данных по оракульным надписям, демонстрируя потенциал искусственного интеллекта в помощи экспертам по эффективному исследованию спорных знаков и продвижению научных дискуссий.
Заключение
AlphaOracle, имитируя подход экспертов-людей, помещает эволюцию формы оракульных знаков, распределение примеров употребления и литературные материалы в одну цепочку доказательств, помогая исследователям находить ключи, искать литературу, проверять материалы и повышая эффективность интерпретации оракульных надписей.
В то же время она открывает для вычислительных исследований древних письмен более близкий к реальной практике путь: машина не должна просто, от начала до конца, безосновательно давать окончательный ответ, а должна предоставлять надежную доказательную поддержку на каждом шаге рабочего процесса исследователя.
Такой подход также может быть распространен на другие области древних письмен, создавая более систематизированные способы помощи ИИ в упорядочении и исследовании разрозненных и сложных древних письмен.
Исследования древних письмен в конечном счете не могут обойтись без человеческого суждения. Машина хороша в быстром выдвижении гипотез из огромных материалов, выполнении поиска, проведении сравнений и обобщений, тогда как ученый отвечает за определение значимости доказательств и принятие окончательного решения.
В будущем более многообещающей является именно такая картина совместной работы: искусственный интеллект расширяет широту поиска материалов, а человеческие знания сохраняют глубину научного суждения, позволяя вновь увидеть больше исторической информации, дремлющей в оракульных костях и древних письменах.
Источники: https://doi.org/10.1016/j.xinn.2026.101462
Эта статья взята с официального аккаунта WeChat «Синьчжиюань» (新智元), автор: ASI启示录; редактор: LRST








