В июле прогностический фреймворк Rhizome v1 от DigClaw занял #1, #3 и #7 места на оценочной платформе FutureX.
Три места от трех разных базовых моделей — включая Kimi -K3, DeepSeek -V4-Pro и другие. Один и тот же фреймворк позволил им всем войти в Top 7, и DigClaw — единственный участник, которому это удалось.
59 реальных вопросов на прогнозирование, охватывающих политику, экономику и технологии, исключают возможность утечки обучающих данных.
Эти результаты подтверждают гипотезу, которую проверяет DigClaw:
Способность к прогнозированию может быть отделена от базовой модели.
По мере развития базовых моделей система получает дивиденды от их возможностей; в то же время траектории прогнозов, обратная связь от результатов, опыт калибровки и рабочие процессы постоянно накапливаются внутри системы.

△
Это не случайный результат конкурса, это первое внешнее подтверждение подхода DigClaw к решению вопроса «как именно следует делать прогнозы».
Прогнозирование — самая недооцененная способность ИИ
По мере того как задачи прогнозирования становятся все более стандартизированными и инженерными, от ИИ ожидают возможности масштабируемого решения сложных прогностических проблем.
Но здесь возникает фундаментальная проблема: большие языковые модели (LLM) по своей природе не очень хорошо справляются с прогнозированием.
LLM изучают корреляции, а не причинно-следственные связи. Они извлекают паттерны из прошлых текстов, но «изучение прошлого» и «прогнозирование будущего» — это две принципиально разные вещи.
Это порождает три серьезные проблемы:
Слепое пятно в направлении причинности. Модель знает, что A и B часто появляются вместе, но не знает, приводит ли A к B, B к A или существует общая причина C.
Неэффективность интервенционного вывода. Вы не можете спросить модель: «Что произойдет с акциями технологических компаний Юго-Восточной Азии, если ФРС снизит ставки?» — потому что она изучала только историческую совместную встречаемость, у нее нет причинно-следственной карты для вычислений интервенций.
Отсутствие калибровки. «Вероятность 70%», выводимая моделью, не откалибрована в вероятностном смысле, по сути, это всего лишь побочный продукт распределения токенов.
На данный момент существующие подходы имеют свои ограничения: коллективный разум (предсказательные рынки) требует ликвидности, по непопулярным вопросам цены недостоверны;
паттерны LLM не имеют причинной структуры; сквозное обучение (end-to-end training) страдает от смещения, ориентированного на результат — логически строгий, но «неправильный» процесс рассуждений наказывается, а грубое суждение, случайно «угадавшее» ответ, наоборот, усиливается.
Именно поэтому существует DigClaw.
DigClaw строит прогностическую инфраструктуру, где причинно-следственная структура служит каркасом, вероятностные вычисления — двигателем, а поисковый интеллект — каналом данных.
Ключевая гипотеза: прогнозирование не должно выполняться одной моделью от начала до конца (end-to-end).
Поиск, причинно-следственные рассуждения и вероятностный вывод — это три ортогональные способности, которые должны решаться тремя отдельными специализированными системами, а затем структурированно комбинироваться.
Три места в топ-10 подтверждают переносимость прогностической способности между разными базовыми моделями
FutureX — это самый сложный на сегодняшний день рейтинг прогнозирования реальных событий в реальном времени: каждую неделю публикуются вопросы о событиях реального мира, на которые нужно дать прогноз, в момент отправки прогноза правильного ответа еще не существует, расчет происходит постфактум.
Набор данных размещен на HuggingFace, оценочная система с открытым исходным кодом на GitHub, результаты воспроизводимы и проверяемы.
Rhizome использовал один и тот же прогностический фреймворк и условия выполнения на трех базовых моделях, каждая независимо генерировала и отправляла ответы, без агрегации между моделями.
Таким образом, эти три места — результат раздельного запуска одного и того же системного метода на трех базовых моделях, то есть четкий перекрестный контроль между разными моделями.
Но это не означает, что базовая модель не важна.
Базовая модель по-прежнему обеспечивает общие способности: понимание языка, рассуждения и использование инструментов.
Результаты этого рейтинга показывают: то, как организовать поиск, обработку времени, выражение вероятностей, поддержание доказательной базы и управление длительными процессами, может сформировать системную способность, независимую от весов модели.
Ниже представлен технический отчет (technical report) DigClaw по фреймворку Rhizome на FutureX:
Технический отчет по Rhizome
Дизайн Rhizome строится вокруг трех инженерных решений: поиск и рассуждения должны быть разделены, траектория прогноза должна полностью сохраняться и формировать калибровочный актив, обновление вероятностей должно учитывать причинную структуру:

△
Конструкторское решение 1: Разделение поиска и рассуждений на разные модели
Ключевое инженерное прозрение Rhizome: качество поиска и качество рассуждений — две ортогональные проблемы, и их не следует одновременно оптимизировать в одной модели.
Текущие популярные агенты глубокого поиска (DeepResearch agent, такие как Perplexity, Gemini Deep Research) связывают поиск и рассуждения внутри одной модели — качество поиска страдает от нагрузки рассуждений, качество рассуждений загрязняется шумом поиска.
Подход Rhizome — полное разделение: агент поиска отвечает только за поиск релевантной информации, а уровень рассуждений отвечает только за структурированные рассуждения на основе имеющихся доказательств.
Потребность в информации для задач прогнозирования — не «точно ответить на вопрос пользователя», а «по возможности обнаружить все связанные сигналы».
Цель оптимизации агента поиска — релевантность информации (relevance), а не правильность ответа (accuracy). Если агент поиска обучается «искать ответ», он будет склонен находить то, что выглядит как вывод, а это как раз наиболее опасно.
Для обучения используется фреймворк обучения с подкреплением (SearchRL) с двумя параллельными итерационными путями:
Путь A: RL-дообучение моделей с открытым исходным кодом — модели с 8B/30B параметров дообучаются методом RL с вознаграждением за релевантность поиска (ссылки: Search-R1, COLM 2025; ReSeek, ICML 2026).
Путь B: Использование моделей с закрытым исходным кодом (Harness) — для моделей типа Claude/GPT строится внешний фреймворк с ограничениями на поиск.
Разные базовые модели демонстрируют стабильные различия в задачах прогнозирования: одни лучше подходят для длительного поиска и сложных рассуждений, другие более искусны в количественном моделировании, третьи имеют преимущества в стоимости и скорости отклика.
Rhizome выносит протокол прогнозирования, оркестрацию агентов, вызов инструментов и оценку результатов за пределы базовой модели, что позволяет учреждениям выбирать модель в зависимости от ценности задачи и масштаба операций, находя компромисс между способностью к рассуждениям, стоимостью и скоростью отклика.
Конструкторское решение 2: Запись траектории и калибровка вероятностей — накопление данных как актив
Rhizome сохраняет полную траекторию с информацией о версии для каждого прогноза: временные условия и критерии расчета задачи, доказательства, доступные на момент прогноза, процесс оркестрации агентов и вызова инструментов, окончательный ответ и вероятность, а также соответствующая версия модели и системы.
Эти записи создаются до того, как станет известен результат, сохраняя реальные суждения, сделанные Rhizome, когда правильный ответ еще не был известен.
После расчета события Rhizome помещает траекторию прогноза и реальный результат в одну запись, чтобы посмотреть, какая информация была доступна тогда, какие противоположные доказательства были упущены, и где произошла ошибка — в поиске, оценке времени, рассуждениях, формулировке ответа или калибровке вероятности.
Ошибка с высокой степенью уверенности и ошибка, близкая к 50/50, хотя и отмечаются как «неправильный ответ», раскрывают разные проблемы.
Rhizome выполняет несколько независимых прогнозов для одной и той же задачи. Система не просто усредняет результаты, а сначала агрегирует их в пространстве логарифмических шансов (logit), а затем корректирует силу экстремальности, используя Brier Score по уже рассчитанным задачам.
Чем более независимую информацию предоставляют разные траектории, тем более определенным может быть агрегированный результат; чем больше перекрытие доказательств, тем более сдержанной будет корректировка.

△
На основе этого Rhizome использует метод Платта (Platt scaling), чтобы на основе уже рассчитанных задач выявить устойчивую излишнюю уверенность или излишнюю осторожность и скорректировать последующие вероятности.
Критерий калибровки интуитивно понятен: событиям, которым система присваивает вероятность 60%, в долгосрочной перспективе должно происходить около 60% случаев; событиям с вероятностью 80% — около 80% случаев.
Каждый запуск привязан к соответствующей версии системы и ключевым конфигурациям, что позволяет отслеживать изменения вероятностей и аномальные результаты до их конкретных причин.
Базовая модель может быть обновлена или заменена, но определение проблемы, запись доказательств, изменения убеждений, результаты расчета и опыт калибровки остаются непрерывными.
Такие данные обратной связи невозможно массово сгенерировать постфактум — каждое наблюдение должно содержать суждение, сделанное до того, как будущее стало настоящим, и ждать ответа от реальности.
Код можно скопировать, но активы данных, накопленные со временем, нельзя создать быстро.
Конструкторское решение 3: Постоянное обновление с учетом причинно-следственных цепочек
Пока событие еще не рассчитано, постоянно появляются новые данные, политические и рыночные новости, и система должна определить, следует ли обновить первоначальную вероятность.
Rhizome сохраняет состояние убеждений для нерассчитанных проблем. Для каждого доказательства отдельно фиксируются время произошедшего события, время публикации контента и время считывания системой.
Когда новая информация полностью повторяет существующую запись, система пропускает обновление; когда новое доказательство противоречит старой записи, старое доказательство не удаляется, система сохраняет процесс исправления суждения.
Если единичное изменение вероятности превышает 0.15, оно должно указывать на конкретное новое доказательство, вызвавшее изменение.
Здесь возникает более сложный вопрос: представляет ли новое доказательство несколько независимых сил или же сигналы, оставленные одной и той же причинно-следственной цепочкой в разных точках?
Объявление о повышении ставок, изменение спредов и движение капитала могут появляться последовательно, но они не обязательно являются тремя независимыми единицами информации.
Если система учитывает их отдельно при обновлении вероятностей, одна и та же причина может быть учтена повторно, толкая вероятность к чрезмерно уверенным экстремумам.
Rhizome разрабатывает фреймворк байесовского обновления, учитывающий причинно-следственные цепочки: прежде чем доказательство попадет в обновление вероятностей, оно сначала идентифицируется по принадлежности к цепочке причинной передачи, и затем его вес корректируется в зависимости от внутрицепочечных отношений.
Этот фреймворк включает четыре уровня:
База знаний причинно-следственных связей: хранит проверенные причинно-следственные цепочки, фиксируя временные задержки передачи (conduction lag), затухание влияния и историческую достоверность ключевых отношений.
Дедупликация сигналов из одной цепочки: последующие сигналы из одной и той же причинно-следственной цепочки не будут повторно учитываться с полным весом, что позволяет избежать многократного вычисления одной и той же силы.
Глобальный предел апостериорной вероятности: ограничивает кумулятивное влияние нескольких однонаправленных доказательств, настраивая силу ограничения в зависимости от срока прогноза.
Учет временной задержки передачи: после того, как произошло событие в начале цепочки, система постепенно обновляет вероятности в соответствии с прогрессом передачи причинно-следственных связей, а не сразу полностью учитывает все влияние на результат в конце цепочки.

△
Во внутренней прогностической системе DigClaw прототип этого фреймворка уже реализован, прошел первоначальную проверку и использовался для руководства несколькими инвестиционными практиками.
Эксперименты показывают, что по сравнению с прямым байесовским агрегированием, дедупликация сигналов из одной цепочки и глобальный предел апостериорной вероятности снижают уровень излишней уверенности (доля ошибочных прогнозов с вероятностью выше 85%) с примерно 25% до 12%.
Почему инвестиционная компания создает прогностическую модель
Newborn Ventures, основанная DigClaw, является первой в мире инвестиционной и инкубационной компанией, движимой трендами Beta, выявленными с помощью ИИ.
База прогнозирования трендов DigClaw является основным технологическим фреймворком, поддерживающим эту AI-Native венчурную компанию.
Сущность инвестиций — это прогнозирование.
Оценка того, станет ли ниша популярной, добьется ли команда успеха, станет ли технология мейнстримом — все это проблемы прогнозирования.
Традиционные инвестиции полагаются на опыт, интуицию партнеров и информационное преимущество, но DigClaw верит, что эти суждения могут быть систематизированы и смоделированы.
С более широкой точки зрения: доходность инвестиций = Beta (движимая событиями/трендами) + Alpha (специфика актива).
Исследования Alpha уже относительно зрелы, но Beta — прогнозирование макроэкономических событий и трендов, пока не имеет по-настоящему эффективного решения на основе ИИ, и это именно та проблема, которую решает DigClaw.
Когда прогнозирование превращается из интуитивного суждения в параметр, который можно вызвать, интегрировать и откалибровать, сценарии принятия решений, в которые его можно внедрить, становятся гораздо более многочисленными, чем мы видим сейчас.
Для публичных компаний это означает стратегическое предвидение и заблаговременное предупреждение о рисках до того, как произойдут изменения в цепочке поставок или сформируется направление политики;
для инвестиционных компаний — обнаружение ценности до формирования консенсуса;
для государственных фондов развития — систематический анализ тенденций в отраслях и эффектов политики.
Одна и та же прогностическая способность проходит публичную оценку на FutureX, внутри — управляет инвестиционными решениями, а также предлагается в качестве услуги промышленным игрокам, финансовым учреждениям и государственным фондам развития.
Для DigClaw и Newborn Ventures первое место на FutureX — это старт, а не финиш.
О DigClaw
DigClaw — это технологическая компания в области ИИ, специализирующаяся на интеллекте прогнозирования. Ее основная миссия — создание прогностической инфраструктуры, которая может быть откалибрована, проаудирована и интегрирована.
Ее флагманский прогностический фреймворк Rhizome, используя трехслойную архитектуру причинно-следственных рассуждений, вероятностной калибровки и поискового интеллекта, реализует системную способность, независимую от базовой модели — модель можно заменить, а прогностические активы продолжают накапливаться.
Прогностическая система DigClaw уже получила внешнее подтверждение на публичных оценочных платформах, таких как FutureX, и применяет те же самые способности в реальных сценариях — принятие инвестиционных решений, анализ отраслевых трендов и оценка стратегических рисков, открывая возможности для сотрудничества с промышленными игроками, финансовыми учреждениями и государственными фондами развития.
О Newborn Ventures
Newborn Ventures — это венчурная компания ранней стадии и инкубатор, изначально созданные на основе ИИ (AI-Native).
Ее основное убеждение: сущность инвестиций — это прогнозирование. Оценка того, станет ли ниша популярной, добьется ли команда успеха, станет ли технология мейнстримом — все это проблемы, которые могут быть систематизированы и смоделированы.
Newborn Ventures с помощью собственных агентов глубокого поиска (Deep Research Agent) и системы причинно-следственного прогнозирования отслеживает инновационные сигналы в области AI-рассуждений по всему миру, обнаруживая структурные возможности, еще не оцененные рынком — истинную Beta.
Начиная с первого контакта и заканчивая инвестиционным решением, компания использует ИИ для преобразования каждого этапа, обещая предоставить содержательный технический фидбек в течение 48 часов.
Исследования — движущая сила. Не консенсус. Изначально ИИ.
*Эта статья была опубликована с разрешения QBitAI, мнения принадлежат исключительно автору.
Эта статья взята из официального аккаунта WeChat «QBitAI», автор: Yunzhong





