Запись предсказаний ИИ: Хотите заработать на предсказательных рынках с помощью ИИ? Но он, возможно, даже не прочитал вопрос внимательно

marsbitОпубликовано 2026-01-04Обновлено 2026-01-04

Введение

Автор провел эксперимент, сравнивая точность прогнозов AI (Gemini 2.5 Pro и Grok 4 Fast) и человека на рынке предсказаний Polymarket. Исключив криптовалютные темы, AI анализировал вопросы, используя поиск новостей и данных, но без учета данных рынка предсказаний. Из 21 завершенного прогноза Grok показал наивысшую точность — 75%, человек — 66.7%, а Gemini — лишь 52.4%. Основные ошибки AI: - Gemini иногда ошибался в определении текущей даты. - Оба AI часто lacked глубины анализа, опираясь на поверхностные данные или общие знания вместо доказательств и логики. - AI неправильно интерпретировал условия расчетов по контрактам, например, требуя выполнения всех условий, когда достаточно частичных. Несмотря на то, что Grok превзошел многих успешных трейдеров, его прогнозы仍需 улучшение в области анализа и точности понимания условий.

Автор|Нань Чжи (@Assassin_Malvo)

После того как большинство направлений были опровергнуты, рынки предсказаний стали одним из немногих сегментов в криптосообществе, которые продолжают показывать положительный рост. 20 ноября Нань Чжи начал экспериментировать с подходом поиска "умных денег" на рынках предсказаний, используя методологию, применявшуюся в прошлом году для поиска умных денег в мемах, и на начальном этапе достиг хороших результатов.

В начале декабря, как раз в момент запуска Gemini 3 Pro, в процессе тестирования соответствующих моделей возникла идея: можно ли использовать ИИ для анализа и прогнозирования рынков предсказаний, и устроить соревнование между человеком и ИИ, чтобы выяснить, чьи прогнозы точнее.

При описании рынков предсказаний обычно утверждается, что они, позволяя "людям с инсайдерской информацией делать ставки реальными деньгами",推动市场向“真相”靠拢推动市场向“真相”靠拢 (двигают рынок к "истине"). Однако некоторые считают, что Крипто + рынки предсказаний позволяют "инсайдерам" безопасно получать прибыль от информационного разрыва, тем самым направляя рынок к "инсайдерскому результату". По сути, это противостояние двух точек зрения: "мудрость толпы" против "истина в руках немногих". Прогнозирование с помощью ИИ больше склоняется к "мудрости толпы", поэтому требует большого количества доступных знаний и мнений.

Таким образом, при выборе модели ИИ изначально были выбраны Gemini и Grok, поскольку они, опираясь на Google и платформу X, могут наиболее непосредственно получать огромные объемы знаний и информации. Недавно Нань Чжи добавил комбинацию "Douban (Доубао) + знания из Douyin (ТикТок)", но из-за небольшого количества прогнозных вопросов, связанных с этим, в данной статье она не рассматривается.

Основные правила

  • Версии ИИ: Gemini 2.5 pro (со встроенным поиском Google), Grok 4 Fast (через OpenRouter, с включенной функцией нативного поиска)
  • Выбор вопросов: человек выбирает вопросы для ставок, ИИ следует за прогнозом, но исключается крипто-сектор
  • Входные данные: официальный вопрос (title), официальное описание (Description), возможные ответы (фактически только Yes и No)

Примечание: Вопросы на Polymarket делятся на крупные категории Event и подкатегории Market. Крупная категория Event — это вопросы широкого охвата, такие как "Кто будет следующим председателем ФРС?" или "Когда Strategy продаст биткоин?". Под Event есть N подкатегорий рынков, например, "Станет ли Хассет следующим председателем ФРС?" или "Продаст ли Strategy биткоин до 31 марта 2026 года?" — конкретные варианты выбора. Чтобы согласовать с человеческим прогнозом, здесь был выбран Market как вопрос для оценки ИИ, без ввода других вариантов. Например, ИИ просят оценить "Станет ли Хассет следующим председателем ФРС?", а не выбрать наиболее вероятного из N кандидатов.

  • Дизайн промптов (подсказок):
  • Требовать от ИИ поиска последних новостей, официальных объявлений, аналитических отчетов экспертов
  • Требовать исключить, запретить использование данных预测市场 (рынков предсказаний)
  • Производить оценку на основе "доказательств", используя логические рассуждения
  • Разрешить вывод только Yes или No, с кратким изложением логики рассуждений

Текущие результаты

Среди прогнозных вопросов расчет проведен по 21. Наивысший процент побед у Grok — 75%, у человека — 66.7%, а у Gemini самый низкий — 52.4%. Текущие результаты можно посмотреть на соответствующем сайте.

Какие ошибки допустил ИИ?

Gemini иногда ошибается в определении текущего времени

В вопросе "Will Trump's approval rating hit 35% in 2025?" (Достигнет ли рейтинг одобрения Трампа 35% в 2025 году?) Gemini заявил, что сейчас первая половина 2025 года, поэтому всё возможно, и бездумно дал ответ.

Но когда автор с помощью программы прямо попросил Gemini вывести текущее время, Gemini смог дать правильный ответ. Пока неясно, почему возникает такая ошибочная оценка времени.

Недостаточная глубина мышления ИИ

В вопросе "Gemini 3.0 Flash released by December 16?" (Будет ли Gemini 3.0 Flash выпущен до 16 декабря?) Grok, основываясь на том, что "официальные источники最近只提及 (недавно упоминали) только Gemini 3 Pro и связанные версии 2.5,极少提及 (очень редко упоминали) 3 Flash, поэтому доказательств недостаточно для判断 (оценки)", учел только текущую информацию.

В то время как Gemini указал: "Gemini 1.0 был выпущен в декабре 2023 года, а экспериментальная версия Gemini 2.0 Flash — в декабре 2024 года. Продолжая эту модель, логично ожидать выпуск версии 3.0 в конце 2025 года", а также обнаружил "недавнюю (14 декабря 2025 года) утечку демонстрации 'Gemini 3.0 Flash', распространявшуюся в интернет-сообществах, что further enhanced (дополнительно усилило) вероятность его скорого публичного релиза".

Хотя с точки зрения结论 (заключения) ответ Gemini оказался ошибочным, в этом вопросе явно видна значительная разница в широте источников, на которые опираются две модели.

ИИ делает выводы на основе常识 (здравого смысла), а не доказательств + логики

В вопросе "Trump approval Up or Down this week?" (Рейтинг Трампа на этой неделе вырастет или упадет?) Gemini заявил: "预测 (Прогнозировать) рейтинг одобрения на одну конкретную неделю более чем через год highly uncertain (весьма неопределенно)", — здесь снова проявилась "ошибка времени". Затем Gemini сказал: "В любую обычную неделю вероятность событий, вызывающих轻微下降 (незначительное падение) рейтинга, может быть slightly higher (немного выше), чем вероятность позитивных событий, significantly提升 (значительно повышающих) рейтинг", поэтому вероятность падения поддержки больше. Сгенерированный вывод основан лишь на субъективных常识假设 (предположениях здравого смысла)).

В этом же вопросе Grok, основываясь на новостных reports (отчетах) и данных опросов о "приостановке работы правительства, экономических担忧 (опасениях), спорах вокруг иммиграционной политики и негативной реакции на комментарии по поводу смерти Роба Райнера", соответствовал ожиданиям дизайна.

Ошибка в判断 (оценке) условий расчета

В вопросе "Will Trump release the Epstein files by December 20?" (Опубликует ли Трамп файлы Эпштейна до 20 декабря?) и Gemini, и Grok уже знали, что "правительство опубликует 'сотни тысяч страниц' документов в пятницу (19 декабря)", а в условиях расчета четко указано: "Правительство публично выпускает любые документы, связанные с незаконной деятельностью Эпштейна, которые не были公开 (опубликованы) до указанной даты, считается как Yes".

Однако при этом условии Gemini заявил: "Завершить публикацию 'всех' документов до 20 декабря невозможно", явно misjudged (неверно оценил) условия, необходимые для расчета, и дал错误的答案 (неправильный ответ).

Краткий итог

В заключение, процент побед Grok в прогнозах уже превзошел показатели этих "умных денег", заработавших на рынках предсказаний сотни тысяч и миллионы долларов. Однако при глубоком изучении его прогнозной логики仍然有大量可以引导、改正的地方 (все еще есть много аспектов, которые можно направлять и исправлять).

Трендовые криптовалюты

Связанные с этим вопросы

QКакой ИИ показал наивысшую точность прогнозов в предсказательных рынках, согласно статье?

AGrok 4 Fast показал наивысшую точность прогнозов с процентом успеха 75%.

QКакие две основные философские концепции сталкиваются в предсказательных рынках, как описано в тексте?

AЭто противостояние концепций «коллективного разума» (мудрости толпы) и «истина принадлежит немногим» (внутренняя информация).

QС какими двумя основными проблемами столкнулись ИИ-модели при составлении прогнозов?

AОсновные проблемы: occasionalное неправильное восприятие текущего времени (Gemini) и принятие решений на основе общих предположений, а не доказательств и логики.

QПочему в эксперименте исключили криптовалютный сектор из выбора тем для прогнозов?

AЧтобы выровнять условия сравнения между человеком и ИИ, а также, вероятно, чтобы избежать влияния высокой волатильности и специфических факторов крипторынка на чистоту эксперимента.

QКакую ошибку совершил Gemini в вопросе о файлах Эпштейна, что привело к неверному прогнозу?

AGemini неправильно интерпретировал условия settlement'a. Он решил, что для ответа «Yes» необходимо опубликовать «все» файлы к указанной дате, хотя условие требовало публикации «любых» ранее не опубликованных файлов.

Похожее

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предоставляет понятную, основанную на доказательствах цепочку рассуждений, делая процесс оценки прозрачным. Работа открывает путь к созданию более надежных и интерпретируемых систем визуального анализа.

marsbit3 мин. назад

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbit3 мин. назад

TRUMP держится на уровне $1,50 – Настройка на пробой или очередная бычья ловушка в третьем квартале?

Токен TRUMP удерживается вблизи уровня $1,50, демонстрируя устойчивую консолидацию на фоне роста открытого интереса (OI), что указывает на возможное накопление позиций трейдерами в ожидании значительного движения цены. Однако общая картина остается уязвимой. В третьем квартале TRUMP показывает снижение более чем на 5,3%, отставая от роста Bitcoin и продолжая серию квартальных убытков. Сектор мемкоинов в целом слабеет, а один из ключевых бычьих катализаторов для TRUMP — вероятность принятия закона CLARITY Act к концу 2026 года — по данным Polymarket, упала до рекордно низких 32%. Таким образом, несмотря на технические сигналы о возможном пробое, сочетание охлаждающегося спроса на мемкоины, угасания позитивных новостей и селективного притока капитала в другие активы (например, PEPE) повышает риски. Недавний отскок TRUMP может оказаться бычьей ловушкой, особенно если цена не удержит поддержку $1,50, что способно привести к более глубокому падению в третьем квартале.

ambcrypto4 мин. назад

TRUMP держится на уровне $1,50 – Настройка на пробой или очередная бычья ловушка в третьем квартале?

ambcrypto4 мин. назад

Allbridge приостанавливает основное протокол после эксплойта с мгновенным займом на $1,65 млн в сети Solana

Кросс-чейновая платформа Allbridge Core приостановила работу своего основного протокола после взлома, в результате которого 14 апреля было похищено 1,65 миллиона долларов. Атака произошла в развертывании платформы на блокчейне Solana, после чего средства были переведены в сеть Ethereum. Злоумышленник использовал стратегию мгновенного кредита (flash loan), взяв в займ 1,12 миллиона USDC на платформе Kamino. Последующие быстрые обмены между USDC и USDT создали дисбаланс цен в пуле ликвидности, что позволило эксплуатировать ошибку в алгоритме автоматического маркет-мейкера (AMM) и изъять средства по завышенной цене. Это уже вторая подобная атака на Allbridge Core после инцидента на 573 000 долларов в пулах BNB Chain в апреле 2023 года. Приостановка работы моста приводит к задержкам в обработке транзакций и сокращению доступной ликвидности, заставляя пользователей и поставщиков ликвидности искать альтернативы. Инцидент вновь подчеркивает сохраняющиеся риски безопасности, связанные с кросс-чейновыми мостами и пулами ликвидности.

TheNewsCrypto10 мин. назад

Allbridge приостанавливает основное протокол после эксплойта с мгновенным займом на $1,65 млн в сети Solana

TheNewsCrypto10 мин. назад

Корейский подрядчик проник в MetaMask на месяц, и настоящая уязвимость криптопроектов — не в коде

Автор: Liam 'Akiba' Wright Компиляция: TechFlow Консорциум Consensys, создатель кошелька MetaMask, сообщил об инциденте с безопасностью. Подрядчик, связанный с КНДР, получил доступ к репозиторию кода MetaMask через третьего поставщика услуг с 9 марта и работал до апреля, когда доступ был отключен. Consensys заявил, что расследование не выявило кражы активов или данных, развертывания вредоносного кода и какого-либо воздействия на безопасность пользователей. Компания быстро идентифицировала угрозу, прекратила доступ, начала расследование и уведомила правоохранительные органы. Инцидент высветил критическую уязвимость в аутсорсинге криптопроектов: 76% украденных из DeFi средств в первой половине 2024 года произошли из-за эксплуатации операционных уязвимостей (доступы, подписи), а не уязвимостей смарт-контрактов. Эксперты и руководства по безопасности (MetaMask, FBI, UK NCSC) рекомендуют следующие меры для снижения подобных рисков: * Тщательная проверка личности подрядчиков при найме и на постоянной основе. * Аудит компаний-поставщиков услуг. * Принцип минимальных привилегий (ограниченный доступ к коду). * Аппаратная аутентификация. * Независимый аудит каждого изменения в производственной среде. * Немедленный отзыв прав доступа при прекращении необходимости. * Мониторинг аномальной активности. Consensys также пересмотрел практики работы с третьими сторонами, распространив строгие внутренние стандарты на внешние отношения.

marsbit31 мин. назад

Корейский подрядчик проник в MetaMask на месяц, и настоящая уязвимость криптопроектов — не в коде

marsbit31 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Аналитики проводят параллели между биткоином и золотом, отмечая схожие черты: фиксированное предложение, статус негенерирующих доход активов-убежищ и зависимость цены от настроений инвесторов. Эксперт Bloomberg Intelligence Эрик Бальчунас указывает, что история золотых ETF за 22 года может служить дорожной картой для биткоин-ETF. После запуска в 2004 году золотые ETF пережили взлёты, болезненные коррекции и долгое восстановление, но каждый цикл устанавливал новые максимумы. Биткоин-ETF, одобренные в 2024 году, стали одними из самых быстрорастущих в истории, открыв криптоактив для институциональных инвесторов. Однако это привело к повышенной волатильности: крупные оттоки средств из ETF, как у BlackRock IBIT, могут оказывать значительное давление на рынок. Несмотря на падение цены более чем на 50% с октября 2025 года, многие остаются оптимистичны в долгосрочной перспективе, видя в биткоине "цифровое золото". Устойчивый институциональный спрос на ETF и растущее включение биткоина в инвестиционные портфели компаний помогают смягчать продажи. Если биткоин сможет занять даже небольшую часть рыночной капитализации золота (около $28 трлн), это откроет огромный потенциал для роста. Путь, вероятно, будет сопряжён с высокой волатильностью, но фиксированное предложение в сочетании с волнами институционального спроса может вновь привести к взрывному росту цены.

Foresight News47 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Foresight News47 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片