Запись предсказаний ИИ: Хотите заработать на предсказательных рынках с помощью ИИ? Но он, возможно, даже не прочитал вопрос внимательно

Odaily星球日报Опубликовано 2026-01-04Обновлено 2026-01-04

Введение

Автор Odaily星球日报 провел эксперимент по использованию искусственного интеллекта (Gemini 2.5 Pro и Grok 4 Fast) для прогнозирования исходов событий на рынке предсказаний Polymarket. Искусственный интеллект анализировал только официальные данные и новости, исключая данные с рынка предсказаний. Из 21 протестированного события Grok показал точность 75%, человек — 66,7%, а Gemini — лишь 52,4%. Анализ выявил ключевые ошибки ИИ: - Gemini иногда неправильно определял текущую дату. - Оба ИИ часто делали выводы на основе общих рассуждений, а не конкретных доказательств. - ИИ ошибались в интерпретации условий расчетов по контрактам. - Глубина анализа часто была недостаточной: Grok упускал исторические паттерны, а Gemini иногда делал неверные логические выводы. Несмотря на то, что Grok превзошел по точности многих успешных трейдеров, автор делает вывод, что ИИ еще далек от идеального прогнозирования и требует значительных улучшений в анализе и интерпретации данных.

Оригинал | Odaily Planet Daily (@OdailyChina)

Автор | Нань Чжи (@Assassin_Malvo)

После того как многие направления были дискредитированы, рынки предсказаний стали одним из немногих направлений в крипто-сообществе, которое продолжает позитивно расти. 20 ноября Нань Чжи начал экспериментировать с использованием подхода прошлого года по поиску «умных денег» на мемах для поиска «умных денег» на рынках предсказаний и на начальном этапе достиг хороших результатов.

В начале декабря, как раз в момент запуска Gemini 3 Pro, при тестировании соответствующих моделей возникла идея: можно ли использовать ИИ для анализа и прогнозирования рынков предсказаний, и устроить соревнование между человеком и ИИ, чтобы увидеть, чьи прогнозы точнее.

При описании рынков предсказаний обычно утверждается, что они способствуют движению рынка к «истине» за счет «ставок реальными деньгами людьми, обладающими знаниями». Однако некоторые считают, что Крипто + рынки предсказаний позволяют «инсайдерам» безопасно получать прибыль от информационного разрыва, тем самым направляя рынок к «инсайдерскому результату». По сути, это противостояние двух точек зрения: «коллективный разум» и «истина принадлежит немногим». Прогнозирование с помощью ИИ больше склоняется к «коллективному разуму», поэтому требует большого количества доступных знаний и информации.

Таким образом, при выборе модели ИИ изначально были выбраны Gemini и Grok, поскольку они, опираясь на Google и платформу X, могут наиболее непосредственно получать огромные объемы знаний и информации. Недавно Нань Чжи добавил комбинацию «Douban + знания из Douyin», но из-за небольшого количества прогнозных вопросов она пока не рассматривается в этой статье.

Основные правила

  • Версии ИИ: Gemini 2.5 pro (со встроенным поиском Google), Grok 4 Fast (через OpenRouter, с включенной нативной функцией поиска)
  • Выбор вопросов: человек выбирает вопросы для ставок, ИИ следует за прогнозом, но исключается крипто-сектор
  • Входные данные: официальный вопрос (title), официальное описание (Description), возможные ответы (фактически только Yes и No)

Примечание: Вопросы на Polymarket делятся на крупные категории Event и подкатегории Market. Крупная категория Event — это такие широкие вопросы, как «Кто будет следующим председателем ФРС» или «Когда Strategy продаст биткоин». Под Event есть N подкатегорий рынков, например, «Станет ли Хассет следующим председателем ФРС» или «Продаст ли Strategy биткоин до 31 марта 2026 года» — конкретные варианты выбора. Для соответствия с человеческим прогнозом здесь был выбран Market как вопрос для оценки ИИ, без ввода других опций. Например, ИИ просят определить «Станет ли Хассет следующим председателем ФРС», а не выбрать наиболее вероятного из N кандидатов.

  • Дизайн промптов (подсказок):
  • Требовать от ИИ поиска последних новостей, официальных заявлений, аналитических отчетов экспертов
  • Требовать исключить, запретить использование данных с预测рынков
  • Производить оценку на основе «доказательств», используя логические рассуждения
  • Разрешить вывод только Yes или No, с кратким объяснением логики рассуждений

Текущие результаты

Среди прогнозных вопросов, по которым уже подведены итоги (21), у Grok самый высокий процент побед — 75%, у человека — 66.7%, а у Gemini самый низкий — 52.4%. Текущие результаты можно посмотреть на соответствующем сайте.

Какие ошибки допустил ИИ?

Gemini иногда неправильно определяет текущее время

В вопросе «Will Trump's approval rating hit 35% in 2025?» Gemini заявил, что сейчас первая половина 2025 года, поэтому всё возможно, и дал случайный ответ.

Но когда автор с помощью программы прямо попросил Gemini вывести текущее время, Gemini смог дать правильный ответ. Пока неясно, почему возникает такая ошибка в восприятии времени.

Недостаточная глубина мышления ИИ

В вопросе «Gemini 3.0 Flash released by December 16?» Grok, основываясь на том, что «официальные источники最近 упоминали только Gemini 3 Pro и связанные с ним версии 2.5, очень редко упоминая 3 Flash, поэтому доказательств для判断 недостаточно», учел только текущую информацию.

В то время как Gemini указал: «Gemini 1.0 был выпущен в декабре 2023 года, а экспериментальная версия Gemini 2.0 Flash — в декабре 2024 года. Продолжая эту модель, логично выпустить версию 3.0 в конце 2025 года», и также обнаружил «недавнюю (14 декабря 2025 года) утечку демонстрации «Gemini 3.0 Flash», распространяющуюся в интернет-сообществах, что further усиливает вероятность его скорого публичного релиза».

Хотя с точки зрения结论 ответ Gemini оказался ошибочным, в этом вопросе явно видна значительная разница в широте используемых источников информации.

ИИ основывает выводы на общих знаниях, а не на доказательствах + логике

В вопросе «Trump approval Up or Down this week?» Gemini заявил: «Прогнозировать рейтинг одобрения на одну неделю более чем через год сопряжено с высокой неопределенностью», — снова проявилась ошибка «неправильного восприятия времени». Затем Gemini сказал: «В любую обычную неделю вероятность события, которое приведет к slight снижению рейтинга, может быть slightly выше, чем вероятность позитивного события, significantly повышающего рейтинг», — поэтому вероятность снижения поддержки выше. Сгенерированный вывод основан только на субъективных общих предположениях.

В этом же вопросе Grok, основываясь на новостных reports о «приостановке работы правительства, экономических опасениях, спорах вокруг иммиграционной политики и негативной реакции на комментарии по поводу смерти Роба Райнера», а также данных опросов, соответствовал ожиданиям дизайна.

Ошибка в判断 условий расчета

В вопросе «Will Trump release the Epstein files by December 20?» и Gemini, и Grok уже знали, что «правительство опубликует «сотни тысяч страниц» документов в пятницу (19 декабря)», при этом в условиях расчета четко указано: «Публичный релиз правительством любых документов, связанных с незаконной деятельностью Эпштейна, которые не были обнародованы до указанной даты, считается за Yes».

Однако при этом условии Gemini заявил, что «завершить публикацию «всех» документов до 20 декабря невозможно», явно misinterpreted условия, необходимые для расчета, и therefore дал错误的答案.

Краткий итог

В заключение, процент побед Grok в прогнозах уже превзошел показатели этих «умных денег», заработавших на预测рынках сотни тысяч, миллионы долларов. Однако при глубоком изучении логики его прогнозов仍然 есть много аспектов, которые можно направлять и исправлять.

Трендовые криптовалюты

Связанные с этим вопросы

QКакой искусственный интеллект показал наивысшую точность прогнозов в исследовании, описанном в статье?

AGrok 4 Fast показал наивысшую точность прогнозов с показателем 75%.

QКакие две основные философские концепции противостоят друг другу в прогнозных рынках, согласно статье?

AЭто противостояние «коллективного разума» (мудрости толпы) и концепции «истина принадлежит немногим».

QС какими двумя основными проблемами столкнулись модели ИИ при прогнозировании?

AМодели ИИ столкнулись с проблемами, такими как неправильное восприятие текущего времени и недостаточная глубина анализа, основанного на доказательствах.

QПочему авторы выбрали для эксперимента модели Gemini и Grok?

AОни были выбраны потому, что имеют прямой доступ к огромным массивам знаний и мнений через платформы Google и X соответственно.

QНа каком основании был урегулирован рынок, связанный с вопросом о файлах Эпштейна, что привело к ошибке ИИ?

AРынок должен был быть урегулирован как «Да», если любая часть файлов была опубликована к указанной дате, но ИИ ошибочно ожидал публикации всех файлов.

Похожее

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

Мультимодальные большие языковые модели (MLLM) часто неточно оценивают качество изображений из-за «семантического смещения» — они фокусируются на высокоуровневом содержании, а не на визуальных дефектах. Чтобы решить эту проблему, исследователи из Северо-Западного политехнического университета и Гонконгского университета науки и технологий представили IQA-T1 — новую архитектуру, которая заставляет MLLM оценивать качество на основе визуальных доказательств. Ключевая идея — предоставить модели набор специализированных инструментов для анализа. Во время работы модель самостоятельно решает, какие инструменты использовать для генерации структурированных «доказательств»: карты остаточного шума, спектры Фурье, карты согласованности градиентов и другие. Эти визуальные доказательства последовательно интегрируются в цепочку рассуждений, что делает оценку объективной и объяснимой. Обучение проходит в два этапа: контролируемая тонкая настройка (SFT) учит модель использовать инструменты и связывать доказательства с оценкой, а обучение с подкреплением (RL) оптимизирует стратегию их вызова, поощряя эффективность и избегая избыточности. Для обучения создан новый набор данных Q-Tool, содержащий 11k мультимодальных цепочек рассуждений с доказательствами. В тестах на 7 наборах данных IQA-T1 показала наилучший средний результат (PLCC 0.795 / SRCC 0.784), превзойдя современные методы. Модель не только точнее оценивает качество, особенно на синтетических и алгоритмических искажениях, но и предоставляет понятную, основанную на доказательствах цепочку рассуждений, делая процесс оценки прозрачным. Работа открывает путь к созданию более надежных и интерпретируемых систем визуального анализа.

marsbit3 мин. назад

Большая модель ставит оценку изображениям не только "на слово", используя структурные диаграммы и спектрограммы в качестве "материальных доказательств", для оценки изображений применяются "визуальные доказательства".

marsbit3 мин. назад

TRUMP держится на уровне $1,50 – Настройка на пробой или очередная бычья ловушка в третьем квартале?

Токен TRUMP удерживается вблизи уровня $1,50, демонстрируя устойчивую консолидацию на фоне роста открытого интереса (OI), что указывает на возможное накопление позиций трейдерами в ожидании значительного движения цены. Однако общая картина остается уязвимой. В третьем квартале TRUMP показывает снижение более чем на 5,3%, отставая от роста Bitcoin и продолжая серию квартальных убытков. Сектор мемкоинов в целом слабеет, а один из ключевых бычьих катализаторов для TRUMP — вероятность принятия закона CLARITY Act к концу 2026 года — по данным Polymarket, упала до рекордно низких 32%. Таким образом, несмотря на технические сигналы о возможном пробое, сочетание охлаждающегося спроса на мемкоины, угасания позитивных новостей и селективного притока капитала в другие активы (например, PEPE) повышает риски. Недавний отскок TRUMP может оказаться бычьей ловушкой, особенно если цена не удержит поддержку $1,50, что способно привести к более глубокому падению в третьем квартале.

ambcrypto3 мин. назад

TRUMP держится на уровне $1,50 – Настройка на пробой или очередная бычья ловушка в третьем квартале?

ambcrypto3 мин. назад

Allbridge приостанавливает основное протокол после эксплойта с мгновенным займом на $1,65 млн в сети Solana

Кросс-чейновая платформа Allbridge Core приостановила работу своего основного протокола после взлома, в результате которого 14 апреля было похищено 1,65 миллиона долларов. Атака произошла в развертывании платформы на блокчейне Solana, после чего средства были переведены в сеть Ethereum. Злоумышленник использовал стратегию мгновенного кредита (flash loan), взяв в займ 1,12 миллиона USDC на платформе Kamino. Последующие быстрые обмены между USDC и USDT создали дисбаланс цен в пуле ликвидности, что позволило эксплуатировать ошибку в алгоритме автоматического маркет-мейкера (AMM) и изъять средства по завышенной цене. Это уже вторая подобная атака на Allbridge Core после инцидента на 573 000 долларов в пулах BNB Chain в апреле 2023 года. Приостановка работы моста приводит к задержкам в обработке транзакций и сокращению доступной ликвидности, заставляя пользователей и поставщиков ликвидности искать альтернативы. Инцидент вновь подчеркивает сохраняющиеся риски безопасности, связанные с кросс-чейновыми мостами и пулами ликвидности.

TheNewsCrypto10 мин. назад

Allbridge приостанавливает основное протокол после эксплойта с мгновенным займом на $1,65 млн в сети Solana

TheNewsCrypto10 мин. назад

Корейский подрядчик проник в MetaMask на месяц, и настоящая уязвимость криптопроектов — не в коде

Автор: Liam 'Akiba' Wright Компиляция: TechFlow Консорциум Consensys, создатель кошелька MetaMask, сообщил об инциденте с безопасностью. Подрядчик, связанный с КНДР, получил доступ к репозиторию кода MetaMask через третьего поставщика услуг с 9 марта и работал до апреля, когда доступ был отключен. Consensys заявил, что расследование не выявило кражы активов или данных, развертывания вредоносного кода и какого-либо воздействия на безопасность пользователей. Компания быстро идентифицировала угрозу, прекратила доступ, начала расследование и уведомила правоохранительные органы. Инцидент высветил критическую уязвимость в аутсорсинге криптопроектов: 76% украденных из DeFi средств в первой половине 2024 года произошли из-за эксплуатации операционных уязвимостей (доступы, подписи), а не уязвимостей смарт-контрактов. Эксперты и руководства по безопасности (MetaMask, FBI, UK NCSC) рекомендуют следующие меры для снижения подобных рисков: * Тщательная проверка личности подрядчиков при найме и на постоянной основе. * Аудит компаний-поставщиков услуг. * Принцип минимальных привилегий (ограниченный доступ к коду). * Аппаратная аутентификация. * Независимый аудит каждого изменения в производственной среде. * Немедленный отзыв прав доступа при прекращении необходимости. * Мониторинг аномальной активности. Consensys также пересмотрел практики работы с третьими сторонами, распространив строгие внутренние стандарты на внешние отношения.

marsbit30 мин. назад

Корейский подрядчик проник в MetaMask на месяц, и настоящая уязвимость криптопроектов — не в коде

marsbit30 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Аналитики проводят параллели между биткоином и золотом, отмечая схожие черты: фиксированное предложение, статус негенерирующих доход активов-убежищ и зависимость цены от настроений инвесторов. Эксперт Bloomberg Intelligence Эрик Бальчунас указывает, что история золотых ETF за 22 года может служить дорожной картой для биткоин-ETF. После запуска в 2004 году золотые ETF пережили взлёты, болезненные коррекции и долгое восстановление, но каждый цикл устанавливал новые максимумы. Биткоин-ETF, одобренные в 2024 году, стали одними из самых быстрорастущих в истории, открыв криптоактив для институциональных инвесторов. Однако это привело к повышенной волатильности: крупные оттоки средств из ETF, как у BlackRock IBIT, могут оказывать значительное давление на рынок. Несмотря на падение цены более чем на 50% с октября 2025 года, многие остаются оптимистичны в долгосрочной перспективе, видя в биткоине "цифровое золото". Устойчивый институциональный спрос на ETF и растущее включение биткоина в инвестиционные портфели компаний помогают смягчать продажи. Если биткоин сможет занять даже небольшую часть рыночной капитализации золота (около $28 трлн), это откроет огромный потенциал для роста. Путь, вероятно, будет сопряжён с высокой волатильностью, но фиксированное предложение в сочетании с волнами институционального спроса может вновь привести к взрывному росту цены.

Foresight News47 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Foresight News47 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片