AI预测实录:想靠AI在预测市场赚钱?但它可能连题目都没看清

Odaily星球日报发布于2026-01-04更新于2026-01-04

文章摘要

预测市场是加密货币领域少数仍在增长的赛道之一。作者尝试使用AI模型(Gemini 2.5 Pro和Grok 4 Fast)对预测市场进行分析,并与人类预测进行对比。实验排除了加密货币类题目,仅输入题目、描述和选项,并要求AI基于最新新闻和专家分析进行逻辑推理,禁止使用预测市场数据。 在已结算的21个题目中,Grok胜率最高(75%),人类为66.7%,Gemini最低(52.4%)。分析发现AI存在以下问题:Gemini偶尔误判当前时间;思考深度不足,未能结合历史模式推理;依赖主观常识而非证据;错误理解结算条件。尽管Grok胜率较高,但其预测逻辑仍有改进空间,例如需更准确理解题目要求和加强推理深度。

原创 | Odaily 星球日报(@OdailyChina)

作者|南枳(@Assassin_Malvo)

多数赛道证伪后,预测市场成为 Crypto 圈内少数仍在正向增长的赛道之一。11 月 20 日,南枳开始尝试用去年寻找 Meme 聪明钱的思路寻找预测市场聪明钱,并在初期取得了较好的成果。

12 月初,正值 Gemini 3 Pro 上线,在测试相关模型的时候想到是否可以使用 AI 对预测市场进行分析和预测,并由人类对阵 AI 看哪方预测更为准确。

在对预测市场做介绍时,通常宣称其通过“让有见解的人使用真金白银下注”,从而推动市场向“真相”靠拢。但也有人认为 Crypto+预测市场让“内幕人士”可以安全地获取信息差所带来的利润,从而带动市场向“内幕结果”发展,这本质上是“群体智慧”与“真理掌握在少数人手中”两种观点的交锋,而 AI 预测更偏向于“群体智慧”,因此需要有大量的可用知识和见解。

所以在如何选择 AI 模型的问题上,初步选用了 Gemini 和 Grok,因为二者依靠着 Google 和 X 平台,可以最直接地获取大量的知识与见解,近期南枳又新增了“豆包+抖音知识”的组合,但由于预测题目尚不多在本篇暂不涉及。

基本规则

  • AI 版本:Gemini 2.5 pro(自带 Google 搜索)、Grok 4 Fast(通过 OpenRouter 调用,启用原生搜索功能)
  • 题目选择:由人类选择下注题目,AI 跟随预测,但排除了 Crypto 板块
  • 输入内容:官方题目(title)、官方描述(Description)、可选答案(其实只有 Yes 和 No)

注:Polymarket 的题目分为大类 Event 和子类 Market,大类 Event 为“谁是下一任美联储主席”、“Strategy 什么时候会卖出比特币”这种大范围的题目,Event 下面又包含了 N 个子类市场,例如“哈赛特是否会成为下一任美联储主席”、“Strategy 在 2026 年 3 月 31 日前会卖出比特币”这种具体的选择。为了与人类预测对齐,这里选择了 Market 作为 AI 判断的题目,不向其输入其他选项,例如只让他判断“哈赛特是否会成为下一任美联储主席”,而非让他从 N 个候选人中选出最有可能的那一个。

  • 提示词设计:
  • 要求 AI 搜索最新新闻、官方公告、专家分析报告
  • 要求剔除、禁止使用预测市场数据
  • 基于“证据”,运用逻辑推理进行判断
  • 只允许输出 Yes 和 No,并用一段话阐述推理逻辑

当前结果

预测题目中,已结算 21 个,Grok 胜率最高为 75%,人类为 66.7%,而 Gemini 最低为 52.4%。目前结果可在相关网站查看。

AI 犯了什么错?

Gemini 偶尔误判当前时间

在题目”Will Trump's approval rating hit 35% in 2025?“中,Gemini 表示目前是 2025 年上半年,所以一切皆有可能,胡乱给出了答案。

但作者使用程序直接要求 Gemini 输出当前时间时,Gemini 能够给出正确答案,尚不清楚为何会出现这样的错误时间认知。

AI 思考深度不足

在题目“Gemini 3.0 Flash released by December 16?”中,Grok 根据“官方最近只提及 Gemini 3 Pro 及 2.5 相关版本,极少提及 3 Flash,因此证据不足不能判断”,只考虑了当下信息。

而 Gemini 指出“Gemini 1.0 于 2023 年 12 月发布,而 Gemini 2.0 Flash 的实验版于 2024 年 12 月推出。延续这一模式,在 2025 年底推出 3.0 版本是合乎逻辑的”,并且发现了“最近(2025 年 12 月 14 日)在网络社区中流传的一个关于“Gemini 3.0 Flash”的泄露演示,进一步增强了其即将公开发布的可能性”。

虽然从结论上来看,Gemini 的答案反而是错误的,但在本题目中可以明显看出二者所依赖的资料广度存在明显差距。

AI 基于常识而非基于证据+逻辑进行推断

在题目“Trump approval Up or Down this week?”中,Gemini 表示“对一年多以后的单周民意调查支持率进行预测具有高度的不确定性”,首先再次出现了“时间误判”的情况。然后 Gemini 表示“在任何一个普通星期内,出现导致支持率轻微下降的事件的概率,可能略高于出现能显著提升支持率的正面事件的概率”,所以支持率下降的可能性更大,生成的结论仅依据主观常识假设。

而本题目中,Grok 基于“政府关门、经济担忧、移民政策争议以及对罗伯·莱纳去世评论引发的负面反弹影响”等新闻报道以及民调数据,符合设计预期。

结算条件判断有误

在题目“Will Trump release the Epstein files by December 20?”中,Gemini 和 Grok 均已知道“政府将于周五(12 月 19 日)公布‘数十万页’文件”,而结算条件中明确指出“政府公开发布任何与爱泼斯坦非法活动相关且在所列日期前未公开的文件,即判断为 Yes”。

然而在这一条件下,Gemini 表示“在 12 月 20 日之前完成‘所有’文件的公布是不可能的”,明显误判了结算所需要的条件,因此给出了错误答案。

小结

综上,Grok 的预测胜率已经超越了这些在预测市场上盈利数十万、百万美元的聪明钱,但深入探究其预测逻辑,仍有大量可以引导、改正的地方。

热门币种推荐

相关问答

Q文章中提到,在预测市场中使用AI进行预测时,主要选择了哪两个AI模型?

A文章主要选择了Gemini 2.5 pro(自带Google搜索)和Grok 4 Fast(通过OpenRouter调用,启用原生搜索功能)两个AI模型进行预测。

QAI在预测过程中被要求使用哪些信息源?禁止使用什么数据?

AAI被要求搜索最新新闻、官方公告、专家分析报告作为信息源,但禁止使用预测市场数据。

Q在已结算的21个预测题目中,Grok、人类和Gemini的胜率分别是多少?

AGrok的胜率为75%,人类的胜率为66.7%,而Gemini的胜率最低,为52.4%。

Q文章指出AI在预测中犯了哪些主要错误?

AAI在预测中主要犯了以下错误:偶尔误判当前时间;思考深度不足,仅考虑当下信息;基于常识而非证据和逻辑进行推断;以及结算条件判断有误。

Q文章认为预测市场本质上是哪两种观点的交锋?

A预测市场本质上是“群体智慧”与“真理掌握在少数人手中”两种观点的交锋。

你可能也喜欢

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit5小时前

如何让自己变得让人工智能永远也无法取代

marsbit5小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru8小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru8小时前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

536人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.5k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片