Alpha Arena 揭示 AI 交易缺陷:西方模型在一周内损失 80% 资本

marsbit发布于2025-10-27更新于2025-10-28

AI 能交易加密货币吗?来自纽约计算机工程师兼金融从业者 Jay Azhang 正在通过 Alpha Arena 对这个问题进行测试。该项目让最强大的大型语言模型相互对抗,每个模型拥有价值 1 万美元的资本,看哪个能在加密货币交易中赚更多钱。这些模型包括 Grok 4、Claude Sonnet 4.5、Gemini 2.5 pro、ChatGPT 5、Deepseek v3.1 和 Qwen3 Max。

现在你可能在想「哇,这真是个绝妙的主意!」 并且会感到惊讶,在撰写本文时,五个 AI 中有三个处于亏损状态,而 Qwen3 和 Deepseek 这两个中国开源模型领先。

AI models

没错,西方世界最强大、闭源、由谷歌和 OpenAI 等巨头运营的专有人工智能,在短短一周多的时间里已经损失了超过 8000 美元,占其加密货币交易资本的 80%,而东方的开源同行则处于盈利状态。

迄今为止最成功的交易?Qwen3 保持利润且持续盈利,仅通过简单的 20 倍比特币多头头寸。Grok 4 毫不意外地在比赛的大部分时间里一直以 10 倍杠杆做多狗狗币,曾一度与 Deepseek 一起位居榜首,现在却接近亏损 20%。也许埃隆·马斯克应该发个狗狗币表情包什么的,让 Grok 摆脱困境。

AI models

与此同时,谷歌的 Gemini 则无情地看跌,对所有可交易的加密资产做空,这一立场呼应了它们过去 15 年来的总体加密货币政策。

最后它连续一周做出了所有可能出现的错误交易,能做到那么差也是需要技巧的,尤其是当 Qwen3 只是做多比特币的情况下。如果这就是闭源 AI 所能提供的最好水平,那么也许 OpenAI 应该继续保持闭源,免得让我们遭受损失。


AI 的新基准

让 AI 模型在加密货币交易竞技场中相互对抗的想法具有一些非常深刻的见解。首先 AI 无法在预训练中获得加密货币交易知识测试的答案,因为它是不可预测的,这是其他基准测试所面临的问题。换句话说,许多 AI 模型在训练中就被提供了其中一些测试的答案,因此它们在测试时自然表现良好。但一些研究表明,对这些测试稍作改动会导致 AI 基准测试结果发生巨大变化。

这一争议引出了一个疑问:什么是智能的终极测试?根据 Grok 4 的创造者、钢铁侠爱好者埃隆·马斯克的说法,预测未来是智能的终极衡量标准。

AI models

而且我们得承认,没有比加密货币的短期价格更不确定的未来了。用 Azhang 的话说,「我们 Alpha Arena 的目标是让基准测试更接近现实世界,而市场对此来说是完美的。它们是动态的、对抗性的、开放式的且永远不可预测的。它们以静态基准测试无法做到的方式挑战 AI。市场是 AI 的终极测试。」

这种关于市场的见解深深植根于比特币诞生的自由主义原则之中。像穆雷·罗斯巴德和米尔顿·弗里德曼这样的经济学家在一百多年前就指出,市场从根本上说是中央政府无法预测的,只有那些需要承担损失的个体做出真实的经济决策时,才能进行理性的经济计算。

换句话说,市场是最难预测的事物,因为它取决于全世界智能个体的个人观点和决策,因此它是对智能的最佳测试。

Azhang 在其项目描述中提到,指示 AI 进行交易不仅是为了收益,还要考虑风险调整后的回报。这个风险维度至关重要,因为一笔糟糕的交易就可能抹去之前所有的回报,例如在 Grok 4 的投资组合崩盘中看到的那样。

还存在另一个问题,那就是这些模型是否从它们交易加密货币的经验中学习,这在技术上并不容易实现,因为 AI 模型首先进行预训练的成本非常高昂。它们可以用自己的交易历史或他人的历史进行微调,它们甚至可能将最近的交易保留在短期记忆或上下文窗口中,但这只能让它们走到这一步。最终正确的 AI 交易模型可能必须真正从自身的经验中学习,这项技术最近已在学术界宣布,但在成为产品之前还有很长的路要走。MIT 称它们为自我适应的 AI 模型。


我们如何知道这不仅仅是运气?

对该项目及其迄今为止结果的另一项分析是,它可能与「随机游走」无法区分。随机游走类似于为每个决策掷骰子。这在图表上会是什么样子?实际上有一个模拟器你可以用来回答这个问题;实际上看起来不会有太大不同。

AI models

市场中的运气问题也已被像纳西姆·塔勒布这样的知识分子在其著作《反脆弱》中相当仔细地描述过。他在书中论证,从统计学的角度来看,一个交易者,比如说 Qwen3,连续整整一周都很幸运,这是完全正常且可能的!从而导致其看起来具有卓越的推理能力。塔勒布的观点远不止于此,他认为华尔街有足够多的交易者,以至于其中一个人很容易连续走运 20 年,建立起神一样的声誉,周围所有人都认为这个交易者就是个天才,直到运气耗尽。

因此,为了让 Alpha Arena 产生有价值的数据,它实际上必须运行很长时间,并且其模式和结果也需要独立地进行复制,同时涉及真实资本的风险,然后才能被认定为与随机游走不同。

最终到目前为止,看到像 DeepSeek 这样开源、成本效益高的模型表现优于闭源的同行。Alpha Arena 迄今为止一直是一个很好的娱乐来源,因为它在上周已经在 X.com 上病毒式传播。它的未来走向谁也猜不透;我们将不得不看看其创造者所采取的赌博:给五个聊天机器人 5 万美元用于加密货币赌博,最终是否会得到回报。

热门币种推荐

你可能也喜欢

2万亿美元,AI史上最大IPO进入倒计时

AI公司Anthropic预计将于今年十月进行IPO,估值可能突破2万亿美元,这将是史上最大规模的AI公司上市。其估值由六位投资人根据模型推算得出,其中有人甚至预估超过3万亿美元。公司内部对此并未设定明确目标。 Anthropic在短短五年内实现了惊人增长,从初创公司迅速跻身巨头行列。2025年底年化收入约90亿美元,到2026年5月已飙升至470亿美元,第二季度营收达115亿美元,同比激增14倍。内部预测,到2028年营收可能达到1900亿至2000亿美元。 公司收入主要依靠API和企业合同,按调用量计费,其中编程辅助工具Claude Code是增长核心,贡献近两成收入,在企业和开发者中广泛使用。 然而,公司内部正面临文化撕裂。CEO达里奥·阿莫代伊及其核心团队带有强烈的“拯救人类”使命感,被部分员工形容为“祭司阶层”,其管理风格引发基层员工不满,甚至出现了秘密的吐槽网络。员工在即将到来的财富自由与压抑的工作环境之间陷入挣扎。 Anthropic目前处境微妙:追求最安全的AI需要巨额算力投入,而这又依赖于资本市场支持,迫使公司在理想与商业现实间寻找平衡。其IPO前景虽被看好,但SpaceX上市后股价大跌的前例,以及监管、成本和内部治理等挑战,都为其未来增添了不确定性。

marsbit57分钟前

2万亿美元,AI史上最大IPO进入倒计时

marsbit57分钟前

降本增效的AI,让VC越来越烧钱

《降本增效的AI,让VC越来越烧钱》一文指出,尽管AI技术降低了创业公司的部分运营和开发成本,却推高了风险投资(VC)获取优质AI公司股权的价格。AI领域融资呈现“杠铃型”结构:一方面,普通初创企业融资规模趋于小额化;另一方面,顶尖团队(如来自OpenAI、Google DeepMind的核心人员)的早期项目估值急剧膨胀,数亿甚至上百亿美元的融资与估值在成立初期便已出现。 这种趋势导致VC持股成本显著上升。早期估值飙升的同时,创始人让渡的股权比例并未同步增加,使得VC为维持相同持股比例所需投入的资金大幅增加。为此,大型风投机构(如Accel、a16z)纷纷募集更大规模的基金,以覆盖从早期进入到后期跟投的全周期,确保在头部项目竞争中不落下风。 资金进一步向少数头部AI项目集中。2026年上半年,全球超70%的创业融资流向AI公司,其中OpenAI和Anthropic两家就占据了全球创业融资总额的43%。这种集中化加剧了VC行业的马太效应,大型基金凭借资金优势持续加码潜在赢家,而小型基金参与热门项目的能力受到削弱。 然而,高估值已提前计入了未来增长预期。若企业最终无法实现与估值匹配的商业化规模,投资回报将面临压缩。目前,许多基金的账面收益仍依赖后续融资的估值重估,而非实际退出。对大型VC而言,当下的核心策略已转变为:在技术“超级周期”中尽早押注潜在龙头,并为伴随估值飙升的持续跟投储备充足弹药。AI降低了创业门槛,却让投资优质AI公司的成本变得愈发昂贵。

marsbit1小时前

降本增效的AI,让VC越来越烧钱

marsbit1小时前

八年投入急转弯,以太坊为何突然放弃Poseidon?

以太坊基金会研究员Justin Drake近日宣布,以太坊将在Layer 1层放弃已研发八年的SNARK友好型哈希算法Poseidon,转而采用SHA2或BLAKE2等传统哈希函数。这一重大转向源于后量子密码学研究的突破性进展。 Poseidon自2019年起因其在零知识证明电路中的高效性,被广泛用于zkRollup等应用。但其算法历史较短,密码学分析时间不足。而随着后量子安全成为硬性要求,其局限性显现。最新的SNARK设计,特别是基于“二进制域”的证明系统(如Binius和Flock),已能高效处理传统哈希函数的布尔运算,使得SHA2等成熟算法在证明性能上可媲美甚至超越Poseidon,消除了采用后者的主要优势。 另一关键因素是应对量子计算威胁的时间表正在加速。报告预测“量子破译日”可能在本世纪30年代初到来,将对区块链资产构成巨大风险。以太坊因此需要尽快采用经过长期密码分析验证的、抗量子攻击能力更强的哈希方案。其后续量子路线图计划于2027年推出核心构件leanVM,并在2028年完成共识层、执行层和数据层的部署。 与此同时,其他公链如Solana已选定后量子签名方案Falcon,而StarkNet也计划采用BLAKE2等算法。以太坊此次转向,标志着技术重点从“设计SNARK友好型哈希”转变为“设计哈希友好型SNARK”,是在后量子时代选择更成熟、更稳健的密码学基元的战略调整。

marsbit2小时前

八年投入急转弯,以太坊为何突然放弃Poseidon?

marsbit2小时前

全球程序员都在给Anthropic白送钱!官方终于看不下去了

Anthropic官方发布博客,针对开发者使用Claude Code时可能产生的不必要高额费用,总结了六条核心省钱建议: 1. 任务完成后及时使用 `/clear` 清理对话,避免无关历史占用上下文。 2. 对话开始时固定好模型和推理强度,中途切换会导致提示缓存失效,需全价重新计算历史。 3. 使用 `@` 引用文件,而非手动输入路径,可避免Claude进行工具调用和试探性读取,减少上下文累积。 4. 为输出冗长的命令(如运行测试)添加静默参数,减少输出内容对上下文的占用。 5. 在会话缓存仍有效时(如休息前)进行 `/compact` 压缩对话,成本仅为十分之一。 6. 将产生大量输出的任务交由子Agent处理,其独立上下文不会污染主对话。 文章解释了费用产生的机制:输入token(预填充)成本较低,输出token(解码)成本约为其5倍。模型(Opus/Sonnet/Haiku)和推理强度直接影响单价和token数量。 **提示缓存是关键的省钱杠杆**:若请求前缀与之前完全相同,服务器可加载缓存结果,读取成本仅为正常输入价的10%。但切换模型、改变推理强度、执行压缩、缓存过期等操作都会导致缓存失效。 此外,对话历史会因不断追加文件内容和命令输出而“变胖”,导致后续每轮对话成本呈接近平方级(O(n²))增长。除了上述建议,还可使用 `/rewind` 回退无效轮次以保住前面缓存。 文章指出,管理token开销正成为AI时代开发者的新技能,关系到使用效率和成本控制。Anthropic自身大量使用AI编写代码,精细的成本管理至关重要。

marsbit4小时前

全球程序员都在给Anthropic白送钱!官方终于看不下去了

marsbit4小时前

交易

现货

热门文章

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.8k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片