神秘「牛来」大模型刷屏,限时免费

marsbit发布于2026-08-23更新于2026-08-23

文章摘要

近期,一款匿名大模型“Ox Alpha”在OpenRouter平台上线,因其代号中“Ox”意为“牛”,被国内网友称为“牛来”大模型。该模型拥有100万token上下文,支持文本、图片和视频输入,具备工具调用能力,目前限时免费。 “牛来”引发关注主要因其突出的代码能力。开发者在DeepSWE真实软件工程任务测试中,其初步通过率达到80%,表现逼近当前顶级代码模型。随后其他测试结果虽有波动,但均显示其具备强大的长程编码潜力。 关于模型身份,证据多指向智谱未发布的GLM-5.3系列。分析指出,其视频编码token消耗、文本tokenizer模式、拒绝处理音频的逻辑及回答风格等特征均与GLM系列高度吻合,且有匿名测试先例。但目前智谱官方未予回应。 与此同时,Code Arena平台出现了另一个匿名模型“korrine”,其身份猜测更为多元,涉及Kimi、Qwen、MiMo等多个中国团队。 大模型厂商采用匿名测试,旨在获取更客观的能力评估与压力测试结果,同时“猜模型”现象也延伸为一种营销手段,延长了话题讨论周期。如果“牛来”确为轻量版模型,其已展现的强劲性能令人对完整版充满期待。

大模型圈流行「挂马甲」测试。

近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:

「牛来」大模型。

根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。

上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。

初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。

与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。

8 月的大模型圈,突然变成了一场大型猜谜游戏。

「牛来」大模型表现抢眼

Ox Alpha 真正引发关注,靠的是代码能力。

开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。

DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。

不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。

不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。

「牛来」大模型到底是谁家的?

「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。

有人还专门写了个博客进行分析:

1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。

2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。

3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。

https://ox-alpha-evidence-production.up.railway.app/

还有网友从对话中寻到蛛丝马迹。

Ben Davis 认为 99% 确定这就是 GLM-5.x。

这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。

截至目前,OpenRouter、智谱都没有公开回应。

korrine 身份更扑朔迷离

「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。

最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。

不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。

评论区中,还有人将它指向 MiMo V3。

大模型厂商为什么喜欢「挂马甲」?

匿名测试正在成为大模型正式发布前的重要环节。

在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。

OpenRouter 提供的是另一类测试环境。

开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。

对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。

此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。

最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?

参考链接:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:关注AI的

相关问答

Q文章中提到的“牛来”大模型在DeepSWE测试中表现如何?

A根据文章内容,“牛来”大模型(Ox Alpha)在开发者Ben Davis从DeepSWE中抽取的10项任务中完成了8项,通过率达到80%。在对比结果中,其表现优于Fable 5 Max、GLM-5.3 Max、Grok 4.6 xhigh和GPT-5.6 Sol Max等模型。

Q文章中提到了哪些关于“牛来”大模型真实身份的证据或猜测?

A文章中提出的主要证据和猜测指向智谱的GLM-5.x系列模型。证据包括:1. 视频编码器消耗的视觉token与GLM-5V-Turbo完全一致。2. 文本tokenizer的token数量与GLM-5.3保持固定的差值。3. 其他特征如拒绝处理音频、回答风格、Agent执行步数等都接近智谱模型。此前智谱也有匿名测试的先例。

Q除了“牛来”大模型,文章中还提到了哪个匿名模型及其可能的来源?

A文章中还提到了一个在Code Arena上测试的名为“korrine”的匿名模型。其可能的来源猜测包括:1. Kimi K3.1。2. Qwen(通义千问)团队。3. MiMo V3。最初因代号结构与Kimi测试代号“kivine”相近而引发猜测,但爆料者后续补充可能另有来源。

Q文章中提到大模型厂商为什么喜欢“挂马甲”进行匿名测试?

A文章提到大模型厂商喜欢“挂马甲”进行匿名测试主要有以下几个原因:1. 在Arena中隐藏身份可以削弱品牌先入为主的影响,让用户根据实际输出选择,使对战结果更接近真实用户体验。2. 在OpenRouter等环境中接入编码Agent进行高强度任务,相当于公开压力测试,可以提前暴露问题、验证服务能力并积累口碑。3. “猜模型”的身份悬念也可以作为一种营销手段,拉长讨论周期。

Q文章中提到的“牛来”大模型有什么主要的技术规格?

A根据文章披露,“牛来”大模型(Ox Alpha)拥有100万token的上下文长度,支持文本、图片和视频输入,并且可以调用工具。文章指出,这些信息来源于OpenRouter平台的披露。

你可能也喜欢

刚刚,全球首场人机网球赛开战,机器人极限救球,让郑洁看呆了

8月22日,第二届世界人形机器人运动会上,全球首场人机网球对战开赛。由中国银河通用机器人研发的人形机器人“银河星仔”与网球名将郑洁进行了单打对决,并与人类搭档进行了混合双打。比赛中,机器人展现了发球、正反拍击球、跨步救球等多项能力,甚至在摔倒后能自行调整站起继续比赛,发球时速超过一百公里,反应时间仅零点几秒。 这场赛事被视为具身智能领域的重大突破。网球运动对机器人的实时感知、决策与全身运动协调能力提出了极限挑战,其动态对抗环境远复杂于围棋等数字博弈。机器人成功的背后,是银河通用自研的“银河星脑”大模型,该模型创新地将高层任务决策与底层运动控制集成于单一架构,避免了传统分层模式的信息损耗与延迟。 训练方面,团队首先从“不完美”的人类网球数据中学习运动规律,随后在“银河星坊”平台构建的虚拟环境中,让智能体进行海量对抗训练,通过自我博弈涌现出滑步救球、倒地起身等未预设技能,最终将能力迁移至实体机器人。 此举标志着AI从数字世界的思考,迈入了能与物理世界实时交互、闭环执行的“具身智能”新阶段。如同十年前AlphaGo战胜李世石,此次人机网球赛成为中国技术创新在智能机器人领域的一个重要里程碑。

marsbit1小时前

刚刚,全球首场人机网球赛开战,机器人极限救球,让郑洁看呆了

marsbit1小时前

AI 支付最大的黑马,或许是给了 Agent 一个钱包的 Coinbase

在AI支付领域,人们通常关注Visa、Mastercard等传统支付巨头或OpenAI等AI平台。然而,Coinbase通过一系列布局,已悄然成为Agent(人工智能体)支付最大的实际运行方。 数据显示,链上Agent交易超90%发生在Coinbase运营的Base链上,99%的Agent商务交易以USDC结算,超97%使用x402协议。这背后是Coinbase在2026年2月推出的“Agentic Wallets”基础设施,它让AI Agent能够拥有自己独立的链上钱包地址、持有资产并自主执行支付,而不再依赖人的账户作为中间层。 为何Agent需要一个专属钱包?核心在于Agent间交易的特性:微额、高频、自动化。使用人的信用卡会面临手续费过高、需频繁人工授权、交易归属不清等问题。而基于稳定币(如USDC)的链上钱包,转账成本极低,支出权限可由代码策略控制,且链上身份使得追溯清晰。 Coinbase的布局形成了完整闭环:拥有Base链(交易层)、Agentic Wallets(账户层)、x402协议(通信标准)以及USDC等资产。这使得Agent从持有资金到完成支付的全流程可在其体系内完成,这是Visa、Stripe等仅具备部分环节的公司所不具备的优势。 Coinbase能占据这一位置,带有一定的“无心插柳”色彩。其最初构建Base链和x402协议并非专为Agent支付设计,但当Agent经济爆发时,这些低成本、适合机器间交易的基础设施恰好满足了需求。这表明,在新兴基础设施需求出现时,红利往往属于那些已进行长期底层积累的参与者。 当前,AI支付的讨论多集中于协议标准、支付轨道之争。Coinbase的案例表明,实际落地可能更取决于“谁的基础设施已就绪”。在标准争论未定时,真实的Agent支付需求已然产生,而Coinbase凭借其准备就绪的生态,率先抓住了这波红利。它虽不一定是最终赢家,但无疑是目前的领跑者。

marsbit2小时前

AI 支付最大的黑马,或许是给了 Agent 一个钱包的 Coinbase

marsbit2小时前

交易

现货
活动图片