英伟达AI刷爆ARC-AGI-3,华人班底一口气屠了183关
英伟达的通用编码智能体AVO在著名的ARC-AGI-3评测中取得了满分成绩,成功通关全部25个游戏环境中的183个关卡,仅用6624步,RHAE得分达到100.00。ARC-AGI-3以不给规则、全靠智能体自主探索而著称,挑战性极高。
此前,即使是顶级模型Claude Opus 5单独测试,成绩也只有30.16%。AVO的核心创新在于不改变模型本身,而是在其外部增加了一套“外壳”系统。该系统主要由两大机制驱动:一是**持久记忆**,能保存历史尝试、结果和推理过程,避免因上下文长度限制导致“记忆清零”和重复试错;二是**监督器**,能监控主智能体的搜索轨迹,在其陷入停滞或无效循环时,将其引导至新策略。
值得注意的是,AVO在全程处理64×64像素游戏时,仅使用纯文本网格作为输入,未使用任何图像token。这套架构最初并非为游戏设计,其主战场是**GPU算子优化**。在相关论文中,AVO被设计为一个自主智能体式的“变异算子”,用于进化搜索优化CUDA内核。实验表明,它能自主运行数天,探索数百个优化方向,其生成的多头注意力内核性能甚至超越了英伟达自家的cuDNN和前沿的开源实现FlashAttention-4。
该项目由一支强大的华人技术团队主导,包括MXNet作者许冰、TVM/XGBoost作者陈天奇等。团队从一开始就瞄准了“盲编程”(完全自动化)的目标。英伟达此举的战略意义在于,其核心优势在于提供承载长时程、重负载智能体任务的算力平台与软件栈,而非模型本身。无论外部使用何种模型,对高性能计算的需求最终都将转化为对其硬件产品的依赖。
AVO的成功表明,在构建长时程自主智能体时,模型能力固然重要,但围绕记忆、工具、反馈和状态恢复所构建的完整系统架构同样至关重要。
marsbit08/24 07:26