Топовые ИИ-модели не осилили видеоигры девяностых

cryptonews.ru发布于2025-03-21更新于2025-04-21

Даже самые продвинутые ИИ-модели не способны эффективно играть в классический шутер от первого лица Doom. К такому выводу пришли эксперты после проверки нейросетей в новом бенчмарке VideoGameBench.

Claude can play Pokemon, but can it play DOOM?

With a simple agent, we let VLMs play it, and found Sonnet 3.7 to get the furthest, finding the blue room!

Our VideoGameBench (twenty games from the 90s) and agent are open source so you can try it yourself now —> 🧵 pic.twitter.com/vl9NNZPBHY

— Alex Zhang (@a1zhang) April 17, 2025

Тест призван проверить способность современных нейросетей играть и побеждать в 20 популярных видеоиграх. Использовать они могут только информацию с экрана.

«Современные модели VLM с трудом справляются с видеоиграми из-за высокой задержки вывода. Когда агент делает снимок экрана и запрашивает VLM о том, какое действие ему следует предпринять, к моменту получения ответа состояние игры значительно меняется, и действие уже неактуально», — отметили исследователи.

Для теста использовались классические игры из 1990 годов из-за простых визуальных эффектов и различных стилей ввода вроде мыши, клавиатуры и игрового контроллера. Такой подход позволяет проверить у модели пространственное мышление и «зрение».

VideoGameBench разработан ученым и ИИ-исследователем Алексом Чжаном. В бенчмарк входят Warcraft II, Age of Empires, Prince of Persia и другие игры.

Список игр из бенчмарка VideoGameBench. Данные: сайт vgbench.

Sonnet 3.7 справилась с Doom лучше остальных — нейросеть нашла синюю комнату.

Исследователи подчеркнули, что задержка реакции — главная проблема в шутерах от первого лица. В быстро меняющейся обстановке враг может переместиться или даже добраться до игрока раньше его реакции на происходящее.

Помимо проблем с пониманием игрового окружения, модели также не могли выполнить основные действия.

«Мы часто наблюдали случаи, когда агент не мог понять, как его действия вроде движения вправо будут отображаться на экране. Самой распространенной ошибкой среди всех протестированных нами пограничных моделей оказалась неспособность надежно управлять мышью в таких играх, как Civilization и Warcraft II, где очень важны точные и частые движения», — отметили эксперты.

Также модели не всегда понимают игровые механики, когда нет прямой инструкции о необходимых действиях.

Напомним, в феврале ИИ-стартап Anthropic представил свою «самую интеллектуальную модель» Claude 3.7 Sonnet, которая прошла игру Pokemon.

你可能也喜欢

解读资产上链背后的杠杆、流动性与风险真相

RWA(现实世界资产)代币化常被讨论,但其价值不在于简单的资产上链,而在于能否在DeFi生态中实现高效、有韧性的金融运作。文章指出,代币化仅是赋予资产一个可识别的数字凭证(如同条形码),真正的变革来自DeFi提供的杠杆、流动性和风险管理能力。 核心挑战在于RWA与DeFi存在多重“时间时钟”冲突:区块链实时结算,而底层传统资产交易、赎回和处理存在延迟。这导致在压力情景下(如周末清算),链上快速处置需求与现实世界缓慢流程之间产生缺口,低波动资产(如国债代币)可能因流动性不足而比高波动加密资产风险更高。 真正的流动性并非总锁定价值(TVL),而是在需要时能否在限定时间内以可接受价格退出。资产需具备多条清晰的退出路径(二级市场卖出、发行方赎回、抵押借贷)。 杠杆能释放资产效用(如抵押借贷),但也引入脆弱性。抵押率的设定需综合考虑法律可执行性、数据新鲜度、赎回延迟、市场深度等多重风险,而不仅是资产波动率。因此,某些情况下国债代币的抵押率应低于ETH。 RWA的风险是一张相互关联的图谱,涉及发行方、托管、预言机、流动性提供者、协议等多节点,需持续监控链下指标(如赎回排队、市场深度)而不仅依赖价格信号。 展望未来,国债代币仅是起点。算力、能源等复杂资产以及代币化股票与永续合约的结合将带来更大机遇与更复杂的风险,需要精心设计风险隔离、动态抵押等机制。 最终,RWA的意义不在于代币本身,而在于其能否融入一个健壮的、可编程的市场体系,在压力下完成估值、融资、对冲和处置,实现资本的高效配置和风险管理。代币是条形码,市场才是运转的机器。

marsbit32分钟前

解读资产上链背后的杠杆、流动性与风险真相

marsbit32分钟前

数学的终结:40位顶尖数学家齐聚OpenAI秘密会议

今年8月初,刚刚获得菲尔兹奖的Jacob Tsimerman与OpenAI科学家Sébastien Bubeck在旧金山召集约40位顶尖数学家举行闭门峰会。会议上一场报告标题为“数学的终结”,引发对人工智能可能终结人类数学研究的深度担忧。 近期AI在数学领域取得一系列突破性成果:5月,OpenAI未发布模型推翻了悬置多年的“单位距离猜想”;8月,该公司又公布了10项AI生成的数学与计算机科学新发现;Anthropic员工利用Claude构造出668维超立方体上的垂直向量对。这些成果绕过了传统的学术发表流程,通过社交媒体等方式快速传播。 数学界的反应出现分裂。超过3000名数学家签署“莱顿宣言”,呼吁负责任地使用AI并确保成果的可验证性。另一些学者则主张抵制AI以保住人类在数学中的位置。与会者指出,AI目前虽能证明问题,但难以解释论证中最困难的部分,也无法自主提出新概念。人类的理解与阐释仍是数学知识成为文献的关键。 峰会探讨了数学未来的几种可能形态:或如软件工程般大规模协作;或如物理学般依赖算力;或人类转为AI产出的“策展人”;抑或数学家集体转向AI安全研究。组织者强调“必须把人放在第一位”,数学的意义在于人类能从中学习。然而会议并未达成共识,数学界仍在寻找自身在AI时代的定位。Tsimerman选择加入OpenAI从事AI安全研究,这一举动本身已折射出该领域面临的深刻变革。

marsbit37分钟前

数学的终结:40位顶尖数学家齐聚OpenAI秘密会议

marsbit37分钟前

交易

现货
活动图片