Протестированы два новые модели Claude: пространственные рассуждения на высоте, вычислительные мощности исчерпаны

marsbitОпубликовано 2026-08-25Обновлено 2026-08-25

Введение

Недавно появились первые практические тесты двух новых моделей Claude от Anthropic — «Marshmallow» (Клубничный зефир) и «Melon» (Дыня). Модели демонстрируют революционные возможности в области пространственного мышления. Они показывают выдающиеся результаты в 3D-обучении с подкреплением и архитектурном планировании, генерируя сложные пространственные композиции и корректные 3D-координаты за один проход (One-Shot), без необходимости многократных правок. Особенностью новых моделей является использование огромного количества «мыслительных токенов» (Thinking Tokens) для глубокого логического вывода перед формированием ответа. Это приводит к беспрецедентному потреблению вычислительных ресурсов, часто достигающему лимитов системы. Такой подход знаменует переход к ИИ с «медленным мышлением» и продвинутым физическим и пространственным рассуждениям. Появление этих моделей, возможно, является ответом компании на критические отзывы о недавно выпущенной флагманской модели Opus 5. «Зефир» и «Дыня», предположительно являющиеся либо усиленной версией Opus (5.1), либо новыми поколениями Sonnet или Haiku, призваны вернуть лидерские позиции Anthropic в конкурентной гонке ИИ. Их способности открывают огромный потенциал для игровой индустрии, архитектуры, метавселенных и цифровых двойников.

Только вчера появились слухи о двух новых моделях Claude — «Marshmallow» (Зефир) и «Melon» (Дыня), а сегодня уже появились первые реальные тесты!

В ходе тестирования было обнаружено, что обе новые модели демонстрируют пугающе высокую производительность в области 3D-обучения с подкреплением и планирования архитектурного пространства.

Кроме того, их аппетит к вычислительным ресурсам оказался невероятно высоким.

Перед тем как дать ответ, они потребляют огромное количество «размышляющих токенов» (Thinking Tokens) для глубокого логического рассуждения, неоднократно приближаясь к системным ограничениям по использованию!

Судя по этим моделям, Claude превращается в следующее поколение ИИ-гигантов, обладающих способностью к «медленному мышлению» и глубокому пространственно-физическому рассуждению.

Решение задач 3D-обучения с подкреплением и архитектурного планирования с одного захода (One-Shot)

По результатам тестов была дана оценка: Anthropic действительно безумно продвигается в области 3D-обучения с подкреплением.

Пространственная компоновка зданий просто возмутительно хороша, и всё это было сгенерировано с одного раза (One-Shot)!

Важно понимать, что пространственное воображение всегда было ахиллесовой пятой для крупных языковых моделей (LLM).

Заставить ИИ понять физические координационные отношения столов и стульев в 3D-комнате, законы гравитации или спланировать комплекс застройки со сложными потоками движения и несущими конструкциями было невероятно сложно.

Но, похоже, на этот раз Claude в лице «Зефира» и «Дыни» преодолел эту пропасть.

Они способны напрямую понимать и генерировать сложные 3D-координаты и пространственные отношения.

Более того, в ходе тестов было отмечено, что их архитектурная компоновка исключительно хороша, что указывает на мощную производительность новых моделей при работе с топологическими, геометрическими и физическими ограничениями.

И всё это — вывод с одного захода, без необходимости многократной корректировки промптов человеком для исправления ошибок. После глубокого внутреннего обдумывания модель способна единовременно выдать идеальные данные 3D-сцены.

За этим скрывается огромная коммерческая и отраслевая ценность.

Представьте: будущим разработчикам игр достаточно будет описать на естественном языке: «Помоги сгенерировать крепость в средневековом стиле с тремя оборонительными башнями и скрытым подземным ходом», — и Claude напрямую выдаст идеальный код 3D-модели или параметры компоновки.

Архитекторы смогут напрямую поручить ИИ сгенерировать десятки предварительных вариантов планировки, соответствующих механике конструкций, на основе рельефа и условий освещения. Создание метавселенных, промышленных цифровых двойников, симуляционных сред для автономного вождения...

Всё это будет кардинально преобразовано благодаря такой мощной способности к 3D-генерации!

Двойной удар от «Зефира» и «Дыни»

Вчера вся сеть была заполнена сообщениями о «Зефире» и «Дыне».

Внутренние кодовые названия двух обнародованных моделей — claude-marshmallow-eap (Зефир) и claude-melon-eap (Дыня).

Такое правило именования «еда + EAP» продолжает традицию, начатую с кратковременно тестировавшейся в июле этого года модели claude-horchata-eap (орчата, мексиканский напиток).

Откуда же взялись эти две модели?

Согласно данным, перехваченным разработчиками из записей трафика API, в период с 00:45 до 00:57 UTC 21 августа идентификатор claude-marshmallow-ht-eap вызывался через API с высокой частотой — 57 раз!

Впоследствии он появился в списке моделей Claude Code под статусом «Custom model» с ошеломляющим сверхдлинным контекстным окном в 1 миллион токенов.

Хотя у этих двух моделей пока нет собственных API-эндпоинтов, и, судя по всему, они доступны только командам красных команд (red team) или ключевым внутренним сотрудникам для тестирования, ранние отрывочные отзывы уже достаточно впечатляющи.

Считается, что общие возможности «Зефира» немного превосходят возможности «Дыни».

В повседневном диалоге и логическом взаимодействии опыт общения с «Зефиром» даже лучше, чем с текущей версией Opus 5, разговор кажется более естественным и приятным.

Хотя их текущие показатели, по-видимому, всё ещё ниже топового уровня «Fable» от Anthropic, кем же они являются? Легендарной Opus 5.1? Sonnet 5.1? Или совершенно новой итерацией Haiku?

Пока что однозначного ответа нет.

Пожиратели вычислительных мощностей: безумные «размышляющие токены»

Более того, несколько тестировщиков обнаружили крайне аномальное явление: при использовании эти две новые модели демонстрируют безумно высокий уровень потребления вычислительных ресурсов!

Один из тестировщиков в твите воскликнул: «Я заметил одну общую черту у этих двух моделей — они используют колоссальное количество размышляющих токенов, так что в ходе тестирования я несколько раз напрямую достигал лимита !»

Что такое «размышляющие токены»? Почему они так важны?

В прошлых взаимодействиях с большими моделями ИИ часто напоминал «скороговорку», мгновенно генерируя ответы слово за словом на основе вероятностного распределения.

Новое поколение моделей Claude кардинально меняет эту логику. Перед тем как дать окончательный ответ, модель генерирует в фоновом режиме огромное количество «невидимых» токенов для чрезвычайно глубокого самоанализа, построения цепочек рассуждений и логических проб и ошибок.

Такое «безоглядное» вливание вычислительных мощностей является очень сильным сигналом: Anthropic втайне преодолевает узкие места в области глубокого логического вывода ИИ!

Это также подтверждает предыдущие догадки в отрасли — конкуренция между большими моделями смещается от «наращивания вычислительных мощностей на этапе обучения» к «потреблению мощностей на этапе логического вывода».

Когда Claude начинает безумно «размышлять», достигая пределов, качество его ответов будет формировать сокрушительное преимущество над традиционными моделями.

Подозрение на срочное тушение пожара? «Война возмездия» Opus 5

Внезапная утечка этих загадочных моделей также произошла в очень показательный момент.

Всего менее месяца назад, 24 июля 2026 года, Anthropic только что представила долгожданный флагманскую модель Opus 5.

До этого выпущенная 30 июня модель Sonnet 5 получила широкое признание.

Однако Opus 5 потерпела фиаско.

Один разработчик в X безжалостно высмеял: «Негативные отзывы на Opus 5 настолько серьёзны, что Anthropic пришлось немедленно выпустить две новые модели, чтобы попытаться заменить её... Умора.»

Действительно, Opus 5, похоже, не оправдала ожиданий пользователей на «межпоколенческий скачок». Для торопящейся с выходом на рынок Anthropic это, несомненно, серьёзный удар.

Поэтому обнаружение «Зефира» и «Дыни» в этот переломный момент породило безграничные домыслы у внешнего мира.

Предположение первое: Контрудар Opus 5.1.

Многие считают, что эти две модели, тесно связанные с Opus 5.1, являются именно той «усиленной версией», которую Anthropic экстренно переработала, чтобы устранить недостатки Opus 5.

За счёт внедрения мощного механизма «размышляющих токенов» искусственно поднимается логический потолок модели.

Предположение второе: Рейд нового поколения Sonnet / Haiku.

Некоторые тестировщики также полагают, что, учитывая их поразительную скорость и эффективность, они могут быть обновлёнными версиями Sonnet или Haiku, ведь им не присвоен топовый титул «Fable».

Но в любом случае Anthropic явно не сидит сложа руки.

Они безумно ускоряют итерации, не боясь даже напрямую предоставить для тестирования передовые модели, чрезвычайно прожорливые в плане вычислений.

Разработчики уже не могут сдержать волнение: «Следующие несколько недель и месяцев станут невероятно интересными!»

Смогут ли «Зефир» и «Дыня» смыть предыдущий позор Opus 5 и позволить Anthropic выиграть ещё один раунд?

Источники:

https://x.com/Lentils80/status/2091704307863142812?s=20

https://x.com/NFT_Chen/status/2091764673767198730?s=20

Эта статья из официального аккаунта WeChat «Новое прозрение ИИ» («新智元»), автор: ASI启示录; редактор: Aeneas

Связанные с этим вопросы

QКакие две новые модели Claude были протестированы и как они себя проявили?

AБыли протестированы две новые модели: Claude Marshmallow-EAP (Клубничный зефир) и Claude Melon-EAP (Дыня). Они показали исключительные результаты в сфере 3D-обучения с подкреплением и пространственного планирования зданий, способные с первого запроса (One-Shot) генерировать сложные 3D-сцены и макеты с учётом физических ограничений.

QЧто такое «токены размышления» (Thinking Tokens) и почему они важны для новых моделей?

A«Токены размышления» — это невидимые для пользователя вычислительные ресурсы, которые модели Claude используют для глубокого логического анализа и построения цепочек рассуждений перед формированием окончательного ответа. Новые модели расходуют огромное количество таких токенов, что свидетельствует об их усиленной способности к сложным рассуждениям, но также значительно увеличивает потребление вычислительных мощностей.

QКакое практическое применение может иметь продвинутая пространственная рассуждающая способность этих моделей?

AУсовершенствованная пространственная рассуждающая способность может революционизировать различные отрасли: разработчики игр смогут генерировать 3D-модели и уровни по текстовому описанию, архитекторы — быстро создавать варианты планировок, учитывающие рельеф и законы физики. Это также применимо в создании цифровых двойников, симуляторах для беспилотных автомобилей и метавселенных.

QПочему появление моделей «Клубничный зефир» и «Дыня» считается срочным ответом компании Anthropic?

AИх появление связано с тем, что предыдущая флагманская модель Opus 5, выпущенная в июле 2026 года, получила в основном негативные отзывы и не оправдала ожиданий пользователей. Предполагается, что новые модели являются либо экстренно доработанной версией Opus 5.1, либо новым поколением более доступных моделей (Sonnet/Haiku), призванных исправить репутацию компании и сохранить конкурентоспособность.

QКаковы основные отличительные черты модели «Клубничный зефир» по сравнению с «Дыней» согласно тестам?

AСогласно ранним тестам, модель «Клубничный зефир» (Marshmallow) демонстрирует немного более высокую общую производительность, чем «Дыня» (Melon). В частности, в повседневных диалогах и логическом взаимодействии её ответы оцениваются как более естественные и приятные, чем у текущей модели Opus. Обе модели, однако, считаются менее мощными, чем топовый внутренний уровень Anthropic под названием «Fable».

Похожее

Тест спроса: биткоин-киты заработали рекордные $1,2 млрд, а владельцы Ethereum вернулись к прибыльности

За три дня после восстановления стоимости биткоина новые крупные держатели (киты) зафиксировали рекордную прибыль более чем в $1,2 млрд, что стало крупнейшим событием такого рода в истории наблюдений. Пик пришелся на 20 августа — $614 млн. Фиксация прибыли началась после того, как биткоин поднялся выше реализованной цены краткосрочных китов (около $68 900). По мнению аналитиков CryptoQuant, это важный тест для спроса: если актив удержится выше себестоимости китов, а объемы продаж нормализуются, это покажет способность нового спроса поглощать предложение. Что касается Ethereum, то крупные держатели этого актива также вернулись в зону нереализованной прибыли, однако ее уровень пока невысок и, по мнению аналитика Darkfost, не создает существенного давления на курс. С июня Ethereum вырос более чем на 65%, что улучшило настроения инвесторов после периода значительных убытков.

cryptonews.ru3 мин. назад

Тест спроса: биткоин-киты заработали рекордные $1,2 млрд, а владельцы Ethereum вернулись к прибыльности

cryptonews.ru3 мин. назад

Команда Kinetiq анонсировала L2-сеть Elysium для Hyperliquid

24 августа протокол ликвидного стейкинга Kinetiq анонсировал запуск L2-сети Elysium для экосистемы Hyperliquid. Новая сеть призвана устранить ограничения HyperEVM, такие как низкая пропускная способность и высокие комиссии, значительно увеличив скорость обработки транзакций. Elysium упростит запуск спотовых рынков, токенов и DeFi-приложений, предоставив разработчикам более глубокий доступ к данным ордербука HyperCore. Для оплаты газа в сети будет использоваться токен $HYPE. Elysium также предложит упрощенный процесс листинга новых активов, объединяя этапы предоставления ликвидности через AMM, выхода на спотовый рынок и запуска фьючерсов. Модель распределения доходов сети предусматривает направление 50% комиссий секвенсора на выкуп и сжигание токена $KNTQ, 25% — разработчикам приложений и 25% — в казначейство Kinetiq. Точная дата запуска Elysium пока не названа, он запланирован на «ближайшее время».

cryptonews.ru4 мин. назад

Команда Kinetiq анонсировала L2-сеть Elysium для Hyperliquid

cryptonews.ru4 мин. назад

Hyperliquid Policy Center призвала регуляторов в США создать фреймворк для бессрочных фьючерсов

Некоммерческая организация Hyperliquid Policy Center призвала регулирующие органы США (SEC и CFTC) создать четкие правила для бессрочных фьючерсов. Центр предлагает классифицировать такие контракты, особенно на акции, как стандартные фьючерсы под совместным надзором, а не как свопы на ценные бумаги (SBS). В качестве аргументов называются стандартизация, публичность цен и возможность офсетного закрытия позиций без перехода права собственности на базовый актив. Hyperliquid Policy Center рекомендует SEC и CFTC выпустить совместное руководство, унифицировать подход к регулированию разных активов (криптовалют, товаров, акций) и модернизировать нормативную базу. Инициатива встречает сопротивление со стороны традиционных бирж, таких как CME Group и ICE, которые требуют более жесткого регулирования подобных площадок и уже подавали иск из-за классификации бессрочных фьючерсов.

cryptonews.ru6 мин. назад

Hyperliquid Policy Center призвала регуляторов в США создать фреймворк для бессрочных фьючерсов

cryptonews.ru6 мин. назад

Индия планирует выпустить первые токенизированные облигации с использованием оптовой CBDC — Reuters

Индия планирует в сентябре запустить пилотный проект по выпуску первых токенизированных корпорационных облигаций с расчетами в оптовой цифровой валюте центрального банка (CBDC) на блокчейне. Государственная энергетическая финансовая компания REC Limited выпустит такие облигации на сумму менее 5 млрд рупий (около $57 млн). На начальном этапе доступ к проекту будет предоставлен ограниченному кругу инвесторов, возможно, в рамках финансово-технологического мероприятия в Мумбаи. Для покупки облигаций инвесторы будут использовать цифровой рупий RBI. Участие потребует двух цифровых счетов: банковского кошелька для CBDC и нового электронного кошелька для ценных бумаг DEMAT 2.0, разрабатываемого местными депозитариями с использованием технологии распределенного реестра для учета прав собственности. Над инициативой совместно работают Резервный банк Индии (RBI) и Совет по ценным бумагам и биржам (SEBI). Облигации будут иметь первоначальный трехмесячный период блокировки, а к декабрю биржи планируют создать для них вторичный рынок.

cryptonews.ru6 мин. назад

Индия планирует выпустить первые токенизированные облигации с использованием оптовой CBDC — Reuters

cryptonews.ru6 мин. назад

Shipyard сворачивает работу над IPFS после прекращения финансирования Protocol Labs

Компания Shipyard, сопровождающая систему межпланетных файловых систем (IPFS), прекратит инженерную деятельность, техническое обслуживание и эксплуатацию инфраструктуры 30 сентября после того, как Protocol Labs отказалась продлевать финансирование. Потеря финансирования оставит без выделенных сопровождающих такие проекты, как Kubo, Helia, Boxo, Rainbow, IPFS Desktop и IPFS Companion. Коллектив прекратит эксплуатацию общедоступной инфраструктуры, включая ipfs.io и dweb.link. Будущее этих доменов и инфраструктуры, принадлежащих Protocol Labs, будет определено этой организацией. Сама IPFS не закрывается, но уход Shipyard лишает многие популярные реализации и сервисы выделенного управления, если их не возьмут под контроль другие сопровождающие. В Protocol Labs заявили, что развитие децентрализованной публичной инфраструктуры продолжится, а управление IPFS перейдет к «более легкому» формату через гранты фонда IPFS Foundation отдельным сопровождающим. Shipyard была создана в 2024 году как независимый коллектив давних разработчиков IPFS, ранее работавших в Protocol Labs.

cointelegraph24 мин. назад

Shipyard сворачивает работу над IPFS после прекращения финансирования Protocol Labs

cointelegraph24 мин. назад

Торговля

Спот
活动图片