Только вчера появились слухи о двух новых моделях Claude — «Marshmallow» (Зефир) и «Melon» (Дыня), а сегодня уже появились первые реальные тесты!
В ходе тестирования было обнаружено, что обе новые модели демонстрируют пугающе высокую производительность в области 3D-обучения с подкреплением и планирования архитектурного пространства.

Кроме того, их аппетит к вычислительным ресурсам оказался невероятно высоким.
Перед тем как дать ответ, они потребляют огромное количество «размышляющих токенов» (Thinking Tokens) для глубокого логического рассуждения, неоднократно приближаясь к системным ограничениям по использованию!
Судя по этим моделям, Claude превращается в следующее поколение ИИ-гигантов, обладающих способностью к «медленному мышлению» и глубокому пространственно-физическому рассуждению.

Решение задач 3D-обучения с подкреплением и архитектурного планирования с одного захода (One-Shot)
По результатам тестов была дана оценка: Anthropic действительно безумно продвигается в области 3D-обучения с подкреплением.
Пространственная компоновка зданий просто возмутительно хороша, и всё это было сгенерировано с одного раза (One-Shot)!


Важно понимать, что пространственное воображение всегда было ахиллесовой пятой для крупных языковых моделей (LLM).
Заставить ИИ понять физические координационные отношения столов и стульев в 3D-комнате, законы гравитации или спланировать комплекс застройки со сложными потоками движения и несущими конструкциями было невероятно сложно.
Но, похоже, на этот раз Claude в лице «Зефира» и «Дыни» преодолел эту пропасть.
Они способны напрямую понимать и генерировать сложные 3D-координаты и пространственные отношения.
Более того, в ходе тестов было отмечено, что их архитектурная компоновка исключительно хороша, что указывает на мощную производительность новых моделей при работе с топологическими, геометрическими и физическими ограничениями.
И всё это — вывод с одного захода, без необходимости многократной корректировки промптов человеком для исправления ошибок. После глубокого внутреннего обдумывания модель способна единовременно выдать идеальные данные 3D-сцены.
За этим скрывается огромная коммерческая и отраслевая ценность.
Представьте: будущим разработчикам игр достаточно будет описать на естественном языке: «Помоги сгенерировать крепость в средневековом стиле с тремя оборонительными башнями и скрытым подземным ходом», — и Claude напрямую выдаст идеальный код 3D-модели или параметры компоновки.
Архитекторы смогут напрямую поручить ИИ сгенерировать десятки предварительных вариантов планировки, соответствующих механике конструкций, на основе рельефа и условий освещения. Создание метавселенных, промышленных цифровых двойников, симуляционных сред для автономного вождения...
Всё это будет кардинально преобразовано благодаря такой мощной способности к 3D-генерации!
Двойной удар от «Зефира» и «Дыни»
Вчера вся сеть была заполнена сообщениями о «Зефире» и «Дыне».
Внутренние кодовые названия двух обнародованных моделей — claude-marshmallow-eap (Зефир) и claude-melon-eap (Дыня).

Такое правило именования «еда + EAP» продолжает традицию, начатую с кратковременно тестировавшейся в июле этого года модели claude-horchata-eap (орчата, мексиканский напиток).
Откуда же взялись эти две модели?
Согласно данным, перехваченным разработчиками из записей трафика API, в период с 00:45 до 00:57 UTC 21 августа идентификатор claude-marshmallow-ht-eap вызывался через API с высокой частотой — 57 раз!
Впоследствии он появился в списке моделей Claude Code под статусом «Custom model» с ошеломляющим сверхдлинным контекстным окном в 1 миллион токенов.
Хотя у этих двух моделей пока нет собственных API-эндпоинтов, и, судя по всему, они доступны только командам красных команд (red team) или ключевым внутренним сотрудникам для тестирования, ранние отрывочные отзывы уже достаточно впечатляющи.



Считается, что общие возможности «Зефира» немного превосходят возможности «Дыни».
В повседневном диалоге и логическом взаимодействии опыт общения с «Зефиром» даже лучше, чем с текущей версией Opus 5, разговор кажется более естественным и приятным.
Хотя их текущие показатели, по-видимому, всё ещё ниже топового уровня «Fable» от Anthropic, кем же они являются? Легендарной Opus 5.1? Sonnet 5.1? Или совершенно новой итерацией Haiku?
Пока что однозначного ответа нет.

Пожиратели вычислительных мощностей: безумные «размышляющие токены»
Более того, несколько тестировщиков обнаружили крайне аномальное явление: при использовании эти две новые модели демонстрируют безумно высокий уровень потребления вычислительных ресурсов!
Один из тестировщиков в твите воскликнул: «Я заметил одну общую черту у этих двух моделей — они используют колоссальное количество размышляющих токенов, так что в ходе тестирования я несколько раз напрямую достигал лимита !»
Что такое «размышляющие токены»? Почему они так важны?
В прошлых взаимодействиях с большими моделями ИИ часто напоминал «скороговорку», мгновенно генерируя ответы слово за словом на основе вероятностного распределения.
Новое поколение моделей Claude кардинально меняет эту логику. Перед тем как дать окончательный ответ, модель генерирует в фоновом режиме огромное количество «невидимых» токенов для чрезвычайно глубокого самоанализа, построения цепочек рассуждений и логических проб и ошибок.

Такое «безоглядное» вливание вычислительных мощностей является очень сильным сигналом: Anthropic втайне преодолевает узкие места в области глубокого логического вывода ИИ!
Это также подтверждает предыдущие догадки в отрасли — конкуренция между большими моделями смещается от «наращивания вычислительных мощностей на этапе обучения» к «потреблению мощностей на этапе логического вывода».
Когда Claude начинает безумно «размышлять», достигая пределов, качество его ответов будет формировать сокрушительное преимущество над традиционными моделями.
Подозрение на срочное тушение пожара? «Война возмездия» Opus 5
Внезапная утечка этих загадочных моделей также произошла в очень показательный момент.
Всего менее месяца назад, 24 июля 2026 года, Anthropic только что представила долгожданный флагманскую модель Opus 5.
До этого выпущенная 30 июня модель Sonnet 5 получила широкое признание.
Однако Opus 5 потерпела фиаско.
Один разработчик в X безжалостно высмеял: «Негативные отзывы на Opus 5 настолько серьёзны, что Anthropic пришлось немедленно выпустить две новые модели, чтобы попытаться заменить её... Умора.»
Действительно, Opus 5, похоже, не оправдала ожиданий пользователей на «межпоколенческий скачок». Для торопящейся с выходом на рынок Anthropic это, несомненно, серьёзный удар.
Поэтому обнаружение «Зефира» и «Дыни» в этот переломный момент породило безграничные домыслы у внешнего мира.
Предположение первое: Контрудар Opus 5.1.
Многие считают, что эти две модели, тесно связанные с Opus 5.1, являются именно той «усиленной версией», которую Anthropic экстренно переработала, чтобы устранить недостатки Opus 5.
За счёт внедрения мощного механизма «размышляющих токенов» искусственно поднимается логический потолок модели.
Предположение второе: Рейд нового поколения Sonnet / Haiku.
Некоторые тестировщики также полагают, что, учитывая их поразительную скорость и эффективность, они могут быть обновлёнными версиями Sonnet или Haiku, ведь им не присвоен топовый титул «Fable».

Но в любом случае Anthropic явно не сидит сложа руки.
Они безумно ускоряют итерации, не боясь даже напрямую предоставить для тестирования передовые модели, чрезвычайно прожорливые в плане вычислений.
Разработчики уже не могут сдержать волнение: «Следующие несколько недель и месяцев станут невероятно интересными!»
Смогут ли «Зефир» и «Дыня» смыть предыдущий позор Opus 5 и позволить Anthropic выиграть ещё один раунд?
Источники:
https://x.com/Lentils80/status/2091704307863142812?s=20
https://x.com/NFT_Chen/status/2091764673767198730?s=20
Эта статья из официального аккаунта WeChat «Новое прозрение ИИ» («新智元»), автор: ASI启示录; редактор: Aeneas





