Сегодня этот бой просто фантастика!
С одной стороны, Лян Вэньфэн наконец-то в предрассветные часы выпустил официальную версию DeepSeek V4 Pro.
С другой, Илон Маск обрушил на рынок свой новый флагман Grok 4.6, делая ставку на низкую стоимость и высокую производительность.
Два гиганта выпустили продукты одновременно, и атмосфера мгновенно накалилась.

Они нацелились практически на одно и то же —
научить модель последовательно использовать инструменты, изменять код, проверять результаты в рамках длительных задач и в итоге предоставлять действительно рабочий продукт.
Выходит DeepSeek V4 Pro
Маск бросает в бой Grok 4.6
Самым впечатляющим достижением официальной версии DeepSeek V4 Pro стало абсолютное первое место в двух тестах, прямо наступая на пятки Fable 5.
В тесте на кибербезопасность CyberGym набрал 83.3 балла, обогнав Fable 5 (83.1 балла) и Claude Opus 4.8 (78.3 балла).
В AutomationBench набрал 31.8 балла, оставив позади Fable 5 (29.1 балла) и Claude Opus 4.8 (27.2 балла).
Самое «лобовое» столкновение произошло в Terminal-Bench 2.1.
DeepSeek набрал 87.9 балла, опередив Claude Opus 4.8 (85.0 баллов) и уступив Fable 5 (88.0 баллов) всего 0.1 балла.
В нескольких других сложных тестах агентов DeepSeek добился абсолютного превосходства над Claude Opus 4.8.
В «Последнем экзамене для человека» с использованием инструментов набрал 60.0 баллов, обогнав Claude Opus 4.8 (57.9 баллов) и продолжая приближаться к Fable 5 (63.0 балла).
Даже самый слабый ранее агент для разработки ПО, DeepSWE, показал скачок с 12.8 баллов в предварительной версии до 62.7 баллов — почти в 4.9 раза больше.
Этот результат не только превзошел Claude Opus 4.8 (58.0 баллов), но и отстает от Fable 5 (70.0 баллов) всего на 7.3 балла.

В то же время Маск поставил Fable 5 и GPT-5.6 Sol в неловкое положение.
Grok 4.6 сначала догнал GPT-5.6 по общей производительности, а затем опередил его в тестах на программирование.
По индексу общего интеллекта набрал 61 балл, отстав от Fable 5 (62 балла) всего на 1 балл.
В CursorBench показал 69.9%, обогнав GPT-5.6 (67.2%) и уступив Fable 5 (70.5%) всего 0.6 процентных пункта.
В FrontierCode набрал 61.3%, также опередив GPT-5.6 (60.6%) и продолжая преследовать Fable 5 (63.6%).
В задачах интеллектуального труда, более близких к реальной рабочей среде, Grok 4.6 совершил прорыв, заняв первое место во всех трех тестах.
В GDPval-AA v2 набрал 1753 рейтинга Elo, превысив показатели Fable 5 (1741) и GPT-5.6 (1728).
В AA-Briefcase снова показал 1577 рейтинга Elo, обойдя Fable 5 (1574) и GPT-5.6 (1502).
В профессиональной юридической задаче Harvey LAB показал 15.8%, тогда как у Fable 5 только 11.3%, а у GPT-5.6 и вовсе 2.5%.

Что еще важнее, DeepSeek V4 Pro и Grok 4.6 не только по производительности приблизились к ведущим моделям OpenAI и Anthropic, но и вместе снизили цены на передовые ИИ-технологии.
За миллион выходных токенов Grok 4.6 стоит 6 долларов, GPT-5.6 Sol — 30 долларов, Claude Opus 5 — 25 долларов, Fable 5 — 50 долларов.
А DeepSeek стоит всего 0.87 доллара —
примерно 1/7 от Grok 4.6, 1/35 от GPT-5.6 Sol, 1/29 от Claude Opus 5, 1/57 от Fable 5!


Первые в сети тесты
DeepSeek против Grok
Первые практические тесты уже появились. DeepSeek V4 Pro и Grok 4.6 наконец-то вышли из таблиц бенчмарков на поле реальных задач.
В первом раунде мы сразу же дали DeepSeek серьезную нагрузку.
Всего по одному промпту он создал в браузере с нуля целую интерактивную 3D-модель Земли.
Все базовые взаимодействия — перетаскивание, вращение, масштабирование — работали; глобальные потоки данных, динамические маршруты и географические маркеры также были полностью отображены на поверхности Земли.
При более детальном рассмотрении: рассеяние атмосферы, рендеринг облаков, дневное и ночное освещение, а также весь пользовательский интерфейс — все было на месте.

Далее мы поместили обе модели на один ринг.
AI-блогер «Сянъян Цяому» сначала запустил с DeepSeek V4 Pro три небольших задачи, а затем дал Grok 4.6 те же промпты для двух из них, напрямую сравнив конечные результаты.
Первая задача — разработка и развертывание веб-сайта с использованием 3 навыков (Skills).
DeepSeek успешно прошел весь процесс, и с точки зрения дизайна страниц и полноты результат выглядел очень стабильным.
Вторая задача — воссоздание 60 стилей дизайна и создание полного набора карточек Bento для их демонстрации.
В этом раунде DeepSeek явно разграничил шрифты, цветовые схемы и макеты, общий визуальный эффект оказался весьма хорошим.
Последняя задача — создание с нуля 3D-игры «Арканоид».
Игру можно было сразу же запустить, в ней были трехмерные сцены, фоновая музыка и динамические звуковые эффекты, отклик на управление и игровой процесс — все на высоте.



Затем тот же промпт был передан Grok 4.6.
В игре «Арканоид» модели оказались практически на равных.
Игра, созданная Grok, также была качественной: как визуальные эффекты, так и полнота сцен и игровой процесс были на одном уровне с DeepSeek V4 Pro.
В задаче с 60 дизайнами Bento Grok 4.6 взял реванш.
Некоторые созданные им страницы были более зрелыми с точки зрения макета, цветовых схем и визуальной иерархии, а конечный результат выглядел лучше.


Более ожесточенная битва развернулась вокруг Flappy Bird.
Разработчик Джун Сонг дал абсолютно одинаковый промпт, чтобы DeepSeek V4 Pro и Grok 4.6 с нуля «создали вручную» игру.
В итоге модели пошли совершенно разными путями.
DeepSeek V4 Pro израсходовал более 20 000 токенов, а стоимость составила всего 0.019 доллара; Grok 4.6 использовал около 5000 токенов, но стоимость достигла 0.03 доллара.

Но судя по конечному результату, в этом раунде DeepSeek явно одержал верх.
В игре были не только горные пейзажи на заднем плане и слоистые облака, но и трубы с градиентом и объемом. Когда персонаж пролетал сквозь трубы, на экране даже появлялась всплывающая анимация «+1».
От слоев сцены до отклика на управление — детали были почти идеальными, и степень завершенности сквозного построения явно превосходила Grok 4.6.
В другом фронтенд-тесте, проведенном разработчиком Хамзой, DeepSeek V4 Pro снова превзошел Grok 4.6.
Независимо от полноты страницы или конечного визуального эффекта, результат, представленный V4 Pro, был лучше.

Однако V4 Pro не был непобедим во всех раундах.
В сравнительном тесте с пеликаном, по сравнению с версией Flash, V4 Pro показал более высокую общую завершенность изображения, а слон получился более красивым.
Единственная проблема заключалась в том, что направление движения пеликана было изображено совершенно неправильно.

Продолжая увеличивать сложность, мы дали DeepSeek V4 Pro, GPT-5.6 Sol и Claude Opus 5 задачу сгенерировать одно и то же вишневое дерево с помощью Three.js, и разница стала еще более очевидной.
Будь то детали ствола и ветвей, освещение, глубина резкости или общая атмосфера, V4 Pro уступал двум другим топовым моделям.



DeepSeek V4 Pro; GPT-5.6 Sol; Claude Opus 5
По результатам нескольких раундов практических тестов видно, что DeepSeek V4 Pro и Grok 4.6 действительно вышли на один уровень, и трудно сказать, кто лучше.
Два ИИ в один день
догнали OpenAI и Anthropic
Одновременный прорыв этих двух моделей эксперт Рик Де Оливейра оценил как «мощный и доступный».
Благодаря DeepSeek V4 Pro и Grok 4.6 эти два слова, которые почти невозможно было услышать вместе, сегодня впервые действительно сошлись.
От кибербезопасности и интеллектуальных задач до автономного решения проблем агентами — они уже на нескольких фронтах, благодаря более низкой стоимости, напрямую разрушили потолок передовых возможностей.

Оглядываясь на сегодняшний фантастический «обмен ударами» в мире ИИ, DeepSeek и Grok совместно изменили одно правило игры:
Передовые интеллектуальные технологии больше не являются недосягаемыми.
Раньше разработчикам часто приходилось делать трудный выбор между «не по карману» и «недостаточно мощно».
А сегодня DeepSeek, имея цену всего в несколько десятков раз ниже, чем у SOTA-моделей, перевернул стол, а Grok последовал за ним с высокой рентабельностью.
Эта фронтальная атака «высокой производительности по низкой цене» уже разорвала старый порядок.

И война еще не окончена.
Маск уже анонсировал, что Grok 4.7 скоро выйдет, и его цель — превзойти все ведущие ИИ; ответные меры от OpenAI и Anthropic, несомненно, последуют.


Живя в эпоху, где эволюция измеряется «часами», интеллект больше не является привилегией горстки гигантов. Взрыв приложений для всех только начинается.
Источники:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://x.ai/news/grok-4-6
https://x.com/vista8/status/2087577905081823559
https://x.com/vista8/status/2087566666477744620
https://x.com/jun_song/status/2087602149979254914
Эта статья взята с официального аккаунта WeChat «Синь Чжи Юань», автор: ASI Апокалипсис, редакторы: Моисей, Таоцзы.






