31 июля, после полудня, Phoenix Net Technology обнаружила на официальном сайте DeepSeek, что API релизной версии DeepSeek-V4-Flash запущена в открытое бета-тестирование. В отличие от прежней логики разделения на "Pro — мощный, Flash — слабый", это обновление сигнализирует о важном моменте: результаты релизной версии Flash в нескольких бенчмарках Agent уже приближаются к уровню, а в некоторых случаях даже превосходят уровень превью-версии V4-Pro трехмесячной давности.

Согласно официальному логу обновлений, релизная версия V4-Flash набрала 82,7 балла на Terminal Bench 2.1, 54,2 балла на NL2Repo, 76,7 баллов на Cybergym и 70,3 балла на Toolathlon verified. В то время как превью-версия V4-Pro набрала 67,9 балла на Terminal Bench 2.0.

Следует пояснить, что Terminal Bench 2.0 и 2.1 — это не один и тот же набор тестов, поэтому прямое сравнение не совсем корректно. Однако тот факт, что облегченная версия с всего 13 миллиардами активных параметров показывает такие результаты в тестах на способности Agent, уже говорит о том, что потенциал оптимизации на этапе дообучения может давать больший эффект, чем простое увеличение количества параметров.
Кроме того, DeepSeek также особо отметила, что в настоящее время открытое бета-тестирование доступно только через API, а в приложении и веб-версии испытать последние возможности пока нельзя. Релизная версия DeepSeek-V4-Pro выйдет как можно скорее.
"Было проведено лишь дообучение"
Официальные представители DeepSeek в логе обновлений заявили: "Архитектура модели, размеры и количество параметров DeepSeek-V4-Flash-0731 остались такими же, как у DeepSeek-V4-Flash-preview, было проведено лишь дообучение".
Согласно официальному техническому отчету DeepSeek, V4-Flash имеет в общей сложности 284 миллиарда параметров, из них активных — 13 миллиардов; V4-Pro — 1,6 триллиона общих параметров, из них активных — 49 миллиардов. Они отличаются на порядок по масштабу модели. Если Flash с помощью дообучения может поднять способности Agent до уровня, близкого к Pro, это означает, что для определенных задач размер модели не является решающим фактором — значимость методов обучения и качества данных растет.
Официальные источники также особо отметили, что для задач Code Agent в открытых бенчмарках тестирование проводилось с использованием фреймворка DeepSeek Harness в минималистичном режиме, максимальный уровень (max), topp=0.95, temperature=1.0. Эта деталь намекает на то, что DeepSeek, возможно, провела целевую оптимизацию и на уровне фреймворка Agent, а не только в самой модели.
Это также первый случай, когда собственный Harness от DeepSeek появляется под официальным названием. Ранее Лян Вэньфэн сравнивал путь к AGI с подъемом по лестнице: языковая модель — это первая ступень, в прошлом году решалась проблема CoT (цепочки мыслей), нынешняя ступень — это Agent, а следующая задача, которую необходимо решить после Agent, — это непрерывное обучение, позволяющее модели накапливать опыт, как человек, а не работать только при полной подаче контекста каждый раз. Дальше — уже "сингулярность" самоитерации и воплощенный интеллект. "Сейчас у ИИ не хватает не вкуса и интуиции, а способности к непрерывному обучению", — сказал он. "Инвесторы смотрят на Agent, а мы думаем о том, как решить проблему обучения".
Непрерывное обучение звучит как задача на уровне модели, но его инженерная реализация лежит именно в Harness. Команда DeepSeek по разработке Agent Harness была сформирована в марте этого года. Во главе ее стоит Цуй Тяньи, родившийся в 90-х, выпускник факультета компьютерных наук Чжэцзянского университета, обладатель шести золотых медалей ACM Asian Regional Contest. Ранее девять лет он работал в ведущей количественной компании Jane Street, в марте этого года присоединился к DeepSeek, после чего в мае активно начал набирать команду.
По имеющейся информации, планируется, что Harness от DeepSeek будет представлен одновременно с выходом релизной версии V4. Кроме того, в конце лога DeepSeek сообщает: "Релизная версия DeepSeek-V4-Pro выйдет в ближайшее время".
Прямое столкновение на уровне экосистемы
Если конкуренция больших моделей в 2023 году была "борьбой за универсальные возможности", в 2024 году — "борьбой за длинный контекст", то ключевым словом 2026 года, без сомнения, является Agent.
Способности Agent — то есть способность модели самостоятельно планировать, использовать инструменты и выполнять сложные задачи — становятся новой мерой оценки силы больших моделей. От Terminal Bench (терминальные операции), NL2Repo (генерация репозиториев кода) до Cybergym (задачи кибербезопасности), SWE-bench (инженерия программного обеспечения) — серия тестов Agent переопределяет, что такое хорошая модель.
В глобальном масштабе первый эшелон по способностям Agent по-прежнему удерживают закрытые гиганты. Согласно данным сторонних платформ оценки, таких как benchlm.ai, GPT-5.6 Sol и серия Claude Opus лидируют в большинстве тестов Agent. Среди китайских производителей GLM, Qwen и другие также быстро нагоняют.
Существенное повышение DeepSeek способностей Agent у Flash имеет четкую стратегическую цель: войти на огромный рынок приложений Agent с помощью экономичной облегченной модели.
В конце концов, сценарии Agent гораздо более чувствительны к скорости вывода и стоимости, чем чистые диалоговые сценарии. Задача Agent, требующая многократного использования инструментов и многошаговых рассуждений, при выполнении на флагманской модели может стоить в несколько раз или даже в десятки раз дороже, чем на Flash. Если Flash сможет достичь уровня способностей Agent, который "достаточен и даже удобен", ее преимущество в стоимости станет чрезвычайно мощным.
Два внутренних набора тестов, опубликованных официально, также имеют четкую цель. DSBench-FullStack (внутренний набор тестов для full-stack разработки) набрал 68,7 балла, DSBench-Hard (внутренний набор сложных тестов для Coding Agent) — 59,6 балла. Это косвенно подтверждает позиционирование DeepSeek — превратить Flash в предпочтительную основу для разработчиков и приложений Agent.
Тихая война экосистем также разгорается: релизная версия V4-Flash изначально поддерживает формат Responses API и специально адаптирована для Codex.
Responses API — это новый формат API, активно продвигаемый OpenAI. По сравнению с традиционными Chat Completions, он больше подходит для сценариев Agent — поддерживает более гибкое использование инструментов, более сложное многошаговое взаимодействие и более точный контроль вывода.
Нативная поддержка этого формата DeepSeek означает, что разработчики смогут с меньшими затратами переносить приложения Agent, разработанные на основе экосистемы OpenAI, на DeepSeek. Это будет прямое столкновение двух компаний на уровне экосистемы.
Адаптация под Codex нацелена на вертикальную сцену генерации кода и разработки программного обеспечения. Codex — это модель OpenAI, ориентированная на код. Целевая адаптация DeepSeek означает прямой вызов OpenAI на ее традиционной сильной территории.
Рассматривая эти действия вместе, становится ясно, что амбиции DeepSeek не ограничиваются созданием "дешевой альтернативы", а заключаются в создании собственной ниши в эпоху Agent.
После финансирования в 50 миллиардов: временное окно в условиях высокой оценки
Это обновление вышло менее чем через два месяца после завершения DeepSeek первого раунда внешнего финансирования.
Около месяца назад DeepSeek завершила первый внешний раунд финансирования за почти три года своего существования на общую сумму более 50 миллиардов юаней, установив рекорд в китайской индустрии ИИ по объему финансирования в одном раунде. Оценка после инвестиций составила около 52 миллиардов долларов США (примерно 350 миллиардов юаней). В число инвесторов вошли такие промышленные гиганты, как Tencent, CATL, JD.com, а также несколько государственных промышленных фондов.

В середине июля DeepSeek намерена продвигать новый раунд частного финансирования с оценкой перед инвестициями около 71 миллиарда долларов США (примерно 480 миллиардов юаней), что примерно на 37% выше оценки в 52 миллиарда долларов после первого раунда финансирования. От 52 до 71 миллиарда прошло менее шести недель.
За высокой оценкой стоит признание рынком технических возможностей DeepSeek, а также ставка на ее коммерческие перспективы. Однако высокая оценка также означает высокие ожидания и высокое давление.
Согласно сообщениям нескольких СМИ, основатель DeepSeek Лян Вэньфэн лично внес около 20 миллиардов юаней в первом раунде финансирования, сохранив твердый контроль над компанией через специальную структуру. Этот основатель, вышедший из Quantitative фонда幻方, ранее почти три года настаивал на финансировании из собственных средств. Теперь переход от "без финансирования, без IPO" к активному привлечению капитала сам по себе является сильным сигналом — DeepSeek ускоряет движение к коммерциализации и IPO.
Выход релизной версии Flash, возможно, можно рассматривать как демонстрацию технологий DeepSeek при поддержке капитала. Но настоящее испытание еще впереди: выйдет ли релизная версия Pro в срок? Приведет ли повышение способностей Agent к реальному росту доходов? Как DeepSeek сможет использовать свой подход с высокой стоимостью в условиях давления таких гигантов, как OpenAI и Anthropic?
Занавес войны Agent только начал подниматься. Своим значительным прогрессом в облегченной модели DeepSeek задает отрасли новый вопрос — когда преимущества дообучения будут полностью раскрыты, когда рост эффективности начнет компенсировать разницу в параметрах, логика конкуренции больших моделей, возможно, должна быть переписана заново.
Эта статья из официального аккаунта WeChat "凤凰网科技", автор: Phoenix Net Technology






