Автор | AIX财经, Автор | Лэй Цзин, Редактор | Цзинь Юйфань
В мире ИИ в последнее время наблюдается активность, и Tencent Hunyuan Hy3 preview официально представлен.
23 апреля Tencent Hunyuan официально выпустил и открыл исходный код новой языковой модели Hy3 preview. Согласно описанию на официальном сайте, модель использует гибридную архитектуру экспертов с融合 быстрого и медленного мышления, общее количество параметров составляет 295B, активированных параметров — 21B, максимальная поддерживаемая длина контекста — 256K. Это модель, которую официально называют самой интеллектуальной на сегодняшний день в линейке Hunyuan.
Три месяца назад Яо Шуньюй присоединился к Tencent с фреймворком ReAct и опытом работы с OpenAI, возглавив реструктуризацию инфраструктуры предварительного обучения и обучения с подкреплением. Hy3 preview — это первый результат этой перестройки. Официально заявлено, что модель значительно улучшила свои способности в сложных рассуждениях, следовании инструкциям, обучении в контексте, генерации кода и работе агентов.
Судя по раскрытым официальным данным и результатам тестов, Hy3 preview демонстрирует впечатляющие результаты в多项 базовых тестах, хотя, возможно, и не достигает высшего уровня во всех измерениях, но достаточна для удовлетворения практических потребностей в большинстве сценариев.
В плане фактической эффективности работы и стабильности Hy3 preview также добился прорывов. Официальные данные показывают, что задержка первого токена у этой модели снижена на 54%, а сквозное время выполнения — на 47%, что значительно повышает скорость отклика. Кроме того, повысился процент успешного выполнения задач, модель уже может стабильно управлять сложными рабочими процессами агентов, охватывая различные бизнес-сценарии, такие как обработка документов и анализ данных.
Кроме того, ее стоимость вывода также снизилась. В API Tencent Cloud входные данные стоят всего 1.2 юаня/миллион токенов, личный пакет — от 28 юаней/месяц, что относится к lowest price echelon среди моделей comparable размера. В настоящее время Hy3 preview уже запущен в ключевых продуктах Tencent, таких как Tencent Cloud, Yuanbao, WorkBuddy.
Далее мы протестируем производительность модели Hunyuan в практических приложениях based on четырем направлениям, упомянутым официально.
Способность к рассуждению: Сложная логика поддается разбору, распознавание ловушек仍需加强
Сначала мы протестировали способность модели к рассуждению. Логические головоломки — это один из типов задач, которые пользователи интернета любят использовать для проверки «IQ» модели. На этом этапе мы сначала протестировали в Yuanbao классическую «задачу о мойке автомобиля».

В этой классической задаче-ловушке Hy3 preview изначально не дал правильного ответа. Он привел четкое рассуждение, рекомендующее идти пешком, упустив ключевой момент — «помыть машину». После повторного напоминания о необходимости помыть машину он дал правильный ответ.
Стоит отметить, что в тестах других пользователей Hy3 preview иногда давал правильный ответ сразу, что указывает на недостаточную стабильность его способности распознавать ловушки.
Давайте попробуем еще одну задачу-головоломку. В этой задаче необходимо понять реальную логику: разбитые, пожаренные и съеденные яйца — это одна и та же партия. Но Hy3 preview не осознал этого, он посчитал, что пожаренные яйца все еще существуют и их можно съесть.

Затем мы увеличили сложность, испытав его более сложной логической задачей с запутанным процессом вывода. Сложность этой задачи заключается в отсутствии прямой定位 информации, необходимость полагаться на неявные условия для исключения, легко упустить ключевую информацию.

В этом сценарии Hy3 preview дал правильный ответ. Он сначала пошагово разобрал подсказки, выделил взаимоисключающие отношения между людьми и профессиями, затем методом исключения определил личности. Далее он последовательно определил принадлежность некоторых должностей, а затем,结合 правила, постепенно восстановил полную картину.
В целом, у Hy3 Hy3 preview сильные способности к常规理性逻辑推演, но逆向思维, распознавание ловушек и гибкость мышления в жизненных ситуациях仍有不足. Столкнувшись с головоломками-ловушками, он склонен ограничиваться буквальной常规逻辑, упуская ловушки в задачах и реальные сценарии, реакция欠佳. Однако при面对条件隐蔽、推导繁琐的复杂逻辑推理题时, он способен разбирать подсказки, рассуждать层层, демонстрируя扎实ные способности логического анализа и пошагового вывода.
Обучение в контексте и следование инструкциям: Извлечение информации, стабильная производительность в условиях помех
Этот этап проверяет два основных навыка модели: способность ухватить суть инструкции и способность быстро ее понять.
Tencent в официальном блоге привел пять сценариев: планирование проекта, итоги путешествия, записи о прочитанных книгах и т.д. Мы выбрали два сценария для тестирования.
Сценарий 1: Извлечение информации из杂乱内容 протокола встречи
Мы дали запутанную расшифровку аудиозаписи встречи с вставными репликами, уходом от темы, повторными исправлениями и попросили выделить три типа информации.

Ответ Hy3 preview точно перечислил эти три типа информации, способность извлечения информации表现不错.
Сценарий 2: Понимание и следование новым языковым правилам
Мы создали простой язык, показали ему правила на примерах и дали три новых предложения для перевода.

В этом раунде Hy3 preview смог точно выполнить相关要求, каждая деталь была выполнена согласно правилам.
В целом, Hy3 preview способен понимать требования инструкций, эффективно отфильтровывать干扰信息, подходит для实用 сценариев с杂乱信息干扰, извлечением информации.
Код и агент: Вызов инструментов较成熟, завершенность交付 задачи不足
Способность к коду и возможности агента — это важные维度 для оценки того, насколько хорош ИИ-помощник. Это проверяет как глубину понимания模型ью потребностей пользователя, так и способность Агента к планированию, вызову инструментов и завершению задач в многошаговых заданиях. На этом этапе мы designed три задачи для WorkBuddy (ИИ-помощник Tencent).
Первая задача: мы попросили WorkBuddy собрать данные о состоянии воздуха за последний год в пяти городах и на основе данных о качестве воздуха сгенерировать аналитический отчет.

Судя по представлению на странице, результат合格. Сезонные изменения,雷达图, графики трендов, тепловые карты корреляции и другие板块结构完整, визуальное представление упорядочено,图表 также обладают基本功能ми взаимодействия. Это указывает на то, что его исполнительность на уровне前端 представления соответствует标准.
Однако主要有 две проблемы: во-первых, на этапе получения данных возникли препятствия, Hy3 preview получил только 224 дня действительных данных,缺口较大, что повлияло на достоверность последующих таблиц; во-вторых, в промпте явно требовалось написать аналитический вывод, Hy3 preview хотя и оставил область для соответствующего板块 на странице,但 фактическое содержание было пустым. Это означает, что у него есть осознание завершения задачи,但最终交付能力仍有不足.
Вторая задача: мы попросили его создать небольшую игру «Змейка».
Конечный результат较为成熟, с красивой графикой,完整逻辑, может正常运行. Но следует отметить, что «Змейка» относится к задачам с封闭规则, требования четкие и не требуют调用 внешних данных, критерии оценки довольно明确, это сценарий, в котором агент较擅长. Работа WorkBuddy в этой задаче может продемонстрировать способности только в within комфортной зоны, подтверждая, что он обладает определенной实用 ценностью.

Третья задача: мы повысили сложность, поручив ему分析 открытую сложную задачу: проанализировать эволюцию бизнес-моделей в отрасли AI Coding, подвести итоги развития с 2023 года по настоящее время и找出 ключевые转折点 и основные驱动因素 отрасли.
Это открытая сложная задача, не имеющая единого标准答案, качество результата зависит от判断力 агента, способности筛选 информации и表达能力.
На исполнительном уровне WorkBuddy смог自动调用 несколько инструментов, сначала修订 план выполнения, затем落地推进计划, весь процесс занял大约 полчаса.

Но конечный результат нельзя назвать впечатляющим, он лишь создал базовую框架, фактическое содержание不够扎实. Видно, что хотя он освоил методы разбора исследовательских проблем, он не умеет further提炼 эти维度 в ценные исследовательские论点.
В целом, WorkBuddy уже обладает способностями, которые должны быть у повседневного помощника по кодированию, но в глубоком выполнении сложных задач и最终交付还有提升空间.
Естественный диалог: Заметное ослабление «привкуса ИИ»
Наконец, давайте посмотрим, есть ли у Yuanbao «человечность». Этот раунд тестируется через два сценария: светская беседа и творческое письмо.
Сценарий 1: Светская беседа
В официальной документации упоминается, что Hy3 preview лучше понимает намерения пользователя излить душу, может承接情绪 пользователя, избегая назидательных, шаблонных ответов.

Фактическое тестирование показало, что производительность Hy3 preview действительно соответствует этой定位. Он не начал с перечисления一堆 советов, а сначала объективно проанализировал возможные причины, затем спросил, не произошло ли чего-то. Общий тон温和, с чувством меры, обладает естественностью в сценарии светской беседы.
Сценарий 2: Творческое письмо
На этом этапе мы designed две задачи, проверяющие его叙事 и表达能力.
Сначала мы попросили его написать историю, где главный герой ни разу не появляется, но читатель после прочтения четко понимает, кто он, что с ним произошло и почему он важен.

Результат, представленный Yuanbao, обладает自洽ной логикой, плавным叙事,较高 завершенностью,几乎 не ощущается常见的 шаблонность AI-письма.
Затем мы попросили его模仿 стиль «Те дела давно минувших дней» (《明朝那些事儿》) и написать историю о персонаже из другой династии.
При ИИ-письме легко свести стилизацию к шаблонному подражанию,仅停留于 копированием框架 изложения, не постигая глубины стиля. Но судя по сгенерированному результату, Hy3 preview обладает较强ой способностью к文风复刻, в целом соответствует要求. Он ухватил стиль通俗讲述 истории оригинала, хорошо представил всю故事.

Этот раунд тестирования оказался самым неожиданным. В целом, в выражении естественного языка Hy3 preview уже избавился от безвкусной шаблонности правильных ответов, способен писать текст с较高 удобочитаемостью.
Заключение
После тестирования по четырем измерениям Hy3 preview производит впечатление «стабильного, но не сенсационного».
Он не показал подавляющего превосходства в каком-то одном аспекте, но у него также几乎 нет явных短板. В общем рейтинге отечественных больших моделей он, возможно, не самая впечатляющая модель, но соответствует标准 практичной модели, которая может работать.
Если взглянуть шире, истинное значение Hy3 preview,或许, заключается не в самой модели.
За последние два года Tencent был довольно пассивен на поле битвы больших моделей. В конце января этого года Ма Хуатенг на ежегодной встрече公开 признал, что Tencent замедлил действия в области ИИ. Относительно медленный технологический ритм и отсутствие запоминающейся эталонной модели для внешнего мира были двумя основными проблемами Tencent. А выпуск Hy3 preview стал转折点 для истории ИИ Tencent и дал Tencent ИИ-модель, которую может использовать вся экосистема.
В настоящее время Hy3 preview — это всего лишь preview версия, отзывы open source сообщества все еще собираются, фактический опыт вызова в таких продуктах, как Yuanbao, QQ, Tencent Document, также требует времени для проверки. Согласно официальным данным, впоследствии будет выпущена модель с большим规模 параметров.
Но, по крайней мере, ИИ Tencent уже начал撕掉 ярлык «пассивности» последних двух лет.








