Модель Kimi K3, для которой раньше требовалось 16 B200, теперь помещается на 8 AMD

marsbitОпубликовано 2026-08-04Обновлено 2026-08-04

Введение

В статье сообщается, что компания Wafer AI успешно развернула большую языковую модель Kimi K3 на 8 графических процессорах AMD MI355X, каждый с 288 ГБ памяти HBM. Ранее для этой модели требовалось 16 GPU NVIDIA B200 (по 192 ГБ), размещенных в двух серверах. Ключевым преимуществом AMD оказался больший объем видеопамяти, позволивший разместить все 2.8 трлн параметров модели на одном узле, избежав межсерверной коммуникации. В тестах (ввод 1024 токена, вывод 400) конфигурация на MI355X показала общую пропускную способность 952 токена/с и скорость генерации для одного пользователя 118 токенов/с. Это примерно в 3.8 раза выше пропускной способности на один узел по сравнению с двухсерверным решением на B200. Хотя решение на 8 GPU NVIDIA B300 показало абсолютно лучшую производительность (1568 токенов/с), MI355X продемонстрировало лучшее соотношение цены и производительности. Также отмечается, что для запуска модели на стеке программного обеспечения ROCm от AMD потребовалась минимальная доработка — исправление одной функции для спекулятивного декодирования и оптимизация ядра внимания для ускорения времени до вывода первого токена. Авторы делают вывод, что в эпоху огромных моделей объем памяти GPU становится критически важным фактором, а улучшение поддержки программного обеспечения делает решения AMD более конкурентоспособными для центров обработки данных.

Возможно, этого момента AMD ждала очень долго.

Недавно Wafer AI развернул Kimi K3 на AMD MI355X. Результат: модель, для которой раньше требовалось 16 GPU NVIDIA B200, распределенных между двумя серверами, теперь можно запустить на одном сервере AMD с 8 картами MI355X.

Что еще важнее, речь не просто о том, чтобы "впихнуть" модель.

В тесте с вводом 1024 токенов и выводом 400 токенов, система на MI355X показала общую пропускную способность 952 токен/с, а скорость генерации для одного пользователя составила 118 токен/с.

В расчете на один узел, ее пропускная способность примерно в 3.8 раза выше, чем у варианта на 16 картах B200. Соотношение цена/производительность также превысило показатели B200 и B300.

Но самое неожиданное – ROCm на этот раз не доставил особых хлопот.

Модели слишком велики: память становится важнее вычислительной мощности

Kimi K3 насчитывает 2.8 триллиона параметров, и только веса модели требуют более 1.5 ТБ видеопамяти, не считая KV Cache для контекста в миллион токенов.

Сервер с 8 картами B200, где каждая карта имеет 192 ГБ памяти, в сумме предлагает около 1.5 ТБ. То есть, веса модели сложно разместить полностью, не говоря уже о месте для KV Cache. Поэтому для B200 необходимы два сервера и 16 GPU.

Карта B300 имеет 288 ГБ памяти, что позволяет разместить модель в рамках одного узла. Что интересно, AMD MI355X также обладает 288 ГБ памяти, и 8 таких карт дают в сумме около 2.3 ТБ – одного сервера достаточно.

Это не просто экономия одного сервера. Когда модель работает на нескольких узлах, генерация каждого токена может требовать синхронизации данных по сети. Даже при использовании сети RoCE v2 со скоростью около 195 Гбит/с, межузловая связь замедляет декодирование.

Благодаря большей памяти, MI355X смог удержать всю модель в рамках одного узла.

Согласно итоговым результатам, пиковая общая пропускная способность 8 карт MI355X достигла 952 токен/с, скорость однопоточной генерации – 118 токен/с.

Для сравнения, общая пропускная способность двухузловой конфигурации на 16 картах B200 составила 498 токен/с, что в пересчете на один узел дает примерно 249 токен/с.

Таким образом, пропускная способность одного узла на MI355X примерно в 3.8 раза выше средней пропускной способности одного узла в двухузловой конфигурации B200. Скорость генерации для одного пользователя у MI355X (118 токен/с) также выше, чем у B200 (90 токен/с).

B300 остается решением с абсолютно наивысшей производительностью. Общая пропускная способность узла с 8 картами B300 достигла 1568 токен/с, скорость однопоточной генерации – 172 токен/с, что примерно в 1.65 раза выше общей пропускной способности MI355X.

Но цена меняет выводы. Wafer провел расчеты, исходя из предположительной стоимости: $2.5 в час за карту MI355X, $4.25 за B200 и $6 за B300.

При таком предположении, MI355X обеспечивает около 48 токен/с пиковой пропускной способности на каждый доллар; B200 – около 7 токен/с; B300 – около 33 токен/с.

B300 быстрее, но MI355X эффективнее с точки зрения стоимости. Для дата-центров, которым требуется массово запускать открытые модели, это может быть важнее, чем просто борьба за лидерство в производительности.

Еще более неожиданно: ROCm в основном работал "из коробки"

Долгое время главной проблемой GPU AMD для дата-центров была часто не аппаратная часть, а программная.

Модель, которая сразу работает на CUDA, на ROCm могла потребовать изменений в фреймворке, добавления операторов или даже переписывания низкоуровневых ядер.

Но с Kimi K3 ситуация оказалась иной.

AMD обеспечила поддержку практически одновременно с выпуском модели. В Wafer сообщили, что модель в основном запускалась на MI355X прямо "из коробки", а последующая работа была сосредоточена на решении незначительных проблем совместимости и оптимизации производительности.

Одна из проблем возникла в части спекулятивного декодирования. Сама модель Kimi K3 не предоставляет параметров черновой модели, необходимых для MTP или EAGLE, поэтому Wafer использовал внешнюю модель чернового блочного расширения.

Это решение работало напрямую в среде CUDA, но в окружении ROCm первый реальный запрос приводил к ошибке планировщика. Причина заключалась в отсутствии определения функции с именем top_k_renorm_prob в ветке ROCm.

Эта функция выполняет не очень сложную задачу: выбирает k наивысших значений из вероятностного распределения, обнуляет остальные вероятности, а затем перенормирует оставшиеся.

В итоге Wafer восполнил эту логику с помощью обычной функции PyTorch, не требуя написания GPU-ядра или перепроектирования системы спекулятивного декодирования.

После исправления, спекулятивное декодирование повысило однопоточную производительность примерно в 2.2 раза, производительность одного потока при среднем уровне параллелизма – примерно в 1.7 раза, а пиковая общая пропускная способность увеличилась примерно на 18%.

Что еще важнее, система смогла достичь пиковой пропускной способности при более высоком уровне параллелизма.

Первое слово слишком долго: в итоге добавили всего четыре нуля

Разумеется, пропускная способность – не единственный показатель для сервиса логического вывода. Для реального пользователя другой важный параметр, напрямую влияющий на восприятие, – это TTFT, время ожидания между отправкой запроса и появлением первого токена.

В этом аспекте первоначальные результаты MI355X были не самыми лучшими. При холодном старте и предзаполнении задачи объемом около 172 тыс. токенов, MI355X требовалось около 51 секунды, в то время как B300 справлялся примерно за 23 секунды.

Для моделей с поддержкой контекста в миллион токенов, задача предзаполнения может быть очень объемной. Если при работе с длинным контекстом пользователю каждый раз приходится ждать десятки секунд или даже дольше, то даже высокая скорость декодирования не сможет компенсировать проблемы с восприятием.

В конечном итоге Wafer обнаружил, что разрыв в производительности почти полностью обусловлен одним ядром внимания. Kimi K3 в конфигурации с 8-канальным тензорным параллелизмом распределяет по 12 голов внимания на каждый GPU. Однако более быстрые ядра предзаполнения MLA в AMD AITER поддерживают только определенные формы, кратные 4, 8 или 16.

12 голов не соответствовали требованиям, и система вернулась к более медленной универсальной реализации на Triton.

Решение оказалось простым: дополнить 12 голов внимания нулями до 16, вызвать существующее высокоскоростное ядро, а после вычислений взять только необходимые 12 голов. Структура модели не менялась, новые ассемблерные ядра не писались – просто добавили четыре нуля.

После оптимизации, стабильная скорость предзаполнения для ядра AITER MLA достигла около 13 тыс. токенов/с, в то время как исходный путь отката на Triton составлял примерно 4000–7000 токенов/с. Время холодного предзаполнения сократилось примерно в 2–3 раза.

Эта оптимизация не изменяет итоговую пропускную способность декодирования, но существенно сокращает время ожидания пользователем появления первого символа.

Это также показывает, что кажущийся большим разрыв в программном обеспечении между AMD и NVIDIA иногда объясняется не недостатком базовых возможностей, а просто тем, что существующие высокоскоростные ядра пока не охватывают какую-то новую форму модели.

Крепость CUDA все еще стоит, но брешь уже появилась

Один тест, конечно, не доказывает, что AMD полностью догнала NVIDIA.

B200 вынужден работать на нескольких узлах из-за нехватки памяти; B300 по-прежнему лидирует в абсолютной производительности; инструментарий ROCm, поддержка фреймворков и экосистема разработчиков также уступают CUDA.

Но открытые модели стремительно вступают в эру триллионов параметров. Когда модель становится настолько большой, что не помещается на одном сервере, объем памяти перестает быть просто цифрой в спецификациях и начинает напрямую влиять на затраты на связь, сложность развертывания и итоговую пропускную способность.

Стратегия AMD по оснащению отдельных карт большим объемом HBM превращается в реальное системное преимущество.

Если AMD сможет продолжать повышать стабильность ROCm, расширять поддержку форм для высокоскоростных ядер и обеспечивать более своевременную адаптацию "в день выхода" для новых моделей, то дата-центры будут вынуждены серьезно рассматривать эти GPU. Цена ниже, память больше, производительность достаточна, а с программным обеспечением больше не нужно "бороться" месяцами.

Что вы думаете по этому поводу?

Ссылки:

https://x.com/wafer_ai/status/2083628389903315406

https://x.com/ChiragAsarpota/status/2083864019870634151

Статья из WeChat официального аккаунта "Машинный разум" (ID: almosthuman2014), автор:关注LLM的

Трендовые криптовалюты

Связанные с этим вопросы

QВ чем заключается ключевое преимущество использования 8 карт AMD MI355X вместо 16 карт NVIDIA B200 для запуска модели Kimi K3?

AКлючевым преимуществом является больший объем видеопамяти (VRAM). Kimi K3 требует более 1,5 ТБ только для весов модели. 8 карт MI355X (по 288 ГБ каждая) в сумме обеспечивают около 2,3 ТБ, что позволяет разместить всю модель на одном сервере. 8 карт B200 (по 192 ГБ) дают лишь около 1,5 ТБ, что вынуждает использовать два сервера и 16 карт, что влечет за собой межсерверные задержки связи и снижение общей пропускной способности.

QКаковы были результаты теста производительности между решениями на AMD MI355X и NVIDIA B200/B300 в терминах пропускной способности и экономической эффективности?

AПо результатам теста, одноузловое решение на 8 картах AMD MI355X показало пиковую пропускную способность 952 токена/с. Одноузловое решение на 8 картах NVIDIA B300 показало более высокую абсолютную производительность — 1568 токенов/с. Однако при расчете стоимости (2,5 доллара/час за MI355X против 6 долларов/час за B300) решение на MI355X оказалось экономически эффективнее: около 48 токенов/с на доллар против примерно 33 токенов/с на доллар у B300. Решение на B200 (два узла, 16 карт) показало самую низкую пропускную способность (498 токенов/с) и экономическую эффективность (около 7 токенов/с на доллар).

QКакая неожиданная проблема возникла с программным стеком ROCm при развертывании Kimi K3, и как она была решена?

AОдной из неожиданных проблем стало отсутствие в ветке ROCm функции `top_k_renorm_prob`, необходимой для работы внешней модели черновика (draft model), используемой для спекулятивного декодирования (speculative decoding). Эта функция выбирает топ-k вероятностей, обнуляет остальные и перенормирует оставшиеся. Вместо переписывания GPU-ядра разработчики решили проблему, заменив отсутствующую функцию стандартной операцией PyTorch, что позволило системе использовать спекулятивное декодирование. После исправления этот метод повысил производительность.

QКак была решена проблема долгого времени до первого токена (TTFT) на MI355X при обработке длинных контекстов?

AПроблема долгого TTFT (около 51 секунды против 23 секунд у B300) была вызвана неоптимальной работой механизма внимания (attention). Быстрый MLA-ядро в библиотеке AMD AITER поддерживало только определенные формы (shape), например, кратное 4, 8 или 16. В конфигурации Kimi K3 на каждую GPU приходилось 12 голов внимания, что не соответствовало требованиям быстрого ядра, и система переключалась на более медленную общую реализацию Triton. Решение оказалось простым: данные были дополнены четырьмя нулями, чтобы получить 16 голов, использовать высокоскоростное ядро, а затем из результата были взяты нужные 12 голов. Это сократило время холодного предварительного заполнения в 2-3 раза.

QКак, согласно статье, изменилась конкурентная ситуация между AMD и NVIDIA в области больших языковых моделей после этого теста?

AСтатья указывает, что конкурентная ситуация начинает меняться. Хотя экосистема CUDA и абсолютная производительность топовых решений NVIDIA (B300) по-прежнему сильны, у AMD появилось четкое конкурентное преимущество для сверхбольших моделей: объем видеопамяти на карту. Стратегия AMD оснащать карты большим объемом HBM становится системным преимуществом, когда модель не помещается в один узел NVIDIA. Кроме того, в данном случае ПО ROCm показало хорошую готовность для новой модели, что сократило время на адаптацию. Если AMD продолжит улучшать стабильность ROCm, расширять поддержку и обеспечивать своевременную адаптацию, их предложение (больше памяти, конкурентная цена, достаточная производительность) станет серьезным аргументом для дата-центров.

Похожее

Кто поддерживает Changxin?

Ключевые моменты: Чансин Технолоджи, крупнейший производитель DRAM в Китае, успешно провел IPO на фондовом рынке Китая 27 июля 2025 года. Компания достигла рыночной капитализации в 3 триллиона юаней, став крупнейшей технологической компанией на китайском рынке. Основные силы, поддержавшие успех компании: 1. **Государственные фонды Хэфэя** – главный инвестор, вложивший средства на ранних этапах. Их долгосрочная поддержка и "терпеливый капитал" сыграли решающую роль в развитии компании. 2. **Различные инвестиционные институты** – включая государственные фонды, страховые компании и частные инвестиционные организации, которые участвовали в девяти раундах финансирования. 3. **Основатель и управленческая команда** – во главе с Чжу Имином, который привлек таланты и реализовал стратегию инноваций, позволившую компании преодолеть технологический разрыв с мировыми лидерами. Компания смогла пройти путь от нуля до лидера в отрасли благодаря сочетанию государственной поддержки, частных инвестиций и сильной управленческой команды. Модель Хэфэя, основанная на долгосрочных инвестициях в высокие технологии, стала примером для других регионов. Однако эксперты отмечают, что такая модель требует уникальных условий и не может быть легко скопирована.

marsbit4 мин. назад

Кто поддерживает Changxin?

marsbit4 мин. назад

После мемов: «дорожная карта выживания» Фонда Solana

**Краткое содержание:** Фонд Solana опубликовал пять вакансий для руководителей высшего звена, что указывает на стратегический сдвиг от мем-коинов к стабильным монетам, институциональному росту в Азии, DeFi и AI-экосистеме. Причиной этому послужило падение доходов сети во втором квартале 2026 года на 43%, при этом значительная часть (39%) по-прежнему зависела от платформы мем-коинов Pump.fun. Одновременно в сети наблюдался взрывной рост объёмов торговли токенизированными акциями (до $58 млрд, +114%), что демонстрирует растущий институциональный спрос. Однако эти «серьёзные» транзакции приносят меньше комиссионных доходов, чем спекулятивные операции с мемами. Новые вакансии призваны решить эту проблему: * **Руководитель по стабильным монетам** должен обеспечить «скачкообразный рост» на отстающем направлении. * **Руководители по институциональному развитию в Азии** займутся расширением сотрудничества с банками и регуляторами. * **Руководитель роста DeFi** будет стимулировать использование средств в продуктах, генерирующих комиссии. * **Руководитель AI-экосистемы** сосредоточится на платежных системах для AI-агентов, что уже привлекает внимание крупных облачных провайдеров. Таким образом, Фонд Solana пытается снизить зависимость от спекулятивной активности, переориентируясь на устойчивые, институциональные и технологические направления роста, способные генерировать стабильный доход. Успех этой стратегии станет ясен, когда в топе доходов появятся проекты не из сферы мем-коинов.

marsbit36 мин. назад

После мемов: «дорожная карта выживания» Фонда Solana

marsbit36 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片