Модель Kimi K3, для которой раньше требовалось 16 B200, теперь помещается на 8 AMD

marsbitОпубликовано 2026-08-04Обновлено 2026-08-04

Введение

В статье сообщается, что компания Wafer AI успешно развернула большую языковую модель Kimi K3 на 8 графических процессорах AMD MI355X, каждый с 288 ГБ памяти HBM. Ранее для этой модели требовалось 16 GPU NVIDIA B200 (по 192 ГБ), размещенных в двух серверах. Ключевым преимуществом AMD оказался больший объем видеопамяти, позволивший разместить все 2.8 трлн параметров модели на одном узле, избежав межсерверной коммуникации. В тестах (ввод 1024 токена, вывод 400) конфигурация на MI355X показала общую пропускную способность 952 токена/с и скорость генерации для одного пользователя 118 токенов/с. Это примерно в 3.8 раза выше пропускной способности на один узел по сравнению с двухсерверным решением на B200. Хотя решение на 8 GPU NVIDIA B300 показало абсолютно лучшую производительность (1568 токенов/с), MI355X продемонстрировало лучшее соотношение цены и производительности. Также отмечается, что для запуска модели на стеке программного обеспечения ROCm от AMD потребовалась минимальная доработка — исправление одной функции для спекулятивного декодирования и оптимизация ядра внимания для ускорения времени до вывода первого токена. Авторы делают вывод, что в эпоху огромных моделей объем памяти GPU становится критически важным фактором, а улучшение поддержки программного обеспечения делает решения AMD более конкурентоспособными для центров обработки данных.

Возможно, этого момента AMD ждала очень долго.

Недавно Wafer AI развернул Kimi K3 на AMD MI355X. Результат: модель, для которой раньше требовалось 16 GPU NVIDIA B200, распределенных между двумя серверами, теперь можно запустить на одном сервере AMD с 8 картами MI355X.

Что еще важнее, речь не просто о том, чтобы "впихнуть" модель.

В тесте с вводом 1024 токенов и выводом 400 токенов, система на MI355X показала общую пропускную способность 952 токен/с, а скорость генерации для одного пользователя составила 118 токен/с.

В расчете на один узел, ее пропускная способность примерно в 3.8 раза выше, чем у варианта на 16 картах B200. Соотношение цена/производительность также превысило показатели B200 и B300.

Но самое неожиданное – ROCm на этот раз не доставил особых хлопот.

Модели слишком велики: память становится важнее вычислительной мощности

Kimi K3 насчитывает 2.8 триллиона параметров, и только веса модели требуют более 1.5 ТБ видеопамяти, не считая KV Cache для контекста в миллион токенов.

Сервер с 8 картами B200, где каждая карта имеет 192 ГБ памяти, в сумме предлагает около 1.5 ТБ. То есть, веса модели сложно разместить полностью, не говоря уже о месте для KV Cache. Поэтому для B200 необходимы два сервера и 16 GPU.

Карта B300 имеет 288 ГБ памяти, что позволяет разместить модель в рамках одного узла. Что интересно, AMD MI355X также обладает 288 ГБ памяти, и 8 таких карт дают в сумме около 2.3 ТБ – одного сервера достаточно.

Это не просто экономия одного сервера. Когда модель работает на нескольких узлах, генерация каждого токена может требовать синхронизации данных по сети. Даже при использовании сети RoCE v2 со скоростью около 195 Гбит/с, межузловая связь замедляет декодирование.

Благодаря большей памяти, MI355X смог удержать всю модель в рамках одного узла.

Согласно итоговым результатам, пиковая общая пропускная способность 8 карт MI355X достигла 952 токен/с, скорость однопоточной генерации – 118 токен/с.

Для сравнения, общая пропускная способность двухузловой конфигурации на 16 картах B200 составила 498 токен/с, что в пересчете на один узел дает примерно 249 токен/с.

Таким образом, пропускная способность одного узла на MI355X примерно в 3.8 раза выше средней пропускной способности одного узла в двухузловой конфигурации B200. Скорость генерации для одного пользователя у MI355X (118 токен/с) также выше, чем у B200 (90 токен/с).

B300 остается решением с абсолютно наивысшей производительностью. Общая пропускная способность узла с 8 картами B300 достигла 1568 токен/с, скорость однопоточной генерации – 172 токен/с, что примерно в 1.65 раза выше общей пропускной способности MI355X.

Но цена меняет выводы. Wafer провел расчеты, исходя из предположительной стоимости: $2.5 в час за карту MI355X, $4.25 за B200 и $6 за B300.

При таком предположении, MI355X обеспечивает около 48 токен/с пиковой пропускной способности на каждый доллар; B200 – около 7 токен/с; B300 – около 33 токен/с.

B300 быстрее, но MI355X эффективнее с точки зрения стоимости. Для дата-центров, которым требуется массово запускать открытые модели, это может быть важнее, чем просто борьба за лидерство в производительности.

Еще более неожиданно: ROCm в основном работал "из коробки"

Долгое время главной проблемой GPU AMD для дата-центров была часто не аппаратная часть, а программная.

Модель, которая сразу работает на CUDA, на ROCm могла потребовать изменений в фреймворке, добавления операторов или даже переписывания низкоуровневых ядер.

Но с Kimi K3 ситуация оказалась иной.

AMD обеспечила поддержку практически одновременно с выпуском модели. В Wafer сообщили, что модель в основном запускалась на MI355X прямо "из коробки", а последующая работа была сосредоточена на решении незначительных проблем совместимости и оптимизации производительности.

Одна из проблем возникла в части спекулятивного декодирования. Сама модель Kimi K3 не предоставляет параметров черновой модели, необходимых для MTP или EAGLE, поэтому Wafer использовал внешнюю модель чернового блочного расширения.

Это решение работало напрямую в среде CUDA, но в окружении ROCm первый реальный запрос приводил к ошибке планировщика. Причина заключалась в отсутствии определения функции с именем top_k_renorm_prob в ветке ROCm.

Эта функция выполняет не очень сложную задачу: выбирает k наивысших значений из вероятностного распределения, обнуляет остальные вероятности, а затем перенормирует оставшиеся.

В итоге Wafer восполнил эту логику с помощью обычной функции PyTorch, не требуя написания GPU-ядра или перепроектирования системы спекулятивного декодирования.

После исправления, спекулятивное декодирование повысило однопоточную производительность примерно в 2.2 раза, производительность одного потока при среднем уровне параллелизма – примерно в 1.7 раза, а пиковая общая пропускная способность увеличилась примерно на 18%.

Что еще важнее, система смогла достичь пиковой пропускной способности при более высоком уровне параллелизма.

Первое слово слишком долго: в итоге добавили всего четыре нуля

Разумеется, пропускная способность – не единственный показатель для сервиса логического вывода. Для реального пользователя другой важный параметр, напрямую влияющий на восприятие, – это TTFT, время ожидания между отправкой запроса и появлением первого токена.

В этом аспекте первоначальные результаты MI355X были не самыми лучшими. При холодном старте и предзаполнении задачи объемом около 172 тыс. токенов, MI355X требовалось около 51 секунды, в то время как B300 справлялся примерно за 23 секунды.

Для моделей с поддержкой контекста в миллион токенов, задача предзаполнения может быть очень объемной. Если при работе с длинным контекстом пользователю каждый раз приходится ждать десятки секунд или даже дольше, то даже высокая скорость декодирования не сможет компенсировать проблемы с восприятием.

В конечном итоге Wafer обнаружил, что разрыв в производительности почти полностью обусловлен одним ядром внимания. Kimi K3 в конфигурации с 8-канальным тензорным параллелизмом распределяет по 12 голов внимания на каждый GPU. Однако более быстрые ядра предзаполнения MLA в AMD AITER поддерживают только определенные формы, кратные 4, 8 или 16.

12 голов не соответствовали требованиям, и система вернулась к более медленной универсальной реализации на Triton.

Решение оказалось простым: дополнить 12 голов внимания нулями до 16, вызвать существующее высокоскоростное ядро, а после вычислений взять только необходимые 12 голов. Структура модели не менялась, новые ассемблерные ядра не писались – просто добавили четыре нуля.

После оптимизации, стабильная скорость предзаполнения для ядра AITER MLA достигла около 13 тыс. токенов/с, в то время как исходный путь отката на Triton составлял примерно 4000–7000 токенов/с. Время холодного предзаполнения сократилось примерно в 2–3 раза.

Эта оптимизация не изменяет итоговую пропускную способность декодирования, но существенно сокращает время ожидания пользователем появления первого символа.

Это также показывает, что кажущийся большим разрыв в программном обеспечении между AMD и NVIDIA иногда объясняется не недостатком базовых возможностей, а просто тем, что существующие высокоскоростные ядра пока не охватывают какую-то новую форму модели.

Крепость CUDA все еще стоит, но брешь уже появилась

Один тест, конечно, не доказывает, что AMD полностью догнала NVIDIA.

B200 вынужден работать на нескольких узлах из-за нехватки памяти; B300 по-прежнему лидирует в абсолютной производительности; инструментарий ROCm, поддержка фреймворков и экосистема разработчиков также уступают CUDA.

Но открытые модели стремительно вступают в эру триллионов параметров. Когда модель становится настолько большой, что не помещается на одном сервере, объем памяти перестает быть просто цифрой в спецификациях и начинает напрямую влиять на затраты на связь, сложность развертывания и итоговую пропускную способность.

Стратегия AMD по оснащению отдельных карт большим объемом HBM превращается в реальное системное преимущество.

Если AMD сможет продолжать повышать стабильность ROCm, расширять поддержку форм для высокоскоростных ядер и обеспечивать более своевременную адаптацию "в день выхода" для новых моделей, то дата-центры будут вынуждены серьезно рассматривать эти GPU. Цена ниже, память больше, производительность достаточна, а с программным обеспечением больше не нужно "бороться" месяцами.

Что вы думаете по этому поводу?

Ссылки:

https://x.com/wafer_ai/status/2083628389903315406

https://x.com/ChiragAsarpota/status/2083864019870634151

Статья из WeChat официального аккаунта "Машинный разум" (ID: almosthuman2014), автор:关注LLM的

Трендовые криптовалюты

Связанные с этим вопросы

QВ чем заключается ключевое преимущество использования 8 карт AMD MI355X вместо 16 карт NVIDIA B200 для запуска модели Kimi K3?

AКлючевым преимуществом является больший объем видеопамяти (VRAM). Kimi K3 требует более 1,5 ТБ только для весов модели. 8 карт MI355X (по 288 ГБ каждая) в сумме обеспечивают около 2,3 ТБ, что позволяет разместить всю модель на одном сервере. 8 карт B200 (по 192 ГБ) дают лишь около 1,5 ТБ, что вынуждает использовать два сервера и 16 карт, что влечет за собой межсерверные задержки связи и снижение общей пропускной способности.

QКаковы были результаты теста производительности между решениями на AMD MI355X и NVIDIA B200/B300 в терминах пропускной способности и экономической эффективности?

AПо результатам теста, одноузловое решение на 8 картах AMD MI355X показало пиковую пропускную способность 952 токена/с. Одноузловое решение на 8 картах NVIDIA B300 показало более высокую абсолютную производительность — 1568 токенов/с. Однако при расчете стоимости (2,5 доллара/час за MI355X против 6 долларов/час за B300) решение на MI355X оказалось экономически эффективнее: около 48 токенов/с на доллар против примерно 33 токенов/с на доллар у B300. Решение на B200 (два узла, 16 карт) показало самую низкую пропускную способность (498 токенов/с) и экономическую эффективность (около 7 токенов/с на доллар).

QКакая неожиданная проблема возникла с программным стеком ROCm при развертывании Kimi K3, и как она была решена?

AОдной из неожиданных проблем стало отсутствие в ветке ROCm функции `top_k_renorm_prob`, необходимой для работы внешней модели черновика (draft model), используемой для спекулятивного декодирования (speculative decoding). Эта функция выбирает топ-k вероятностей, обнуляет остальные и перенормирует оставшиеся. Вместо переписывания GPU-ядра разработчики решили проблему, заменив отсутствующую функцию стандартной операцией PyTorch, что позволило системе использовать спекулятивное декодирование. После исправления этот метод повысил производительность.

QКак была решена проблема долгого времени до первого токена (TTFT) на MI355X при обработке длинных контекстов?

AПроблема долгого TTFT (около 51 секунды против 23 секунд у B300) была вызвана неоптимальной работой механизма внимания (attention). Быстрый MLA-ядро в библиотеке AMD AITER поддерживало только определенные формы (shape), например, кратное 4, 8 или 16. В конфигурации Kimi K3 на каждую GPU приходилось 12 голов внимания, что не соответствовало требованиям быстрого ядра, и система переключалась на более медленную общую реализацию Triton. Решение оказалось простым: данные были дополнены четырьмя нулями, чтобы получить 16 голов, использовать высокоскоростное ядро, а затем из результата были взяты нужные 12 голов. Это сократило время холодного предварительного заполнения в 2-3 раза.

QКак, согласно статье, изменилась конкурентная ситуация между AMD и NVIDIA в области больших языковых моделей после этого теста?

AСтатья указывает, что конкурентная ситуация начинает меняться. Хотя экосистема CUDA и абсолютная производительность топовых решений NVIDIA (B300) по-прежнему сильны, у AMD появилось четкое конкурентное преимущество для сверхбольших моделей: объем видеопамяти на карту. Стратегия AMD оснащать карты большим объемом HBM становится системным преимуществом, когда модель не помещается в один узел NVIDIA. Кроме того, в данном случае ПО ROCm показало хорошую готовность для новой модели, что сократило время на адаптацию. Если AMD продолжит улучшать стабильность ROCm, расширять поддержку и обеспечивать своевременную адаптацию, их предложение (больше памяти, конкурентная цена, достаточная производительность) станет серьезным аргументом для дата-центров.

Похожее

Будет ли следующая буря на Уолл-стрит спровоцирована казначейскими облигациями США? Решающая неделя впереди

Автор: Сюй Чао. Источник: Wallstreetcn. Рынок государственных облигаций США подает все более тревожные сигналы другим классам активов, и фондовый рынок принимает на себя первый удар. Доходности долгосрочных казначейских облигаций резко выросли на прошлой неделе: доходность 30-летних бондов достигла максимума с 2007 года, а 10-летние бумаги вышли из торгового диапазона, сохранявшегося с конца 2023 года. Индекс волатильности ICE BofA MOVE поднялся до высшего уровня с мая, а спрос на опционы пут на облигации резко вырос. Ключевым драйвером роста доходности стал вопрос о доверии рынков к твердости ФРС в борьбе с инфляцией. После последнего заседания разрыв в доходности между долгосрочными и краткосрочными облигациями резко сократился. Рост волатильности привел к всплеску спроса на хеджирование. Показатель перекоса в сторону опционов пут на ETF долгосрочных бондов (TLT) взлетел до максимума со времен финансового кризиса 2008 года. Эксперты предупреждают, что текущие уровни доходности могут начать оказывать давление на фондовый рынок. На предстоящей неделе ситуация может обостриться: Министерство финансов США раскроет детали планов по заимствованиям, а также будут опубликованы важные экономические данные, включая отчет по занятости за июль, что окажет серьезное влияние на ожидания относительно политики ФРС. Аналитики отмечают, что недавняя координация с Японией по стабилизации иены отчасти была мотивирована желанием предотвратить новую волну нестабильности на рынке облигаций США. Потенциальные потрясения на этом рынке-основании глобальной финансовой системы могут иметь далеко идущие последствия.

marsbit18 мин. назад

Будет ли следующая буря на Уолл-стрит спровоцирована казначейскими облигациями США? Решающая неделя впереди

marsbit18 мин. назад

Двойное предупреждение для биткоина (BTC): аналитик раскрывает критический уровень, который может ускорить падение, крупный игрок делает ставку против этого ценового уровня в сентябре! Вот...

Криптовалюта биткоин в настоящее время торгуется в узком диапазоне. Аналитик Аксель Адлер, изучив стресс-индикатор UTXO, отмечает, что он снова вошел в зону высокого стресса, достигнув значения 71,58, что указывает на значительную долю монет в убытке и усиление давления продавцов. Если BTC упадет ниже месячного минимума около $61 500, а индикатор превысит 90, это давление может резко усилиться и привести к дальнейшему снижению курса. Параллельно с этим анонимный крупный инвестор на рынке опционов сделал ставку на то, что биткоин не превысит уровень $70 000 до 25 сентября, продав соответствующих контрактов на $173 млн. Если прогноз оправдается, он получит премию в $3,03 млн.

cryptonews.ru19 мин. назад

Двойное предупреждение для биткоина (BTC): аналитик раскрывает критический уровень, который может ускорить падение, крупный игрок делает ставку против этого ценового уровня в сентябре! Вот...

cryptonews.ru19 мин. назад

IX Crypto Summit — первый крупный криптофорум в условиях нового регулирования

28–29 октября в Москве состоится IX Crypto Summit — первое крупное отраслевое мероприятие после вступления в силу с 1 сентября нового закона о регулировании цифровых валют в России. Участники форума первыми обсудят, как новые правила, определяющие обращение цифровых валют, деятельность криптобирж, обменников и депозитариев, изменят рынок и какие возможности откроют. В центре внимания будут позиция регуляторов, изменения на рынке, выход банков на рынок цифровых активов, развитие инфраструктуры, трансграничные расчеты, а также перспективы инвестиций и майнинга. На площадке соберутся представители госорганов, банков, криптокомпаний и международного бизнеса из дружественных стран. Подробности и билеты — на официальном сайте. Промокод CRYPTONEWS дает скидку 10%.

cryptonews.ru49 мин. назад

IX Crypto Summit — первый крупный криптофорум в условиях нового регулирования

cryptonews.ru49 мин. назад

Кто поддерживает Changxin?

Ключевые моменты: Чансин Технолоджи, крупнейший производитель DRAM в Китае, успешно провел IPO на фондовом рынке Китая 27 июля 2025 года. Компания достигла рыночной капитализации в 3 триллиона юаней, став крупнейшей технологической компанией на китайском рынке. Основные силы, поддержавшие успех компании: 1. **Государственные фонды Хэфэя** – главный инвестор, вложивший средства на ранних этапах. Их долгосрочная поддержка и "терпеливый капитал" сыграли решающую роль в развитии компании. 2. **Различные инвестиционные институты** – включая государственные фонды, страховые компании и частные инвестиционные организации, которые участвовали в девяти раундах финансирования. 3. **Основатель и управленческая команда** – во главе с Чжу Имином, который привлек таланты и реализовал стратегию инноваций, позволившую компании преодолеть технологический разрыв с мировыми лидерами. Компания смогла пройти путь от нуля до лидера в отрасли благодаря сочетанию государственной поддержки, частных инвестиций и сильной управленческой команды. Модель Хэфэя, основанная на долгосрочных инвестициях в высокие технологии, стала примером для других регионов. Однако эксперты отмечают, что такая модель требует уникальных условий и не может быть легко скопирована.

marsbit1 ч. назад

Кто поддерживает Changxin?

marsbit1 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片