В годы бурного развития ИИ отраслью практически управляла одна логика: вычислительная мощность определяет потолок возможностей, а GPU — это ядро вычислительной мощности.
Однако к 2026 году эта логика начала меняться: вывод моделей больше не является единственным узким местом, производительность системы все больше зависит от возможностей выполнения и планирования. GPU по-прежнему важен, но ключ к тому, «заработает ли ИИ», постепенно смещается в сторону долгое время игнорируемого CPU.
9 апреля по местному времени США Google и Intel заключили многолетнее соглашение о масштабном развертывании «процессоров Intel Xeon» в глобальных дата-центрах ИИ именно для решения этой проблемы. Генеральный директор Intel Чен Лиу прямо заявил, что ИИ работает на всей системе, и именно CPU и IPU являются ключом к производительности, эффективности и гибкости. Другими словами, CPU, который последние два года считался «второстепенным игроком», теперь «душит» расширение возможностей ИИ.

Генеральный директор Intel Чен Лиу в социальных сетях заявил: Intel углубляет сотрудничество с Google, распространяя его с традиционных CPU на инфраструктуру ИИ (такую как IPU), чтобы совместно продвигать возможности ИИ и облачных вычислений.
CPU больше не является просто пассивным вспомогательным компонентом, а становится одной из ключевых переменных в инфраструктуре ИИ.
01
«Тихий» кризис поставок
Пока все следили за сроками поставок GPU, напряженность на рынке CPU уже достигла пика.
Согласно последним отчетам нескольких ИТ-дистрибьюторов, в четвертом квартале 2025 года средняя цена серверных CPU выросла примерно на 30%. Такой рост на относительно зрелом рынке CPU является весьма редким.
Глава подразделения центров обработки данных AMD Форрест Норрод (Forrest Norrod) сообщил, что за последние три квартала спрос на CPU рос быстрее, чем можно было представить. В настоящее время цикл поставок AMD увеличился с первоначальных восьми недель до более чем десяти недель, а некоторые модели сталкиваются с задержками до шести месяцев.
Этот дефицит в основном вызван «вторичным эффектом», приводящим к вытеснению ресурсов. По словам некоторых представителей отрасли, из-за крайней загруженности 3-нм производственной линии TSMC, мощности пластин, первоначально выделенные для CPU, постоянно вытесняются более прибыльными заказами на GPU. Это привело к крайне ироничной ситуации: лаборатории ИИ получили достаточно GPU, но обнаружили, что на рынке невозможно купить достаточно мощных CPU, чтобы «запустить» эти видеокарты.
В этой волне скупки CPU поучаствовал и Илон Маск (Elon Musk).
Генеральный директор Intel Чен Лиу подтвердил на платформе социальных сетей, что Маск поручил Intel разработать и произвести定制ные чипы для своего проекта «Terafab» в Техасе. Этот масштабный проект旨在 создать единую вычислительную базу для xAI, SpaceX и Tesla.
Доверие Маска к Intel во многом объясняется тем, что Intel пытается внедриться на каждый уровень — от наземных центров обработки данных до орбитальных вычислений в космосе.

Для Intel это, несомненно, долгожданная поддержка. Некоторые отраслевые аналитики预测, что доля доходов AMD на рынке серверных CPU превысит долю Intel в 2026 году, но глубокая инерция и производственные возможности Intel в экосистеме x86 по-прежнему являются козырем, который крупные клиенты, подобные Маску, не могут игнорировать.
Такое глубокое межотраслевое взаимодействие превращает конкуренцию на рынке CPU из простого соревнования параметров в игру экосистем и стабильности цепочек поставок.
02
Почему CPU стал «слабым звеном»?
Внезапное превращение CPU в узкое место связано с fundamentalным изменением характера работы, которую ему приходится выполнять в эпоху агентов.
В традиционной модели чат-ботов CPU в основном отвечает за планирование и обработку данных, а GPU承担核心推理计算. Поскольку вычислительно-емкие этапы сосредоточены на стороне GPU, общая задержка обычно определяется GPU, и CPU редко становится узким местом производительности.
Но рабочая нагрузка агентов совершенно иная. Агенту необходимо выполнять многошаговые рассуждения, вызывать API, читать и записывать базы данных, orcheстрировать сложные бизнес-процессы и интегрировать промежуточные результаты в окончательный вывод. Такие задачи, как поиск, вызов API, выполнение кода, файловый ввод-вывод и orchestration результатов, в основном ложатся на CPU и主机系统. GPU отвечает за генерацию токенов (т.е. «мышление»), а CPU负责 преобразование результатов «мышления» в конкретные действия.
В статье «Взгляд на агентный ИИ с процессоро-центричной точки зрения» (A CPU-Centric Perspective on Agentic AI), опубликованной учеными Технологического института Джорджии в ноябре 2025 года, был проведен количественный анализ распределения задержек в рабочей нагрузке агентов. Исследование показало, что время, затрачиваемое на обработку инструментов на стороне CPU, составляет от 50% до 90,6% общей задержки. В некоторых сценариях GPU был готов обработать следующую партию задач, а CPU все еще ждал возврата от вызова инструмента.
Другим ключевым фактором является быстрое расширение контекстного окна. В 2024 году большинство主流 моделей поддерживали 128–200 тыс. токенов. К 2025 году такие модели, как Gemini 2.5 Pro, GPT-4.1, Llama 4 Maverick, начали поддерживать 1 млн+ токенов. Кэш KV (Key-Value Cache, используемый для ускорения процесса вывода моделей Transformers) растет линейно с количеством токенов, составляя около 200 ГБ при 1 млн токенов, что значительно превышает объем памяти одной видеокарты H100 (80 ГБ).
Одним из решений этой проблемы является частичная выгрузка кэша KV в оперативную память CPU. Это означает, что CPU должен управлять не только orchestration и вызовами инструментов, но и помогать обрабатывать данные, которые не помещаются в видеопамять. Таким образом, объем оперативной памяти CPU, пропускная способность памяти и скорость соединения между CPU и GPU становятся ключевыми для производительности системы.
Следовательно, CPU, подходящий для эпохи агентов,更需要 низкую задержку, согласованную способность доступа к памяти и более сильные возможности системного уровня, а не простое наращивание ядер.
03
Что делают производители? Кто-то захватывает территории, кто-то меняет设计
Столкнувшись с этим внезапным всплеском спроса на CPU, крупные производители выбрали совершенно разные стратегии.
Intel — традиционный лидер на рынке серверных CPU. По данным Mercury Research, в четвертом квартале 2025 года доля Intel на рынке серверных CPU仍然 составляла 60%, AMD — 24,3%, NVIDIA — 6,2%. Но все эти годы Intel一直在追赶新技术, и этот всплеск спроса на CPU является как возможностью, так и испытанием для них.
Текущая стратегия Intel — идти двумя путями. С одной стороны, продолжать продавать процессоры Xeon, тесно связываясь с крупномасштабными клиентами, такими как Google; с другой стороны, сотрудничать с SambaNova, предлагая комбинированные решения на основе процессоров Xeon и их собственных акселераторов RDU, с主打卖点 «возможность запуска推理 агентов без GPU». Дорожные карты Xeon 6 Granite Rapids и технологии 18A станут ключевым испытанием способности Intel переломить ситуацию.
AMD является одним из крупнейших бенефициаров этого всплеска спроса на CPU. В четвертом квартале 2025 года выручка центра обработки данных AMD составила 5,4 млрд долларов, увеличившись на 39% год к году. Пятое поколение EPYC Turin占了 более половины доходов от серверных CPU, развертывание облачных инстансов на EPYC выросло более чем на 50% год к году. Доля доходов AMD от серверных CPU впервые превысила 40%.
Генеральный директор AMD Лиза Су (Lisa Su)直接 связала причину роста с развитием «агентов» — рабочая нагрузка агентов «вернула» задачи к традиционным задачам CPU.
В феврале 2026 года AMD также объявила о потенциальной сделке с Meta стоимостью более 100 млрд долларов на поставку GPU MI450 и CPU Venice EPYC.
Однако у AMD все еще есть возможности для улучшения на системном уровне协同, не хватает зрелых возможностей高速 соединения CPU-GPU, подобных NVLink C2C. По мере того, как системы агентов предъявляют все более высокие требования к эффективности взаимодействия и协同 данных, важность этого аспекта также постепенно возрастает.
Подход NVIDIA к проектированию CPU полностью отличается от подходов Intel и AMD.
Процессор NVIDIA Grace имеет всего 72 ядра, в то время как AMD EPYC и Intel Xeon обычно имеют 128. Глава подразделения инфраструктуры ИИ NVIDIA Дион Харрис (Dion Harris) объяснил: «Если вы — крупномасштабный企业, вы хотите максимизировать количество ядер на каждый CPU, что基本上 снизит стоимость, то есть стоимость в долларах за ядро. Так что это бизнес-модель.»
Другими словами, в системе вычислений ИИ роль CPU больше не является основной для универсальных вычислений, а представляет собой «центр планирования», обслуживающий GPU. Если CPU не успевает, дорогостоящие GPU вынуждены ждать, и общая эффективность反而 падает.
Поэтому при проектировании NVIDIA优先 обеспечивает高效协同 между CPU и GPU. Например, с помощью соединения NVLink C2C пропускная способность между CPU и GPU увеличивается до примерно 1,8 ТБ/с, что значительно выше традиционного PCIe, CPU может напрямую обращаться к памяти GPU, что значительно упрощает управление кэшем KV.
В настоящее время NVIDIA уже продает процессор Vera как独立ный продукт. CoreWeave стал первым клиентом. Сделка с Meta еще более масштабна: это第一次大规模「чистого развертывания Grace», то есть大规模独立ного развертывания CPU без配对 GPU.
Главный аналитик Creative Strategies Бен Баджарин (Ben Bajarin) отметил, что в условиях высокой интенсивности системного взаимодействия вычислительная мощность CPU должна соответствовать скорости итерации акселераторов. Если в канале передачи данных возникает даже однопроцентная задержка, экономическая эффективность всего кластера ИИ значительно снижается. Это стремление к максимальной системной эффективности заставляет всех крупных производителей重新评估 показатели производительности CPU.
Вице-президент и главный аналитик Constellation Research Хольгер Мюллер (Holger Mueller) заявил, что по мере перехода рабочих нагрузок ИИ на агентно-ориентированную архитектуру роль CPU становится все более центральной. Он отметил: «В мире агентов агентам необходимо вызывать API и различные бизнес-приложения, эти задачи最适合 для выполнения на CPU.»
Он также добавил: «В настоящее время нет единого мнения о том, что更适合 для处理 задач вывода — GPU или CPU. GPU имеют преимущество в обучении моделей, а定制ные ASIC, такие как TPU, также имеют свою специализацию. Но одно ясно: Google необходимо采用 гибридную процессорную архитектуру. Поэтому выбор Google в пользу сотрудничества с Intel является обоснованным».
04
Заключение: В эпоху агентов天平 вычислительной мощности качнулась обратно
В последних отраслевых наблюдениях следует обратить внимание на одни данные. В рамках соглашения о сотрудничестве между Amazon AWS и OpenAI на сумму 38 млрд долларов в官方ном заявлении также четко упоминается масштаб расширения в «десятки миллионов CPU».
В последние годы внимание отрасли обычно было приковано к «сотням тысяч GPU». Однако то, что передовые лаборатории, такие как OpenAI,主动 рассматривают масштаб CPU как важную переменную планирования, посылает четкий сигнал: расширение рабочей нагрузки агентов должно основываться на огромной инфраструктуре CPU.
Bank of America预测, что к 2030 году мировой рынок CPU может удвоиться с текущих 27 млрд долларов до 60 млрд долларов.几乎 вся эта доля будет обусловлена ИИ.
Мы являемся свидетелями начала расширения全新的 инфраструктуры: крупные производители больше не просто наращивают GPU, а同步 расширяют целый уровень «инфраструктуры планирования CPU», специально предназначенной для поддержки работы агентов ИИ.
Объединение усилий Intel и Google, а также крупные инвестиции Маска в定制ные чипы доказывают один факт: точка превосходства в гонке ИИ смещается. Когда вычислительная мощность перестает быть дефицитом, победит в этой игре на триллионы долларов тот, кто最先 решит проблему системного «узкого места».
*Приглашенный编译 Цзинь Лу также внес вклад в эту статью.
Эта статья来自微信公众号「Tencent Technology», автор: Ли Хайлунь, редактор: Сюй Цинъян






