Проблема нехватки памяти в больших языковых моделях: решение нашли в технологии USB-флешек

marsbitОпубликовано 2026-07-20Обновлено 2026-07-20

Введение

В статье обсуждается новый подход к решению проблемы нехватки памяти для крупных языковых модеей (ИИ) с помощью технологии NAND Flash, аналогичной используемой в USB-накопителях. Компании SanDisk и SK Hynix разрабатывают High Bandwidth Flash (HBF) — высокопропускную флэш-память, которая применяет методы упаковки и чипового стекирования, как в HBM (высокоскоростной памяти), к чипам NAND Flash. Ключевая идея в том, что Flash-память медленна преимущественно при записи, но чтение может быть значительно ускорено. Путем стекирования до 16 чипов NAND Flash в один модуль HBF целевые показатели для первого поколения составляют до 512 ГБ емкости и пропускной способности чтения до 1.6 ТБ/с. HBF позиционируется не как замена HBM, а как дополнение для этапа *инференса (вывода) ИИ-моделей*. В этом сценарии веса уже обученной модели в основном статичны и требуют интенсивного чтения, что хорошо подходит для Flash. Это позволяет разгрузить дорогую и ограниченную по объему HBM, освободив ее для самых горячих данных, и потенциально снизить количество необходимых ускорителей, общую стоимость и энергопотребление серверов. Хотя до коммерческого внедрения HBF могут пройти годы, эта разработка сигнализирует о переосмыслении иерархии памяти в системах ИИ, где различные типы данных могут оптимально размещаться на разных уровнях: HBM для максимальной скорости, HBF для емкого и достаточно быстрого доступа только для чтения, а SSD — для массового хранения.

Погодите, разве Flash-память не очень медленная? Как же SanDisk и SK Hynix предлагают использовать её для больших языковых моделей???

В свежем выпуске IEEE Spectrum представлен довольно неожиданный подход: проблему нехватки памяти в больших языковых моделях можно смягчить с помощью той же технологии, что и в USB-флешках.

Да, речь именно о NAND Flash.

В представлении многих главные черты Flash-памяти — дешевизна, большой объём и сохранение данных без питания. Но что касается скорости, особенно для задач вывода больших моделей (инференса), она кажется не самым подходящим решением.

Но сейчас SanDisk и SK Hynix продвигают нечто новое: High Bandwidth Flash (высокоскоростная флеш-память), сокращённо HBF.

Идея проста: применить к NAND Flash передовые методы упаковки и чипового стекирования, как в HBM (High Bandwidth Memory).

Другими словами, заставить флеш-память, изначально предназначенную для хранения, участвовать в высокоскоростной поставке данных для AI-инференса.

Согласно открытым материалам SanDisk, в HBF можно уложить до 16 чипов NAND Flash, целевой максимальный объём одного стека — до 512 ГБ, а целевая максимальная пропускная способность чтения — до 1,6 ТБ/с.

В дорожной карте для второго и третьего поколений пропускная способность чтения вырастет до 2 ТБ/с и 3,2 ТБ/с соответственно.

Хотя эти цифры ещё не догоняют топовые HBM, это уже не та «медлительная память», что была у традиционной флешки.

За этим технологическим прорывом, возможно, стоит глобальная проблема дефицита поставок в индустрии памяти.

Недавно (11 июля по пекинскому времени) генеральный директор южнокорейского гиганта памяти SK Hynix, Го Лу Чжэн, публично заявил в день дебюта на Nasdaq, что ожидает самого серьёзного дефицита поставок в истории мировой индустрии памяти к 2027 году. Это заявление быстро вызвало реакцию на рынках капитала и в отраслевых СМИ.

На этом фоне запуск HBF совместно с SanDisk, возможно, и является их технологическим ответом на попытку смягчить напряжённость с поставками памяти.

Давайте разберёмся.

Разве Flash не медленная? Как её можно использовать для AI?

Возникает вопрос: разве Flash не печально известна медленной записью? Как её вдруг можно применять для AI?

В интервью IEEE Spectrum директор по исследованиям полупроводникового рынка Objective Analysis, Джим Хэнди, отметил: «У многих первая реакция именно такая: как это может работать? Flash ведь невероятно медленная».

Но ключевой момент в том, что Flash медленна в основном при записи.

NAND Flash хранит данные с помощью заряда в плавающем затворе транзистора, организуясь в блоки и страницы. Этот механизм позволяет сохранять данные без питания, в отличие от DRAM, которую нужно постоянно обновлять. Поэтому она естественным образом подходит для долгосрочного хранения, сочетая высокую плотность и низкую стоимость.

Однако расплата в том, что для записи данных нужно проталкивать или удалять заряд через изолирующий затвор, и этот процесс значительно медленнее, чем зарядка/разрядка конденсатора.

Поэтому в традиционных вычислениях Flash трудно сравнивать с высокоскоростной памятью вроде DRAM или HBM.

Но если смотреть только на чтение, картина меняется.

Согласно последнему стандарту интерфейса флеш-памяти ONFI 6.0, теоретическая максимальная пропускная способность одного кристалла (die) может достигать 4,8 ГБ/с.

Само по себе это число не кажется впечатляющим.

Но максимальная пропускная способность одного модуля DDR5 DIMM составляет до 70,4 ГБ/с, а одного стека HBM4E — до 3,6 ТБ/с. По сравнению с одним чипом NAND Flash разница составляет примерно 750 раз.

HBF как раз и нацелена на то, чтобы с помощью 3D-упаковки и вертикального стекирования объединить несколько кристаллов NAND Flash, значительно повысив общую пропускную способность чтения.

Старший вице-президент по исследованиям систем памяти SK Hynix, Хошик Ким, отметил: «Применяя передовые технологии 3D-упаковки и вертикального стекирования к NAND-флеш-памяти, HBF позволяет достичь пропускной способности, значительно превышающей стандартное хранилище NVMe».

Подобно тому, как HBM складывает чипы DRAM, HBF складывает кристаллы NAND Flash, создавая чипы с высокой плотностью хранения.

Их цель — не внезапно ускорить один чип Flash, а с помощью стекирования и упаковки увеличить количество каналов чтения.

HBF не стремится заменить HBM, она находит свою нишу

По-настоящему интересно в HBF не то, что она собирается заменить HBM.

А то, что она находит идеальную для Flash область применения: AI-инференс.

Требования к памяти для обучения и вывода (инференса) разные.

При обучении больших моделей системе постоянно нужно считывать веса, вычислять ошибки, а затем обновлять веса через обратное распространение.

Этот процесс требует как интенсивного чтения, так и интенсивной записи, что очень неудобно для Flash.

Потому что Flash медленно записывает, а частые записи также связаны с проблемами долговечности и управления стиранием.

Но на этапе инференса всё иначе.

На этом этапе модель уже обучена, веса в основном зафиксированы. Чаще всего системе нужно быстро считывать эти огромные веса модели, а не часто их перезаписывать.

Это как раз попадает в сильную сторону Flash.

Старший вице-президент по исследованиям систем памяти SK Hynix Ким заявил: «В среде инференса такие большие, интенсивно считываемые данные, как статические веса моделей с миллиардами параметров или предвычисленный KV-кеш (precomputed KV cache), могут надёжно храниться на уровне HBF».

Таким образом, дорогую и ограниченную по объёму HBM можно освободить для использования в качестве высокоскоростного буфера.

Эта архитектура похожа на добавление к AI «пула памяти только для чтения сверхбольшой ёмкости».

HBM по-прежнему отвечает за самый срочный и частый обмен данными для высокоскоростных вычислений.

HBF же отвечает за хранение тех огромных по объёму, но редко изменяемых параметров модели.

Для текущего инференса больших моделей этот подход имеет большое практическое значение.

Потому что трудности инференса больших моделей уже давно не ограничиваются нехваткой вычислительной мощности. Нехватка памяти, недостаточная пропускная способность, высокое энергопотребление, дороговизна развёртывания — все эти факторы накладываются друг на друга.

Особенно на фоне продолжающегося роста масштабов моделей, нехватка видеопамяти на одной карте и высокая стоимость HBM становятся значительными ограничивающими факторами.

Часто проблема не в том, что GPU не справляется с вычислениями, а в том, что модель не помещается или данные не успевают подаваться.

И если HBF сможет найти баланс между ёмкостью, пропускной способностью и стоимостью, она может позволить запускать более крупные модели с меньшими затратами.

512 ГБ в одном стеке: AI-серверы, возможно, будут использовать меньше карт

Целевые параметры HBF первого поколения от SanDisk — максимум 512 ГБ ёмкости и 1,6 ТБ/с пропускной способности чтения.

Это сочетание очень важно: преимущество HBM — чрезвычайно высокая скорость, но она дорога и ограничена по объёму; HBF, хотя и немного медленнее, может обеспечить большую ёмкость и более низкую удельную стоимость.

Это означает, что в будущем при развёртывании инференса больших моделей AI-серверам, возможно, не придётся загружать все веса в HBM.

Часть менее востребованных, статических данных, где чтения больше, чем записи, можно разместить в HBF.

Потенциальные выгоды от такого подхода:

Во-первых, смягчение ограничений по объёму HBM.

Во-вторых, снижение потребности в наращивании количества ускорительных карт для размещения модели.

В-третьих, снижение общей стоимости и энергопотребления системы инференса.

Судя по словам Кима: «HBF и HBM не конкуренты, а взаимодополняющие инструменты».

Он отмечает: «HBF может эффективно смягчить серьёзные ограничения по объёму, с которыми сталкивается HBM, не жертвуя скоростью подачи данных, что, как ожидается, позволит сократить количество ускорителей, необходимых для работы крупномасштабных моделей».

На этой основе он прогнозирует, что это решение также повысит энергоэффективность и снизит затраты, тем самым способствуя дальнейшему расширению масштабов аппаратного обеспечения AI-инференса в дата-центрах.

Это и есть самая важная для отрасли логика HBF: она нужна не для того, чтобы превратить Flash в HBM, а для того, чтобы разные данные в AI-системах находились в наиболее подходящих для них местах.

Горячие данные остаются в HBM; большие объёмы статических данных с интенсивным чтением — в HBF; более медленные и дешёвые данные — на SSD или другом хранилище.

Если такая иерархия установится, архитектура памяти аппаратного обеспечения AI-инференса может получить новый уровень.

До широкого внедрения ещё далеко, но в системе памяти больших моделей уже видны новые сигналы разделения труда

Конечно, HBF пока не является зрелым продуктом.

Согласно сообщению IEEE Spectrum, до возможных поставок HBF пройдёт как минимум год, а до массового развёртывания, возможно, несколько лет.

25 февраля этого года SanDisk и SK Hynix провели совместное стартовое мероприятие, объявив о продвижении работ по стандартизации HBF в рамках проекта Open Compute Project (OCP).

Как важная отраслевая организация в области аппаратного обеспечения дата-центров, OCP разработала множество спецификаций для серверов, стоек, источников питания и ускорителей, таких как спецификация серверов DC-MHS, спецификация ускорителей OAI-OAM и др.

Но на данный момент стандарт HBF всё ещё разрабатывается, официальная дата выпуска ещё не определена — это также означает, что в краткосрочной перспективе HBF не сразу изменит рынок AI-серверов.

Это больше похоже на преждевременно проявившийся сигнал: AI-инференс заставляет систему памяти и хранения пересматривать разделение труда.

Раньше внимание в аппаратном обеспечении больших моделей было сосредоточено на GPU, HBM и межсоединениях.

Но по мере роста моделей и увеличения количества запросов на инференс узкие места смещаются с «быстроты вычислений» на «помещается ли модель», «хватает ли скорости чтения» и «позволяют ли счета за электричество».

HBF нацелена именно на эту нишу.

Война за память для AI, возможно, не ограничится HBM

Интересно, что сама SK Hynix является одним из крупнейших бенефициаров HBM.

HBM приносит ей рекордные доходы, и, казалось бы, продвижение более дешёвой альтернативной технологии противоречит коммерческой логике.

Но с системной точки зрения, HBF не обязательно отберёт хлеб у HBM.

AI-серверам будущего нужна не единая память, а иерархическая память.

Пусть HBM отвечает за максимальную производительность, HBF — за большой объём и высокую пропускную способность чтения, а SSD — за более дешёвое массовое хранение.

Если эта комбинация заработает, AI-системы инференса станут более масштабируемыми.

Проще говоря: не каждому параметру модели нужно «жить в роскошных апартаментах» HBM. Некоторым данным достаточно места с достаточным объёмом, быстрым чтением и более низкой стоимостью.

Именно на это место и претендует HBF.

От NAND Flash в USB-флешках и SD-картах до высокоскоростного пула весов моделей в AI-серверах — скачок кажется большим, но проблема больших моделей уже ясна: параметров всё больше, инференс всё дороже, HBM всё дефицитнее.

И решение может прийти не только от более дорогой памяти, но и от переупаковки старой, знакомой технологии.

Ссылки:

[1]https://spectrum.ieee.org/high-bandwidth-flash?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-07-15&itm_content=hero6

Статья из официального аккаунта WeChat «Квантовый бит», автор: Гэ Вэнтин

Связанные с этим вопросы

QЧто такое High Bandwidth Flash (HBF) и как он может помочь в работе больших языковых моделей?

AHigh Bandwidth Flash (HBF) — это новая технология на основе NAND Flash, которая использует передовую 3D-упаковку и вертикальное наслоение чипов, подобно HBM. Её цель — значительно увеличить пропускную способность при чтении данных. В контексте больших моделей HBF предлагает создать уровень памяти с большой ёмкостью и высокой скоростью чтения специально для статических, редко изменяемых данных, таких как веса обученной модели или предвычисленный KV-кэш. Это позволяет освободить дорогостоящую и ограниченную по объёму память HBM для самых критичных операций, снизить общую стоимость и энергопотребление системы вывода (инференса), а также уменьшить количество необходимых акселераторов для работы с огромными моделями.

QПочему NAND Flash, известная своей медленной записью, рассматривается для использования в высокопроизводительных AI-задачах?

AХотя NAND Flash действительно имеет низкую скорость записи из-за физических процессов перемещения заряда, её скорость чтения может быть достаточно высокой, особенно при использовании современных стандартов интерфейса (например, ONFI 6.0). Ключевое наблюдение заключается в том, что фаза вывода (инференса) больших языковых моделей в основном требует интенсивного чтения заранее обученных и статических весов модели, а не их частой перезаписи. Таким образом, слабая сторона Flash (запись) не является критичным ограничением для этой конкретной задачи, в то время как её сильные стороны — большая плотность хранения, низкая стоимость и энергонезависимость — становятся весьма ценными.

QКакова целевая производительность и ёмкость первой версии HBF от SanDisk?

AСогласно данным SanDisk, целевые параметры для первого поколения High Bandwidth Flash (HBF) составляют: максимальная ёмкость до 512 ГБ на один стек (набор наслоённых чипов) и целевая пропускная способность при чтении до 1,6 ТБ/с. В дорожной карте также заявлено, что в последующих поколениях (втором и третьем) пропускная способность будет увеличена до 2 ТБ/с и 3,2 ТБ/с соответственно.

QВ чём заключается основное различие между требованиями к памяти на этапах обучения и вывода (инференса) больших моделей?

AНа этапе обучения система постоянно и многократно считывает веса модели, вычисляет ошибки и обновляет эти веса методом обратного распространения. Этот процесс требует как высокой пропускной способности при чтении, так и чрезвычайно высокой скорости записи, что плохо подходит для NAND Flash. На этапе вывода (инференса) модель уже обучена, её веса заморожены и практически не изменяются. Основная задача системы — быстро считывать эти огромные массивы данных для генерации ответов. Таким образом, инференс — это преимущественно задача с интенсивным чтением, что идеально соответствует сильным сторонам технологии HBF (высокая скорость чтения, большая ёмкость, низкая стоимость).

QКак технология HBF может изменить архитектуру памяти в AI-серверах будущего?

AHBF может привести к появлению нового, дополнительного уровня в иерархической архитектуре памяти AI-серверов. Вместо того чтобы пытаться разместить все данные модели в чрезвычайно быстрой, но дорогой и ограниченной по объёму памяти HBM, система сможет эффективно распределять данные: самые «горячие» и критичные для вычислений данные остаются в HBM; объёмные, статические, преимущественно читаемые данные (например, веса модели) перемещаются в HBF, который предлагает лучший баланс ёмкости, скорости чтения и стоимости; а ещё менее требовательные данные могут храниться на традиционных SSD. Такая многоуровневая система позволит более масштабируемо, экономично и энергоэффективно запускать всё более крупные модели для вывода.

Похожее

Интерпретация Bernstein: Могут ли долгосрочные заказы на 142 миллиарда долларов смягчить цикл памяти?

Бернштейн анализирует долгосрочные соглашения о закупках (LTA) в индустрии памяти. Micron и SanDisk заключили новые соглашения с гарантиями минимальных цен и финансовыми обязательствами, совокупно оцениваемыми примерно в 1420 млрд долларов, чтобы создать базовый уровень доходов. Однако отчет показывает, что эти гарантии (около 33 млрд долларов) составляют лишь около 0,6% от расчетного объема доходов в 5,2 трлн долларов, нуждающихся в защите в течение следующих 3-5 лет. Это означает, что LTA смягчают, но не устраняют цикличность. Гарантии усложняют отказ крупных клиентов, таких как американские облачные провайдеры, особенно при умеренных падениях цен. Однако в случае глубокого спада экономические расчеты могут привести к расторжению контрактов. Кроме того, значительная часть спроса (30-50%), включая потребительский сегмент и некоторых китайских клиентов, вряд ли будет охвачена LTA, что сохранит волатильность. Хотя спрос на ИИ (HBM, DRAM) поддерживает оценку компаний и увеличивает ценность LTA в период высокой конъюнктуры, соглашения не фиксируют пиковую прибыль. Их реальная проверка наступит во время следующего спада, когда будет видно, будут ли соблюдаться обязательства и окажется ли финансовая защита достаточной. LTA — это буфер, а не конец отраслевого цикла.

marsbit10 мин. назад

Интерпретация Bernstein: Могут ли долгосрочные заказы на 142 миллиарда долларов смягчить цикл памяти?

marsbit10 мин. назад

Крупнейшая выставка торговли и инвестиций в Индии проходит в Мумбаи

Индийская торговая и инвестиционная сфера стремительно развивается, расширяясь за пределы крупных городов благодаря росту финансовой грамотности и цифровых платформ. Чтобы удовлетворить спрос на качественное образование и экспертные знания, ключевую роль играют отраслевые мероприятия. Money Expo India 2026, 5-я выставка, пройдет 29–30 августа 2026 года в Конгресс-центре Jio World в Мумбаи. Мероприятие соберет ведущие онлайн-торговые и финтех-компании, инвестиционные платформы и поставщиков финансовых услуг. В программе — экспертные конференции, демонстрации продуктов и возможности для нетворкинга. Как отмечает коммерческий директор HQMENA Нияз, выставка призвана объединить растущее сообщество инвесторов с глобальными брендами, экспертами и новыми технологиями. Участники, такие как HDFC Securities, Alphabots и Tradomate, высоко оценили качество аудитории, уровень организации и энергетику мероприятия. Money Expo India способствует развитию финансовой экосистемы страны, объединяя инновации, образование и отраслевое сотрудничество. Это одна из ведущих финансовых выставок Индии, создающая платформу для взаимодействия брокеров, финтех-компаний, инвесторов и отраслевых лидеров.

TheNewsCrypto22 мин. назад

Крупнейшая выставка торговли и инвестиций в Индии проходит в Мумбаи

TheNewsCrypto22 мин. назад

Патрик Витт откладывает военную подготовку, чтобы возглавить усилия Белого дома по принятию закона CLARITY Act

Белый дом усилил работу над Законом о CLARITY, и его главный советник по цифровым активам, Патрик Уитт, отложил свою военную подготовку в Национальной гвардии армии Джорджии, чтобы продолжить переговоры по этому важному законопроекту о криптовалютах. Уитт должен был начать обучение 27 июля, но из-за предстоящего перерыва в работе Сената с 8 августа открылось небольшое окно для переговоров. Администрация считает этот период критически важным для продвижения Закона о CLARITY, который призван установить четкие правила регулирования рынка цифровых активов в США. Это уже не первый раз, когда Уитт откладывает военную службу ради этой работы. Актуальность роли Уитта возросла после того, как заместитель директора Гарри Джунг объявил о своем уходе из правительства. Первоначально Джунг должен был взять на себя обязанности во время отсутствия Уитта, но теперь присутствие Уитта в Вашингтоне необходимо для обеспечения преемственности руководства в ключевой законодательный период. Администрация продолжает работу над законопроектом до перерыва в Сенате 8 августа.

TheNewsCrypto31 мин. назад

Патрик Витт откладывает военную подготовку, чтобы возглавить усилия Белого дома по принятию закона CLARITY Act

TheNewsCrypto31 мин. назад

Акции Circle обвалились на 76%, гонконгская стейблкоин появится в течение двух недель

Акции Circle упали на 76% с июня 2023 года, с $260 до $62, что свидетельствует о переоценке рынком ее стоимости. Президент компании Хит Тарберт заявляет о долгосрочной стратегии, но аналитики Mizuho понизили рейтинг акций, ссылаясь на растущую конкуренцию и давление на прибыль. Конкуренция на рынке стейблкоинов обостряется. USDC сохраняет лидерство с объемом в $730 млрд, но сталкивается с вызовом от нового стейблкоина Open USD и платформы Visa Stablecoin Platform, которые используют модель распределения доходов для привлечения партнеров. Circle в ответ развивает партнерство с японской JCB для интеграции USDC в офлайн-платежи. Tether (USDT) сталкивается с проблемами соблюдения требований нового закона США (GENIUS), дающего два года на приведение резервов (сейчас включающих биткойны и драгметаллы) в соответствие с нормами. Несоблюдение может ограничить его использование на рынке США. В Гонконге ожидается запуск стейблкоина HKDAP, привязанного к гонконгскому доллару, после получения одной из первых лицензий регулятором консорциумом во главе со Standard Chartered. Ключевым вопросом станет интеграция в реальные финансовые потоки. Падение акций Circle отражает не только усиление конкуренции в отрасли, но и изменение рыночных ожиданий относительно процентных ставок. Эпоха безраздельного доминирования на рынке стейблкоинов подходит к концу, и ценность масштаба пересматривается. Будущее определит, кто сможет реализовать заявленные стратегии.

marsbit35 мин. назад

Акции Circle обвалились на 76%, гонконгская стейблкоин появится в течение двух недель

marsbit35 мин. назад

В условиях капиталистической осады децентрализация — единственная линия обороны публичных блокчейнов

В статье профессора Колумбийской бизнес-школы Омида Малекана утверждается, что в условиях давления со стороны крупного капитала и корпораций единственной надежной защитой публичных блокчейнов является максимальная децентрализация. Автор, называющий себя прагматиком и реалистом, анализирует ситуацию с позиций макиавеллизма и истории, доказывая, что любые компромиссные и централизованные решения (разрешенные блокчейны, консорциумы) неизбежно будут поглощены или коррумпированы традиционными институтами для сохранения их власти и прибыли. Главная опасность для протоколов заключается не во внешних атаках, а в захвате контроля изнутри, о чем свидетельствует эволюция таких платформ, как Visa, Mastercard или Google. Поскольку публичный базовый блокчейн потенциально охватывает огромный рынок расчетов для активов, платежей и приложений, мотивация для его захвата чрезвычайно высока. Корпорации будут либо пытаться контролировать новые технологии, либо активно их дискредитировать. Псевдодецентрализованные корпоративные решения, по мнению автора, неэффективны и служат лишь тактикой задержки, позволяя традиционным игрокам замедлить внедрение truly децентрализованных систем. Однако в долгосрочной перспективе рынок, подобно воде, стекающей вниз, неизбежно выберет наиболее безопасную и открытую инфраструктуру, несмотря на ее текущие недостатки и высокую стоимость работы. Ethereum, при всех своих несовершенствах, сегодня представляет собой оптимальный баланс и наилучшую защиту от захвата.

Foresight News44 мин. назад

В условиях капиталистической осады децентрализация — единственная линия обороны публичных блокчейнов

Foresight News44 мин. назад

Торговля

Спот
活动图片