Проблема нехватки памяти в больших языковых моделях: решение нашли в технологии USB-флешек

marsbitОпубликовано 2026-07-20Обновлено 2026-07-20

Введение

В статье обсуждается новый подход к решению проблемы нехватки памяти для крупных языковых модеей (ИИ) с помощью технологии NAND Flash, аналогичной используемой в USB-накопителях. Компании SanDisk и SK Hynix разрабатывают High Bandwidth Flash (HBF) — высокопропускную флэш-память, которая применяет методы упаковки и чипового стекирования, как в HBM (высокоскоростной памяти), к чипам NAND Flash. Ключевая идея в том, что Flash-память медленна преимущественно при записи, но чтение может быть значительно ускорено. Путем стекирования до 16 чипов NAND Flash в один модуль HBF целевые показатели для первого поколения составляют до 512 ГБ емкости и пропускной способности чтения до 1.6 ТБ/с. HBF позиционируется не как замена HBM, а как дополнение для этапа *инференса (вывода) ИИ-моделей*. В этом сценарии веса уже обученной модели в основном статичны и требуют интенсивного чтения, что хорошо подходит для Flash. Это позволяет разгрузить дорогую и ограниченную по объему HBM, освободив ее для самых горячих данных, и потенциально снизить количество необходимых ускорителей, общую стоимость и энергопотребление серверов. Хотя до коммерческого внедрения HBF могут пройти годы, эта разработка сигнализирует о переосмыслении иерархии памяти в системах ИИ, где различные типы данных могут оптимально размещаться на разных уровнях: HBM для максимальной скорости, HBF для емкого и достаточно быстрого доступа только для чтения, а SSD — для массового хранения.

Погодите, разве Flash-память не очень медленная? Как же SanDisk и SK Hynix предлагают использовать её для больших языковых моделей???

В свежем выпуске IEEE Spectrum представлен довольно неожиданный подход: проблему нехватки памяти в больших языковых моделях можно смягчить с помощью той же технологии, что и в USB-флешках.

Да, речь именно о NAND Flash.

В представлении многих главные черты Flash-памяти — дешевизна, большой объём и сохранение данных без питания. Но что касается скорости, особенно для задач вывода больших моделей (инференса), она кажется не самым подходящим решением.

Но сейчас SanDisk и SK Hynix продвигают нечто новое: High Bandwidth Flash (высокоскоростная флеш-память), сокращённо HBF.

Идея проста: применить к NAND Flash передовые методы упаковки и чипового стекирования, как в HBM (High Bandwidth Memory).

Другими словами, заставить флеш-память, изначально предназначенную для хранения, участвовать в высокоскоростной поставке данных для AI-инференса.

Согласно открытым материалам SanDisk, в HBF можно уложить до 16 чипов NAND Flash, целевой максимальный объём одного стека — до 512 ГБ, а целевая максимальная пропускная способность чтения — до 1,6 ТБ/с.

В дорожной карте для второго и третьего поколений пропускная способность чтения вырастет до 2 ТБ/с и 3,2 ТБ/с соответственно.

Хотя эти цифры ещё не догоняют топовые HBM, это уже не та «медлительная память», что была у традиционной флешки.

За этим технологическим прорывом, возможно, стоит глобальная проблема дефицита поставок в индустрии памяти.

Недавно (11 июля по пекинскому времени) генеральный директор южнокорейского гиганта памяти SK Hynix, Го Лу Чжэн, публично заявил в день дебюта на Nasdaq, что ожидает самого серьёзного дефицита поставок в истории мировой индустрии памяти к 2027 году. Это заявление быстро вызвало реакцию на рынках капитала и в отраслевых СМИ.

На этом фоне запуск HBF совместно с SanDisk, возможно, и является их технологическим ответом на попытку смягчить напряжённость с поставками памяти.

Давайте разберёмся.

Разве Flash не медленная? Как её можно использовать для AI?

Возникает вопрос: разве Flash не печально известна медленной записью? Как её вдруг можно применять для AI?

В интервью IEEE Spectrum директор по исследованиям полупроводникового рынка Objective Analysis, Джим Хэнди, отметил: «У многих первая реакция именно такая: как это может работать? Flash ведь невероятно медленная».

Но ключевой момент в том, что Flash медленна в основном при записи.

NAND Flash хранит данные с помощью заряда в плавающем затворе транзистора, организуясь в блоки и страницы. Этот механизм позволяет сохранять данные без питания, в отличие от DRAM, которую нужно постоянно обновлять. Поэтому она естественным образом подходит для долгосрочного хранения, сочетая высокую плотность и низкую стоимость.

Однако расплата в том, что для записи данных нужно проталкивать или удалять заряд через изолирующий затвор, и этот процесс значительно медленнее, чем зарядка/разрядка конденсатора.

Поэтому в традиционных вычислениях Flash трудно сравнивать с высокоскоростной памятью вроде DRAM или HBM.

Но если смотреть только на чтение, картина меняется.

Согласно последнему стандарту интерфейса флеш-памяти ONFI 6.0, теоретическая максимальная пропускная способность одного кристалла (die) может достигать 4,8 ГБ/с.

Само по себе это число не кажется впечатляющим.

Но максимальная пропускная способность одного модуля DDR5 DIMM составляет до 70,4 ГБ/с, а одного стека HBM4E — до 3,6 ТБ/с. По сравнению с одним чипом NAND Flash разница составляет примерно 750 раз.

HBF как раз и нацелена на то, чтобы с помощью 3D-упаковки и вертикального стекирования объединить несколько кристаллов NAND Flash, значительно повысив общую пропускную способность чтения.

Старший вице-президент по исследованиям систем памяти SK Hynix, Хошик Ким, отметил: «Применяя передовые технологии 3D-упаковки и вертикального стекирования к NAND-флеш-памяти, HBF позволяет достичь пропускной способности, значительно превышающей стандартное хранилище NVMe».

Подобно тому, как HBM складывает чипы DRAM, HBF складывает кристаллы NAND Flash, создавая чипы с высокой плотностью хранения.

Их цель — не внезапно ускорить один чип Flash, а с помощью стекирования и упаковки увеличить количество каналов чтения.

HBF не стремится заменить HBM, она находит свою нишу

По-настоящему интересно в HBF не то, что она собирается заменить HBM.

А то, что она находит идеальную для Flash область применения: AI-инференс.

Требования к памяти для обучения и вывода (инференса) разные.

При обучении больших моделей системе постоянно нужно считывать веса, вычислять ошибки, а затем обновлять веса через обратное распространение.

Этот процесс требует как интенсивного чтения, так и интенсивной записи, что очень неудобно для Flash.

Потому что Flash медленно записывает, а частые записи также связаны с проблемами долговечности и управления стиранием.

Но на этапе инференса всё иначе.

На этом этапе модель уже обучена, веса в основном зафиксированы. Чаще всего системе нужно быстро считывать эти огромные веса модели, а не часто их перезаписывать.

Это как раз попадает в сильную сторону Flash.

Старший вице-президент по исследованиям систем памяти SK Hynix Ким заявил: «В среде инференса такие большие, интенсивно считываемые данные, как статические веса моделей с миллиардами параметров или предвычисленный KV-кеш (precomputed KV cache), могут надёжно храниться на уровне HBF».

Таким образом, дорогую и ограниченную по объёму HBM можно освободить для использования в качестве высокоскоростного буфера.

Эта архитектура похожа на добавление к AI «пула памяти только для чтения сверхбольшой ёмкости».

HBM по-прежнему отвечает за самый срочный и частый обмен данными для высокоскоростных вычислений.

HBF же отвечает за хранение тех огромных по объёму, но редко изменяемых параметров модели.

Для текущего инференса больших моделей этот подход имеет большое практическое значение.

Потому что трудности инференса больших моделей уже давно не ограничиваются нехваткой вычислительной мощности. Нехватка памяти, недостаточная пропускная способность, высокое энергопотребление, дороговизна развёртывания — все эти факторы накладываются друг на друга.

Особенно на фоне продолжающегося роста масштабов моделей, нехватка видеопамяти на одной карте и высокая стоимость HBM становятся значительными ограничивающими факторами.

Часто проблема не в том, что GPU не справляется с вычислениями, а в том, что модель не помещается или данные не успевают подаваться.

И если HBF сможет найти баланс между ёмкостью, пропускной способностью и стоимостью, она может позволить запускать более крупные модели с меньшими затратами.

512 ГБ в одном стеке: AI-серверы, возможно, будут использовать меньше карт

Целевые параметры HBF первого поколения от SanDisk — максимум 512 ГБ ёмкости и 1,6 ТБ/с пропускной способности чтения.

Это сочетание очень важно: преимущество HBM — чрезвычайно высокая скорость, но она дорога и ограничена по объёму; HBF, хотя и немного медленнее, может обеспечить большую ёмкость и более низкую удельную стоимость.

Это означает, что в будущем при развёртывании инференса больших моделей AI-серверам, возможно, не придётся загружать все веса в HBM.

Часть менее востребованных, статических данных, где чтения больше, чем записи, можно разместить в HBF.

Потенциальные выгоды от такого подхода:

Во-первых, смягчение ограничений по объёму HBM.

Во-вторых, снижение потребности в наращивании количества ускорительных карт для размещения модели.

В-третьих, снижение общей стоимости и энергопотребления системы инференса.

Судя по словам Кима: «HBF и HBM не конкуренты, а взаимодополняющие инструменты».

Он отмечает: «HBF может эффективно смягчить серьёзные ограничения по объёму, с которыми сталкивается HBM, не жертвуя скоростью подачи данных, что, как ожидается, позволит сократить количество ускорителей, необходимых для работы крупномасштабных моделей».

На этой основе он прогнозирует, что это решение также повысит энергоэффективность и снизит затраты, тем самым способствуя дальнейшему расширению масштабов аппаратного обеспечения AI-инференса в дата-центрах.

Это и есть самая важная для отрасли логика HBF: она нужна не для того, чтобы превратить Flash в HBM, а для того, чтобы разные данные в AI-системах находились в наиболее подходящих для них местах.

Горячие данные остаются в HBM; большие объёмы статических данных с интенсивным чтением — в HBF; более медленные и дешёвые данные — на SSD или другом хранилище.

Если такая иерархия установится, архитектура памяти аппаратного обеспечения AI-инференса может получить новый уровень.

До широкого внедрения ещё далеко, но в системе памяти больших моделей уже видны новые сигналы разделения труда

Конечно, HBF пока не является зрелым продуктом.

Согласно сообщению IEEE Spectrum, до возможных поставок HBF пройдёт как минимум год, а до массового развёртывания, возможно, несколько лет.

25 февраля этого года SanDisk и SK Hynix провели совместное стартовое мероприятие, объявив о продвижении работ по стандартизации HBF в рамках проекта Open Compute Project (OCP).

Как важная отраслевая организация в области аппаратного обеспечения дата-центров, OCP разработала множество спецификаций для серверов, стоек, источников питания и ускорителей, таких как спецификация серверов DC-MHS, спецификация ускорителей OAI-OAM и др.

Но на данный момент стандарт HBF всё ещё разрабатывается, официальная дата выпуска ещё не определена — это также означает, что в краткосрочной перспективе HBF не сразу изменит рынок AI-серверов.

Это больше похоже на преждевременно проявившийся сигнал: AI-инференс заставляет систему памяти и хранения пересматривать разделение труда.

Раньше внимание в аппаратном обеспечении больших моделей было сосредоточено на GPU, HBM и межсоединениях.

Но по мере роста моделей и увеличения количества запросов на инференс узкие места смещаются с «быстроты вычислений» на «помещается ли модель», «хватает ли скорости чтения» и «позволяют ли счета за электричество».

HBF нацелена именно на эту нишу.

Война за память для AI, возможно, не ограничится HBM

Интересно, что сама SK Hynix является одним из крупнейших бенефициаров HBM.

HBM приносит ей рекордные доходы, и, казалось бы, продвижение более дешёвой альтернативной технологии противоречит коммерческой логике.

Но с системной точки зрения, HBF не обязательно отберёт хлеб у HBM.

AI-серверам будущего нужна не единая память, а иерархическая память.

Пусть HBM отвечает за максимальную производительность, HBF — за большой объём и высокую пропускную способность чтения, а SSD — за более дешёвое массовое хранение.

Если эта комбинация заработает, AI-системы инференса станут более масштабируемыми.

Проще говоря: не каждому параметру модели нужно «жить в роскошных апартаментах» HBM. Некоторым данным достаточно места с достаточным объёмом, быстрым чтением и более низкой стоимостью.

Именно на это место и претендует HBF.

От NAND Flash в USB-флешках и SD-картах до высокоскоростного пула весов моделей в AI-серверах — скачок кажется большим, но проблема больших моделей уже ясна: параметров всё больше, инференс всё дороже, HBM всё дефицитнее.

И решение может прийти не только от более дорогой памяти, но и от переупаковки старой, знакомой технологии.

Ссылки:

[1]https://spectrum.ieee.org/high-bandwidth-flash?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-07-15&itm_content=hero6

Статья из официального аккаунта WeChat «Квантовый бит», автор: Гэ Вэнтин

Связанные с этим вопросы

QЧто такое High Bandwidth Flash (HBF) и как он может помочь в работе больших языковых моделей?

AHigh Bandwidth Flash (HBF) — это новая технология на основе NAND Flash, которая использует передовую 3D-упаковку и вертикальное наслоение чипов, подобно HBM. Её цель — значительно увеличить пропускную способность при чтении данных. В контексте больших моделей HBF предлагает создать уровень памяти с большой ёмкостью и высокой скоростью чтения специально для статических, редко изменяемых данных, таких как веса обученной модели или предвычисленный KV-кэш. Это позволяет освободить дорогостоящую и ограниченную по объёму память HBM для самых критичных операций, снизить общую стоимость и энергопотребление системы вывода (инференса), а также уменьшить количество необходимых акселераторов для работы с огромными моделями.

QПочему NAND Flash, известная своей медленной записью, рассматривается для использования в высокопроизводительных AI-задачах?

AХотя NAND Flash действительно имеет низкую скорость записи из-за физических процессов перемещения заряда, её скорость чтения может быть достаточно высокой, особенно при использовании современных стандартов интерфейса (например, ONFI 6.0). Ключевое наблюдение заключается в том, что фаза вывода (инференса) больших языковых моделей в основном требует интенсивного чтения заранее обученных и статических весов модели, а не их частой перезаписи. Таким образом, слабая сторона Flash (запись) не является критичным ограничением для этой конкретной задачи, в то время как её сильные стороны — большая плотность хранения, низкая стоимость и энергонезависимость — становятся весьма ценными.

QКакова целевая производительность и ёмкость первой версии HBF от SanDisk?

AСогласно данным SanDisk, целевые параметры для первого поколения High Bandwidth Flash (HBF) составляют: максимальная ёмкость до 512 ГБ на один стек (набор наслоённых чипов) и целевая пропускная способность при чтении до 1,6 ТБ/с. В дорожной карте также заявлено, что в последующих поколениях (втором и третьем) пропускная способность будет увеличена до 2 ТБ/с и 3,2 ТБ/с соответственно.

QВ чём заключается основное различие между требованиями к памяти на этапах обучения и вывода (инференса) больших моделей?

AНа этапе обучения система постоянно и многократно считывает веса модели, вычисляет ошибки и обновляет эти веса методом обратного распространения. Этот процесс требует как высокой пропускной способности при чтении, так и чрезвычайно высокой скорости записи, что плохо подходит для NAND Flash. На этапе вывода (инференса) модель уже обучена, её веса заморожены и практически не изменяются. Основная задача системы — быстро считывать эти огромные массивы данных для генерации ответов. Таким образом, инференс — это преимущественно задача с интенсивным чтением, что идеально соответствует сильным сторонам технологии HBF (высокая скорость чтения, большая ёмкость, низкая стоимость).

QКак технология HBF может изменить архитектуру памяти в AI-серверах будущего?

AHBF может привести к появлению нового, дополнительного уровня в иерархической архитектуре памяти AI-серверов. Вместо того чтобы пытаться разместить все данные модели в чрезвычайно быстрой, но дорогой и ограниченной по объёму памяти HBM, система сможет эффективно распределять данные: самые «горячие» и критичные для вычислений данные остаются в HBM; объёмные, статические, преимущественно читаемые данные (например, веса модели) перемещаются в HBF, который предлагает лучший баланс ёмкости, скорости чтения и стоимости; а ещё менее требовательные данные могут храниться на традиционных SSD. Такая многоуровневая система позволит более масштабируемо, экономично и энергоэффективно запускать всё более крупные модели для вывода.

Похожее

BONK взлетает на 11%, но медведи наращивают позиции: Эти данные говорят, что ралли – ловушка

Мемкоин Bonk (BONK) продемонстрировал значительный рост более чем на 11% за сутки на фоне восстановления общего настроения рынка и роста внимания в социальных сетях. Однако анализ данных указывает на противоречивую картину. Несмотря на рост, ставки финансирования (Funding Rate) по бессрочным контрактам на BONK стали отрицательными (-0.0009%), что сигнализирует о преобладании коротких позиций и усилении давления продавцов на фьючерсном рынке. Общее настроение также остается негативным. В то же время на спотовом рынке наблюдается противоположная динамика: инвесторы выводят монеты с бирж в частные кошельки для хранения. Чистый отток средств с бирж составил около $880 000, а общий объем накопленных активов оценивается в $4.24 миллиона, что говорит о сохраняющемся интересе покупателей. Таким образом, текущий рост BONK сопровождается наращиванием медвежьих позиций на деривативном рынке, что создает риск для продолжения ралли, в то время как активное накопление на споте может поддержать цену.

ambcrypto27 мин. назад

BONK взлетает на 11%, но медведи наращивают позиции: Эти данные говорят, что ралли – ловушка

ambcrypto27 мин. назад

WEEX TradFi: Один счет в USDT для акций, золота, нефти и мировых рынков

Криптобиржа WEEX анонсировала запуск нового сервиса WEEX TradFi, который позволяет торговать традиционными активами, используя стейблкоин USDT в качестве залога. Через единый счет пользователи получают доступ к золоту, серебру, нефти, токенизированным акциям (таким как TSLA, AAPL) и мировым индексам, объединяя крипто- и традиционные рынки. Сервис устраняет необходимость в отдельном брокерском счете, банковских переводах и работает 24/7, предоставляя гибкость вне стандартных торговых сессий. Он ориентирован на криптотрейдеров, желающих получить доступ к макроэкономическим трендам, не меняя привычный рабочий процесс с USDT. В рамках продвижения продукта WEEX проводит Торговый челлендж TradFi. Участники, как новые, так и существующие пользователи, могут получить бонусы в виде пробных средств USDT за совершение первых сделок, внесение депозита или достижение определенного торгового объема. WEEX, основанная в 2018 году, насчитывает более 6,2 млн пользователей по всему миру и предлагает широкий спектр торговых инструментов, включая фьючерсы с высоким кредитным плечом, а также внедряет AI-инструменты для трейдинга.

TheNewsCrypto32 мин. назад

WEEX TradFi: Один счет в USDT для акций, золота, нефти и мировых рынков

TheNewsCrypto32 мин. назад

Фиксированное предложение + институциональный ажиотаж: после падения на 50% Биткоин повторит «взрывной» сценарий золота 20-летней давности?

Согласно анализу Forbes, несмотря на падение цены биткойна более чем на 50% с пиков 2025 года, эксперты проводят параллели с историей золотых ETF. Аналитик Bloomberg Эрик Балчунас отмечает, что с момента запуска в 2004 году золотые ETF пережили взлеты и долгие периоды консолидации, в итоге значительно увеличив рыночную капитализацию золота. Аналогично, утверждает он, биткойн-ETF, с их фиксированным предложением и зависимостью от спроса, могут повторить этот путь "взрывного" роста, хотя и с высокой волатильностью. Биткойн-ETF, одобренные в 2024 году, быстро привлекли институциональные инвестиции, став одними из самых быстрорастущих фондов. Ключевой фактор будущего роста — устойчивый институциональный спрос, который, по мнению экспертов, смягчает давление продаж. Если биткойн как "цифровое золото" займет даже небольшую долю рыночной капитализации золота (около $28 трлн), это откроет огромный потенциал для роста. Однако, как и в случае с золотом, путь будет отмечен резкими взлетами и болезненными коррекциями, требуя от инвесторов терпения и сосредоточения на долгосрочной перспективе.

marsbit33 мин. назад

Фиксированное предложение + институциональный ажиотаж: после падения на 50% Биткоин повторит «взрывной» сценарий золота 20-летней давности?

marsbit33 мин. назад

Starknet представляет приватную версию биткоина strkBTC, нацелившись на институциональный ончейн финансовый рынок

**Starknet запускает приватную версию биткоина strkBTC, ориентируясь на институциональный ончейн-финансовый рынок** По мере того как ончейн-финансы приближаются к традиционным рынкам, становятся критически важными две проблемы: полная публичная видимость всех финансовых потоков и угроза существующим криптографическим подписям со стороны квантовых вычислений. Биткоин, занимающий более 56% рынка криптовалют, является наиболее ярким примером этих вызовов. Решение Starknet, strkBTC, пытается одновременно решить проблемы видимости и долговечности. strkBTC — это токен ERC-20 в сети Starknet, обеспеченный BTC, заблокированным в сети Bitcoin. Он построен на приватном фреймворке StarkWare STRK20, который позволяет скрывать балансы и совершать конфиденциальные переводы. Пользователи могут работать в публичном режиме (как с обычным ERC-20) или в скрытом режиме, где балансы и транзакции не видны публике. Комплайенс встроен в дизайн: при скрытии средств связанный ключ просмотра передается независимому аудитору (Financial Privacy Inc.), который может предоставить доступ регуляторам по запросу. Вторая часть проблемы — квантовая угроза. Квантовые компьютеры в будущем могут взломать текущие криптографические схемы (например, secp256k1), лежащие в основе Bitcoin и Ethereum. Starknet имеет архитектурное преимущество: его система доказательств STARK основана на хэш-функциях, а не на уязвимой к квантовым атакам эллиптической криптографии. Недавно StarkWare опубликовала дорожную карту по достижению полной квантовой устойчивости (к "Q-day") своего стека, включая миграцию на устойчивые алгоритмы и улучшение поддержки квантово-устойчивых кошельков через нативную абстракцию аккаунтов. Таким образом, strkBTC представляет собой попытку Starknet обеспечить биткоину приватность и готовность к квантовой эре, что является ключевыми требованиями для следующего этапа институционального принятия ончейн-финансов, где необходимы конфиденциальность, комплайенс и долгосрочная безопасность.

marsbit39 мин. назад

Starknet представляет приватную версию биткоина strkBTC, нацелившись на институциональный ончейн финансовый рынок

marsbit39 мин. назад

Strategy привлекла $730 млн за 2 недели и купила 0 биткойнов – рынок спрашивает, почему

Компания Strategy привлекла 730 миллионов долларов за две недели, но не купила ни одного биткойна, увеличив свои денежные резервы до 3,2 миллиарда долларов. Это отступление от привычной стратегии компании, которая годами привлекала капитал для немедленной покупки BTC. Рынок задается вопросом о причинах такого шага. Одна из версий — компания укрепляет баланс и ликвидность, поскольку ее индекс STRC торгуется ниже ключевого уровня в 100 долларов, что ограничивает возможности для привлечения нового капитала через программу ATM для покупки биткойнов. Некоторые инвесторы рассматривают это как стратегическую паузу в ожидании лучших условий, в то время как другие выражают озабоченность в связи с размыванием доли акционеров при отсутствии наращивания стека BTC. Данное решение усиливает неопределенность вокруг будущих действий Strategy в условиях доминирующих настроений избегания риска на рынке.

ambcrypto57 мин. назад

Strategy привлекла $730 млн за 2 недели и купила 0 биткойнов – рынок спрашивает, почему

ambcrypto57 мин. назад

Торговля

Спот
活动图片