Top.Mail.Ru
1
Ваша корзина пуста. Перейти в каталог
Товар добавлен в корзину

HBM становится главным ограничением для масштабирования ИИ-инфраструктуры

19 августа 2026
#
19
#
7 мин.

В технологической отрасли одним из главных показателей ИИ-гонки долгое время оставалось количество GPU, которое смогли накопить гиперскейлеры, крупные компании и государственные структуры. Распространено мнение, что преимущество получит тот, у кого окажется больше вычислительных ускорителей.

Такой подход хорошо знаком по предыдущим технологическим циклам, когда увеличение числа серверов и процессоров действительно позволяло последовательно преодолевать ограничения производительности. Однако в случае современной ИИ-инфраструктуры концентрация только на GPU оставляет без внимания другой, все более серьезный фактор — доступность High Bandwidth Memory (HBM).

Даже самые мощные вычислительные кластеры не смогут постоянно работать с максимальной загрузкой, если ускорители не получают данные с необходимой скоростью. Поэтому дефицит и стоимость памяти постепенно превращаются в ограничение, не менее важное, чем доступность самих GPU.

Недавние исследования рынка указывают на сохраняющийся глобальный дефицит микросхем памяти, причем возможности расширения производства ограничены не только фабричными мощностями, но и доступностью материалов, упаковки и других компонентов цепочки поставок. Отдельные исследования рынка HBM также показывают, что мощности ведущих производителей уже распределены между заказчиками на длительный период.

В результате физическое производство, упаковка и распределение высокоскоростной памяти становятся одним из ключевых вопросов для дальнейшего масштабирования ИИ.

Три подхода к развитию ИИ-инфраструктуры

Текущую ситуацию на рынке можно условно сравнить с тремя фракциями из стратегии StarCraft. Аналогия упрощенная, но хорошо показывает различия между подходами крупнейших участников рынка.

NVIDIA в такой модели напоминает Protoss. Компания предлагает сложные, высокоинтегрированные и очень производительные решения, которые фактически стали отраслевым стандартом для многих ИИ-проектов. Однако такой уровень интеграции сопровождается высокой стоимостью и сильной зависимостью от производственных цепочек.

Для стартапа или пилотного проекта инфраструктура NVIDIA позволяет относительно быстро построить работающий прототип и подтвердить концепцию. Но при масштабировании до миллионов пользователей стоимость вычислений, ускорителей, памяти и сетевой инфраструктуры начинает играть значительно большую роль.

AMD можно сравнить с Terran — более гибким и прагматичным подходом. Одним из характерных примеров стала активная ставка компании на чиплетную архитектуру, при которой вместо разработки одного огромного монолитного кристалла несколько специализированных компонентов объединяются в единую систему.

Такая конструкция дает больше свободы при масштабировании, позволяет комбинировать разные технологические процессы и упрощает создание процессоров и ускорителей для различных сегментов рынка.

Huawei в этой аналогии ближе к Zerg: ставка делается на массовость, локальную экосистему и возможность масштабирования инфраструктуры независимо от западных цепочек поставок. Из-за геополитических ограничений компания вынуждена развивать собственный стек аппаратных и программных решений, делая акцент не столько на победе в каждом отдельном бенчмарке, сколько на доступности большого количества оборудования внутри собственной экосистемы.

ИИ упирается не только в вычисления

Все эти стратегии развиваются на фоне общего ограничения — HBM остается дорогой, дефицитной и технологически сложной в производстве памятью.

Особенно заметна эта проблема после перехода проекта из экспериментальной стадии в промышленную эксплуатацию. Обучение большой модели может быть чрезвычайно дорогостоящим, но оно выполняется ограниченное число раз. После развертывания основная часть постоянных расходов переносится на инференс — обработку пользовательских запросов.

В таких нагрузках производительность часто зависит не столько от максимального количества арифметических операций GPU, сколько от того, насколько быстро веса модели и промежуточные данные могут поступать из памяти к вычислительным блокам.

Если пропускной способности памяти недостаточно, дополнительные вычислительные блоки не дают пропорционального прироста производительности. GPU просто приходится ждать данные.

Дорогие ускорители не решают проблему сами по себе

В условиях ограниченной доступности памяти ставка исключительно на наиболее производительные ускорители может оказаться экономически неэффективной.

Компания может приобрести дорогостоящий кластер, но затем значительная часть его ресурсов будет расходоваться на относительно простые операции — классификацию запросов, маршрутизацию, распознавание текста или изображений.

По мере взросления рынка становится очевидно, что этап, когда практически любое увеличение вычислительных ресурсов оправдывалось экспериментами и proof-of-concept-проектами, подходит к концу. Для промышленной эксплуатации необходимо учитывать уже не только производительность GPU, но и стоимость памяти, энергопотребление, загрузку оборудования и эффективность всей архитектуры.

Именно поэтому ключевой вопрос постепенно меняется с «сколько ускорителей можно купить?» на «насколько эффективно можно использовать уже имеющиеся ресурсы?».

#

Эффективность памяти становится частью экономики ИИ

В этих условиях оптимизация использования памяти превращается не в дополнительную возможность, а в экономическую необходимость.

Использовать крупнейшую доступную модель для каждой небольшой специализированной задачи далеко не всегда рационально. Если огромная модель с сотнями миллиардов параметров применяется только для классификации текста или маршрутизации пользовательского запроса, значительная часть вычислительных и память-зависимых ресурсов расходуется впустую.

Альтернативой становится использование специализированных моделей и более гибкой архитектуры, где разные задачи выполняются компонентами подходящего масштаба.

Это может включать:

  • небольшие специализированные модели вместо одной универсальной;
  • более эффективное управление KV-кэшем;
  • квантизацию моделей и кешей;
  • оптимизированное планирование запросов;
  • повторное использование вычисленных данных;
  • разделение разных этапов инференса между различными типами ускорителей;
  • более эффективное использование системной памяти и локального хранения.

Целью становится не просто закупка дополнительного оборудования, а максимальная загрузка уже существующей инфраструктуры.

Чиплеты и открытые модели повышают гибкость

Еще одним важным направлением становится архитектурная модульность. Чиплетные процессоры, специализированные ускорители и модели с открытыми весами дают компаниям больше свободы при выборе компонентов.

Вместо инфраструктуры, жестко привязанной к одному типу ускорителя или одному поставщику, можно создавать более гетерогенные системы и менять отдельные элементы в зависимости от стоимости, производительности и региональной доступности оборудования.

Это особенно важно в условиях, когда ограничения могут возникать не только из-за цены, но и из-за доступности конкретных GPU, HBM, серверных платформ или производственных мощностей.

Оптимизация выходит на первый план

Согласно последнему NVIDIA State of AI Report, 86% опрошенных ожидают увеличения технологических бюджетов. При этом значительная часть руководителей все больше внимания уделяет оптимизации уже существующих процессов и инфраструктуры.

Это отражает более широкий сдвиг на рынке. Компании постепенно переходят от экспериментов с ИИ к вопросу о том, как сделать его постоянную эксплуатацию экономически устойчивой.

Именно поэтому дальнейшее развитие ИИ-инфраструктуры будет определяться не только количеством приобретенных GPU. Не менее важными становятся пропускная способность памяти, объем доступной HBM, эффективность кеширования, выбор моделей и способность архитектуры использовать оборудование максимально полно.

В условиях ограниченного предложения памяти преимущество могут получить не те компании, которые просто закупили больше ускорителей, а те, которые смогут получить больше полезной работы от каждого GPU и каждого гигабайта памяти.

Подпишитесь на новости

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close

Консультация эксперта

#
#

Импортозамещение

#
#
#

Подпишитесь на новости

Обратитесь к экспертам компании Itelon

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close