Top.Mail.Ru
1
Ваша корзина пуста. Перейти в каталог
Товар добавлен в корзину

Сбалансированные конфигурации памяти в серверах на процессорах AMD EPYC 5 поколения

Опубликовано: 13 ноября 2025
#
1290
#
15 мин.
#
0
#
0

Сбалансированная конфигурация памяти — ключ к максимальной пропускной способности и стабильной производительности серверов на процессорах AMD EPYC 5 поколения (серия 9005, Turin). У этих процессоров по двенадцать каналов памяти на сокет и до двух модулей DIMM на канал. Поэтому важно понимать, какие схемы считаются сбалансированными, а какие приводят к потерям скорости и росту задержек.

Топология памяти

Доступ к данным в модулях DIMM оперативной памяти управляется встроенными в процессор контроллерами памяти. У процессоров AMD EPYC 5 поколения (серия 9005, Turin) двенадцать контроллеров UMC, каждый из которых соответствует одному каналу DDR. Архитектурно канал поддерживает до двух модулей DIMM, однако часто в серверах на базе AMD EPYC 5 поколения реализована схема только «один модуль на канал» (1DPC). Это означает: на сокет доступно 12 каналов и 12 слотов DIMM, по одному модулю на каждый канал.

Практические следствия для конфигурации:

  • Баланс достигается при равномерном заполнении всех 12 каналов на сокет.

  • Масштабирование емкости выполняется за счет выбора модулей большей емкости, а не установки второго DIMM в канал.

  • Схема 1DPC обычно позволяет удерживать заявленные частоты JEDEC и низкую задержку доступа, что положительно влияет на производительность памяти и предсказуемость нагрузки.

Схематично: 12 UMC → 12 каналов DDR → 12 слотов DIMM (1DPC) на сокет.

На серверах с процессорами AMD EPYC 5 поколения физические слоты памяти располагаются по обе стороны от сокета и привязаны к каналам A–L.

  • Со стороны каналов G–L ближайшим к сокету является слот канала G, затем идут H, I, J, K, и самым удаленным является L.

  • Со стороны каналов A–F ближайшим к сокету является слот канала A, далее B, C, D, E, а самым удаленным — F.

Такое расположение важно учитывать при трассировке кабелей, планировании обслуживания и равномерном заполнении каналов (1DPC): сначала удобнее ориентироваться на ближайшие к сокету слоты для визуального контроля и инвентаризации, а затем двигаться к периферии.

Для наглядности будут использоваться два представления процессора (логическое и физическое), чтобы показать, как заполняются слоты DIMM и как работает интерливинг памяти при разных схемах.

Разные топологии памяти обозначаются последовательностью L:K:J:I:H:G:A:B:C:D:E:F, где каждая буква — число установленных DIMM в соответствующем канале памяти. Порядок в записи соответствует фактической очередности слотов на плате.

Соответствие букв каналам и UMC:

  • A — канал 3 (UMC3)

  • B — канал 4 (UMC4)

  • C — канал 0 (UMC0)

  • D — канал 5 (UMC5)

  • E — канал 1 (UMC1)

  • F — канал 2 (UMC2)

  • G — канал 9 (UMC9)

  • H — канал 10 (UMC10)

  • I — канал 6 (UMC6)

  • J — канал 11 (UMC11)

  • K — канал 7 (UMC7)

  • L — канал 8 (UMC8)

Пример.
Запись 1:0:1:0:1:0:1:0:1:0:1:0 означает установку по одному модулю DIMM в каналы L, J, H, A, C, E, а каналы K, I, G, B, D, F остаются пустыми. Такая форма записи позволяет сразу видеть баланс/перекос по сторонам сокета и последовательность физического размещения.

Чередование (interleaving) памяти

Семейство AMD EPYC 5 поколения (EPYC 9005) повышает эффективность доступа к памяти за счет формирования наборов интерливинга между контроллерами и каналами памяти. Суть проста: если два канала укомплектованы одинаковыми модулями (тип DIMM, суммарная емкость и число рангов совпадают), процессор объединяет их в 2-канальный набор интерливинга. Аналогично формируются наборы из 4, 6, 8, 10 или 12 каналов.

Интерливинг распределяет последовательные обращения к памяти по всем каналам набора, а не нагружает один канал. Это позволяет обращаться к нескольким каналам параллельно и увеличивает пропускную способность.

Чтобы набор интерливинга сформировался, каналы в наборе должны иметь:

  • одинаковый тип DIMM (напр., RDIMM),

  • одинаковую суммарную емкость,

  • одинаковое число рангов.

Если конфигурация не позволяет собрать один общий набор, формируются несколько наборов интерливинга. В этом случае производительность становится неравномерной и зависит от конкретного диапазона адресов: области, где набор меньше (меньше каналов в интерливинге), дают ниже пропускную способность, чем области с большим набором.

Пример (2-канальный интерливинг).
При установке идентичных модулей в каналы A и G формируется набор из двух каналов. Последовательные адреса по очереди обслуживаются разными контроллерами памяти и каналами (переброс адресов между UMC и каналами), что повышает суммарную полосу.

Базовые правила для сбалансированной конфигурации памяти

Сбалансированная конфигурация обеспечивает корректное чередование и тем самым максимальную пропускную способность подсистемы памяти. Ниже — базовые правила балансировки (далее в тексте: правила 1–4).

Правило 1. Количество активных каналов на сокет — кратно двум: 1, 2, 4, 6, 8, 10 или 12.
Такой набор гарантирует формирование корректного интерливинга (2/4/6/8/10/12 каналов) без «обрезков» по адресному пространству.

Правило 2. Идентичность каналов в пределах сокета.
На серверах Lenovo с AMD EPYC 5 поколения поддерживается только 1DPC; значит, во всех задействованных каналах должны стоять одинаковые DIMM (тип, емкость, ранги, частота).

Правило 3. Единообразие между сокетами.
Во всех процессорных сокетах одного сервера размещается одинаковая конфигурация DIMM. Это исключает перекос производительности между NUMA-узлами.

Правило 4. Единообразие между NUMA-доменами внутри сокета.
При режимах NPS2 и NPS4 (несколько NUMA-доменов на сокет) каждая внутренняя NUMA-область должна иметь идентичную конфигурацию памяти. Это сохраняет предсказуемость полосы и задержек для любых привязок.

Методика измерения производительности

STREAM Triad — синтетический тест для оценки устойчивой пропускной способности подсистемы памяти. Цель — зафиксировать максимально достижимую полосу памяти на системе. В дальнейшем именно STREAM Triad используется для сравнения конфигураций памяти из этого материала. Если не оговорено иначе, испытания выполнены на 64 ГБ 2R RDIMM с частотой 6400 МГц.

Как отмечалось выше в разделе про интерливинг, при наличии нескольких наборов интерливинга возможна неравномерная пропускная способность. Чтобы отразить реальное поведение, каждый прогон теста настраивается так, чтобы STREAM обращался ко всему адресному пространству памяти. Публикуется среднее значение пропускной способности для конфигураций с несколькими наборами чередования. На практике производительность может колебаться в зависимости от того, какой набор интерливинга задействован. Поэтому дополнительно приводится наихудший сценарий — когда доступ идет к области, объединенной в интерливинг с минимальным числом каналов.

Поддерживаемые конфигурации памяти

На серверах с процессорами AMD EPYC 5 поколения поддерживаются следующие варианты конфигурации памяти:

UMC

UMC8

UMC7

UMC11

UMC6

UMC10

UMC9

UMC3

UMC4

UMC0

UMC5

UMC1

UMC2

Каналы

L

K

J

I

H

G

A

B

C

D

E

F

Количество DIMMs

DIMM 12

DIMM 11

DIMM 10

DIMM 9

DIMM 8

DIMM 7

DIMM 6

DIMM 5

DIMM 4

DIMM 3

DIMM 2

DIMM 1

1

X

2

X

X

4

X

X

X

X

6

X

X

X

X

X

X

8

X

X

X

X

X

X

X

X

10

X

X

X

X

X

X

X

X

X

X

12

X

X

X

X

X

X

X

X

X

X

X

X


В тестах использовался двухсокетный сервер, однако выводы применимы и к односокетным системам. 

Для исключения перекоса по NUMA принимается правило 3 балансировки: все сокеты в одном сервере имеют идентичную конфигурацию DIMM. Поэтому далее описывается конфигурация для одного процессора, второй процессор настроен аналогично.

В первой части исследования применялись модули 64 ГБ RDIMM, двухранговые (2R), тем самым соблюдено правило 2 (одинаковые модули во всех задействованных каналах). Заполнение на сокет варьировалось: 1, 2, 4, 6, 8, 10 и 12 модулей — это соответствует правилу 1 (кратно двум числу каналов) и правилу 3 (одинаковость между сокетами). Режим процессора — NPS1, поэтому правило 4 (идентичность между NUMA-доменами внутри сокета) не задействовано. Все конфигурации в этой части — сбалансированные.

Конфигурация с 1 модулем DIMM

Стартовая схема 0:0:0:0:0:0:1:0:0:0:0:0 (задействован только один канал) демонстрирует относительную пропускную способность ~9% от потенциального максимума процессора. 

Причина проста: из 12 доступных каналов работает лишь один, интерливинг не формируется, узким местом становится единственный канал.

Как увеличить полосу без роста общей емкости

  • Задействовать больше каналов меньшими по емкости модулями.

  • Примеры эквивалентной емкости при кратном росте полосы:
    • 2×32 ГБ на двух каналах ≈ в 2 раза выше полоса, чем 1×64 ГБ на одном канале.
    • 4×16 ГБ на четырех каналах ≈ в 4 раза выше полоса, чем 1×64 ГБ на одном канале.

  • Дальнейший прирост достигается заполнением 6/8/10/12 каналов идентичными модулями (1DPC), сохраняя симметрию между сокетами.

Ключевой вывод: при равной суммарной емкости предпочтительнее большее число каналов с одинаковыми DIMM, чем один крупный модуль — это радикально повышает устойчивую пропускную способность.

Конфигурация с 2 модулями DIMM

Рекомендуемая и поддерживаемая схема для двух модулей — 0:0:0:0:0:1:1:0:0:0:0:0. 

В таком варианте формируется один 2-канальный набор интерливинга, что дает около 18% от максимально достижимой пропускной способности памяти (фактически примерно 1/6 от потенциала процессора).

Почему так мало
Активны только два из двенадцати каналов, поэтому параллелизм доступа ограничен, а интерливинг минимален. Это узкое место для задач, чувствительных к полосе памяти.

Как улучшить производительность без увеличения общей емкости памяти

  • Использовать больше каналов памяти, заполняя их модулями меньшей емкости в соответствии с принципами, описанными выше.

  • Переход к 4/6/8/10/12 каналам при той же суммарной емкости даст значительное увеличение производительности памяти.

Конфигурация с 4 модулями DIMM

Рекомендуемая и поддерживаемая схема для четырех модулей — 0:0:0:1:0:1:1:0:1:0:0:0. 

В этом варианте формируется один 4-канальный набор интерливинга, что обеспечивает около 35% от максимальной пропускной способности памяти процессора.

Почему это работает
Активны 4 из 12 каналов, что дает уже заметный параллелизм доступа и ровный интерливинг без «разрывов» по адресному пространству. Это ощутимый прирост по сравнению с 2 каналами, но до плато производительности еще далеко.

Как улучшить производительность без увеличения общей емкости памяти

  • Рецепт прежний - использовать больше каналов памяти

Конфигурация с 6 модулями DIMM

Рекомендуемая и поддерживаемая схема для шести модулей — 0:0:0:1:1:1:1:1:1:0:0:0. 

Формируется один 6-канальный набор интерливинга, обеспечивающий около 52% от максимально достижимой пропускной способности памяти процессора.

Почему это удачный компромисс
Задействована половина из 12 каналов, что дает заметный параллелизм доступа и производительность. По сравнению с 4 каналами прибавка существенная.

Где уместно

  • Виртуализация со средним профилем потребления памяти.

  • OLTP/смешанные нагрузки, где важен баланс цена/производительность.

  • Универсальные конфигурации для стандартных приложений и микросервисов.

Как улучшить производительность без увеличения общей емкости памяти

  • Рецепт прежний - использовать больше каналов памяти

Конфигурация с 8 модулями DIMM

Рекомендуемая и поддерживаемая схема для восьми модулей — 0:1:0:1:1:1:1:1:1:0:1:0. 

Формируется единый 8-канальный набор интерливинга, обеспечивающий около 69% от максимально достижимой пропускной способности памяти процессора.

Почему это сильный вариант
Активны 8 из 12 каналов — хороший баланс между стоимостью и производительностью, особенно заметный на крупных модулях 128 и 256Gb. Интерливинг единый, без «рваных» областей адресного пространства, производительность предсказуема.

Где уместно

  • Виртуализация средней и высокой плотности, VDI.

  • СУБД и аналитика с умеренно высокой чувствительностью к полосе памяти.

  • Универсальные платформы, где важно оставить запас для дальнейшего расширения.

Как улучшить производительность без увеличения общей емкости памяти

  • Технически рецепт прежний - использовать больше каналов памяти, но здесь уже можно пристально смотреть на экономику решения и реальные требования к производительности в поисках баланса между объемом модуля, минимально допустимой производительностью и ценой модуля

Конфигурация с 10 модулями DIMM

Рекомендуемая и поддерживаемая схема для десяти модулей — 0:1:1:1:1:1:1:1:1:1:1:0. 

Формируется один 10-канальный набор интерливинга, что обеспечивает примерно 85% от максимально достижимой пропускной способности памяти процессора.

Почему это почти максимум
Активны 10 из 12 каналов, интерливинг единый, без разнородных наборов. Узкие места минимальны, профиль производительности стабильный во всем адресном пространстве. 

Где уместно

  • Виртуализация высокой плотности, насыщенные по памяти приложения.

  • СУБД и аналитика, где важна устойчивая полоса и предсказуемые задержки.

  • Универсальные платформы, где нужен почти максимальный уровень без полной 12-канальной комплектации.

Как улучшить производительность без увеличения общей емкости памяти

  • И тут с точки зрения инженера рецепт прежний - до предельных значений остается один шаг до 12 каналов. Технически рационально докупить еще 2-4 модуля памяти, но если вы рассматриваете модули памяти 128/256Gb и есть жесткий лимит по бюджету, этот вариант стоит серьезно оценить - стоит ли 15% производительности непропорционально высоких инвестиций и отказа от запаса расширения в 512-1024Gb без полной замены всех модулей в сервере.

Конфигурация с 12 модулями DIMM

Полное заполнение каналов — 1:1:1:1:1:1:1:1:1:1:1:1. 

Формируется единый 12-канальный набор интерливинга, и подсистема памяти достигает 100% пропускной способности, доступной для данного процессора.

Почему это максимум
Активны все 12 каналов, обращения равномерно распределяются по контроллерам и каналам без «разрывов» по адресному пространству. Это обеспечивает наивысшую устойчивую полосу пропускания и предсказуемые задержки. Очевидный минус данного варианта - полная замена всех модулей памяти при существенном росте нагрузки.

Когда выбирать

  • СУБД и аналитика с интенсивным доступом к памяти.

  • Плотная виртуализация и VDI.

  • Узлы для приложений, где производительность памяти лимитирует общий отклик системы.

Сводные результаты производительности

В таблице ниже сведены относительные полосы памяти для всех поддерживаемых и протестированных конфигураций при NPS1. Во всех случаях формируется один набор чередования, поэтому поведение стабильное по всему адресному пространству.

Количество установленных DIMM

Конфигурация

Число наборов интерливинга

Относительная производительность

Сбалансированность (NPS1)

1

0:0:0:0:0:0:1:0:0:0:0:0

Н/Д

9%

Сбалансирована

2

0:0:0:0:0:1:1:0:0:0:0:0

1

18%

Сбалансирована

4

0:0:0:1:0:1:1:0:1:0:0:0

1

35%

Сбалансирована

6

0:0:0:1:1:1:1:1:1:0:0:0

1

52%

Сбалансирована

8

0:1:0:1:1:1:1:1:1:0:1:0

1

69%

Сбалансирована

10

0:1:1:1:1:1:1:1:1:1:1:0

1

85%

Сбалансирована

12

1:1:1:1:1:1:1:1:1:1:1:1

1

100%

Сбалансирована


Сбалансированные конфигурации и режимы NPS

Все примеры выше рассматривались при NPS1 (один NUMA-узел на сокет). В этом режиме в каждом сокете существует единый раздел памяти, и все разобранные схемы являются сбалансированными.

Однако при NPS2 или NPS4 ситуация меняется: вступает в силу правило 4 — все NUMA-домены внутри одного сокета должны иметь одинаковую конфигурацию памяти.

Ниже — два показательных кейса.

Пример 1: Конфигурация с 12 DIMM

Итог: сбалансирована для NPS1/NPS2/NPS4.

Пояснение: при разбиении сокета на 2 или 4 NUMA-домена (пунктирные границы на схеме) во всех доменах получаются одинаковые наборы каналов и модулей. Формируется единый 12-канальный интерливинг, равномерный для любого NPS.

Пример 2: Конфигурация с 10 DIMM

Итог: сбалансирована для NPS1 и NPS2, не сбалансирована для NPS4.

Пояснение: при NPS2 распределение модулей по двум доменам остается симметричным. Но при NPS4 получается перекос: два домена имеют по 3 канала в наборе интерливинга, два — по 2 канала. В итоге ядра в «3-канальных» доменах получают большую локальную полосу памяти, чем ядра в «2-канальных», что нарушает требование правила 4 и ведет к неравномерной производительности.

Сводка сбалансированности конфигураций памяти при разных NPS

Таблица ниже суммирует, какие конфигурации остаются сбалансированными при NPS1, NPS2 и NPS4. Практическое правило простое:

  • Если в режиме NPS2/NPS4 каждый NUMA-домен внутри сокета получает одинаковое число каналов и идентичные DIMM, конфигурация сбалансирована.

  • Если распределение по доменам разнится (например, 3 канала против 2), конфигурация для данного NPS считается несбалансированной.

Конфигурация

NPS1

NPS2

NPS4

Конфигурация — 1 DIMM

Сбалансирована

Несбалансирована

Несбалансирована

Конфигурация — 2 DIMM

Сбалансирована

Сбалансирована

Несбалансирована

Конфигурация — 4 DIMM

Сбалансирована

Сбалансирована

Сбалансирована

Конфигурация — 6 DIMM

Сбалансирована

Сбалансирована

Несбалансирована

Конфигурация — 8 DIMM

Сбалансирована

Сбалансирована

Сбалансирована

Конфигурация — 10 DIMM

Сбалансирована

Сбалансирована

Несбалансирована

Конфигурация — 12 DIMM

Сбалансирована

Сбалансирована

Сбалансирована



Как получить максимальную производительность памяти

Чтобы получить максимальную произвидительность памяти на сервере, соблюдайте три правила баланса:

  1. Между сокетами. Во всех процессорных сокетах одного сервера должна быть одинаковая конфигурация DIMM.

  2. Между контроллерами памяти (UMC). В пределах сокета все контроллеры должны иметь одинаковую конфигурацию DIMM.

  3. Между задействованными каналами. Во всех активных каналах — одинаковая суммарная емкость и одинаковое число рангов модулей.

На серверах с AMD EPYC 5 поколения пиковая полоса достигается при 12 одинаковых DIMM на сокет.

Пошаговая методика подбора конфигурации под требуемую емкость

  1. Определить требуемую емкость памяти на сокет.

  2. Разделить эту емкость на 12 каналов — получить минимальную емкость на канал.

  3. Округлить расчетную емкость до ближайшей доступной емкости модуля DIMM.

  4. Установить в каждый сокет 12 одинаковых DIMM выбранной емкости.

Пример. Требуется 1 ТБ оперативной памяти для двухпроцессорного сервера.

  • Емкость на сокет: 1 ТБ / 2 = 512 ГБ.

  • Емкость на канал: 512 ГБ / 12 = 42,67 ГБ.

  • Округление до доступной емкости DIMM: 64 ГБ.

  • Итого конфигурация: 24×64 ГБ DIMM (по 12 модулей на каждый сокет).

Конфигурации со смешанными емкостями DIMM

Правило 2 сбалансированной конфигурации требует, чтобы во всех задействованных каналах стояли одинаковые модули (тип, емкость, ранги, частота). На практике иногда возникает требование точно попасть в заданную емкость, и стандартная «симметричная» схема оказывается избыточной. Тогда рассматривают смешанную емкость DIMM — разные емкости в каналах. Такая схема несбалансирована, формирует несколько наборов интерливинга и дает неоптимальную производительность.

Пример: 576 ГБ на сокет

Сбалансированный вариант.


12×64 ГБ = 768 ГБ на сокет. Это больше требования, но конфигурация сбалансирована, формируется единый 12-канальный интерливинг, полоса памяти = 100% (максимум).

Несбалансированный «точно в цель».

Смешанные емкости дают ровно 576 ГБ, но образуют два набора интерливинга (один на 12 каналов и один на 6 каналов). Производительность становится неравномерной и зависит от того, в какую область адресов попадает нагрузка.
— Средняя полоса: ≈73–75% от максимума (в тексте встречаются оба значения — стоит унифицировать до одного).
— В «худшем» случае, когда обращение идет к области с 6-канальным интерливингом, полоса падает до ≈51%.

Почему так происходит:

Полностью равномерно распределяемая по каналам часть памяти — это объем, который система может одинаково «размазать» по всем активным каналам. Она равна объему самого маленького канала, умноженному на число задействованных каналов. Если емкости каналов различаются, интерливинг возможен только на минимальной емкости. Оставшаяся емкость больших модулей — это избыточная емкость каналов (overhang): она не включается в равномерный интерливинг и доступна лишь на части каналов. При обращении к избыточной емкости задействуется меньше каналов, что снижает полосу.

Когда смешанная емкость допустима

Если рабочий набор данных мал (например, < 384 ГБ в примере), влияние может быть небольшим — обращение идет в «полностью интерливуемую» область. Но как только нагрузка затрагивает дополнительные 192 ГБ, начинаются узкие места по полосе и растут задержки. Для чувствительных к памяти задач (HPC, виртуализация высокой плотности, крупные СУБД) асимметрия часто становится бутылочным горлышком.

Как влияет NPS

  • NPS1. Несбалансированная схема образует 12-канальный и 6-канальный наборы интерливинга; средняя полоса ниже, локальные просадки возможны.

  • NPS2. В сокете два NUMA-домена по 6 каналов. Если правильно разложить модули, получится два 6-канальных набора. При локальном доступе (процесс и данные в одном домене) пиковая полоса у узлов одинакова; емкость DIMM (32 или 64 ГБ) сама по себе на полосу не влияет, решают число каналов и частота.

  • NPS4. Четыре NUMA-домена по 3 канала — четыре 3-канальных набора. Если приложение можно привязать к одному домену и уложить его рабочий набор в локальную емкость домена, деградации не будет. Но при выходе за локальную емкость — риск неоднородности.

Вариант чередования смешанных модулей

Если распределить избыточную емкость не на одной стороне CPU, а чередовать его по каналам, как на рисунке ниже, то при выходе за 384 ГБ по-прежнему доступны лишь 6 каналов, но нагрузка распределяется по топологии, уменьшая горячие точки. 

В результате падение полосы будет более плавным, а средняя производительность — выше.

Важно: при NPS2/NPS4 такой монтаж ухудшает локальную полосу из-за большего объема избыточной емкости в каждом домене и для NUMA-aware приложений нежелателен.

Двухсокетные платформы на AMD EPYC 5 поколения: Dell, HPE, Lenovo, xFusion, Supermicro

Ниже актуальные 2U-серверы на AMD EPYC 9005 от ведущих производителей. Каждая модель поддерживает DDR5 с 12 каналами на сокет, PCIe Gen5 и гибкие конфигурации NVMe, что делает их пригодными для виртуализации высокой плотности, СУБД/аналитики, VDI и ИИ-инференса. Перечень поможет быстро выбрать базовую платформу под требуемую емкость памяти и полосу, сохраняя балансировку каналов и симметрию между сокетами.

Серверы на AMD EPYC 5

Dell PowerEdge R7725

Современный 2U-сервер с поддержкой двух процессоров AMD EPYC 9005, до 24 слотов DDR5 и опций хранения от SATA/SAS до NVMe.

Сценарии использования: виртуализация, VDI, аналитика/OLAP, HPC.

Преимущества: PCIe Gen5, высокий предел по емкости ОЗУ и хранилищам, развитая экосистема OpenManage.

HPE ProLiant DL385 Gen11

Двухсокетный 2U-сервер на AMD EPYC 9005/9004, до 12 каналов DDR5 на сокет (1DPC), с поддержкой PCIe Gen5 и EDSFF E3.S.

Сценарии использования: зрелая виртуализация, базы данных, программно-определяемое хранилище.

Преимущества: до 6 ТБ DDR5, высокая плотность NVMe, гибкие OCP-NIC.

xFusion FusionServer 2258H V8

2U-платформа с двумя AMD EPYC 9005 (до 192 ядер на сокет), 12 линиями PCIe и вариантами OCP 3.0, с гибкой корзиной под 2.5"/3.5" SAS/SATA/NVMe.

Сценарии использования: виртуализация, SDS, аналитика, ИИ-инференс.

Преимущества: подтвержденная поддержка 2×EPYC 9005, богатые опции ввода-вывода и хранения.

Supermicro AS-2125HS-TNR (H13/H14 Hyper)

Двухсокетный 2U-сервер с поддержкой AMD EPYC 9004/9005 (для EPYC 9005 требуется ревизия платы 2.xx), до 24 слотов DDR5 (1DPC) и до 24 отсеков 2.5" NVMe/SAS/SATA.

Сценарии использования: универсальные корпоративные нагрузки, виртуализация, SDS, ИИ-инференс.

Преимущества: до 8 линий PCIe Gen5 x8 или 4×x16, модульный сетевой слот AIOM/OCP 3.0, большой фронт NVMe.


Практический пример: как выбор модулей влияет на полосу памяти

Например, вы планируете использовать сервер Lenovo ThinkSystem SR655 V3 с двумя процессорами AMD EPYC 5 поколения (серия 9005) под виртуализацию и аналитические нагрузки. Требование на старте — высокая емкость и возможность масштабирования, при этом рассматриваются две равные по объему конфигурации на каждый сокет:

  • Вариант A (6 каналов на сокет, 1DPC): 6×128 ГБ = 768 ГБ на сокет (всего по серверу 12×128 ГБ). Решили оставить свободные слоты памяти, ожидая рост в будущем.

  • Вариант B (12 каналов на сокет, 1DPC): 12×64 ГБ = 768 ГБ на сокет (всего по серверу 24×64 ГБ). Решили заполнить все каналы, чтобы получить полную производительность сразу.

Обе конфигурации дают одну и ту же емкость 768 ГБ/сокет, но по-разному заполняют каналы памяти.

Что происходит с полосой памяти

В архитектуре EPYC 9005 полоса пропорционально растет с количеством активных каналов при равной частоте и типе модулей (на Lenovo для EPYC 5 поддерживается 1DPC, частота до DDR5-6400).

  • Вариант A (6×128 ГБ/сокет, 6 активных каналов): формируется один 6-канальный интерливинг, относительная полоса ~52% от максимума.

  • Вариант B (12×64 ГБ/сокет, 12 активных каналов): формируется один 12-канальный интерливинг, относительная полоса = 100%.

Таким образом, при одинаковой емкости вариант с 12 каналами обеспечивает примерно двукратное преимущество по производительности оперативной памяти над вариантом с 6 каналами.

Практика: как это ощущается в нагрузке

  • Виртуализация и VDI. При 6 каналах растут задержки при конкурентном доступе к памяти, снижается пиковая плотность ВМ на хост и возрастает разброс времени отклика в пиках.

  • Базы данных и аналитика. Уменьшается пропускная способность сканирования и скорость сортировок, а часть операций смещается в кэш и дисковую подсистему, что увеличивает хвосты латентности.

  • HPC/рендеринг. Широкие, хорошо распараллеленные ядра лучше насыщаются при 12-канальном интерливинге, а 6 каналов чаще становится ограничителем.

Сводная таблица по двум вариантам

Параметр

Вариант A: 6×128 ГБ (на сокет)

Вариант B: 12×64 ГБ (на сокет)

Емкость на сокет

768 ГБ

768 ГБ

Заполнение каналов

6 из 12 (1DPC)

12 из 12 (1DPC)

Интерливинг

один набор на 6 каналов

один набор на 12 каналов

Относительная полоса памяти

~52%

100%

Предсказуемость производительности

средняя

высокая


Вопрос масштабирования

Если изначально выбрать 12×128 ГБ по серверу (6×128 ГБ/сокет) ради запаса по емкости, то в такой схеме сохранение производительности выглядит так:

  • Расширение до 12 каналов без замены модулей возможно только добавлением еще 6×128 ГБ на сокет. Итог: 12×128 ГБ/сокет = 1536 ГБ/сокет с выходом на 100% полосы.

  • Если такой объем избыточен по бюджету или лицензиям, придется идти на компромисс: запускать сейчас с полной полосой (12×64 ГБ/сокет), а затем заменять 64-гигабайтные DIMM на 128-гигабайтные модули, сохраняя заполнение всех 12 каналов.

Вывод

При той же емкости на сокет (768 ГБ) выбор в пользу 12×64 ГБ дает в два раза более высокую производительность памяти, чем 6×128 ГБ. Если производительность важна, то целесообразно сразу заполнять все 12 каналов. Если приоритет — минимум затрат сейчас и апргейд в будущем, то вариант с 6×128 ГБ на старте вполне приемлем, но нужно осознанно принять потерю ~48% производительности памяти до момента, когда все 12 каналов будут равномерно заполнены.

Производительность памяти на Dell PowerEdge R7715 (EPYC 9275F) при разных схемах заполнения DIMM

Сервер Dell PowerEdge R7715 выделяется среди других платформ, описанных выше, своей односокетной архитектурой и 24 слотами DIMM, что делает его оптимальным для большинства задач - этаким универсальным бизнес мультитулом за адекватную цену. 

В отличие от двухпроцессорных систем, где акцент на симметрии между узлами, этот сервер позволяет изучить влияние количества модулей памяти в изолированной среде одного процессора за счет 24 слотов под оперативную память, позволяя в рамках одного тестирования сравнить поведение полосы и при 1DPC, и при 2DPC. 

Такое тестирование особенно актуально для бизнеса, поскольку демонстрирует реальные сценарии масштабирования от минимальной конфигурации до полной загрузки, включая переход к режиму два модуля на канал (2DPC), помогая оценить компромиссы между емкостью, скоростью и задержками.

В процессе подготовки данной статьи мы обратились в наш сервисный центр и попросили провести короткую серию тестов на сервере R7715 с процессором AMD EPYC 9275F Zen5 и модулями оперативной памяти 64Gb c максимальной частотой в 6400MHz. За восемь шагов наши инженеры последовательно установили от 1 до 24 модулей и сняли данные с метрик.

RAM Test Pro — прикладной бенчмарк памяти, в котором Linear Read/Write/Copy моделируют последовательную обработку больших блоков данных с минимальным влиянием кэшей. Показатели выражаются в GB/s и хорошо отражают реальную полосу памяти при потоковой загрузке (ETL, сканы таблиц, последовательные копии, сериализация/десериализация).

На графиках виден почти линейный рост от 1 до 12 модулей (1DPC): при увеличении числа модулей задействуются новые каналы, и полоса растет «ступенями». 10 DIMM ≈ почти пик, 12 DIMM — пик. Разница между 10 и 12 модулями меньше, чем между ранними шагами, но 12 дают максимум, тогда как 24 DIMM (2DPC) — падение полосы относительно 12 DIMM из-за снижения частоты памяти и роста задержек на каждый канал.

AIDA64 включает отдельные микротесты Read/Write/Copy (полоса в GB/s) и Latency (задержка в наносекундах).

  • Read/Write/Copy отражают «сырую» пропускную способность памяти при потоковых операциях.

  • Latency (ns) показывает время доступа к данным при работе контроллера памяти и таймингов модулей.

Тесты чувствительны к числу задействованных каналов (интерливинг), частоте/таймингам модулей, ранговости и режимам 1DPC/2DPC.

От 1 до 12 модулей (1DPC) виден устойчивый рост полосы, а 24 DIMM (2DPC) также как и в предыдущем тесте дают заметное снижение относительно 12 DIMM из-за падения частоты и усложнения топологии при двух модулях на канал.

На 6 DIMM Write/Copy почти не растут относительно 4 DIMM — типичный эффект комбинации таймингов, фоновой активности и особенностей интерливинга на конкретной прошивке. Это не отменяет общей тенденции роста к 10–12 DIMM, где 10 DIMM ≈ почти пик, 12 DIMM — пик для Read/Write/Copy в 1DPC.

Чтобы нивелировать влияние всевозможных случайных факторов, измерения производительности проводились различными утилитами многократно. Данные по операциям чтения, записи и копирования консолидированы. В итоге у нас получился следующий сводный график:

Как видите, происходит практически пропорциональный рост производительности оперативной памяти по мере использования все большего количества каналов и максимум достигается при использовании всех 12 каналов. При увеличении количества модулей памяти до 24, наблюдается снижение производительности, обусловленное штатным снижением тактовой частоты каналов памяти при установке больше, чем одного модуля DIMM на канал.

Тем самым даже в короткой серии тестов на случайно выбранном сервере поведение оперативной памяти совпадает с эталонными примерами выше и может использоваться при принятии решений в части конфигурации оперативной памяти на серверах с процессорами AMD Zen5.

А где частота 6400Mhz?

Хотя в конфигурации Dell PowerEdge R7715 стояли AMD EPYC 9275F и 24× DDR5-6400 RDIMM (64 ГБ, Dual Rank), зафиксированные в тестах 5200 МТ/с при 12 модулях и 4000 МТ/с при 24 модулях — это корректное поведение платформы согласно документации Dell для R7715:

В реальных конфигурациях предельные 6400 МТ/с, формально заявленные AMD, пока достижимы лишь в некоторых серверных платформах и при минимальном заполнении, тогда как при полной загрузке 12 каналов практически любая серверная плата пока валидирована на 5200 МТ/с, а в 2DPC — на 4000 МТ/с. При этом критично не «паспортное» число мегатрансферов у одного модуля, а суммарная пропускная способность полосы: 12× 5200 дают ~449 ГБ/с (≈ 37–38 ГБ/с на канал с полным интерливингом) — это в 5,5 раза выше, чем ~82 ГБ/с у 2× 6400. Для прикладных задач (виртуализация, аналитика, СУБД) при реальной емкости, например, в 768 ГБ именно суммарная полоса определяет производительность, поэтому 5200 МТ/с при 12 модулях — оптимальный режим 12-канальной архитектуры, обеспечивающий максимум производительности, стабильность и предсказуемую отдачу инвестиций.

Заключение

Производительность подсистемы памяти на AMD EPYC 5-го поколения определяется балансом каналов памяти и частотой модулей. Заполнение всех двенадцати каналов на сокет (1DPC) идентичными RDIMM обеспечивает максимально возможную полосу пропускания - это подтверждено нашими замерами на практике. Увеличение емкости до 24 модулей в 2DPC неизбежно снижает частоту и, как следствие, пропускную способность. Такое решение вполне оправдано, если выигрыш от большего объема оперативной памяти перекрывает некоторое снижение производительности памяти.

Сбалансированность должна соблюдаться на всех уровнях: между сокетами, между контроллерами внутри сокета и между задействованными каналами. Несимметричные схемы и смешанные емкости формируют несколько наборов интерливинга, создают неравномерность по адресам и ухудшают «худший» сценарий. При работе в режимах NPS2/NPS4 требования к идентичности усиливаются: каждый NUMA-домен обязан иметь одинаковое число каналов и одинаковые модули, иначе возрастает разброс производительности между доменами.

Выбор конфигурации сводится к приоритетам нагрузки. Если критичны полоса и стабильный отклик, целевым вариантом остается 12×DIMM (1DPC) с одинаковыми модулями на всех каналах и сокетах. Если ключевым ограничением становится объем памяти в одном узле, допускается 24×DIMM (2DPC) с осознанным принятием снижения частоты и GB/s. Однако перед переходом в 2DPC рационально оценить альтернативы: более емкие модули при 1DPC или горизонтальное масштабирование вторым узлом с сохранением баланса. Такой подход минимизирует технические риски и позволяет прогнозируемо выдерживать требования бизнеса к доступности и скорости отклика приложений как для полосозависимых сценариев (виртуализация высокой плотности, VDI, СУБД/аналитика, HPC), так и для задач, где решает вместимость in-memory рабочего набора.


Автор:

Команда пресейла ITELON

Источник:

Lenovo Press, ITELON

Скопировать ссылку Ссылка Добавить в закладки В закладки

Оцените статью и добавьте комментарий — будьте первым

Ваша оценка*

Ваш комментарий
Имя*
Почта*

Ваш адрес не будет опубликован или добавлен в рассылку

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close

Спасибо!

Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!

Подпишитесь на новости

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close

Консультация эксперта

#
#

Импортозамещение

#
#
#

Вам может быть интересно

#

Сбалансированные конфигурации памяти для двухсокетных серверов на Intel Xeon Scalable 4-го и 5-го поколений

Баланс памяти на Intel Xeon Scalable 4/5 (Sapphire/Emerald Rapids): как 8 каналов в 1DPC дают максимум полосы, когда 2DPC закономерно замедляет, и почему симметрия по iMC/сокетам критична. Показываем типовые раскладки (4/6/8/12/16 DIMM), результаты MLC и практические рекомендации под емкость и бюджет.
Опубликовано: 14 ноября 2025
#
1274
#
0
#
0
#

Сбалансированные конфигурации памяти для серверных процессоров AMD EPYC 4-го поколения

Баланс памяти на AMD EPYC 9004 (Genoa): 12 каналов DDR5, 1DPC, интерливинг и NPS1/2/4. Показываем, как выбор 4/6/8/10/12 DIMM влияет на полосу (STREAM Triad) и почему 12×DIMM дают максимум, а смешанные емкости — просадки.
Опубликовано: 12 ноября 2025
#
805
#
0
#
0
#

Как подобрать сервер под 1С ERP и обзор лучших моделей

Перед выбором сервера 1С ERP, важно понимать, какие ресурсы действительно критичны для его стабильной работы. Ниже рассмотрим основные характеристики, влияющие на производительность серверов, масштабируемость и надежность в рамках корпоративных задач ERP-уровня.
Опубликовано: 18 июня 2025
#
5487
#
1
#
5

Подпишитесь на новости

Обратитесь к экспертам компании Itelon

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close