
Обзор: Серверные процессоры AMD EPYC 9005 для ЦОД: ядра Zen 5, память DDR5, PCIe Gen 5, CXL и аппаратная безопасность
Содержание
- Спецификация процессоров AMD EPYC 9005
- Гибридная многочиповая архитектура процессоров AMD
- CCX и CCD
- Память, ввод-вывод и CXL 2.0
- NUMA и настройка топологии в AMD EPYC 9005
- Односокетные и двухсокетные серверы на базе AMD EPYC 9005
- AVX-512 и ускорение векторных вычислений
- RAS и AMD Infinity Guard: устойчивость платформы и защита виртуализированных сред
- Заключение
Современная ИТ-инфраструктура развивается под давлением двух крупных факторов. С одной стороны, растет число корпоративных приложений: от классических систем обработки транзакций до интерактивных облачных сервисов, которым требуется больше данных и больше вычислительных ресурсов. С другой стороны, искусственный интеллект становится прикладным инструментом для разных отраслей - от исследований и промышленности до торговли и сервисных компаний. Это требует новой серверной инфраструктуры, рассчитанной не только на традиционные нагрузки, но и на более сложные вычислительные сценарии.
Как решать эти задачи
Один из подходов - модернизация серверного парка на базе энергоэффективных процессоров. Такая замена может помочь уплотнить инфраструктуру, сократить занимаемое место в ЦОД и снизить энергопотребление. В ряде сценариев более производительные процессоры также позволяют выполнять больше задач меньшим числом ядер, что важно для программного обеспечения с лицензированием по ядрам.
Освобождение места, питания и охлаждения в действующей инфраструктуре открывает возможность для размещения серверов под машинное обучение и искусственный интеллект. AMD позиционирует процессоры EPYC 5-го поколения как платформу для такого перехода - от консолидации и модернизации ЦОД до внедрения новых вычислительных сервисов.
Серверы на базе AMD EPYC 9005 рассчитаны на широкий круг задач: виртуализацию, нагруженные базы данных, облачные среды, корпоративные приложения, аналитику, машинное обучение и инфраструктуру для искусственного интеллекта. Высокая плотность ядер помогает размещать больше виртуальных машин и контейнеров на одном сервере, а энергоэффективность снижает нагрузку на инженерную инфраструктуру ЦОД.
Оптимизированная производительность
AMD позиционирует семейство EPYC как одну из ключевых серверных платформ для ресурсоемких корпоративных приложений класса 1C ERP. Процессоры EPYC установили более 400 мировых рекордов в отраслевых тестах, многие из которых оценивают производительность в прикладных сценариях.
В каждом новом поколении AMD отмечает двузначный прирост производительности на такт. В EPYC 9005 за это отвечает архитектура Zen 5, которая дает прирост в задачах машинного обучения, высокопроизводительных вычислений и корпоративных нагрузок.
Отдельное направление - ядра Zen 5c, оптимизированные под плотность и энергоэффективность. На их базе выпускаются процессоры с самым большим числом ядер в линейке EPYC 9005. В недавнем кейсе мы рассказывали про 192-ядерный процессор EPYC 9965. Этот процессор при схеме «одно виртуальное ядро на одно физическое» может поддерживать на треть больше виртуальных машин, чем 144-ядерный Intel Xeon 6E Sierra Forest. Для двухсокетных серверов AMD также указывает до 40% более высокую производительность на ватт у 64-ядерных EPYC 9555 по сравнению с 64-ядерными Intel Xeon 8592+.
Основа для задач искусственного интеллекта
AMD EPYC 9005 может использоваться как основа для части задач искусственного интеллекта без обязательного применения графических ускорителей. К таким сценариям относятся отдельные языковые модели, классическое распознавание изображений, анализ мошеннических операций, графы решений и рекомендательные системы.
Для ускорения таких нагрузок в ядре Zen 5 расширены основные тракты передачи данных и увеличено число целочисленных арифметико-логических блоков. Это помогает обрабатывать больше данных за цикл по сравнению с предыдущим поколением.
При этом часть задач искусственного интеллекта требует ресурсов, которые невозможно эффективно закрыть только центральным процессором. Крупные языковые модели, обучение в реальном времени и тяжелые генеративные сценарии часто требуют одного или нескольких графических ускорителей. Для таких систем AMD предлагает процессоры EPYC 5-го поколения с большим числом ядер и высокими частотами - они могут использоваться как центральные процессоры в серверах с GPU, где важны производительность, включая повышенную производительность на ядро (высокая тактовая частота), энергоэффективность, пропускная способность памяти и масштабируемость ввода-вывода.
Корпоративная платформа
AMD EPYC ориентированы на стандартную x86-экосистему, что упрощает совместимость с существующим программным обеспечением. Такие процессоры доступны в серверах ведущих производителей и проходят проверку с корпоративными программными пакетами, средствами виртуализации, инструментами машинного обучения, фреймворками и моделями искусственного интеллекта.
Серия EPYC 9005 развивает этот подход за счет гибридной многочиповой архитектуры, ядер Zen 5 и Zen 5c, высокой плотности вычислений и встроенных механизмов аппаратной безопасности. Такой набор характеристик делает платформу применимой как для односокетных серверов без компромиссов по вводу-выводу, так и для мощных двухсокетных конфигураций под самые требовательные задачи ЦОД.
Спецификация процессоров AMD EPYC 9005
Процессоры AMD EPYC 9005 выпускаются в разных конфигурациях, которые отличаются числом ядер, тепловым пакетом (TDP), частотами, объемом кэша и другими параметрами. Эта линейка дополняет существующий серверный портфель AMD и ориентирована на повышение производительности, энергоэффективности и практической ценности в разных средах и типах нагрузок. Ниже приведены ключевые характеристики процессоров AMD EPYC 9005.
|
Кодовое имя |
Turin |
|
Архитектура ядер |
Zen 5 и Zen 5c |
|
Техпроцесс вычислительных кристаллов |
4 нм - Zen 5; 3 нм - Zen 5c |
|
Техпроцесс кристалла ввода-вывода |
6 нм |
|
Диапазон числа ядер |
8-192 |
|
Максимальное число ядер и потоков SMT |
до 128 ядер / 256 потоков - Zen 5; до 192 ядер / 384 потока - Zen 5c |
|
Максимальный общий кэш L3 |
до 512 МБ |
|
Кэш L3 на CCX |
32 МБ |
|
Каналы памяти |
12 каналов DDR5 |
|
Максимальная скорость памяти |
до DDR5-6400 |
|
Максимальная теоретическая пропускная способность памяти на сокет |
614 ГБ/с |
|
Максимальная емкость DDR5 |
до 6 ТБ DDR5-6400 |
|
Расширение памяти через CXL |
до 64 линий CXL 2.0 |
|
PCIe |
до 128 линий PCIe Gen 5 в односокетных системах; до 160 линий в двухсокетных серверах |
|
Дополнительные линии PCIe |
до 8 линий PCIe Gen 3 |
|
cTDP |
120-500 Вт |
|
Прирост производительности относительно прошлого поколения |
по данным AMD: около 37% в ML/HPC и около 17% в корпоративных нагрузках, геометрическое среднее |
Схема именования AMD EPYC 9005 позволяет определить особенности конкретной модели процессора. На рисунке ниже показано, как по названию процессора различать отдельные модели и их назначение.
Инструкция CPUID
Программное обеспечение использует инструкцию CPUID Fn0000_0001_EAX для идентификации процессора. Она возвращает несколько ключевых значений.
-
Family - значение 1Ah указывает на архитектуру Zen 5.
-
Model - зависит от конкретного продукта. Например, модель EPYC 10h соответствует варианту процессора Zen 5 категории «A».
-
Stepping - может использоваться для определения minor-изменений в дизайне процессора.
Например, значения CPUID для Family, Model и Stepping в десятичном виде 25, 17, 1 соответствуют процессору Zen 5 варианта B1.
Гибридная многочиповая архитектура процессоров AMD
Одна из ключевых особенностей AMD EPYC - гибридная многочиповая архитектура. В отличие от монолитного процессора, где все функциональные блоки создаются в рамках одного кристалла и одного производственного подхода, в EPYC вычислительные кристаллы и кристалл ввода-вывода разделены.
Такой подход важен по двум причинам. Во-первых, плотность вычислительных ядер со временем становится сложнее увеличивать в монолитных конструкциях. Во-вторых, ядра процессора и внешние интерфейсы развиваются по разным технологическим траекториям: для вычислительных блоков важны максимальная плотность, производительность и энергоэффективность, а для интерфейсов памяти, ввода-вывода и межпроцессорной связи - надежная передача сигналов за пределы вычислительного кристалла.
Разделение этих функций позволяет использовать разные техпроцессы для разных задач. В AMD EPYC 9005 ядра Zen 5 выпускаются по 4-нм техпроцессу, ядра Zen 5c - по 3-нм техпроцессу, а кристалл ввода-вывода использует 6-нм техпроцесс. Это дает возможность гибко сочетать вычислительные и интерфейсные кристаллы, создавая процессоры под разные профили нагрузки - от 8-ядерных моделей до высокоплотных решений с числом ядер до 192.
Zen 5 и Zen 5c
В AMD EPYC 9005 используются два типа ядер - Zen 5 и Zen 5c.
Zen 5 ориентировано на высокую производительность на ядро. До восьми таких ядер объединяются в комплекс CCX с общим кэшем L3 объемом 32 МБ. Один такой комплекс размещается на вычислительном кристалле CCD. В составе процессора EPYC 9005 может использоваться до 16 таких CCD, что дает до 128 ядер в разъеме SP5.
64-ядерные процессоры EPYC 5-го поколения на базе Zen 5 при том же тепловом пакете 360 Вт обеспечивают на 20% более высокую целочисленную производительность и на 34% более высокую производительность в операциях с плавающей точкой по сравнению с предыдущим поколением.
Zen 5c ориентировано на плотность и энергоэффективность. Логика ядра близка к Zen 5, но физическая компоновка занимает меньше места и рассчитана на более высокую производительность на ватт. Один комплекс CCX на базе Zen 5c может включать до 16 ядер с общим кэшем L3 объемом 32 МБ. До 12 таких CCD могут объединяться с кристаллом ввода-вывода, формируя процессоры с числом ядер до 192 в том же разъеме SP5.
CCX и CCD
Core Complex, или CCX, - это группа ядер, которые используют общий кэш последнего уровня L3. В AMD EPYC 9005 один CCX включает:
-
до 8 ядер Zen 5 с общим кэшем L3 32 МБ;
-
до 16 ядер Zen 5c с общим кэшем L3 32 МБ.
При включении SMT один CCX может обрабатывать вдвое больше аппаратных потоков: до 16 потоков для Zen 5 и до 32 потоков для Zen 5c.
Core Complex Die, или CCD, - это вычислительный кристалл, который в AMD EPYC 9005 содержит один CCX. При необходимости часть ядер может быть отключена через BIOS. Возможны два подхода:
-
уменьшить число активных ядер на каждом CCD, сохранив количество CCD - это повышает отношение кэша L3 к одному активному ядру и уменьшают конкуренцию за кеш;
-
уменьшить число активных CCD, сохранив количество ядер на каждом из них - это сохраняет преимущества совместного использования кэша внутри активных комплексов.
Такая гибкость важна для моделей с разным профилем: высокочастотных процессоров, решений с большим объемом кэша на ядро, процессоров для виртуализации и систем с высокой плотностью вычислений.
Модульность и типы нагрузок
Модульная архитектура позволяет выпускать разные варианты EPYC 9005 под конкретные задачи.
-
Сбалансированные корпоративные нагрузки - для разработки приложений, бизнес-систем, аналитики, систем управления данными, в том числе MS SQL, совместной работы и инфраструктурных сервисов используются процессоры на базе Zen 5. До 16 вычислительных кристаллов позволяют получить до 128 ядер.
-
ПО с лицензированием по ядрам - для систем, где стоимость лицензии зависит от числа ядер, важна высокая производительность каждого ядра. Для таких задач предусмотрены высокочастотные модели с суффиксом F. Например, EPYC 9575F использует 64 ядра и рассчитан на повышенные частоты. EPYC 9175F использует 16 вычислительных кристаллов с одним активным ядром на каждом, что дает 32 МБ L3 на каждое активное ядро.
-
Задачи искусственного интеллекта - 64-ядерный EPYC 9575F, по данным AMD, имеет на 33% больше ядер, чем наиболее производительная по частоте модель предыдущего поколения. Высокая параллельность помогает быстрее готовить и передавать данные к GPU в системах с графическими ускорителями, а высокая частота полезна для задач искусственного интеллекта, которые выполняются без GPU.
-
Нагрузки с высокой потребностью в памяти - к ним относятся моделирование логических схем, вычислительная гидродинамика, прогнозирование погоды, молекулярная динамика и часть корпоративных Java-систем. Для таких сценариев отдельные модели используют несколько внутренних соединений Infinity Fabric между кристаллом ввода-вывода и вычислительными кристаллами, что увеличивает теоретическую пропускную способность между ядрами и вводом-выводом. CXL 2.0 используется для расширения памяти, многоуровневого размещения данных и формирования крупных пулов памяти.
-
Высокопараллельные вычисления - для контейнерных приложений, виртуализированных сред, большого числа виртуальных машин или контейнеров на сервер, задач биоинформатики, химии, рендеринга и доставки контента могут использоваться процессоры на базе Zen 5c. До 12 кристаллов Zen 5c по 16 ядер позволяют получить до 192 ядер в одном процессоре EPYC 9965.
-
Нагрузки с небольшими требованиями к числу ядер - в линейке также есть 8- и 16-ядерные процессоры. Они позволяют использовать одну архитектуру EPYC в разных сегментах инфраструктуры - от компактных систем до высокоплотных серверов.
Упрощение производства
Многочиповая архитектура также влияет на производство. Небольшие кристаллы проще тестировать и отбраковывать отдельно. Если дефект возникает на пластине с множеством небольших кристаллов, он затрагивает только конкретный кристалл, который не попадет в готовый процессор. В монолитной конструкции дефект может вывести из строя крупный кристалл целиком, что снижает выход годных изделий и повышает стоимость производства.
Память, ввод-вывод и CXL 2.0
Процессоры AMD EPYC 9005 построены как «система на кристалле». Это означает, что в процессоре уже предусмотрены основные функции, необходимые для проектирования полноценного сервера без отдельного внешнего набора микросхем. Такой подход снижает сложность серверной платформы и может уменьшать энергопотребление, поскольку часть функций реализована внутри процессора.
Ключевую роль в этой архитектуре выполняет кристалл ввода-вывода. Он связывает вычислительные кристаллы, контроллеры памяти, интерфейсы PCIe Gen 5, CXL 2.0, SATA, межпроцессорную связь Infinity Fabric и служебные механизмы безопасности.
Контроллеры памяти DDR5
В AMD EPYC 9005 используется до 12 унифицированных контроллеров памяти UMC с поддержкой DDR5. Каждый контроллер может работать с двумя модулями DIMM на канал, что дает до 24 модулей DIMM на один процессорный сокет.
Конкретная серверная платформа может поддерживать разные схемы заполнения памяти:
-
1DPC - один модуль DIMM на канал, обычно с меньшими задержками;
-
2DPC - два модуля DIMM на канал, обычно для максимальной емкости памяти.
Процессоры AMD EPYC 5-го поколения могут поддерживать до 9 ТБ DDR5-памяти в зависимости от конфигурации платформы. Дополнительные и более быстрые каналы памяти по сравнению с предыдущими поколениями помогают обеспечить пропускную способность, необходимую для процессоров с большим числом ядер.
В EPYC 9005 также заявлена поддержка DDR5-6400. Чередование памяти между 2, 4, 6, 8, 10 и 12 каналами в AMD Zen5 помогает оптимизировать как компактные, так и крупные конфигурации памяти. Контроллеры памяти включают встроенные механизмы шифрования, которые используются в функциях AMD Infinity Guard.
Передача данных и работа с кэшем
AMD EPYC 9005 поддерживает функцию Smart Data Cache Injection. Она позволяет передавать данные от конечного PCIe-устройства напрямую в кэш L2, без первичной записи в основную память и последующего чтения процессором.
Такая схема может быть полезна для сетевых нагрузок, обработки данных в реальном времени и финансовых приложений с ультра низкими и непредсказуемыми задержками. При этом сохраняется когерентность памяти и кэша: блок данных в дальнейшем должен быть записан в основную память в согласованном состоянии.
PCIe Gen 5, Infinity Fabric, SATA и CXL 2.0
Кристалл ввода-вывода AMD EPYC 9005 использует гибкую схему линий. Один процессор может иметь набор из 4 P-links и 4 G-links. Производитель серверной платы может использовать G-link либо для подключения второго процессора EPYC 5-го поколения, либо для дополнительных линий PCIe Gen 5.
В односокетных серверах один AMD EPYC 9005 поддерживает до 128 линий PCIe Gen 5. В двухсокетных конфигурациях доступно до 160 линий PCIe Gen 5, если часть межпроцессорных соединений высвобождается под общий ввод-вывод.
Возможности платформы включают:
-
до 4 G-links Infinity Fabric для двухсокетных систем;
-
до 128 линий PCIe Gen 5 для периферийных устройств в односокетных серверах;
-
до 160 линий PCIe Gen 5 в двухсокетных серверах;
-
до 64 линий CXL 2.0 для расширения памяти;
-
до 32 линий ввода-вывода, которые могут быть настроены как контроллеры SATA.
Внутренние соединения Infinity Fabric
Внутренние интерфейсы AMD Infinity Fabric соединяют кристалл ввода-вывода с вычислительными кристаллами. В EPYC 9005 используется 16 линий Infinity Fabric со скоростью 36 Гбит/с. В технических схемах эти соединения часто обозначаются как GMI - Global Memory Interface.
AMD EPYC 9005 поддерживает до 4 соединений xGMI со скоростью до 32 Гбит/с. В отдельных модификациях OPN используется расширенная схема, при которой каждый CCD подключается к двум интерфейсам GMI. Это удваивает пропускную способность между вычислительным кристаллом и кристаллом ввода-вывода.
В моделях, оптимизированных под пропускную способность памяти, каждый вычислительный кристалл может подключаться к кристаллу ввода-вывода двумя линиями GMI. В этом случае пропускная способность соединения между вычислительным кристаллом и вводом-выводом достигает 72 Гбит/с.
В двухсокетных серверах Infinity Fabric используется для связи между процессорами. Для этого применяются те же физические интерфейсы, что и для PCIe Gen 5, но с другим протоколом поверх физического уровня. Производитель серверов может выбрать 3 или 4 межпроцессорных соединения:
-
при трех соединениях высвобождаются дополнительные 16 линий PCIe Gen 5 на каждом процессоре, а суммарная емкость ввода-вывода может достигать 160 линий;
-
при четырех соединениях максимальная теоретическая пропускная способность между процессорами может достигать 512 ГБ/с.
Гибкая настройка линий PCIe Gen 5
Линии PCIe Gen 5 в AMD EPYC 9005 могут использоваться для разных функций. До 32 линий могут быть настроены как встроенные контроллеры SATA, а до 64 линий - как CXL 2.0.
Функция AMD Trusted I/O использует стандартные механизмы шифрования PCIe-соединений, чтобы расширить границы доверенной среды и подтвердить устройство и его конфигурацию. Это особенно важно для виртуализированных и облачных сред, где требуется контролировать не только вычислительный узел, но и подключенные устройства.
Дополнительно EPYC 9005 поддерживает до 8 линий PCIe Gen 3 в односокетной конфигурации и до 12 линий PCIe Gen 3 в двухсокетной. В серверных системах такие линии часто применяются для менее чувствительных к производительности задач, например для M.2-накопителей под загрузку операционной системы.
Возможности CXL 2.0
AMD EPYC 9005 поддерживает сценарии CXL 2.0 для устройств Type 1 и Type 3, включая энергонезависимую память, многоуровневое размещение памяти под управлением ПО и пулы памяти.
Процессор может выполнять чередование памяти между CXL-устройствами, а также между CXL-памятью и основной DDR5-памятью. Поддержка устройств CXL Type 1, Type 2 и Type 3 зависит от готовности экосистемы производителей серверов и операционных систем.
Для таких сценариев предусмотрена телеметрия качества обслуживания памяти. Она позволяет сравнивать относительную производительность DRAM и CXL-памяти, чтобы операционные системы и гипервизоры могли принимать более обоснованные решения о размещении данных.
SERDES и разделение линий
Один физический уровень в AMD EPYC 9005 может обслуживать несколько типов соединений: PCIe Gen 5, AMD Infinity Fabric, SATA и CXL. Это снижает потребность в специализированных проприетарных интерфейсах и дает производителям серверов больше гибкости при проектировании платформ, как, например, в сервере Dell PowerEdge R7725xd.
Логика SERDES размещена на кристалле ввода-вывода. В EPYC 9005 предусмотрено восемь 16-линейных SERDES-блоков, которые в сумме дают до 128 линий ввода-вывода с учетом ограничений конкретной серверной платформы.
Линии внутри каждого SERDES-блока могут делиться на разные конфигурации. Полный 16-линейный порт может быть выделен под Infinity Fabric, PCIe или CXL. Для PCIe возможны варианты x8, x4, x2 и x1, для CXL - x16, x8 и x4. SATA-контроллеры используют x1; если SATA и PCIe разделяют один SERDES-блок, в такой группе может быть выделено до восьми SATA-контроллеров.
Служебные функции кристалла ввода-вывода
Кристалл ввода-вывода EPYC 9005 также включает ряд встроенных служебных функций.
Интегрированный AMD Secure Processor отвечает за корень доверия Root-of-Trust, прозрачное шифрование памяти TSME и защищенную зашифрованную виртуализацию SEV.
Server Controller Hub помогает сократить потребность во внешнем наборе микросхем для базовых функций управления сервером. В зависимости от реализации он может включать USB-подключение, встроенный сетевой интерфейс 1 Гбит/с, а также шины UART, I2C и I3C.
System Management Unit управляет распределением питания между кристаллом ввода-вывода, вычислительными кристаллами и ядрами. Этот блок удерживает процессор в пределах теплового пакета или заданных параметров управления питанием, включая настраиваемый cTDP.
NUMA и настройка топологии в AMD EPYC 9005
Процессоры AMD EPYC 9005 используют архитектуру NUMA - неоднородный доступ к памяти. В такой архитектуре задержки могут отличаться в зависимости от того, насколько близко конкретное процессорное ядро находится к контроллерам памяти и устройствам ввода-вывода.
Если ядра, память и устройства работают внутри одного NUMA-узла, задержки обычно ниже и стабильнее. При обращении к ресурсам из других NUMA-узлов задержки возрастают. Поэтому для приложений, чувствительных к задержкам памяти, важно учитывать локальность: какие ядра работают с какими областями памяти и через какой участок кристалла ввода-вывода подключены PCIe-устройства.
В многочиповой архитектуре EPYC это особенно важно, так как вычислительные кристаллы CCD, контроллеры памяти и ввод-вывод соединяются через центральный кристалл I/O Die и шину Infinity Fabric.
Как изменилась NUMA-топология в поколениях EPYC
В первых AMD EPYC 7001 контроллеры памяти находились на тех же кристаллах, что и группы до восьми вычислительных ядер. Это создавало жесткую привязку между ядрами и локальной памятью, но при обращении к памяти, связанной с другими ядрами, данные должны были проходить между кристаллами через внутренние соединения Infinity Fabric.
Начиная с AMD EPYC 7002, контроллеры памяти были вынесены на отдельный кристалл ввода-вывода. Это заметно снизило разницу в задержках между разными участками памяти. В EPYC 7003 топология стала еще более «плоской» за счет перехода к общему кэшу L3 объемом 32 МБ.
В EPYC 9004 и EPYC 9005 доработки Infinity Fabric дополнительно сократили различия в задержках. Поэтому, для большинства приложений нет необходимости вручную усложнять работу с NUMA-доменами: режим NPS=1 обычно дает высокий уровень производительности.
Тонкая настройка NUMA остается актуальной для задач, где критичны задержки памяти и расположение устройств ввода-вывода: баз данных, высокопроизводительных вычислений, низколатентных сетевых приложений, финансовых систем и отдельных аналитических нагрузок.
Настройка NPS
Топология NUMA настраивается через параметр BIOS NUMA Nodes Per Socket, или NPS. Он определяет, на сколько NUMA-доменов делится один процессорный разъем и как распределяется чередование памяти между каналами.
Чем более детально разделен процессор на NUMA-узлы, тем точнее можно привязывать вычисления к ближайшей памяти и устройствам ввода-вывода. При этом уменьшается число каналов памяти, объединенных в один NUMA-домен.
В односокетной системе возможны следующие варианты.
-
NPS=4 - процессор делится на четыре NUMA-узла, по одному на каждый логический квадрант. В каждом квадранте может находиться до 4 CCD на базе Zen 5 или до 3 CCD на базе Zen 5c, а также 3 контроллера памяти UMC и соответствующий узел ввода-вывода. Память чередуется по каналам внутри своего квадранта. PCIe-устройства относятся к тому NUMA-домену, в чьем квадранте расположен соответствующий PCIe root complex.
-
NPS=2 - процессор делится на два NUMA-домена. В один домен попадает половина ядер и половина каналов памяти, во второй - оставшаяся часть. Память чередуется по шести каналам внутри каждого NUMA-домена. PCIe-устройства относятся к одному из двух узлов в зависимости от того, к какой половине кристалла ввода-вывода подключен их root complex.
-
NPS=1 - один процессорный разъем работает как один NUMA-узел. Все ядра, вся подключенная память и все PCIe-устройства внутри SoC находятся в одном домене. Память чередуется по всем каналам процессора в едином адресном пространстве.
-
NPS=0 - вся система рассматривается как один NUMA-домен, включая оба процессора в двухсокетной конфигурации. Все ядра, память и PCIe-устройства обоих процессоров объединяются в единое адресное пространство. Этот режим относится к системам с двумя процессорами.
LLC as NUMA
Для отдельных сред производительность можно дополнительно настроить через параметр BIOS LLC as NUMA. В этом режиме каждый общий кэш L3, то есть каждый CCX, рассматривается как отдельный NUMA-узел.
Такой подход позволяет привязывать задачи к группе ядер, которые используют один и тот же кэш последнего уровня. В результате один процессор EPYC 9005 может поддерживать разные NUMA-конфигурации - от одного до шестнадцати NUMA-узлов на сокет.
При этом приложениям, которым требуется понимать топологию NUMA или порядок нумерации ядер, следует использовать документированные API операционной системы, стандартные интерфейсы и команды. Нельзя опираться на старые предположения о порядке APICID или расположении CCX.
Односокетные и двухсокетные серверы на базе AMD EPYC 9005
Процессоры AMD EPYC 9005 могут использоваться в односокетных и двухсокетных серверных конфигурациях. При этом модели с суффиксом P в названии оптимизированы только для односокетных серверов. В таких процессорах все линии SERDES выделяются под подключения PCIe ввода-вывода.
Модели без суффикса P могут применяться как в односокетных, так и в двухсокетных серверах. Это важно учитывать при подборе платформы: процессор для односокетного сервера не всегда подходит для последующего масштабирования до двух процессоров.
Односокетные серверы
В односокетной конфигурации процессор AMD EPYC 9005 может использовать все доступные линии для подключения периферийных устройств. Такая схема особенно полезна для серверов с большим числом NVMe-накопителей, сетевых адаптеров, ускорителей и других PCIe-устройств.
В односокетных системах EPYC 9005 поддерживает до 128 линий PCIe Gen 5. Конфигурация может включать два модуля DIMM на канал памяти, если это предусмотрено производителем серверной платформы.
В качестве примеров односокетных серверов на AMD EPYC 9005 можно привести Lenovo ThinkSystem SR635 V3, Dell PowerEdge R7715 и HPE ProLiant Compute DL325 Gen12. Такие платформы позволяют использовать преимущества одного процессора EPYC 9005 - большое число ядер, широкую подсистему памяти и до 128 линий PCIe Gen 5 - без перехода к двухпроцессорной архитектуре.
Двухсокетные серверы
Двухсокетные конфигурации требуют двух полностью идентичных процессоров EPYC 9005.
В таких серверах два процессора соединяются через внешние линии xGMI, также относящиеся к AMD Infinity Fabric. Эти соединения обеспечивают высокую пропускную способность и низкие задержки между процессорами.
Для межпроцессорной связи производитель платформы может использовать три или четыре соединения Infinity Fabric. Каждое такое соединение задействует до 16 линий PCIe Gen 5, так как xGMI и PCIe используют одну и ту же физическую инфраструктуру линий.
Типовая двухсокетная система может использовать 4 G-links на каждый процессор. В этом случае 64 линии PCIe Gen 5 с каждого процессора перенастраиваются под Infinity Fabric, а для общего ввода-вывода остается по 64 линии на процессор - всего 128 линий PCIe Gen 5 на сервер.
Если для межпроцессорной связи используются 3 G-links, то под Infinity Fabric задействуется 48 линий на каждый процессор. Освободившиеся линии могут быть направлены на PCIe Gen 5, и суммарная емкость ввода-вывода возрастает до 160 линий - по 80 линий на каждый процессор.
В плане прикладного выбора для двухсокетных конфигураций серверов подходят Lenovo ThinkSystem SR665 V3, Dell PowerEdge R7725 и HPE ProLiant DL385 Gen11. Эти серверы рассчитаны на более высокую плотность вычислений, больший суммарный объем памяти, расширенные возможности ввода-вывода и сценарии, где важны масштабирование, NVMe, GPU-ускорители или большое число виртуальных машин.
Память и NUMA в двухсокетных системах
Двухсокетная система на AMD EPYC 9005 имеет 24 канала памяти - по 12 каналов на каждый процессор. В зависимости от конкретного процессора и настроек платформы могут поддерживаться разные NUMA-конфигурации.
Это означает, что двухсокетная система дает больше каналов памяти и больше суммарных вычислительных ресурсов, но требует внимательного баланса между межпроцессорной связью и количеством доступных линий PCIe Gen 5. В задачах с большим числом NVMe-накопителей, сетевых адаптеров или ускорителей иногда важнее оставить больше линий под ввод-вывод, а в задачах с интенсивным обменом между процессорами - использовать больше соединений Infinity Fabric.
AVX-512 и ускорение векторных вычислений
Многие современные приложения извлекают ценность из больших массивов данных и многократно выполняют однотипные арифметические операции. К таким нагрузкам относятся вычислительная гидродинамика, криптография и сжатие данных, конечно-элементный анализ, финансовые расчеты, обработка изображений,аудио и видео, науки о жизни, машинное обучение, выполнение обученных моделей, молекулярная динамика, геологоразведка и медицинская виртуализация.
Обычные приложения часто работают по модели SISD - одна инструкция обрабатывает один элемент данных. Для перечисленных выше задач эффективнее модель SIMD, при которой одна инструкция применяется сразу к нескольким элементам данных. Это важно для высокопроизводительных вычислений, финансовых расчетов, обработки видео и задач искусственного интеллекта.
AVX-512 - набор инструкций, основанный на SIMD-подходе. Одна инструкция AVX-512 может работать с 512-битным вектором, содержащим значения размером 8, 16, 32 или 64 бита. Процессоры AMD EPYC 5-го поколения поддерживают AVX-512 с полноценным 512-битным трактом и регистрами для SIMD-операций.
В AMD EPYC 9005 на базе Zen 5 расширены тракты передачи данных до 512 бит. Также увеличены очереди, планировщики и исполнительные блоки для операций с плавающей точкой. Дополнительные целочисленные арифметико-логические блоки помогают быстрее загружать данные в процессор и проводить их через вычислительный конвейер.
В задачах, где приоритетом является энергоэффективность, а не максимальная производительность, настройки BIOS могут использовать последовательное выполнение двух 256-битных векторов для инструкций AVX-512.
Реализация AVX-512 в EPYC 5-го поколения поддерживает актуальные инструкции AVX-512 и префиксы EVEX, поэтому код, написанный для ранних реализаций AVX-512, может выполняться без изменений. При этом в исходном материале отдельно отмечено исключение для типов данных FP16.
Процессоры AMD EPYC 5-го поколения также поддерживают инструкцию VP2INTERSECT (Vector Pair Intersection - она ускоряет поиск совпадений в базах данных, обработку разреженных матриц и алгоритмы фильтрации данных).
По данным AMD в тесте HPL, двухсокетный сервер с 192-ядерными процессорами EPYC 9965 5-го поколения показывает примерно 2,75-кратное преимущество над двухсокетной системой с 96-ядерными процессорами EPYC 9654 4-го поколения.
RAS и AMD Infinity Guard: устойчивость платформы и защита виртуализированных сред
Процессоры AMD EPYC проектируются с учетом требований корпоративных серверов к надежности, доступности, обслуживаемости и защите данных. В архитектуре EPYC 9005 эти задачи решаются на нескольких уровнях - от самопроверки вычислительных блоков и коррекции ошибок памяти до аппаратного шифрования, защищенной загрузки и изоляции виртуальных машин.
Функции надежности, доступности и обслуживаемости обычно объединяются термином RAS. Они направлены на то, чтобы процессор и серверная платформа могли продолжать работу при отдельных сбоях, корректно сообщать об ошибках операционной системе и упрощать диагностику компонентов.
Надежность и коррекция ошибок
Надежность процессора определяется тем, насколько стабильно он выполняет вычисления без ошибок. В AMD EPYC используются тысячи схем самопроверки, которые помогают выявлять ошибки и продолжать выполнение задач без остановки всей платформы.
По мере миниатюризации и стремительного роста объёмов оперативной памяти, возникновение в ней случайных ошибок, обусловленных тепловым шумом, космическими лучами и т.п., стало естественным и неизбежным. Для стандартной памяти типа LPDDR5 это от 1 до 10 одиночных ошибок на терабайт в сутки, в зависимости от условий. Технологии обнаружения и исправления ошибок оперативной памяти стали критическим фактором обеспечения стабильности всей вычислительной системы.
Для снижения таких рисков в AMD EPYC используются несколько механизмов.
-
AMD Advanced Memory Device Correction, AMDC - расширенный механизм коррекции ошибок памяти. Он выходит за рамки стандартной ECC DRAM и позволяет корректировать крупные группы битов с минимальным влиянием на производительность. По назначению этот подход близок к Chipkill: он снижает риск того, что отказ отдельного DRAM-компонента на модуле DIMM приведет к сбою приложения или остановке сервера.
-
DRAM Read UECC Retry и DRAM Address and Command Parity with Replay - механизмы повторной обработки запросов при временных ошибках на шине памяти. Они помогают сохранять стабильность сервиса при кратковременных сбоях передачи данных.
Доступность и обслуживание платформы
Доступность в серверной инфраструктуре обычно связывается со временем бесперебойной работы и способностью системы принимать новые задачи. На уровне платформы AMD EPYC участвует в сценариях горячей замены PCIe- и NVMe-устройств без остановки процессора, а также в управлении частотами CPU при изменении теплового режима DRAM.
Для повышения доступности используются дополнительные механизмы.
-
Data Poisoning - передача информации о некорректируемой ошибке вместе с данными через специальный признак. Это позволяет процессору сообщить операционной системе, какой процесс столкнулся с ошибкой. Такой подход снижает риск использования поврежденных данных приложениями и ограничивает влияние ошибки теми процессами, которые зависят от проблемного блока данных.
-
Seamless Firmware Servicing, SFS - механизм обслуживания прошивок для крупных операторов инфраструктуры. Он рассчитан на установку отдельных обновлений без перезагрузки, чтобы поддерживать актуальность и безопасность платформы без традиционного цикла перезаписи прошивки и последующего перезапуска сервера.
Надежное обслуживание в контексте процессора означает возможность диагностировать и заменять компоненты с минимальным влиянием на работу системы. В контексте EPYC это особенно важно для памяти: расширенная коррекция ошибок позволяет отдельным модулям DIMM с ошибками оставаться в работе там, где обычная схема могла бы привести к остановке сервера.
Аппаратная безопасность AMD Infinity Guard
Данные остаются одним из ключевых активов любой организации, поэтому в AMD EPYC используются аппаратные функции безопасности AMD Infinity Guard. Они направлены на снижение рисков, связанных с физическим доступом к модулям памяти, атаками на виртуальные машины, компрометацией гипервизора и работой в распределенных или облачных средах.
Поддержка конкретных функций зависит от поколения EPYC, серии процессора, производителя сервера, версии BIOS, гипервизора и облачного провайдера. Для рабочей конфигурации необходимо отдельно проверять наличие и включение нужных возможностей у производителя платформы или поставщика сервиса.
Защита на уровне ядра и платформы
Подход AMD к безопасности начинается на уровне процессорного ядра, затем распространяется на систему на кристалле и серверную платформу. Каждое поколение ядер Zen развивает механизмы безопасности предыдущего поколения и учитывает известные на момент проектирования классы уязвимостей без необходимости менять прикладное ПО.
В ранних поколениях Zen применялась маркировка данных по потокам при загрузке в кэш процессора. Это снижало вероятность того, что один поток сможет получить доступ к данным другого потока во время их обработки в процессоре. В Zen 4 появилась возможность запускать гостевые операционные системы в виртуализированных средах с привязкой к отдельному ядру, что дополнительно снижает риски атак по побочным каналам на кэшированную память.
AMD Secure Processor и проверяемая загрузка
Управление функциями безопасности выполняет AMD Secure Processor - 32-битный микроконтроллер, который координирует работу процессорных ядер, контроллеров памяти и загрузочной прошивки. Он использует защищенную операционную среду, криптографические функции, генерацию и управление ключами.
Одна из ключевых задач AMD Secure Processor - аппаратно проверяемая загрузка. Процесс начинается с загрузочного ПЗУ внутри процессора, затем проверяется внешний загрузчик, после этого - BIOS. Только после успешной проверки BIOS ядра Zen могут начать выполнение кода. Затем загрузчик операционной системы запускает ОС или гипервизор.
В виртуализированных средах используется аттестация. После загрузки виртуальная машина может запросить у гипервизора подтверждение того, что программная среда запущена на нужном сервере или в нужном облачном сервисе, а шифрование включено. В ответ могут передаваться контрольная сумма загрузочного образа и ключ, связанный с сервером, площадкой или облачным провайдером. Такой механизм важен для конфиденциальных вычислений и сценариев, где требуется соблюдать требования к размещению данных.
Прозрачное шифрование памяти TSME
Transparent Secure Memory Encryption, TSME - базовая функция AMD EPYC для шифрования основной памяти без изменений в операционной системе и прикладном ПО.
TSME направлена на снижение рисков атак на содержимое оперативной памяти, включая отдельные сценарии физического доступа к DIMM. В контроллеры памяти встроены механизмы шифрования AES-XTS с 256-битными движками. Они могут использовать ключи 128 или 256 бит и снижают влияние шифрования на производительность при чтении и записи данных.
Вариант с 256-битным шифрованием, появившийся в поколении Zen 4, интегрирован в кристалл ввода-вывода и рассчитан на соответствие требованиям FIPS 140-3. Ключ шифрования при этом не выводится за пределы AMD Secure Processor.
Безопасность виртуализированных сред
Виртуализация остается базовой технологией для корпоративных ЦОД, облачных платформ и гибридной инфраструктуры. Для таких сред критична изоляция виртуальных машин друг от друга, от гипервизора и от потенциально скомпрометированных компонентов платформы.
AMD EPYC развивает этот набор функций по поколениям.
-
Secure Encrypted Virtualization, SEV - криптографическая изоляция гипервизора и гостевых виртуальных машин. Даже если вредоносный код обходит обычные механизмы изоляции гипервизора, чтение памяти другой виртуальной машины должно возвращать только зашифрованные данные. В EPYC 9005 для шифрования виртуальных машин может использоваться до 1006 ключей. Прошивка для SEV является открытой для проверки сообществом.
-
Secure Encrypted State, SEV-ES - функция, доступная начиная с AMD EPYC 3-го поколения. Она шифрует состояние виртуальной машины при обработке прерываний и сохранении данных в гипервизоре. Это снижает риск доступа скомпрометированного гипервизора к регистрам виртуальной машины.
-
Secure Nested Paging, SEV-SNP - развитие SEV и SEV-ES, добавляющее защиту вложенных таблиц страниц виртуальной машины. Функция направлена на снижение рисков атак с повторной подстановкой данных, переназначением памяти и другими манипуляциями. Цель - создание изолированной конфиденциальной среды выполнения для виртуальных машин.
SEV-SNP также поддерживает аттестацию с использованием сторонних ключей. В рамках аттестации могут учитываться прошивка, микрокод, контрольные суммы памяти, параметры запуска, конфигурация гостевой системы и среда выполнения x86. Это помогает оценивать, можно ли доверять виртуальной среде, в которой запущена система.
-
Secure Multi-Key Encryption, SMKE - функция, появившаяся в EPYC 9004. Она расширяет шифрование на память класса storage-class memory и помогает сохранять шифрование данных на CXL-подключенной памяти после перезагрузки системы.
-
Trusted I/O - функция, представленная в EPYC 9005. Она формирует основу для защиты виртуализированных путей ввода-вывода и поддерживает стандарт PCI-SIG TDISP. Механизм предусматривает взаимную аутентификацию виртуальной машины и устройства с последующим установлением зашифрованного соединения.
Trusted I/O особенно важна для сценариев, где виртуальная машина работает с устройствами ускорения, сетевыми адаптерами или контроллерами хранения. Например, при обучении моделей в облачной среде требуется не только шифровать память виртуальной машины, но и контролировать, что данные передаются доверенному устройству.
В совокупности RAS, AMD Secure Processor, TSME, SEV, SEV-SNP, SMKE и Trusted I/O формируют аппаратный уровень устойчивости и безопасности AMD EPYC 9005. Для корпоративных серверов это важно не только в крупных ЦОД, но и в локальных, распределенных и облачных средах, где требуется сочетание отказоустойчивости, управляемости и изоляции данных.
Заключение
Процессоры AMD EPYC 9005 сочетают производительность без сложной предварительной настройки и высокую плотность ядер для растущих требований ЦОД. Платформа ориентирована на критически важные корпоративные нагрузки, виртуализацию, облачные среды и задачи искусственного интеллекта.
В основе EPYC 9005 лежит архитектура Zen 5. Каждое новое поколение EPYC дает двузначный прирост IPC - числа инструкций, выполняемых за такт. Разделение разработки вычислительных кристаллов и кристалла ввода-вывода позволяет использовать более подходящие техпроцессы для разных частей процессора, повышая производительность и энергоэффективность.
EPYC 9005 рассчитаны на баланс между традиционными корпоративными задачами и нагрузками, связанными с искусственным интеллектом. Для виртуализированных, облачных и высокопараллельных сред доступны конфигурации с числом ядер до 192, что помогает повышать плотность размещения виртуальных машин, контейнеров и вычислительных сервисов на одном сервере.
Специально для серверов под задачи запуска LLM-моделей и обучения ИИ в архитектуре Zen 5 расширены тракты передачи данных. После загрузки данных в 512-битный тракт процессора увеличенное число арифметических и логических блоков помогает быстрее проводить операции через вычислительный конвейер.
Отдельный акцент сделан на безопасности виртуализированных и облачных сред. Функция AMD Trusted I/O из набора AMD Infinity Guard формирует основу для защиты виртуализированных путей ввода-вывода между процессором и поддерживаемыми устройствами - сетевыми адаптерами, контроллерами хранения и графическими ускорителями. Это расширяет контур доверенной обработки данных для виртуальных машин и помогает развивать конфиденциальные вычисления в локальной и облачной инфраструктуре.
Внедрение AMD EPYC 9005 в серверы ЦОД может использоваться как часть модернизации инфраструктуры. За счет консолидации традиционных нагрузок на более плотных и производительных системах можно сократить потребность в части серверов, высвободить питание и место в стойках для новых вычислительных задач и проектов искусственного интеллекта.
AMD, ITELON
Вам может быть интересно


Базы данных и аналитика на AMD EPYC - практический гид по модернизации и подбору серверной платформы

Какой процессор лучше для сервера 1С
Выбор правильной конфигурации сервера для 1С — задача, требующая внимания к деталям. От правильного решения зависят производительность, стабильность и масштабируемость вашей IT-структуры. В этой статье рассмотрим, какие процессоры стоит выбрать для сервера 1С, учитывая современные требования, рекомендации специалистов и реальные кейсы.
Подпишитесь на новости
Обратитесь к экспертам компании Itelon



Оцените статью и добавьте комментарий — будьте первым
Спасибо!
Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!