
E-ядра, P-ядра и AP-платформа Intel Xeon 6: как выбрать сервер под конкретную нагрузку
Содержание
Раньше сервер часто выбирали по максимально простому принципу: больше ядер, выше частота, больше запас по производительности. Для части задач такой подход остается рабочим, но в современной корпоративной инфраструктуре он уже не закрывает все сценарии. Нагрузки стали слишком разными: одни хорошо масштабируются по сотням параллельных потоков, другие зависят от скорости выполнения одной операции, третьи упираются в пропускную способность памяти, ввод-вывод, задержки или энергопотребление.
Для веб-сервисов, фоновых задач и контейнерных сред важны плотность, энергоэффективность и способность обрабатывать большое число легких запросов. Для баз данных, аналитики и транзакционных систем критичнее предсказуемое время отклика и высокая производительность на ядро. Для инженерных расчетов, ИИ-инференса и научного моделирования на первый план выходит уже не скорость одной задачи, а суммарный объем вычислений, который система способна выполнить за единицу времени.
Именно поэтому сравнение E-ядер, P-ядер и AP-платформы Intel Xeon 6 нужно рассматривать через призму главного вопроса: какой тип вычислительной архитектуры лучше соответствует конкретной нагрузке, ограничениям площадки и экономике проекта. В одном случае рациональнее выбрать более плотную и энергоэффективную конфигурацию, в другом - платформу с максимальной производительностью на ядро, в третьем - систему, рассчитанную на высокую совокупную пропускную способность и длительную многопоточную нагрузку.
Intel Xeon 6: P-cores, E-cores и AP-cores в одной логике выбора
В предыдущей статье уже была разобрана базовая логика Intel Xeon 6 для корпоративной инфраструктуры: чем отличаются P-cores и E-cores, в каких сценариях они применяются, как это раскрывается на серверах Dell PowerEdge и почему HPE ProLiant Gen12 с E-cores подходит для плотных сетевых workloads, включая 5G Core.
Intel Xeon 6 — это семейство серверных процессоров, рассчитанных на разные профили корпоративных нагрузок. В рамках этой линейки Intel разделяет вычислительные сценарии по типам cores: P-cores, E-cores и AP-cores - Granite Rapids-AP / Xeon 6900P как старшие модели P-ядер.
Смешанная серверная архитектура на базе Intel Xeon 6 позволяет точнее сопоставлять тип нагрузки с подходящими вычислительными ресурсами. Такой подход упрощает эксплуатацию разнородной инфраструктуры. На одной архитектурной базе Intel Xeon 6 можно строить серверный парк для ИИ-инференса, аналитики, виртуализации, общих корпоративных приложений, высокопроизводительных вычислений и периферийных сервисов. Главное преимущество здесь в более точном распределении задач по тем платформам, где они дают лучший баланс производительности, энергоэффективности и предсказуемости.
Performance-cores (P-cores) рассчитаны на нагрузки, где важны высокая производительность, низкие задержки и быстрая обработка отдельного потока. Такие процессоры дают больше вычислительной мощности на ядро, чем E-cores, поэтому лучше подходят для приложений, где результат зависит не только от числа параллельных процессов, но и от скорости выполнения конкретной операции. Обратная сторона такого подхода — более высокое энергопотребление и повышенные требования к охлаждению.
В корпоративной инфраструктуре P-cores обычно выбирают для задач, где критичны отклик, предсказуемое время выполнения и способность выдерживать резкие всплески нагрузки:
-
ИИ-инференс и аналитика в режиме, близком к реальному времени;
-
транзакционные базы данных с большим числом операций;
-
системы оперативной аналитики, розничной аналитики и принятия решений;
-
клиентские приложения, где задержка напрямую влияет на качество сервиса;
-
визуализация, дополненная и виртуальная реальность, обработка графики и другие вычислительно насыщенные интерактивные задачи.
Главный смысл P-cores — в стабильной производительности на задачу. Поэтому такие конфигурации рациональны там, где сервер должен быстро отвечать на запросы, обрабатывать сложные операции и сохранять предсказуемое поведение даже при неравномерной нагрузке.
Efficient-cores (E-cores) рассчитаны на параллельную обработку и высокую производительность на ватт. Процессоры с такими ядрами лучше подходят для нагрузок, где одновременно выполняется много операций, но каждая отдельная задача не требует максимальной производительности одного потока.
В сравнении с P-cores такие процессоры уступают по скорости выполнения отдельной операции, но сильнее раскрываются в масштабируемости и эффективности. Это важно для инфраструктур, где нужно увеличить количество обслуживаемых сервисов, виртуальных машин или контейнеров без пропорционального роста энергопотребления, тепловыделения и занимаемого пространства в стойке.
В практических корпоративных сценариях E-cores уместны для следующих задач:
-
фронтенд-сервисы, микросервисы и легкие API-точки;
-
фоновые и сервисные процессы: журналы событий, телеметрия, пакетные задания, обслуживание инфраструктуры;
-
виртуализированные среды с большим числом виртуальных машин;
-
кластеры Kubernetes с высокой плотностью контейнерных нагрузок;
-
периферийные площадки, где ограничены питание, охлаждение и физическое пространство.
Ключевое преимущество E-cores — в возможности плотнее размещать параллельные и фоновые нагрузки. Поэтому такие конфигурации особенно рациональны там, где бизнесу важны масштабируемость, предсказуемая стоимость эксплуатации и эффективное использование ресурсов ЦОД.
Особенно ярко это видно на энергопотреблении между P-cores и E-cores. В тесте SPECpower при полной загрузке системы - 100% - процессоры с P-cores стабильно потребляли больше энергии, чем конфигурации с E-cores. Наиболее заметным этот разрыв был в режиме максимальной производительности. При 60% загрузки разница сокращалась, но преимущество по эффективности сохранялось за E-cores.
В энерготестах SPECpower_ssj2008 and SPECpower_ssj2008 P-cores показывают почти двукратное преимущество по производительности на одно ядро: 143 361 SSJ Ops на ядро против 71 366 SSJ Ops у E-cores. Но этот прирост сопровождается более высоким энергопотреблением: 5,58 Вт на ядро у P-cores против 2,88 Вт у E-cores.
На уровне всей системы конфигурации с P-cores также потребляли больше энергии в пике: 960 Вт против 831 Вт у систем с E-cores. При этом в простое P-конфигурация потребляла меньше — 164 Вт против 197 Вт. Это объясняется тем, что в конфигурациях E-cores обычно значительно больше ядер: в пределе 288 против 172.
Несмотря на меньшее число ядер, P-cores дают на 20% более высокую общую пропускную способность. Это хорошо показывает разницу в назначении двух архитектур: P-cores ориентированы на максимальную производительность, а E-cores — на энергоэффективность и высокую плотность ядер.
Архитектура серверов на базе E-cores дает преимущества там, где важны энергоэффективность и рациональное использование пространства в стойке. Такие системы требуют меньше питания и охлаждения, поэтому лучше подходят для площадок, где критичны эксплуатационные расходы, тепловой режим и плотность размещения оборудования. Высокая плотность ядер позволяет строить компактные конфигурации, которые остаются масштабируемыми для параллельных задач — прежде всего в облачных, периферийных и распределенных средах.
Серверы на базе P-cores, напротив, проектируются под более высокую производительность и пропускную способность. Они лучше подходят для корпоративных приложений, высокопроизводительных вычислений, задач искусственного интеллекта и других сценариев, где важны отклик, вычислительная мощность и развитый ввод-вывод. При этом более высокое энергопотребление и тепловыделение требуют внимательнее подходить к охлаждению, питанию и компоновке стойки. В результате такая конфигурация может быть мощнее, но одновременно сложнее и дороже в инфраструктурной эксплуатации.
Advanced Performance–cores (AP-cores) - старший класс Intel Xeon 6 для задач, где важна максимальная суммарная производительность системы. Это продуктивные среды с большим числом потоков, высокой нагрузкой на память и длительным вычислительным циклом, где вместе с процессорами могут использоваться дополнительные аппаратные средства ускорения — GPU-серверы для задач искусственного интеллекта, вычислений и перемещения данных. Это делает такие платформы уместными в сценариях, где обычной универсальной производительности CPU уже недостаточно и требуется более высокая плотность вычислений на уровне всей системы.
Типовые сценарии для AP-cores:
-
корпоративные задачи искусственного интеллекта, включая сценарии ускорения, близкие по назначению к выделенным графическим ускорителям;
-
крупномасштабное моделирование, включая NAMD, конечно-элементный анализ и вычислительную гидродинамику;
-
промышленная аналитика в режиме, близком к реальному времени, и встроенные ИИ-системы;
-
вычислительные кластеры с высокой нагрузкой на память;
-
задачи, где универсальные процессорные вычисления сочетаются с нейропроцессорами, графическими ускорителями или другими специализированными ускорителями.
Назначение AP-cores — максимум суммарной производительности для тяжелых и длительных расчетных задач. Такие платформы рациональны там, где критичен общий объем выполненной работы: сколько моделей обработано, сколько симуляций завершено, сколько аналитических или инженерных задач выполнено за единицу времени.
Выбор между P-cores, E-cores и AP-cores — это выбор архитектуры сервера под конкретный профиль нагрузки: отклик, плотность, энергопотребление, пропускную способность памяти и суммарный поток вычислений.
Производительность без переплаты: как P-cores и E-cores влияют на экономику сервера
Для бизнеса важна не только максимальная производительность процессора, но и то, какой ценой она достигается. Один сервер может быстрее выполнять тяжелые вычислительные задачи, другой — эффективнее обслуживать большое число параллельных процессов при меньшем энергопотреблении и более простой эксплуатации.
Поэтому в тестах Dell сравнивает сразу несколько показателей: производительность в целочисленных вычислениях, скорость операций с плавающей точкой и соотношение производительности к потребляемой мощности. Для тестирования использовались SPEC CPU 2017 Integer Speed, SPEC CPU 2017 Floating Point Speed и оценка CPU Performance to Power Ratio. Первые два теста показывают, как P-Cores и E-Cores ведут себя в разных типах вычислительных задач на Dell PowerEdge R770. Третий блок переносит сравнение на уровень серверной платформы Dell PowerEdge R570 и R770 и показывает, как производительность в ssj_ops соотносится с потребляемой мощностью при разных уровнях нагрузки.
Такой подход позволяет оценить где рациональнее использовать P-cores, где оправданы E-cores, а где важнее итоговая эффективность серверной платформы — с учетом питания, охлаждения, плотности размещения и совокупной стоимости эксплуатации.
SPEC CPU 2017 Integer Speed: P-cores против E-cores в целочисленных вычислениях
В тестах SPEC CPU 2017 Integer Speed двухсокетные конфигурации Dell PowerEdge R770 с P-cores стабильно опережали системы с E-cores по целочисленной производительности на одно ядро. Преимущество P-cores доходило до 1,6 раза, а прирост в шести сопоставленных парах процессоров находился в диапазоне от 37% до 64%.
Такой результат подтверждает назначение P-cores: они лучше подходят для задач, где важна высокая скорость обработки отдельного потока и предсказуемое выполнение операций. Это может быть значимо для корпоративных приложений, транзакционных систем, аналитики и других нагрузок, где производительность одного ядра напрямую влияет на отклик системы.
При этом E-cores сохраняют преимущество по энергопотреблению: они расходуют заметно меньше энергии на операцию. Поэтому такие конфигурации рациональны там, где приоритетом являются параллельность, высокая производительность на ватт и тепловая устойчивость многопроцессорной системы.
SPEC CPU 2017 Floating Point Speed: производительность в расчетных задачах с плавающей точкой
В тестах SPEC CPU 2017 Floating Point Speed процессоры с P-cores стабильно опережали конфигурации с E-cores в задачах с плавающей точкой. Средний прирост производительности достигал до 1,4 раза. Это немного ниже, чем в целочисленных вычислениях, где преимущество P-cores доходило до 1,6 раза, но общий вывод остается тем же: P-cores лучше подходят для вычислительно насыщенных приложений.
Для бизнеса это важно в задачах, где сервер должен быстро выполнять сложные расчеты: инженерное моделирование, научные вычисления, аналитика, ИИ-инференс и другие сценарии с высокой нагрузкой на процессор.
При этом E-cores сохраняют сильную сторону в энергоэффективности. Они потребляют меньше энергии на операцию с плавающей точкой, поэтому могут быть рациональнее в средах, где критичны ограничения по питанию, охлаждению или тепловому пакету. В таких условиях E-cores позволяют дольше удерживать стабильную производительность на большем числе ядер в пределах заданного энергобюджета.
Производительность на ватт: как Dell R570 и R770 используют питание под нагрузкой
В CPU Performance to Power Ratio сравнивались серверы PowerEdge R570 в односокетной конфигурации и PowerEdge R770 в двухсокетной конфигурации на разных уровнях целевой нагрузки. В тестах оценивалось, как растут производительность системы, измеряемая в ssj_ops, и энергопотребление, измеряемое в ваттах.
Смысл этого сравнения — не только в абсолютной производительности, но и в эффективности ее получения. По мере увеличения нагрузки соотношение производительности к потребляемой мощности улучшалось. Это показывает, что серверы эффективнее используют питание при высокой загрузке, а не только в пиковых режимах.
В тестовой конфигурации Dell PowerEdge R570 использовался один процессор Intel Xeon 6787P и 8 модулей памяти по 64 ГБ DDR5-6400. Совокупный показатель эффективности производительности к энергопотреблению составил 21 089.
В конфигурации Dell PowerEdge R770 использовались два процессора Intel Xeon 6787P и 16 модулей памяти по 32 ГБ DDR5-6400. Совокупный показатель эффективности составил 21 232.
Для бизнеса этот результат важен при выборе между односокетными и двухсокетными платформами. R570 может быть рационален там, где требуется компактная конфигурация с меньшей инфраструктурной сложностью. R770 подходит для сценариев, где нужен больший вычислительный запас, масштабирование по процессорам и высокая эффективность при плотной загрузке. При этом финальный выбор должен учитывать не только производительность, но и фактический профиль нагрузки, энергобюджет стойки, охлаждение и требования к расширению.
Первая серия тестов Dell показывает, что P-Cores и E-Cores закрывают разные инфраструктурные задачи. P-Cores дают более высокую вычислительную мощность на ядро, а E-Cores сильнее раскрываются в параллельных и энергоэффективных нагрузках.
Чтобы показать эту разницу на прикладном уровне, дальше сравним три типа нагрузок: веб-сервисы, вывод ИИ-моделей и высокопроизводительные вычисления.
Три класса задач для сравнения: веб, ИИ-инференс и HPC
Чтобы сравнение E-cores, P-cores и AP-cores было прикладным, важно оценивать их не на абстрактной вычислительной нагрузке универсальных тестов, а в разных сценариях корпоративной нагрузки. В тестировании Dell и Prowess для этого использовались три сценария: веб-нагрузка WRK2, ИИ-инференс ResNet-50 и научное моделирование NAMD.
-
WRK2 показывает поведение платформы при большом числе параллельных HTTP-запросов. Такой профиль близок к веб-сервисам, API, микросервисам и другим фронтенд-нагрузкам, где важны одновременная обработка множества легких запросов, стабильная пропускная способность и эффективность на ватт.
-
ResNet-50 используется для оценки ИИ-инференса на CPU. Этот сценарий важен для задач компьютерного зрения и корпоративных систем, где нужно выполнять вывод моделей без обязательного выделения отдельного GPU под каждую нагрузку.
-
NAMD отражает класс HPC-нагрузок: научное моделирование, молекулярная динамика, инженерные расчеты и длительные многопоточные вычисления. Здесь важна не только скорость отдельного задания, но и суммарный объем работы, который сервер выполняет при параллельном запуске большого числа задач.
Такая методика позволяет сравнивать соответствие конкретного типа ядер реальному профилю нагрузки. Для E-cores это плотность и параллельность, для P-cores — отклик и производительность на задачу, для AP-cores — высокая совокупная производительность в длительных многопоточных задачах.
Для бизнеса правильное сопоставление нагрузки с типом процессора — это способ повысить эффективность инфраструктуры и избежать избыточных требований к неподходящему оборудованию. Если задача размещена на платформе, которая плохо соответствует ее профилю, это может привести к лишнему масштабированию, росту затрат на серверы, питание, охлаждение и сопровождение.
Когда каждая нагрузка выполняется на подходящем типе процессора, инфраструктура работает предсказуемее: снижается риск узких мест, задержки становятся стабильнее, а общая пропускная способность растет. Для веб-сервисов это можно оценивать, например, по числу обработанных запросов в секунду.
В масштабе ЦОД такой подход помогает повышать качество сервисов и эффективнее использовать уже закупленные ресурсы.
Три типа ядер: три платформы Dell PowerEdge в сравнении
Для сравнения использовались три конфигурации серверов Dell PowerEdge, каждая из которых была подобрана под свой тип процессора и прикладной сценарий.
-
Dell PowerEdge R770 с E-cores
Конфигурация с двумя процессорами Intel Xeon 6740E, по 96 ядер каждый. Эта система использовалась для оценки сценариев с высокой параллельностью и большим числом легких запросов. -
Dell PowerEdge R770 с P-cores
Конфигурация с двумя процессорами Intel Xeon 6767P, по 64 ядра каждый. Такая платформа отражает задачи, где важны производительность на ядро, низкие задержки и стабильное выполнение отдельных операций. -
Dell PowerEdge R770AP с AP-cores
Конфигурация с двумя процессорами Intel Xeon 6978P, по 120 ядер каждый. Эта система использовалась для тяжелых многопоточных задач, ИИ-инференса и расчетных нагрузок, где критичен общий объем выполненной работы.
Все системы работали под управлением Red Hat Enterprise Linux 10. Для сопоставимости использовались одинаковые базовые прогоны sysbench, а также согласованные сетевые и дисковые конфигурации. В части хранения данных во всех тестовых платформах применялись NVMe-накопители с прямым подключением к CPU. При этом платформа с AP-cores использовалась в более мощной серверной конфигурации — с более быстрыми модулями памяти и блоками питания большей емкости.
Такое тестирование позволяет увидеть, как E-cores, P-cores и AP-cores ведут себя в контролируемых условиях: как они нагружают платформу, как реагируют на длительную работу и насколько хорошо соответствуют разным типам корпоративных задач. Для бизнеса это дает основу для выбора архитектуры по реальному профилю нагрузки.
Полные конфигурации тестовых серверов Dell PowerEdge R770 и R770AP
|
Параметр |
Dell PowerEdge R770 с E-Cores |
Dell PowerEdge R770 с P-Cores |
Dell PowerEdge R770AP с AP-Cores |
|---|---|---|---|
|
CPU |
2 × Intel Xeon 6740E, по 96 ядер, TDP 250 Вт |
2 × Intel Xeon 6767P, по 64 ядра, TDP 350 Вт |
2 × Intel Xeon 6978P, по 120 ядер, TDP 500 Вт |
|
Память |
2048 ГБ — 32 × 64 ГБ DDR5 RDIMM, 5200 МТ/с, 2DPC |
2048 ГБ — 32 × 64 ГБ DDR5 RDIMM, 5200 МТ/с, 2DPC |
1536 ГБ — 24 × 64 ГБ DDR5 RDIMM, 6400 МТ/с, 1DPC |
|
Питание |
БП 2 х 1500 Вт |
БП 2 х 1500 Вт |
БП 2 х 2400 Вт |
|
Сеть |
4-портовый сетевой адаптер Broadcom SFP 57504S OCP, 25 Гбит/с |
4-портовый сетевой адаптер Broadcom SFP 57504S OCP, 25 Гбит/с |
2-портовый сетевой адаптер Mellanox ConnectX-6 Dx, 100 Гбит/ссетевой адаптер Broadcom BCM57608 OCP Ethernet, 2 × 200 Гбит/с |
|
Хранение данных |
2 × 480 ГБ Micron EC NVMe ISE 7450 RI M.2 80 — Dell BOSS8 × 3,84 ТБ Micron MTFDDAK3T8TGA-1B — Dell PERC H365i4 × 1,92 ТБ KIOXIA DC NVMe CD8 U.2 — прямое подключение к CPU |
2 × 480 ГБ Micron EC NVMe ISE 7450 RI M.2 80 — Dell BOSS8 × 3,84 ТБ Micron MTFDDAK3T8TGA-1B — Dell PERC H365i4 × 1,92 ТБ KIOXIA DC NVMe CD8 U.2 — прямое подключение к CPU |
2 × 480 ГБ Micron EC NVMe ISE 7450 RI M.2 80 — Dell BOSS2 × 1,6 ТБ Samsung DC NVMe PM9D5a MU U.2 — прямое подключение к CPU |
WRK2: веб-нагрузка и параллельная обработка запросов
WRK2 — это инструмент нагрузочного тестирования HTTP-серверов, предназначенный для проверки работы веб-сервисов при большом числе одновременных соединений. Он формирует реалистичный профиль трафика и фиксирует важные метрики: количество запросов в секунду — RPS, распределение задержек и ошибки на уровне сетевых соединений.
За счет этого WRK2 хорошо подходит для сравнения разных архитектур Intel Xeon 6 в единых условиях: с E-cores, P-cores и AP-cores. В тестировании оценивалось, насколько каждый тип ядер способен удерживать пропускную способность, управлять глубиной очереди и сохранять стабильные задержки при росте параллельной нагрузки.
Результаты WRK2 показали, что веб-нагрузки в большей степени зависят от способности сервера обрабатывать большое число одновременных легких запросов, чем от пиковой производительности одного потока. Это поведение было характерно для всех протестированных конфигураций. При низком и среднем числе соединений системы с E-cores, P-cores и AP-cores показывали почти одинаковую пропускную способность. Существенные различия начинали проявляться только при росте параллелизма.
В сценарии до 10 000 запросов при 50 соединениях системы с E-cores и P-cores удерживали пропускную способность в пределах 0,25% друг от друга. Похожий уровень паритета между E-cores и AP-cores был зафиксирован при 10 000 запросов и 500 соединениях.
В большинстве режимов WRK2 конфигурации с E-cores работали на уровне систем с P-cores и AP-cores. Сама нагрузка не требовала высокопроизводительных ядер для сохранения приемлемого уровня сервиса. При этом загрузка CPU оставалась высокой на всех платформах, что указывает на эффективное использование доступных вычислительных ресурсов.
Для инфраструктурного выбора это важный вывод: фронтенд-сервисы, API и распределенные веб-приложения не всегда получают заметную выгоду от более производительных и энергоемких конфигураций. В таких сценариях E-cores могут быть более рациональным вариантом за счет плотности, энергоэффективности и достаточной пропускной способности при массовой обработке легких запросов. А развертывание систем с P-cores или AP-cores для нагрузок в стиле Apache HTTP вряд ли даст заметный прирост производительности. Напротив, оно может увеличить энергопотребление без очевидной практической выгоды.
ИИ-инференс на процессорах: ResNet-50 и оптимизированные инструменты Intel
ResNet-50 — широко используемая сверточная нейронная сеть, которую часто применяют для оценки производительности вывода моделей в задачах классификации изображений. В этом тестировании ResNet-50 запускалась с использованием оптимизированного программного стека Intel:
-
Intel OpenVINO toolkit;
-
Intel oneAPI Base Toolkit и Intel oneAPI HPC Toolkit;
-
TensorFlow, оптимизированный Intel.
Такой подход позволил оценить производительность ИИ-инференса на процессорах в системах с E-cores, P-cores и AP-cores. При этом тест отражал типовой корпоративный сценарий, где модели компьютерного зрения выполняются не только на выделенных графических ускорителях, но и на серверных процессорах.
В ходе тестирования сравнивалось, как разные типы ядер обрабатывают одинаковые задачи ResNet-50 через OpenVINO. Оценивались различия в векторных вычислениях, эффективности планирования потоков и энергопотреблении при разных размерах блока и режимах точности. Также фиксировалось поведение платформ под длительной нагрузкой: масштабирование частот, тепловая устойчивость и чувствительность к пропускной способности памяти.
Результаты показали четкое разделение между архитектурами в задачах ИИ-инференса на процессорах. Системы с AP-cores обеспечили самую высокую пропускную способность вывода моделей и опередили конфигурации с P-cores и E-cores во всех протестированных сценариях. В зависимости от режима системы с AP-cores показывали от умеренного преимущества над P-cores до более чем двукратного прироста производительности.
Максимальное и минимальное относительное преимущество систем с AP-cores над системами с P-cores в зависимости от режима точности и размера блока
|
Режим точности |
Размер блока |
Максимальная производительность систем с AP-Cores по сравнению с P-Cores |
Минимальная производительность систем с AP-Cores по сравнению с P-Cores |
|---|---|---|---|
|
INT8 |
1 |
на 119% выше |
на 58% выше |
|
INT8 |
16 |
на 113% выше |
на 52% выше |
|
FP32 |
1 |
на 120% выше |
на 45% выше |
|
FP32 |
16 |
на 101% выше |
на 26% выше |
Однако более высокая чистая производительность AP-cores показывает только часть картины. Системы с P-cores стабильно выполняли нагрузку ResNet-50 и давали устойчивые, хорошо интерпретируемые результаты в широком наборе конфигураций. При этом они потребляли меньше энергии: как за счет меньшего энергопотребления самих процессоров, так и за счет меньшего объема памяти, участвующего в работе системы.
Более низкое энергопотребление платформ с P-cores означает, что их производительность на ватт в отдельных режимах могла быть выше, чем у систем с AP-cores. В тестировании 44% комбинаций режима точности и размера блока для ResNet-50 на системах с P-cores находились на уровне паритета с AP-cores по производительности на ватт или превосходили их в пределах ±3%.
Это означает, что более высокая пропускная способность AP-cores не всегда автоматически превращается в лучшую энергоэффективность. Для организаций, которым важно снижать общее энергопотребление серверной инфраструктуры, более низкое потребление систем с P-cores может быть значимым фактором выбора.
Максимальная и минимальная относительная производительность на ватт систем с P-cores по сравнению с системами с AP-cores в зависимости от режима точности и размера блока
|
Режим точности |
Размер блока |
Максимальная производительность на ватт систем с P-Cores по сравнению с AP-Cores |
Минимальная производительность на ватт систем с P-Cores по сравнению с AP-Cores |
|---|---|---|---|
|
INT8 |
1 |
на 52% выше |
на 56% выше |
|
INT8 |
16 |
на 132% выше |
на 53% выше |
|
FP32 |
1 |
на 132% выше |
на 52% выше |
|
FP32 |
16 |
на 209% выше |
на 42% выше |
Системы с E-cores в тестах ResNet-50 оценивались более выборочно. Они способны выполнять такую нагрузку, но стабильно показывали меньшую пропускную способность, чем системы с AP-cores и P-cores. Этот результат соответствует архитектурному компромиссу E-cores: они ориентированы на эффективность и параллельность, а не на максимальную производительность одного экземпляра ИИ-инференса.
Также оценивалось масштабирование в разных конфигурациях: с режимами точности INT8 и FP32, разными размерами блока и разным числом cores. В отдельных сценариях меньшее число ядер давало более высокую пропускную способность, но общий порядок результатов не изменился: лидировали системы с AP-cores, за ними шли P-cores, а E-cores показывали более низкую производительность в этой задаче.
Системы с AP-cores показали самые сильные результаты в ИИ-инференсе ResNet-50 на CPU с использованием OpenVINO toolkit. Они стабильно обеспечивали максимальную пропускную способность во всех протестированных конфигурациях, поэтому лучше подходят для задач компьютерного зрения, где главный критерий — общий объем обработанных данных.
Системы с P-cores остаются производительной и предсказуемой альтернативой: они не достигают пропускной способности AP-cores, но дают устойчивый результат и могут быть привлекательнее по производительности на ватт.
NAMD: параллельное моделирование и суммарная производительность AP-cores
NAMD — приложение для параллельного моделирования молекулярной динамики, которое широко используется в научных исследованиях, фармацевтической разработке и средах HPC. Такие задачи сильно зависят от многопоточного выполнения, пропускной способности памяти и устойчивой производительности в операциях с плавающей точкой. Поэтому NAMD хорошо подходит для оценки того, как разные архитектуры Intel Xeon справляются с крупными вычислительными нагрузками - одновременно на процессорный конвейер и подсистему памяти.
В тестировании оценивалось, как E-cores, P-cores и AP-cores ведут себя в масштабных параллельных симуляциях молекулярной динамики. Особое внимание уделялось устойчивой производительности в вычислениях с плавающей точкой, масштабированию по потокам, использованию пропускной способности памяти и эффективности взаимодействия между cores. Для сопоставимости каждый тип процессора запускался с одинаковыми параметрами симуляции. Это позволило оценить планирование потоков, использование SIMD-инструкций и стабильность платформы при длительной расчетной нагрузке.
Первые измерения по отдельным заданиям показали, что системы с P-cores дают немного более высокую пропускную способность на одно задание и на одно ядро, чем системы с AP-cores. Если смотреть только на одиночный запуск, отдельные симуляции могут завершаться немного быстрее на P-cores. Но такой взгляд не отражает полной картины для реальных HPC-сценариев, где часто запускается не одна длительная задача, а сразу несколько независимых расчетов.
Системы с AP-cores за счет существенно большего числа ядер запускали 30 одновременных 8-ядерных заданий NAMD, тогда как системы с P-cores — 16 одновременных заданий. При суммировании общего числа наносекунд симуляции в день по всем выполняемым задачам платформы с AP-cores стабильно показывали более высокую совокупную производительность.
В сценариях молекулярного моделирования — как с включенными инструкциями Intel AVX, так и без них — системы с AP-cores выполнили за тот же период времени на 84–87% больше суммарной работы, чем системы с P-cores.
В итоге отдельная симуляция NAMD может выполняться немного быстрее на P-cores, но при параллельном запуске большого числа независимых задач AP-cores дают существенно более высокую общую пропускную способность. Поэтому оценивать такие нагрузки только по скорости одного задания некорректно.
Для исследовательских, инженерных и фармацевтических сред AP-cores лучше подходят в тех случаях, когда важнее максимизировать общий объем научных расчетов, а не минимизировать время выполнения одной отдельной симуляции.
Как выбрать тип процессора Intel 6 для сервера
Результаты тестов показывают, что универсального варианта для всех сценариев нет. В веб-нагрузке WRK2 конфигурации с E-cores показали сопоставимую пропускную способность с системами на P-cores и AP-cores, поэтому для фронтенд-сервисов, микросервисов и легких параллельных запросов важнее плотность и эффективность, а не максимальная производительность одного ядра.
В задачах, чувствительных к задержкам и скорости выполнения отдельной операции, сильнее раскрываются P-cores. В тестах Dell они показывали более высокую производительность на ядро в целочисленных и расчетных нагрузках, но одновременно требовали больше энергии и охлаждения. Поэтому P-cores логичнее выбирать для транзакционных систем, аналитики, корпоративных приложений и сценариев, где отклик важнее плотности размещения.
AP-cores лучше подходят для задач, где важна не скорость одного задания, а общий объем выполненной работы. В ResNet-50 они показали более высокую пропускную способность ИИ-инференса, а в NAMD — более высокий суммарный результат при параллельном запуске расчетов. Это делает AP-платформу рациональной для ИИ-инференса на CPU, научного моделирования, инженерных расчетов и других тяжелых многопоточных нагрузок.
Выводы
В современных корпоративных сценариях критически важен профиль нагрузки: одни задачи выигрывают от плотности и эффективности, другие — от высокой производительности на ядро, третьи — от максимального совокупного вычислительного потока. Именно это делает выбор между E-cores, P-cores и AP-платформой частью архитектурного проектирования инфраструктуры.
Тестирование в разных условиях хорошо показывает риск избыточной конфигурации, которую легко получить, если действовать по старым принципам. Более производительная платформа не всегда дает бизнесу пропорциональную отдачу: в легких параллельных нагрузках она может просто увеличить энергопотребление, требования к охлаждению и стоимость владения.
P-cores остаются базовым выбором для тех задач, где инфраструктура должна отвечать быстро и стабильно. Это не обязательно самые тяжелые нагрузки по общему объему вычислений, но именно те сценарии, где задержка, скорость одного потока и предсказуемое выполнение операции напрямую влияют на качество сервиса.
AP-платформа интересна как специализированный класс для задач, где важен общий объем выполненной работы. Это принципиально другой критерий выбора: не ускорить одну операцию любой ценой, а обработать больше моделей, расчетов или симуляций за единицу времени. Поэтому AP-конфигурации выглядят оправданно в ИИ-инференсе на CPU, научных расчетах, инженерном моделировании и других длительных многопоточных задачах.
С выходом новых поколений поцессоров Intel 6 и AMD Zen 5 заказчики столкнулись с необходимостью менять подход в проектировании архитектуры своих серверов. Перед закупкой нужно понимать, что ограничивает конкретную систему: процессорное ядро, память, ввод-вывод, энергобюджет стойки, охлаждение, лицензирование или характер самой нагрузки. Без этого можно переплатить за мощность, которая не будет использована, или наоборот — получить узкое место там, где требовалась более производительная платформа. И сегодня правильная конфигурация сервера — та, где тип процессора, серверная платформа и профиль нагрузки совпадают между собой.
Вопросы и ответы
Для кого подготовлен этот материал?
Материал рассчитан на ИТ-директоров, архитекторов инфраструктуры, технических руководителей и специалистов, которые выбирают серверные платформы под корпоративные нагрузки. Его задача — помочь понять, где рациональнее использовать E-cores, где нужны P-cores, а где оправдана AP-платформа.
В чем главное различие между E-cores, P-cores и AP-cores?
E-cores ориентированы на плотность, параллельность и производительность на ватт. Они лучше подходят для веб-сервисов, фоновых процессов, контейнерных сред и большого числа легких задач.
P-cores дают более высокую производительность на ядро и лучше раскрываются в задачах с требованиями к отклику: базы данных, аналитика, транзакционные системы, интерактивные приложения и часть ИИ-сценариев.
AP-cores рассчитаны на задачи, где важна максимальная суммарная производительность: ИИ-инференс на CPU, научное моделирование, инженерные расчеты, HPC и другие длительные многопоточные нагрузки.
Зачем сопоставлять нагрузку с типом ядер?
Неправильно выбранная платформа может привести к лишним затратам: сервер будет потреблять больше энергии, требовать более сложного охлаждения или масштабироваться не там, где это действительно нужно. Когда нагрузка размещается на подходящем типе cores, инфраструктура работает предсказуемее, а ресурсы используются эффективнее.
Для каких задач особенно важны AP-cores?
AP-cores наиболее уместны там, где нужно выполнить большой объем тяжелых вычислений за единицу времени. Это молекулярное моделирование, инженерные симуляции, вычислительная гидродинамика, крупные аналитические задачи, ИИ-инференс и расчетные конвейеры, где одновременно запускается много независимых задач.
Как результаты тестов помогают выбрать сервер?
Они показывают, что разные типы ядер сильны в разных условиях. E-cores рациональны для плотных параллельных сервисов, P-cores — для задач с высокими требованиями к отклику и производительности на ядро, AP-cores — для максимального совокупного объема вычислений. Поэтому сервер лучше выбирать не по формальному числу ядер, а по тому, как именно будет работать прикладная нагрузка.
Dell, ITELON
Вам может быть интересно


Сбалансированная конфигурация памяти для двухпроцессорных серверов на Intel Xeon 6

Какой процессор лучше для сервера 1С
Выбор правильной конфигурации сервера для 1С — задача, требующая внимания к деталям. От правильного решения зависят производительность, стабильность и масштабируемость вашей IT-структуры. В этой статье рассмотрим, какие процессоры стоит выбрать для сервера 1С, учитывая современные требования, рекомендации специалистов и реальные кейсы.
Подпишитесь на новости
Обратитесь к экспертам компании Itelon



Оцените статью и добавьте комментарий — будьте первым
Спасибо!
Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!