
CXL-память для ИТ-инфраструктуры - ниже задержки, выше гибкость
Содержание
Compute Express Link - CXL долго оставался технологией, к появлению которой рынок готовился много лет. Формально CXL уже есть в реальных продуктах и приносит пользу. При этом большинство специалистов в 2019 года предполагали, что к 2024 году CXL займет куда более заметное место в ландшафте ИТ. В реальности в 2025 году ожидается только переход из узкой ниши к регулярному применению в инфраструктуре.
CXL приходит по-настоящему в 2025
В 2019 году обсуждался первый крупный доклад по CXL после анонса - как раз в момент, когда технология выходила из статуса внутренней разработки и передавалась в консорциум. Для контекста: в I квартале 2019 года еще не был представлен AMD EPYC 7002 Rome, рынок не был разогрет акселераторами ИИ до нынешних масштабов, а Intel оставалась в позиции, когда могла продвигать подобные инициативы для всей отрасли. Показательный штрих: на Interconnect Day в апреле 2019 года в схеме интерконнектов Intel заметное место занимал Ethernet - примерно в тот период не состоялась сделка по Mellanox. Отдельно важно, что связка CXL/PCIe рассматривалась как приоритетный путь, а не масштабирование по линкам межпроцессорного уровня наподобие UPI или альтернатив вроде NVLink и UALink.
Слайд Interconnect Day 2019
После этого начались интересные события. В 2022 году вышел AMD EPYC Genoa с поддержкой CXL для устройств расширения памяти класса Type-3. У Intel четвертое поколение Xeon Scalable Sapphire Rapids стартовало без поддержки CXL Type-3 - сами процессоры умели работать с CXL, но официальная поддержка появилась только в пятом поколении Xeon Emerald Rapids примерно год спустя. В итоге поддержка устройств расширения памяти у Intel появилась примерно на год позже, чем у AMD.
Поскольку современные серверы уже поддерживают CXL, одним из главных драйверов станет наращивание памяти. Если коротко о Type-3 - идея в том, чтобы использовать линии, которые обычно отданы под CXL или PCIe, именно под CXL и подключать контроллер памяти CXL с установленной DRAM. Ряд производителей памяти создает модули формата CXL, похожие на твердотельные диски - со временем они будут устанавливаться в отсеки формата EDSFF E3.S или E3.L так же, как обычные SSD.
Micron CZ120 CXL Memory Expansion Modules
Альтернатива - плата формата PCIe с установленной памятью или со слотами под DIMM - например, карта расширения памяти CXL Astera Labs Leo.
Astera Labs Leo CXL Memory Expansion Card с DIMMs
В полноразмерных конфигурациях это масштабируется до уровня, когда в сервер устанавливается плата расширения памяти CXL - примером служит демонстрационный стенд с Lenovo CXL Memory Monster на 128 модулей DDR5 по 128 ГБ каждый - суммарно до 16 ТБ, показанный также на стенде Astera Labs. Модель Lenovo ThinkSystem SR860 V3 ориентирована на задачи класса scale-up с упором на объем оперативной памяти, такие как СУБД/SAP HANA, где критично максимально возможное количество ОЗУ.
Lenovo ThinkSystem SR860 V3 CXL
Встречаются и специальные модули от Montage и ASUS. В демонстрации сервера ASUS на базе AMD EPYC с поддержкой CXL показана шасси-конфигурация, где в одном корпусе размещены четыре серверных узла и несколько модулей расширения памяти CXL.
Inventec CXL Box OCP
На фото внешняя полка на 96 слотов DDR5-4800 с контроллерами Astera Labs Leo и 8-сокетный сервер на Intel Xeon 6 Granite Rapids-SP с 128 слотами DDR5. Через CXL x16 эта пара дает суммарно 224 слота DIMM и выводит единичный сервер на десятки терабайт ОЗУ, что критично для scale-up задач уровня in-memory аналитики и HANA-подобных нагрузок. Архитектура гибкая: ту же полку можно перекоммутировать к другим серверам, а с появлением CXL-коммутаторов масштабирование станет удобнее.
Inventec 8-сокетный Intel Xeon 6 с подключением внешней полки CXL
С CXL 2.0 открывается путь к коммутации. По всей видимости, ключевые сценарии раскроются с приходом поколений PCIe Gen6 - CXL 3.x. Представим полку памяти, подключенную в стойку, которая выделяется узлам динамически через коммутируемую архитектуру.
XConn SC50256 - микросхема коммутатора CXL 2.0
Один из ключевых плюсов, особенно на фоне стремления крупных дата-центров отложить полное обновление серверов, в том, что контроллеры CXL не требуют перехода на DDR5. Можно переиспользовать большие партии модулей DDR4, устанавливая их на контроллеры класса Marvell Structera. Это снижает прямые затраты на память и уменьшает углеродный след за счет отказа от выпуска новых модулей. Фактически операторы могут изъять DDR4 из списываемых узлов, собрать полки на контроллерах CXL под DDR4 и затем динамически распределять этот ресурс между серверами. Экономическая выгода в таких сценариях значительная.
Marvell Structera 2504 - расширение памяти CXL на DDR4
Помимо DDR5 и DDR4 появляются и иные варианты — например, прототип Kioxia с CXL и BiCS Flash, показанный на FMS 2023, как аккуратная опция для нестандартных сценариев. Главное в другом: уже 1–2 года выпускаются чипы и, что важнее, поколения серверов с поддержкой устройств CXL, а экосистема контроллеров и модулей позволяет начинать реальное применение.
В начале 2023 года попытка внедрения часто упиралась в список точных артикулов DRAM, узкие версии прошивок и конкретные платформы. В 2025 году стоит ожидать роста числа серверных платформ с CXL для тех, кому нужен больший объем и полоса памяти в универсальных вычислениях. Технология становится внедряемой и будет появляться в новых сегментах, хотя ее слабое место — то, что CXL пока не встроен в типовые контуры построения инфраструктуры для ИИ. Массовое принятие и более интересные варианты применения вероятны ближе к 2027 году — но сейчас, наконец, начался практический этап.
Что такое CXL
Compute eXpress Link - CXL это протокол поверх PCIe, который не нарушает штатную работу PCIe. CXL позволяет наращивать память за пределами DIMM слотов, например использовать DRAM или энергонезависимую память в виде модулей формата EDSFF E1.s или E3.s. Возможен вариант с платами расширения - их устанавливают в стандартные разъемы PCIe, а на самих платах размещают обычные DIMM.
Ниже на иллюстрациях показаны примеры: плата расширения на 8 DIMM и модуль расширения памяти E3.S от SMART Modular Technologies.
SMART Modular Technologies - модуль CXL E3.S и плата расширения на 8 DIMM
Зачем CXL
В центрах обработки данных на производительность и совокупную стоимость владения давят три проблемы памяти:
-
Во-первых, ограниченность классических подсистем памяти. Разрыв по задержкам между DRAM и накопителями колоссальный - порядка в тысячу раз. Например, модуль Micron 96 ГБ DDR5-4800 MT/s дает задержку записи около 15.44 нс, а SSD Micron 7450 NVMe - около 15 мкс. Как только процессор упирается в объем DRAM и начинает выгружать данные на SSD, ядра простаивают в ожидании данных и вычислительная производительность заметно падает.
-
Во-вторых, число каналов контроллера памяти растет не так быстро, как количество ядер. Ядра недополучают полосу памяти - эффект от увеличения количества ядер нивелируется. Пример - процессоры Intel Xeon 6: до 288 ядер при 12 каналах памяти.
-
В-третьих, память ускорителей изолирована - ресурсы оказываются не до конца использованными или «запертыми» внутри отдельных устройств.
Нужна гибкая технология, которая добавляет процессорам и полосу, и емкость памяти. Compute Express Link - CXL спроектирован как когерентная связь с низкой задержкой между процессорами, ускорителями и памятью, позволяющая расширять память за пределами DIMM и делать ее общим ресурсом.
CXL - редкая по масштабу технология уровня десятилетия, которая меняет архитектуру дата-центров. Ее поддерживают системные производители, разработчики платформ и модулей, софтверные команды и чипмейкеры. Темпы развития и внедрения подтверждают высокую практическую ценность подхода.
Серверы на процессорах Intel Xeon 6 поддерживают память CXL 2.0. Ожидается, что будущие поколения AMD EPYC также получат поддержку CXL-памяти, тогда как вопрос поддержки альтернативной памяти MRDIMM от AMD остается открытым.
Классы устройств CXL
Технология CXL поддерживает когерентность между адресным пространством памяти процессора и памятью на подключенных устройствах. Это позволяет объединять и делить ресурсы для повышения производительности, упрощает программный стек и снижает совокупную стоимость системы. Консорциум CXL выделяет три класса устройств по типу, а не по версии стандарта. Для обмена данными устройства используют два или более протоколов CXL - CXL.io, CXL.mem и CXL.cache.
Тип 1 - акселераторы без собственной памяти. Такие устройства обращаются к памяти хоста по CXL и работают напрямую с DRAM процессора, на схеме обозначенной как DDR5 - MRDIMM.
Тип 2 - акселераторы с собственной памятью. Графические процессоры, ASIC и FPGA с DDR или HBM используют CXL, чтобы сделать память хоста доступной локально для акселератора, а локальную память акселератора - доступной для CPU хоста. Это двустороннее представление памяти упрощает обмен данными и уменьшает накладные расходы на копирование.
Тип 3 - устройства с собственной независимой от памяти хоста ОЗУ. Такие модули подключаются по CXL и добавляют процессору и полосу, и емкость памяти, выступая как расширение системной памяти за пределами DIMM-слотов.
Поддерживаемые протоколы CXL
Стандарт CXL включает три протокола. Первый по сути эквивалентен PCIe и обеспечивает транспорт. Второй дает акселераторам доступ к памяти хоста и позволяет кэшировать эти данные. Третий открывает доступ хоста к памяти, установленной на устройстве.
Совместная работа этих протоколов обеспечивает когерентный обмен и разделение памяти между устройствами, например между CPU и ИИ-акселератором. За счет общей памяти упрощается программирование - взаимодействие идет через единое адресное пространство без лишних копирований.
Архитектура CXL на PCIe
CXL опирается на физический и электрический уровни PCIe и использует режим, позволяющий запускать альтернативные протоколы поверх физики PCIe. Транзакционные протоколы CXL активируются только если оба конца линии поддерживают CXL - в противном случае устройство работает как обычное PCIe.
Версии CXL 1.1 и 2.0 используют физический уровень PCIe 5.0 со скоростью до 32 GT/s - это дает до 64 GB/s в каждом направлении по линии x16. Для сравнения, DDR5-5600 обеспечивает пропускную способность около 69.21 GB/s, то есть очень близко к скорости CXL 2.0.
Отличия CXL 2.0
CXL 2.0 развивает CXL 1.1 и приносит важные функции: коммутацию, логическое дробление устройств, объединение памяти в пулы и поддержку форм-факторов EDSFF. Рассмотрим по порядку.
Коммутация в CXL 2.0
CXL 2.0 поддерживает коммутацию, чтобы формировать пул памяти и открывать к нему доступ сразу для нескольких хостов. С коммутатором CXL 2.0 один хост может обращаться к одному или нескольким устройствам из пула. Для хостов требуется поддержка CXL 2.0, при этом сами модули памяти могут быть смешанными по поколениям — CXL 1.0, 1.1 и 2.0. Функция коммутации реализуется в самих устройствах памяти через микросхему контроллера CXL.
Логическое дробление устройств в CXL 2.0
Устройство памяти CXL 1.0 - 1.1 ведет себя как единый логический блок и может одновременно обслуживать только один хост, что показано на схеме ниже.
Память устройства CXL 2.0 можно делить на несколько логических блоков, и до 16 хостов способны одновременно работать с разными участками адресного пространства. В качестве носителя такая память может использовать DDR5 DRAM, расширяя основной объем оперативной памяти хоста.
В качестве примера: четыре процессора на схеме выше могут использовать устройство памяти эксклюзивно, как это показано для CPU_4 и CXL_device_7, особенно если устройство относится к CXL 1.0 или CXL 1.1. Устройства CXL 2.0, такие как CXL_device_1 — CXL_device_6, могут совместно использоваться всеми четырьмя хостами. Хосты сопоставляют требования по памяти своих нагрузок с доступной емкостью в общем пуле.
Объединение памяти в CXL 2.0
CXL 2.0 объединяет всю доступную память в общий пул и распределяет ее по хостам по мере необходимости, повышая утилизацию и эффективность.
Поддержка EDSFF в CXL 2.0
CXL 2.0 поддерживает устройства в форм-факторе EDSFF, что позволяет устанавливать модули памяти в дисковые отсеки сервера. Это расширяет сценарии применения и помогает лучше использовать доступные ресурсы, например свободные дисковые слоты.
Преимущества CXL 2.0 для бизнеса
-
Расширение памяти. Основная память хоста отвечает в наносекунды, но ее объем ограничен числом слотов и стоимостью. Диск работает примерно в тысячу раз медленнее - разрыв огромный. Память по CXL закрывает часть этого разрыва - ее задержка выше DRAM примерно в 20-50 раз, но на порядки быстрее диска. Высокоемкие нагрузки вроде ИИ-систем зависят от объема памяти - именно в такие классы задач сейчас идут вложения, потому выгода CXL очевидна.
-
Общий пул памяти. Пулинг позволяет процессорам хоста и ускорителям вроде GPU делить память между собой. Это упрощает и ускоряет обмен сообщениями, что повышает производительность. Кроме того, CXL-память можно разбивать на несколько логических областей и назначать их различным хостам и устройствам или делить между ними. В итоге ресурсы памяти используются эффективнее, а совокупная стоимость владения - TCO снижается.
-
Потенциал энергонезависимой памяти. Опыт с прекращенной линейкой Intel Persistent Memory показал пользу быстрой энергонезависимой памяти в ряде сценариев. CXL открывает путь к энергонезависимой памяти вне шины памяти процессора. Плюс в том, что это не уменьшает доступный объем основной DRAM на шине и не нагружает саму шину, что позитивно сказывается на TCO.
Что дальше: CXL 3.1
Спецификация CXL 3.1 опубликована в ноябре 2023 года. Практика показывает, что устройства под новые требования выходят в широкую доступность через два-три года после релиза спецификации.
CXL 3.1 добавляет прямой доступ к памяти и расширяет возможности объединения памяти в пулы, а многоуровневая коммутация позволяет строить полноценные коммутационные матрицы. Скорость передачи данных удваивается до уровня PCIe 6.1 — 64 GT/s. Поддерживается переконфигурация памяти без перезагрузки, что повышает гибкость эксплуатации.
Пример внедрения CXL 2.0 в серверах Dell PowerEdge
Сервер PowerEdge R7725 на процессорах AMD EPYC пятого поколения поддерживает устройства памяти CXL 2.0 класса Type 3. Это дает масштабируемый объем памяти сверх ограничений по DIMM, что делает систему удобной для задач, упирающихся в ОЗУ, например in-memory базы данных, II - ML и крупные моделирования.
CXA-4F1W — модуль, примененный при тестировании R7725
NUMA и CXL - как устроен доступ к памяти
В системах класса PowerEdge R7725 память организована по схеме NUMA - у каждого сокета своя локальная память. Обращение к памяти другого сокета - или к устройству CXL - добавляет задержку.
Модули памяти CXL видны как отдельные NUMA-узлы. Они дают заметное расширение емкости, но их задержка обычно выше, чем у локальной DRAM. Это видно по сравнениям латентности между логическими ядрами CPU - доступ к памяти по CXL занимает больше времени, чем к каналам базовой памяти. Однако такой компромисс нередко оправдан для задач, где критичен объем памяти, а не минимальная задержка на каждое обращение.
Ценность CXL на PowerEdge
-
Масштабирование полосы и емкости памяти с оптимальными затратами
-
Поддержка задач AI/ML, HPC, in-memory БД и виртуализации
-
Совместимость с широкой экосистемой процессоров и ОС
-
Пулинг памяти и многоуровневая архитектура памяти
Конфигурация тестового сервера
|
Модель сервера: |
PowerEdge R7725 |
|
Процессор: |
AMD Zen 5, 128 ядер |
|
Системная память (DRAM): |
24×64 ГБ DIMM |
|
Память CXL: |
4×96 ГБ (через устройства CXL) |
Тестировние PowerEdge R7725 с CXL 2.0
Результаты бенчмарка AOCC5 для PowerEdge R7725 показывают высокую эффективность по разным функциям работы с памятью. Тест измеряет пропускную способность ключевых операций памяти — это отражено на графике ниже.
Сравнение пропускной способности памяти (AOCC5)
Полученные результаты подтверждают, что сервер эффективно справляется с памятьемкими задачами и подходит для высокопроизводительных вычислений - HPC, нагрузок AI/ML и крупномасштабных моделирований. Особенно высокие показатели по операциям Read и Add указывают на сильную полосу памяти и высокую вычислительную производительность - критичные параметры для систем с интенсивной работой с данными.
Время доступа к памяти по NUMA-узлам (ниже - лучше)
Этот график сравнивает задержку доступа к памяти по ядрам CPU для локальных каналов памяти A и B и для модулей памяти, подключенных по CXL. Модули CXL показывают несколько более высокую задержку, но дают ценный прирост емкости без замены установленных DIMM.
Выводы
PowerEdge R7725 привносит в корпоративные нагрузки новое поколение работы с памятью благодаря поддержке CXL 2.0. Подключая устройства класса Type 3, платформа масштабирует объем памяти сверх ограничений DIMM и закрывает растущие потребности приложений в оперативной памяти. Для задач AI/ML, крупномасштабных моделирований и in-memory баз CXL 2.0 дает гибкий и экономичный путь к росту производительности и емкости без кардинальной перестройки существующей инфраструктуры.
Актуальные серверы с CXL 2.0 от мировых производителей
Современные платформы уже выходят за пределы классической шины памяти – CXL 2.0 дает возможность масштабировать объем и полосу памяти, а также формировать общие пулы для разных узлов. Ниже собраны актуальные модели, где поддержка CXL подтверждается спецификациями и документацией вендоров. Список будет обновляться по мере расширения линеек.
Серверы Dell:
Серверы Lenovo:
Серверы HPE:
Серверы xFusion:
CXL 2.0 уже закрепился в массовых двухсокетных и масштабируемых системах, и по мере появления новых контроллеров и свитчей перечень моделей будет расти.
Актуальные операционные системы с поддержкой CXL 2.0
CXL 2.0 уже встроен в современные ядра Linux и поддерживается крупными дистрибутивами. Это позволяет расширять память через устройства Type-3, формировать пулы памяти и работать с NUMA-доменами CXL.
Red Hat Enterprise Linux
-
RHEL 9.2+ — в релиз-нотах указаны драйверы CXL: cxl_core, cxl_port, cxl_acpi, cxl_mem для endpoint-устройств и свитчей памяти.
-
RHEL 9.4/9.5/9.6 — ветка 9 продолжает поставлять ядро с CXL-стеком; см. общие релиз-ноты RHEL 9.4/9.5/9.6 и руководства по переходу на 9, где компоненты cxl-cli/cxl-devel доступны в репозиториях 9.x.
-
Дополнительно: в пакете аппаратной сертификации RHEL есть отдельный тест memory_CXL для устройств Type-3, что подтверждает поддержку на уровне платформы и инструментов проверки.
SUSE Linux Enterprise Server
-
SLES 15 SP6/SP7 — дистрибутив для серверов на AMD EPYC/Intel Xeon, официальные материалы SUSE по тюнингу для EPYC 9005 описывают использование линий как CXL 2.0 links, что отражает поддержку стека в ядре и платформенной интеграции.
-
SLES 16 — релиз-ноты отмечают поддержку машинных проверок для памяти CXL, что важно для эксплуатации и мониторинга.
Ubuntu LTS
-
Ubuntu 24.04 LTS — ядро 6.8 содержит CXL-драйверы; в списках обновлений безопасности прямо упоминаются CXL drivers, что подтверждает наличие стека в стандартном ядре дистрибутива.
-
Ubuntu 22.04.5 LTS — при установке HWE-ядра 6.8 (стандарт для 22.04.5) доступны те же CXL-компоненты; см. официальную схему HWE и таблицу, где 22.04.5 использует ядро 6.8.
-
В официальных man-страницах Ubuntu есть libcxl и инструменты работы с CXL, указывающие на поддержку пространства /sys и пользовательских утилит.
Что с Windows Server
Windows Server 2025 — продукт доступен и поддерживается по LTSC, однако в публичной документации Microsoft на момент подготовки нет прямого описания поддержки CXL Type-3 устройств на уровне ОС.
Microsoft активно публикует исследования и материалы по CXL для облачных сценариев и память-пулинга, но это не является официальным описанием функционала ОС. Для он-прем подтверждения следует ожидать профильные документы по драйверам и ролям, которых пока нет в открытых гайдах.
Поддержка CXL 2.0 уже де-факто доступна в серверных Linux-дистрибутивах актуальных веток RHEL, SLES и Ubuntu LTS. По мере выхода CXL-коммутаторов и зрелости устройств в EDSFF список поддерживаемых версий будет расширяться, а производители дистрибутивов добавят новые утилиты и профили мониторинга. Для Windows Server официальные материалы о полноценной поддержке CXL Type-3 пока не опубликованы.
Также поддержка CXL 2.0 уже официально сертифицирована на платформах ведущих вендоров — в матрицах совместимости Dell, Lenovo, HPE и xFusion перечислены актуальные выпуски RHEL, SLES и Ubuntu LTS для конкретных моделей серверов.
Заключение
CXL 2.0 уже перешел из эксперимента в рабочий инструмент масштабирования памяти: он добавляет емкость и полосу без замены платформы, позволяет объединять память в общий пул и тем самым снижает TCO при росте нагрузок.
Главный эффект для бизнеса — отсрочка капитальных затрат на обновление серверов, лучшее использование уже купленных модулей и гибкое распределение ресурсов между кластерами. Главный риск — более высокая латентность по сравнению с локальной DRAM и зависимость от прошивок и совместимости; это требует грамотной сегментации данных и регламентов эксплуатации. При корректной архитектуре CXL позволяет ускорить ввод новых сервисов, упростить масштабирование ИИ-контуров и in-memory систем и удержать стоимость инфраструктуры под контролем.
Servethehome, Lenovo express, Dell, ITELON
Вам может быть интересно


Обновляться ли до Windows Server 2025: сравнение с Windows Server 2022

Что такое MRDIMM (Multi-Capacity Rank Dual In-Line Memory Modules) и почему об этой памяти столько говорят
Подпишитесь на новости
Обратитесь к экспертам компании Itelon



Оцените статью и добавьте комментарий — будьте первым
Спасибо!
Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!