
Обзор: Сервер Dell PowerEdge XE7740: как устроена платформа для корпоративных задач ИИ
Содержание
- Аппаратный конструктив сервера Dell PowerEdge XE7740
- Топология PCIe-коммутации и потоки данных
- Разделение на CPU и GPU зоны в схеме питания
- Поколение процессоров Intel Xeon 6
- Intel Gaudi 3 в формате карт расширения - конкурентоспособный запуск моделей в промышленном масштабе
- Управление и корпоративная надежность в сервере Dell PowerEdge XE7740
- Производительность и результаты тестирования сервера Dell PowerEdge XE7740
- Для кого предназначен сервер Dell PowerEdge XE7740
- Заключение
Рынок ИИ-инфраструктуры развивается не по единому сценарию - он все заметнее расходится на два самостоятельных направления. С одной стороны - передовые обучающие кластеры для создания базовых моделей в сверхкрупном масштабе, завязанные на проприетарные межсоединения и ограниченный набор ускорителей. С другой - быстро растущий сегмент корпоративного применения моделей, где ИИ используется для обслуживания пользователей, обработки данных в реальном времени и получения измеримого бизнес-результата. Dell PowerEdge XE7740 изначально спроектирован именно под этот второй сценарий.
В основе XE7740 лежит ставка на диверсификацию аппаратной платформы. Вместо жесткой привязки к одной линейке ускорителей Dell предлагает систему, которую можно адаптировать под доступность компонентов, бюджет проекта и уровень готовности ИТ-инфраструктуры. XE7740 поддерживает широкий набор ускорителей PCIe Gen5, включая NVIDIA RTX PRO 6000, H100/H200, L40S, L4 и A16 - для организаций, которым важна совместимость с широкой экосистемой, а также Intel Gaudi 3 - для команд, которым нужен более экономичный и доступный путь к промышленному выводу моделей. Ускорители Gaudi 3 доступны уже сегодня, что позволяет переходить от проектирования к внедрению без тех задержек в закупке, которые нередко определяют стратегию выбора ускорителей.
По мере того как запуск моделей становится основным сценарием применения ИИ, все большее значение приобретают доступность решений и их ценовая модель. Большинство компаний не обучают модели предельного масштаба - в реальной эксплуатации решаются задачи вывода, обслуживания языковых моделей среднего размера, поддержки сценариев с дополнением генерации внешними данными и запуска систем компьютерного зрения. В этом контексте Gaudi 3 выглядит как один из наиболее экономичных современных вариантов для запуска моделей - с актуальной архитектурой, высокоскоростной памятью и масштабированием по Ethernet без ценового уровня, характерного для флагманских ускорителей под обучение. В составе XE7740 роль Gaudi 3 заключается не в вытеснении других вариантов, а в создании более устойчивой и экономически оправданной инфраструктуры для инференса моделей.
Не менее продуманной выглядит и сама платформа вокруг ускорителей. XE7740 построен на процессорах Intel Xeon 6, а в системах, ориентированных на запуск моделей, центральный процессор по-прежнему остается критически важным элементом. Большое число ядер и возросшая пропускная способность памяти создают необходимый запас для планирования задач, токенизации, предварительной обработки данных и оркестрации - то есть для операций, которые напрямую влияют на путь прохождения запроса. Фронтальное NVMe-хранилище E3.S дополнительно поддерживает локальную подачу данных и вынос кэша ключей и значений, снижая нагрузку на ускорители и повышая общую эффективность системы. Такой баланс показывает, что производительность вывода определяется всей архитектурой сервера, а не только установленными ускорителями.
XE7740 спроектирован и с расчетом на последовательное масштабирование. Начать можно с умеренной конфигурации - например, с двумя или четырьмя ускорителями - и получать практический результат без полного заполнения шасси. По мере роста нагрузки та же платформа позволяет либо наращивать ресурсы внутри одного сервера, либо переходить к распределенному инференсу моделей. Поддержка восьми слотов PCIe Gen5 x16 с выделенной пропускной способностью для скоростных сетевых подключений позволяет использовать XE7740 как строительный блок для кластеров масштабируемого вывода. Дополнительная поддержка DPU еще больше расширяет эту гибкость, вынося сетевые и коммуникационные задачи по мере развития инфраструктуры.
Аппаратный конструктив сервера Dell PowerEdge XE7740
Две зоны в архитектуре - раздельная компоновка CPU и GPU
Одно из наиболее заметных инженерных решений в XE7740 - физическое разделение системы на две независимые тепловые и силовые зоны. Верхняя секция высотой 1U отведена под процессорную зону, где размещены оба процессора Xeon 6, все 32 слота DIMM, подсистема хранения и модуль управления DC-SCM. Для охлаждения процессорной зоны используются четыре пары высокопроизводительных модулей размером 40×40×56 мм с воздушным потоком 47,4 CFM.
Нижняя секция высотой 3U представляет собой зону ускорителей, где размещены все слоты под карты ускорения с собственной выделенной системой охлаждения, а также плата PCIe Base Board, задние слоты расширения PCIe и подключение OCP NIC. В этой зоне используются двенадцать более крупных высокопроизводительных вентиляторов размером 60×60×56 мм с существенно большей производительностью - до 122,2 CFM на каждый вентилятор, что заметно выше показателей вентиляторов процессорной зоны. Все вентиляторы поддерживают горячую замену. Такой двухзонный подход к охлаждению позволяет изолировать тепловую нагрузку ускорителей с TDP до 600 Вт на карту, не ухудшая охлаждение процессоров и памяти, и наоборот, в рамках стандартной 19-дюймовой стойки.
Dell уделила в XE7740 особое внимание оптимизации воздушного потока. Системы с высокой плотностью ускорителей неизбежно требуют большого объема внутренней кабельной разводки, включая линии дополнительного питания GPU, сигнальные кабели PCIe между платой HPM и PBB, а также подключения платы вентиляторов. В XE7740 эти кабели проложены вдоль боковых стенок шасси с использованием специальных кронштейнов и защитных кабельных кожухов. Каждый кабель выполнен точно по необходимой длине - без лишних петель и избыточных жгутов внутри системы. За счет выноса кабельной разводки из центрального канала охлаждения конструкция сохраняет прямой воздушный поток спереди назад и снижает сопротивление в обеих зонах охлаждения - процессорной и ускорительной.
В шасси, рассчитанном на установку до восьми ускорителей по 600 Вт, даже небольшие препятствия на пути воздушного потока могут формировать локальные зоны перегрева и вынуждать вентиляторы работать на более высоких оборотах, увеличивая и энергопотребление, и акустическую нагрузку. Подход Dell к кабельной разводке сохраняет центральную часть шасси свободной, обеспечивая прямой и беспрепятственный поток воздуха к тем компонентам, для которых это критично.
Топология PCIe-коммутации и потоки данных
Подсистема PCIe в XE7740 построена вокруг четырех коммутаторов PCIe Gen5 на плате PBB - PCIe Base Board, обозначенных как SW1-SW4. Именно они формируют основу архитектуры ввода-вывода системы, связывая ускорители, сетевые подключения и подсистему хранения с двумя процессорами Xeon 6 в рамках четко организованной топологии.
16 внутренних слотов под ускорители разделены на два блока по восемь, при этом каждый блок обслуживается парой PCIe-коммутаторов, каждый из которых подключен к своему процессору. Внутри каждого блока соседние двухслотовые позиции чередуются между двумя коммутаторами. Со стороны CPU0 коммутатор SW1 обслуживает слоты ускорителей 21 и 25, а также задние PCIe-слоты 8 и 9, тогда как SW2 обслуживает слоты 23 и 27, а также задние PCIe-слоты 6 и 7. Со стороны CPU1 коммутатор SW3 обслуживает слоты 29 и 33, а также задние PCIe-слоты 3 и 4, тогда как SW4 обслуживает слоты 31 и 35, а также задние PCIe-слоты 1 и 2.
Таким образом, каждый домен CPU включает четыре двухслотовые позиции под ускорители, четыре задних слота под сетевые адаптеры и I/O-модули, а также четыре из восьми фронтальных отсеков E3.S NVMe. Такая топология коммутаторов напрямую влияет на потоки данных, особенно в сценариях с RDMA. Поскольку каждый коммутатор одновременно обслуживает и ускорители, и задние сетевые слоты, ускоритель и сетевой адаптер, подключенные к одному коммутатору, могут выполнять RDMA-обмен внутри самой коммутационной среды. В этом случае данным не требуется проходить через корневой комплекс процессора, а значит, исключается промежуточная буферизация через CPU, которая обычно возникает при взаимодействии PCIe-устройств, подключенных к разным корневым портам. Это снижает задержки, уменьшает нагрузку на пропускную способность памяти процессора и освобождает вычислительные ресурсы CPU для других задач.
Обмен данными внутри домена одного процессора между двумя его коммутаторами проходит через корневой комплекс CPU, но остается в пределах этого сокета. При взаимодействии между двумя процессорами трафик уже должен проходить через линии UPI, связывающие оба Xeon 6. Процессор 6787P поддерживает четыре линии UPI 2.0 со скоростью 24 GT/s каждая, что обеспечивает высокий межсокетный ресурс. Однако обмен между ускорителем, подключенным к группе коммутаторов CPU0, и сетевым адаптером на стороне CPU1 неизбежно будет сопровождаться более высокой задержкой по сравнению с передачей внутри одного коммутатора или в пределах одного сокета.
Разделение на CPU и GPU зоны в схеме питания
Архитектура питания XE7740 повторяет логику его теплового разделения и построена по не совсем типичной схеме. Система поддерживает до восьми блоков питания с горячей заменой, распределенных между двумя зонами: в зоне CPU - процессорной - размещаются блоки питания 1 и 2, а в зоне GPU - зоне ускорителей - блоки питания с 3 по 8.
Для поддержания питания BMC и дежурного режима системе требуется как минимум по одному блоку питания в каждой зоне. Если во время работы одна из зон теряет входное питание AC, сервер немедленно отключается, чтобы исключить риск потери данных. Несмотря на физическое и электрическое разделение, обе зоны взаимозависимы с точки зрения работы системы. Для полной отказоустойчивости Dell рекомендует схему 1+1 для процессорной зоны и 3+3 для зоны ускорителей, то есть в полностью резервируемой конфигурации должны быть установлены все восемь отсеков PSU.
Поколение процессоров Intel Xeon 6
В основе XE7740 установлены два процессора Intel Xeon 6 6787P - старшие модели серии Xeon 6700P. Они построены на архитектуре Granite Rapids с использованием техпроцесса Intel 3 и обеспечивают по 86 производительных ядер и 172 потока на сокет при TDP 350 Вт, базовой частоте 2,0 ГГц и ускорении до 3,8 ГГц.
Для ИИ-инфраструктуры Granite Rapids особенно важен сочетанием высокой плотности ядер и развитой подсистемы памяти. Каждый процессор 6787P поддерживает восемь каналов DDR5 с частотой до 6400 MT/s. В двухсокетной конфигурации XE7740 с 32 модулями DIMM система может быть оснащена общим объемом памяти до 4 ТБ, что дает заметный запас для вывода моделей и сопутствующих задач обработки данных.
Емкость и пропускная способность памяти критичны для ИИ-нагрузок, особенно при использовании выноса части KV cache за пределы памяти ускорителя. По мере роста длины контекста в больших языковых моделях объем KV cache увеличивается пропорционально и может занимать значительную часть памяти ускорителя. Перенос части KV cache в системную память или быстрое локальное хранилище позволяет эффективнее использовать HBM для активных вычислений, а в сценариях с многократными диалогами способен сократить время до выдачи первого токена.
Стоит учитывать и тензорные блоки AMX в составе Xeon 6, которые берут на себя заметную часть работы на стороне CPU. Речь идет о предварительной обработке данных, токенизации и гибридных сценариях вывода, где задействуются матричные операции. Это особенно полезно в связке с такими средами, как SGLang, где CPU участвует в управлении KV cache на базе radix-tree-подхода и в планировании выполнения с минимальными накладными расходами.
Intel Gaudi 3 в формате карт расширения - конкурентоспособный запуск моделей в промышленном масштабе
Intel Gaudi 3 - флагманский ИИ-ускоритель компании, вышедший на рынок в конце 2024 года. Intel продвигает это решение не столько как прямую альтернативу самым дорогим ускорителям для обучения моделей в дата-центрах, сколько как платформу с выраженным акцентом на сегмент промышленного вывода. Именно на задачи инференса и сделана основная ставка Gaudi 3.
Запуск моделей на базе трансформеров в большинстве популярных LLM сегодня в значительной степени упирается в подсистему памяти. На этапе декодирования при авторегрессионной генерации модель формирует токены по одному, и для каждого нового токена заново обращается к весам модели и записям KV cache. В таких условиях ограничивающим фактором становится не столько вычислительная часть, сколько пропускная способность памяти - то есть скорость, с которой ускоритель может передавать данные из HBM в вычислительные блоки.
Gaudi 3 оснащен 128 ГБ памяти HBM2e с пропускной способностью 3,7 ТБ/с. С архитектурной точки зрения ускоритель построен по техпроцессу TSMC 5nm и использует двухкристальную компоновку: два одинаковых вычислительных кристалла объединены высокоскоростным интерконнектом и для программной среды выглядят как единое устройство. Вычислительная часть организована в четыре блока DCORE, которые суммарно включают 8 MME, 64 TPC и 96 МБ локальной SRAM на кристалле с очень высокой внутренней пропускной способностью. Дополнительно ускоритель интегрирует 14 специализированных медиадекодеров для H.265, H.264, JPEG и VP9, что ускоряет предварительную обработку визуальных данных в мультимодальных сценариях.
Во многих наиболее продвинутых открытых моделях, выходящих сегодня, уже используются либо нативное обучение в FP8, либо смешанные схемы, где сочетаются веса в FP8 - в том числе E4M3 - и BF16. Для таких сценариев Gaudi 3 предлагает полноценное аппаратное ускорение FP8 на уровне 8 Matrix Multiplication Engine и 64 Tensor Processor Core, обеспечивая до 1,8 PFLOPS вычислительной производительности в FP8 и BF16.
Gaudi 3 также включает встроенную сетевую архитектуру RoCEv2 на базе 24 портов 200 GbE в OAM-исполнении, интегрированную на уровне самого ускорителя. Однако PCIe-вариант карты расширения, используемый в XE7740, реализует эти сетевые возможности иначе и не выводит их в том же виде, что OAM-версия. При этом PCIe-карты поддерживают объединение до четырех ускорителей для более быстрого обмена данными между ними.
Управление и корпоративная надежность в сервере Dell PowerEdge XE7740
Серверы Dell PowerEdge давно воспринимаются как зрелая платформа для корпоративной эксплуатации, где на первый план выходят надежность, ремонтопригодность и предсказуемое администрирование. XE7740 продолжает эту линию, а в текущем поколении Dell PowerEdge G17 дополнительно усилила и аппаратное управление, и защиту платформы.
iDRAC 10
XE7740 поставляется с iDRAC 10 - следующим поколением встроенного контроллера управления Dell, которое стало заметным шагом вперед по сравнению с iDRAC 9. В отличие от обычного обновления прошивки, здесь речь идет уже о новом аппаратном исполнении: iDRAC 10 реализован в виде модуля Data Center Secure Control Module по стандарту OCP DC-MHS. Контроллер оснащен четырьмя ядрами по 1 ГГц с 64-разрядной архитектурой и 2 ГБ памяти DDR4, что обеспечивает более высокую скорость отклика и лучшую производительность операций управления.
С точки зрения безопасности iDRAC 10 получил заметное усиление. Платформа поддерживает более стойкие криптографические алгоритмы, включая аутентификацию на базе SHA-384 и SHA-512, а также шифрование AES-256. Внутри самого контроллера реализован выделенный защищенный контур, который отвечает за функции киберустойчивости, включая подтверждение подлинности устройства и аппаратный Root of Trust. Такой подход обеспечивает криптографическую проверку BIOS, iDRAC и компонентных прошивок до их запуска, снижая риски подмены микрокода и атак на цепочку поставок.
Функция Secured Component Verification позволяет дополнительно проверить, что система, отгруженная с завода Dell, пришла в точной конфигурации, которая была заказана, без отклонений по составу компонентов. Обновленная прошивка iDRAC 10 также получила переработанный модульный интерфейс, делающий повседневное администрирование более удобным.
OpenManage Enterprise
Для управления инфраструктурой в масштабе всего парка Dell предлагает OpenManage Enterprise - централизованную платформу для мониторинга, обновления прошивок и управления конфигурациями серверов PowerEdge. Для ИИ-серверов особенно важно, что OpenManage Enterprise и iDRAC позволяют видеть параметры ускорителей в едином контуре управления - энергопотребление, температуру, загрузку и другие рабочие показатели без постоянного перехода к отдельным инструментам поставщиков ускорителей. Для организаций, которые эксплуатируют десятки или сотни узлов XE7740 в кластере вывода моделей, такой единый уровень управления заметно упрощает сопровождение и повышает управляемость среды.
Производительность и результаты тестирования сервера Dell PowerEdge XE7740
Конфигурация сервера XE7740
-
2 x Intel Xeon 6787P, 86 ядер, 2,00 ГГц
-
2 ТБ DDR5 - 32 x 64 ГБ, 5200 MT/s
-
4 x Intel Gaudi 3 PCIe AI Accelerator с 128 ГБ HBM на карту
-
Ubuntu 24.04.5 Server
Производительность vLLM в онлайн-обслуживании
Для оценки возможностей Dell XE7740 с ускорителями Intel Gaudi 3 было проведено тестирование производительности vLLM в сценарии онлайн-обслуживания на ряде популярных моделей, различающихся по архитектуре, числу параметров и формату точности. Каждая модель проверялась в трех профилях нагрузки при росте числа одновременных запросов от 1 до 128.
Запуск LLM состоит из двух разных этапов. Сначала идет этап предварительной обработки входа, когда все входные токены обрабатываются параллельно до начала генерации ответа. Это вычислительно нагруженный участок, производительность которого растет вместе с длиной входа. Затем начинается этап генерации, где токены создаются по одному. На каждом шаге система заново обращается к весам модели в памяти, поэтому ограничивающим фактором здесь чаще становится пропускная способность памяти, а не объем вычислений на токен.
Эти два этапа нагружают разные части ускорителя, поэтому в тестах использовались три профиля нагрузки с разным балансом между ними:
-
Equal (1024 входных / 1024 выходных токена) - сбалансированный сценарий, близкий к обычному диалогу.
-
Prefill Heavy (8192 / 1024) - профиль с длинным входом, характерный для генерации с дополнением внешними данными и суммаризации больших контекстов.
-
Decode Heavy (1024 / 8192) - профиль с длинной генерацией, где итоговая производительность сильнее зависит от устойчивой пропускной способности памяти.
В этом разделе используются две основные метрики. Первая - суммарная пропускная способность по токенам, измеряемая в токенах в секунду, которая показывает общий потенциал системы под нагрузкой. Вторая - TTFT, время до выдачи первого токена, то есть задержка между отправкой запроса и появлением первого сгенерированного токена. Поскольку до начала генерации система должна полностью завершить обработку входа, TTFT напрямую связан с вычислительной производительностью ускорителя. По этой причине профиль Prefill Heavy в сочетании с TTFT особенно полезен для оценки чистой вычислительной мощности Gaudi 3: системе нужно обработать все 8192 входных токена, прежде чем появится первый ответ.
Напротив, профиль Decode Heavy в большей степени проверяет подсистему памяти, так как при длинной генерации сервер должен поддерживать высокий темп вывода на протяжении тысяч токенов. Для интерактивных приложений TTFT остается критически важным показателем: даже если система демонстрирует высокую пропускную способность при пакетной обработке, избыточная задержка до первого токена делает работу менее отзывчивой. В промышленной эксплуатации важны обе метрики.
Отдельно стоит отметить результаты в FP8. Хотя Intel Gaudi 3 поддерживает аппаратное ускорение FP8 и теоретически этот формат должен обеспечивать более высокую производительность по сравнению с BF16, в проведенных тестах показатели FP8 оказались ниже. Причина связана не с ограничениями самого ускорителя, а с текущей зрелостью программной реализации FP8 в ветке vLLM для Gaudi. Использованная версия - vLLM installer 2.7.1 в составе Gaudi Docker 1.22.2 - пока не полностью оптимизирует такие сценарии. У Intel уже есть новая, модульная версия vLLM в стадии бета-тестирования, которая потенциально может улучшить эти результаты.
Llama 3.1 8B Instruct
Llama 3.1 8B Instruct - это плотная трансформерная модель Meta, в которой при генерации каждого токена задействуются все параметры. При объеме 8 млрд параметров она относится к числу относительно компактных открытых моделей. Такой класс особенно востребован в повседневных прикладных сценариях - краткое суммирование документов, подготовка писем и сообщений, ответы на типовые вопросы и работа простых чат-решений, где приоритетом становятся скорость отклика и экономичность, а не сложные многошаговые рассуждения.
Эта модель тестировалась в двух конфигурациях - TP1 с одним ускорителем и TP4 со всеми четырьмя ускорителями Gaudi 3. В режиме TP1 модель показывает около 8 000 tok/s совокупной пропускной способности при 128 одновременных запросах в сбалансированном профиле нагрузки, плавно масштабируясь от примерно 250 tok/s при одном запросе. В сценарии с длинным входом проявляется особенно заметный эффект: если TP1 достигает пика на уровне около 7 000 tok/s, то TP4 поднимается выше 17 900 tok/s при 128 одновременных запросах, эффективнее используя дополнительные ускорители для обработки большого входного контекста.
С точки зрения задержки при единичном обращении TP1, напротив, показывает более низкий TTFT при малой конкуренции - 67 мс против 98 мс у TP4. Это отражает накладные расходы на координацию между четырьмя ускорителями в случае модели, которая без затруднений размещается на одном. Однако по мере роста нагрузки TP4 начинает уверенно выигрывать. При 128 одновременных запросах TP4 удерживает TTFT на уровне около 2 секунд в сбалансированном и decode-ориентированном профилях, тогда как у TP1 этот показатель увеличивается до 3,7 и 6,6 секунды соответственно. Наиболее заметен разрыв в сценарии с длинным входом: при 128 запросах TTFT у TP1 достигает почти 47 секунд, тогда как TP4 удерживает его примерно на уровне 11 секунд.
Llama 3.1 70B Instruct
Llama 3.1 70B Instruct - более крупная плотная модель в семействе Meta Llama 3.1. При объеме 70 млрд параметров она обеспечивает заметно более высокий уровень следования инструкциям и лучшую многоязычную работу по сравнению с версией 8B. Модели такого масштаба особенно подходят для более ресурсоемких агентных сценариев - например, для интеллектуальной поддержки клиентов, многошаговых исследовательских помощников, сложного анализа документов и задач, где требуется удерживать связный контекст на длинной дистанции взаимодействия.
Эта модель тестировалась в конфигурациях TP2 и TP4. Разница в пропускной способности между ними очень заметна. При 128 одновременных запросах TP4 обеспечивает около 3 600 tok/s в сбалансированном профиле нагрузки и достигает почти 4 600 tok/s в сценарии с длинным входом. Это примерно в 4,4 и 4,6 раза выше показателей TP2, который в этих же режимах выходит на максимум около 816 tok/s и 1 005 tok/s соответственно. Даже в decode-ориентированном профиле TP4 достигает примерно 1 960 tok/s против 593 tok/s у TP2.
По показателю TTFT конфигурация TP2 заметно теряет эффективность под нагрузкой в профиле с длинным входом: при 128 одновременных запросах значение вырастает до 496 секунд, что делает такой режим практически непригодным для интерактивных приложений. TP4 снижает этот показатель примерно до 73 секунд. В сбалансированном и decode-ориентированном профилях TP4 удерживает TTFT на уровне около 10 секунд при 128 запросах, тогда как TP2 достигает соответственно 50 и 29 секунд. При низкой конкуренции TP4 также быстрее выдает первый токен - около 160 мс в сбалансированном сценарии против 486 мс у TP2.
Qwen3 Coder 30B-A3B Instruct
Qwen3 Coder 30B-A3B - одна из самых популярных моделей для локального вывода в задачах программирования, построенная на архитектуре Mixture-of-Experts - смеси экспертов. В отличие от плотных моделей, где в каждом проходе задействуются все параметры, MoE-модели направляют каждый токен только через небольшое подмножество специализированных экспертных сетей. Qwen3 Coder сохраняет полный размер модели на уровне 30 млрд параметров в точности BF16, но при генерации каждого токена активирует только 3 млрд параметров. Такая разреженная схема активации позволяет получать качество, характерное для значительно более крупной сети, при существенно меньших вычислительных затратах на токен, если аппаратная платформа эффективно справляется с маршрутизацией. На практике модель хорошо подходит для повседневной помощи в разработке - генерации типового кода, дополнения функций, пояснения программного кода, написания модульных тестов и других стандартных задач, где важна специализация на программировании без избыточно тяжелых сценариев рассуждения.
Были протестированы три конфигурации: TP1 BF16, TP1 FP8 и TP4 BF16. При 128 одновременных запросах лучший результат показывает TP4 BF16 - около 14 300 tok/s в сценарии с длинным входом. Это самый высокий показатель пропускной способности среди всех моделей, участвовавших в тестовой серии. TP1 BF16 в этом же профиле достигает примерно 6 900 tok/s, а TP1 FP8 - около 3 360 tok/s.
В сбалансированном профиле разрыв становится меньше: TP4 выходит на 6 073 tok/s, TP1 BF16 - на 5 718 tok/s, а TP1 FP8 - на 2 101 tok/s. Как уже отмечалось в комментарии по FP8 выше, более низкие результаты FP8 здесь связаны с текущим состоянием программной реализации Intel vLLM, а не с аппаратным ограничением ускорителя.
TTFT остается низким благодаря разреженной схеме активации. В конфигурации TP4 BF16 задержка до первого токена составляет около 140 мс при нагрузке от одного пользователя и удерживается примерно на уровне 2,6 секунды при 128 одновременных запросах в сбалансированном профиле. TP1 BF16 показывает сопоставимый результат при низкой конкуренции - 106 мс, но под полной нагрузкой увеличивается до 3,1 секунды. В сценарии с длинным входом различия между конфигурациями становятся еще заметнее: TP4 достигает около 18 секунд при 128 запросах, TP1 BF16 - 57 секунд, а TP1 FP8 - 72 секунд.
Qwen3 235B-A22B Thinking
Самая крупная модель в тестовой серии - Qwen3 235B-A22B Thinking - представляет собой масштабную MoE-модель для задач рассуждения с общим объемом 235 млрд параметров и активацией 22 млрд параметров на токен. Помимо самого масштаба, модель включает встроенные механизмы пошагового рассуждения, позволяющие разбирать сложные задачи по этапам перед выдачей ответа, хотя это и увеличивает число токенов на этапе генерации. Такой подход делает модель особенно подходящей для наиболее сложных сценариев - продвинутой генерации и отладки кода, решения математических задач, многошаговых логических рассуждений и сложных агентных процессов, где точность важнее максимальной скорости. Для запуска этой модели требуется конфигурация TP4, а тестирование проводилось в двух вариантах точности - BF16 и FP8.
BF16 во всех тестах уверенно превосходит FP8. При 128 одновременных запросах BF16 достигает примерно 2 750 tok/s в сценарии с длинным входом и 2 500 tok/s в сбалансированном профиле, тогда как FP8 показывает около 1 784 tok/s и 516 tok/s соответственно. Кроме того, вариант FP8 в decode-ориентированном сценарии сталкивался с тайм-аутами при более высоком уровне конкуренции - начиная с 32 запросов и выше.
По показателю TTFT конфигурация BF16 стартует примерно с 340 мс при одном сбалансированном запросе и масштабируется до около 6,9 секунды при 128 одновременных запросах. Для модели такого масштаба это хороший уровень отзывчивости. FP8 на протяжении теста показывает примерно вдвое более высокую задержку - от 615 мс на старте до около 11,2 секунды при полной нагрузке. Наиболее тяжелым остается сценарий с длинным входом: здесь TTFT у BF16 увеличивается до 168 секунд, а у FP8 - до 80 секунд при 128 запросах.
Для кого предназначен сервер Dell PowerEdge XE7740
Спрос на инфраструктуру для запуска моделей не снижается. Независимо от того, используются ли модели внутри компании для ускорения работы команд разработки, встраиваются ли ИИ-функции в клиентские продукты или запускаются круглосуточные контуры автоматизации, потребность в вычислительных ресурсах продолжает расти. Вместе с этим возникает и хорошо знакомое ограничение - сроки закупки. Поставки популярных ускорителей могут растягиваться на месяцы, задерживая запуск уже утвержденных и укомплектованных проектов.
В конфигурации с Intel Gaudi 3 платформа XE7740 напрямую отвечает на это ограничение. Ускорители Gaudi 3 уже доступны, а Intel вместе с Dell предлагают проверенные варианты ИИ-серверов с GPU, позволяющие быстрее переходить от поставки оборудования к запуску инференса в рабочей среде.
Дополнительно возможность пилотной оценки в реальной инфраструктуре снижает риск внедрения, поскольку позволяет проверить производительность на собственных данных, нагрузках и внутренних контурах до масштабного внедрения. Такое сочетание доступности, быстрого выхода на практический результат и более контролируемого риска делает конфигурацию с Gaudi 3 особенно привлекательной для организаций, которым вычислительные ресурсы под инференс нужны уже сейчас. Также на предварительном этапе такое тестирование можно запускать и на компактной локальной платформе с 112Gb vRAM - например, на HP Z2 Mini G1a, если требуется быстро проверить сценарий и модель до перехода к серверному внедрению.
При этом XE7740 не является платформой под один единственный тип ускорителя. В рамках подхода Dell к аппаратной гибкости тот же сервер может комплектоваться разными вариантами ускорителей, а выбор конфигурации определяется конкретной нагрузкой. Например, конвейеры обработки видео и потокового перекодирования хорошо сочетаются с NVIDIA L4, а XE7740 поддерживает до 16 однослотовых ускорителей такого класса наряду с отдельными высокоскоростными сетевыми подключениями PCIe Gen5 x16. Для организаций, которые ведут смешанные ИИ-нагрузки между подразделениями, это позволяет стандартизовать инфраструктуру на одном шасси XE7740 и варьировать только тип ускорителей под конкретный сценарий, упрощая сопровождение парка серверов и одновременно точнее подбирая вычислительные ресурсы под задачу.
На уровне внутренних сервисов это могут быть чат-ассистенты для сотрудников, обработка обращений, суммаризация документов и писем. В контурах RAG - поиск и генерация ответов по базе знаний, договорам, инструкциям, сервисной документации и внутренним регламентам. В мультимодальных сценариях и видео задачах - анализ видеопотоков, поиск событий в архивах наблюдения, контроль операций на площадках и разбор визуальных данных вместе с текстом. В смешанных ИИ-нагрузках на одной платформе XE7740 можно одновременно запускать модели для клиентской поддержки, корпоративного поиска, автоматизации разработки и ИТ-операций, выбирая конфигурацию ускорителей под конкретную нагрузку.
Заключение
Dell PowerEdge XE7740 спроектирован с учетом реальных требований корпоративного инференса. Двухзонная система охлаждения, продуманная PCIe-топология, развитая подсистема памяти и возможности масштабирования формируют платформу, рассчитанную на длительную работу под промышленной нагрузкой. Это не набор отдельных инженерных решений, а целостная архитектура для среды, где инференс должен работать непрерывно, предсказуемо масштабироваться и без лишних усложнений встраиваться в существующую инфраструктуру ЦОД. Проведенное тестирование показывает, что в связке с Intel Gaudi 3 платформа уже сегодня обеспечивает рабочий уровень производительности для плотных и MoE-моделей, демонстрируя понятное поведение при масштабировании и уверенную эффективность в память-зависимых сценариях. Программная среда продолжит развиваться, но архитектурная основа решения уже выглядит зрелой и устойчивой.
Не менее важно, что XE7740 задает понятную долгосрочную модель построения корпоративной ИИ-инфраструктуры. На одной платформе можно стандартизовать шасси, управление и подход к развертыванию, сохраняя возможность со временем менять стратегию по ускорителям под новые задачи. По мере того как модели становятся крупнее, сценарии использования шире, а инференс глубже встраивается в бизнес-процессы, потребность в стабильной и адаптируемой инфраструктуре будет только расти. PowerEdge XE7740 хорошо соответствует этой траектории, предлагая сбалансированную архитектуру, зрелые средства эксплуатации и достаточный запас для дальнейшего расширения корпоративных ИИ-сред.
StorageReview, ITELON
Вам может быть интересно


Два подхода к GPU NVIDIA H100 - PCIe в R760xa и SXM в XE9680

Контроллер Dell PERC13: новый уровень аппаратного NVMe-RAID для эпохи ИИ
Подпишитесь на новости
Обратитесь к экспертам компании Itelon



Оцените статью и добавьте комментарий — будьте первым
Спасибо!
Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!