Top.Mail.Ru
1
Ваша корзина пуста. Перейти в каталог
Товар добавлен в корзину

NVIDIA L40S и Omniverse: от сцен OpenUSD к моделям мира с учётом законов физики

Опубликовано: 25 сентября 2025
#
1070
#
11 мин
#
0
#
0

Разнообразие всевозможных серверных GPU и GPU для рабочих станций иногда может сбивать с толку, но возникло оно не на пустом месте. Дело в том, что для каждой решаемой задачи есть наиболее подходящий инструмент и при выборе конкретной модели разумно ориентироваться на её возможности в контексте конкретного спектра решаемых задач. Научные и инженерные вычисления, обучение нейросетей, инференс, графический дизайн и медиа, VDI - все эти применения имеют свою специфику и приходится инвестировать некоторое время, чтобы обоснованно принять правильное решение, так как цена ошибки сейчас может оказаться значительной.

Например, знаменитый GPU Nvidia H100, отлично подходящий для обучения нейросетей, вовсе не умеет трассировку лучей и не пригоден для VDI. С другой стороны, L40/L40S оказывается в несколько раз менее производительным при работе с тензорными ядрами, но значительно быстрее при вычислениях с плавающей точкой с одинарной точностью (FP32). Однако, L40 совсем не предназначен для вычислений с двойной точностью (FP64), интенсивно используемых в инженерии, науке и высокопроизводительных компьютерах. Материал, представленный Вашему вниманию ниже, обозревает возможности и применимость перечисленных GPU на примере некоторых задач. Возможно, использованные программные пакеты сейчас в РФ не слишком популярны, тем не менее, приведённые примеры позволяют получить общее представление о различиях и позиционировании GPU.

L40S закрывает важный разрыв в экосистеме GPU для ЦОД. Пока ускорители для обучения ИИ, ориентированные исключительно на вычисления (например, Nvidia H100), выжимают максимум производительности, но не поддерживают аппаратное ускорение графики, традиционные профессиональные видеокарты, напротив, часто лишены требуемой для современных задач вывода ИИ-моделей и новых «ИИ-управляемых» графических приложений вычислительной мощности. За счёт такого позиционирования L40S особенно полезна для генерации синтетических данных, разработки мультимодальных моделей и сценариев Omniverse, где одновременно критичны и вычислительная, и графическая составляющие.

NVIDIA L40S-1.png

Сравнение GPU для ЦОД: L40, L40S, H100 80G PCIe

Характеристика

L40

L40S

H100 80G PCIe

Архитектура GPU

Ada Lovelace

Ada Lovelace

Hopper

Кристалл GPU

AD102

AD102

GH100

Ядра CUDA

18 176

18 176

14 592

Ядра Tensor

568 (4-е поколение)

568 (4-е поколение)

456

RT-ядра

142 (3-е поколение)

142 (3-е поколение)

Видеопамять

48 ГБ GDDR6 с ECC

48 ГБ GDDR6 с ECC

80 ГБ HBM2e

Пропускная способность памяти

864 ГБ/с

864 ГБ/с

2 ТБ/с

Шина памяти

384-бит

384-бит

5120-бит

Максимальное энергопотребление

300 Вт

350 Вт

350 Вт

Форм-фактор

двойной слот; высота 4,4″ × длина 10,5″ (≈ 112 × 267 мм)

двойной слот; 4,4″ × 10,5″ (≈ 112 × 267 мм)

двойной слот; 4,4″ × 10,5″ (≈ 112 × 267 мм)

Охлаждение

пассивное

пассивное

пассивное

Видеовыходы

4× DisplayPort 1.4a

4× DisplayPort 1.4a

Интерфейс PCIe

Gen4 ×16

Gen4 ×16

Gen5 ×16

Разъем питания

16-контактный

16-контактный

16-контактный

Поддержка vGPU

да

да

нет

Разделение GPU на экземпляры (MIG)

нет

нет

да

Поддержка NVLink

нет

нет

нет

Спецификации производительности L40, L40S, H100 80G PCIe

Метрика

Производительность L40<

Производительность 40S

Производительность H100

Производительность FP32

90,5 TFLOPS

91,6 TFLOPS

51,2 TFLOPS

Tensor Core TF32

362,1 TFLOPS

366 TFLOPS

756 TFLOPS

Tensor Core FP16

724 TFLOPS

733 TFLOPS

1 513 TFLOPS

Tensor Core FP8

1 448 TFLOPS

1 466 TFLOPS

3 026 TFLOPS

Пиковая INT8 Tensor (TOPS)

1 448 TOPS

1 466 TOPS

3 026 TOPS

Производительность RT-ядер

209 TFLOPS

212 TFLOPS

NVIDIA L40S против H100

Сопоставление спецификаций показывает разные инженерные подходы к L40S и H100. L40S основана на архитектуре Ada Lovelace и использует кристалл AD102, применяемый в старших рабочих графических адаптерах. Отсюда — 18 176 CUDA-ядер и высокая производительность в FP32, на которой держатся классический рендер и часть научных вычислений. H100, напротив, построена на архитектуре Hopper с кристаллом GH100, изначально спроектированным под задачи ИИ и HPC.

Ключевое отличие — конфигурация специализированных блоков. L40S оснащена 142 RT-ядрами (3-е поколение)и 568 Tensor-ядрами (4-е поколение). RT-ядра — аппаратное ускорение трассировки лучей, которого у H100 нет, поэтому L40S способна обеспечивать фотореалистичный рендер. У H100 Tensor-ядер меньше, но они быстрее и продвинутее; поддержка формата FP8 даёт серьёзное преимущество в «чистой» ИИ-производительности.

Компромисс заметен и в подсистемах памяти. H100 использует 80 ГБ HBM2e с пропускной способностью 2 ТБ/с— это необходимо, чтобы непрерывно «кормить» вычислительные блоки при обучении и выводе крупных моделей. L40S применяет 48 ГБ GDDR6 с 864 ГБ/с. Это меньше чем у H100, но более чем достаточно для загрузки больших 3D-сцен, высоких разрешений текстур и крупных моделей на вывод.

Набор функций подчёркивает назначение ускорителей. L40S имеет четыре DisplayPort 1.4a и развитую поддержку vGPU, что делает ее уместной для виртуальных рабочих мест, рендер-ферм и облачных графических сервисов. H100 без видеовыходов и vGPU компенсирует это технологией MIG, позволяющей делить один GPU на несколько изолированных экземпляров для параллельных вычислительных задач. Общие параметры — двухслотовый пассивный радиатор и потребление до 350 Вт (для L40S и PCIe-версии H100) — обеспечивают совместимость с широким рядом стандартных серверов.

Сравнение с флагманом H100 ясно показывает различие ролей. H100 остаётся лидером поколения по «сырой» скорости обучения ИИ, но это лишь часть картины. В линейке присутствует и L40 (без «S») с TDP 300 Вт против 350 Вт у L40S — близкий функционал при меньшем энергопотреблении.

NVIDIA L40S-2.png

Рассматриваемая модификация H100 — это исходная PCIe-версия на 80 ГБ с памятью HBM2e. Позже NVIDIA расширила линейку: появился вариант H100 NVL, фактически сменивший 80-гигабайтную PCIe-модель — он предлагает 94 ГБ памяти, более высокий TDP 400 Вт и поддержку NVLink для связки двух ускорителей. Семейство H100 также включает 8-GPU-конфигурации SXM, а также H200, который использует тот же графический кристалл, но обеспечивает повышенную производительность как в PCIe, так и в SXM-исполнении.

NVIDIA L40S-3.png

Различия между L40S и H100 — это стратегическое расхождение в подходах к дизайну GPU для ЦОД.

H100 — «чистый» вычислительный ускоритель, целиком оптимизированный под задачи ИИ и высокопроизводительных вычислений. Его цель — крупномасштабное обучение моделей, где во главе угла стоит максимальная вычислительная пропускная способность. От подсистемы памяти HBM2e с огромной шириной канала до специализированных Tensor-ядер — всё в этой карте подчинено самым требовательным сценариям обучения нейросетей.

L40S, напротив, — универсальный GPU, рассчитанный на многообразие задач: вывод ИИ-моделей, графически нагруженные рабочие процессы и развертывания NVIDIA vGPU. Да, L40S обеспечивает убедительную и экономически оправданную производительность на выводе ИИ-моделей, но ее основная сила — поддержка широкого спектра графических приложений и смешанных пайплайнов «графика + ИИ», под которые H100 изначально не предназначен.

Графически нагруженные рабочие процессы и профессиональные приложения

L40S раскрывает себя там, где одновременно нужны вычислительная мощность и продвинутый рендер. В 3D-рендеринге и анимации эта карта берёт на себя просчет сложных сцен: RT-ядра ускоряют трассировку лучей — то, чего у «чисто вычислительных» GPU попросту нет. Кинопроизводство и телевидение используют эти возможности для предвизуализации в реальном времени: режиссер и оператор видят фотореалистичные кадры с CGI прямо на площадке, что заметно сокращает сроки и расходы пост-продакшена.

Архитектурные и инжиниринговые компании задействуют L40S для реалистичной визуализации проектов и промдизайна: заказчики могут «пройтись» по будущему зданию или оценить детальный прототип изделия до начала физического производства. Профессиональные графические возможности карты делают ее оптимальной основой для CAD-станций, где инженерам одновременно требуются и ресурсы для сложных симуляций, и ускорение графики для плавной, детализированной работы в окнах моделей.

NVIDIA L40S-4.png

Медиа- и развлекательная индустрия. L40S используется в рендер-фермах для просчета финальных кадров анимации. Параллельно ее возможности vGPU позволяют организовать облачные творческие процессы: художники подключаются к мощным графическим рабочим местам удаленно. В студиях монтажа и пост-продакшена L40S задействуют для обработки эффектов в реальном времени, цветокоррекции и композитинга, где одновременно требуются и графическое ускорение, и значительные вычислительные ресурсы.

Виртуальная инфраструктура рабочих столов (VDI). Рынок VDI — ещё одно ключевое направление: технология vGPU в L40S позволяет делить ресурсы одного ускорителя между несколькими пользователями, предоставляя им графически ускоренные виртуальные рабочие столы. В корпоративной среде это делает профессиональную графику доступной без необходимости выделять по отдельному GPU на каждого сотрудника.

Эволюция к обучению ИИ с учетом физики

Ключевое — L40S предлагает возможности, которых у H100 нет вовсе. Главный отличитель — 142 RT-ядра третьего поколения, обеспечивающие трассировку лучей в реальном времени и фотореалистичный рендер. У H100 RT-ядер нет, графическое ускорение не поддерживается. Поэтому в сценариях, где требуются и вычисления для ИИ, и продвинутая графика, L40S — очевидный выбор.

NVIDIA L40S-5.png

Рост популярности ИИ-генерации 3D-моделей, цифровых двойников и рабочих процессов на Universal Scene Description (OpenUSD) делает различие между классами GPU все более критичным. Следующий рубеж в ИИ — не просто «еще больше языковых моделей», а модели мира, которые понимают физику, пространственные связи и поведение объектов. Для этого требуется переосмыслить сам подход к генерации обучающих данных.

Если традиционные ИИ-модели в основном опираются на флагманские вычислительные GPU NVIDIA, то обучение физически обоснованных моделей мира требует иного пути. Таким системам нужны массивы данных, которые отражают не только картинку, но и физические свойства, поведение света, взаимодействие материалов и геометрию сцены. Здесь ускорители класса L40S становятся ключевыми для масштабной генерации обучающих датасетов: их RT-ядра позволяют создавать физически корректные синтетические среды, на которых обучаются более сложные ИИ-модели.

Именно эта способность — продвинутый графический рендер на RT-ядрах — делает L40S оптимальным «двигателем» для NVIDIA Omniverse и широкой экосистемы ИИ, учитывающего физику.

Omniverse

Omniverse — это платформа разработки, объединяющая API, SDK и сервисы для создания приложений и рабочих процессов на базе Universal Scene Description (OpenUSD). Ее задача — создавать и связывать физически корректные, реалистичные в реальном времени 3D-миры. Это достигается за счет встраивания технологии NVIDIA RTX с фотореалистичным трассированием лучей прямо в промышленные и робототехнические симуляции. В этих сценариях L40S с мощными RT-ядрами обеспечивает необходимое аппаратное ускорение RTX-рендера, позволяя достоверно моделировать свет, материалы и физику.

Omniverse — не просто инструмент визуализации, а платформа для создания «физического ИИ» следующего поколения. На базе цифровых двойников можно моделировать сложные производственные объекты, тестировать целые парки роботов и проверять автономный транспорт в безопасной виртуальной среде до выхода в реальный мир. Критически важно, что такие высокоточные симуляции служат основой для генерации масштабных наборов физически корректных синтетических данных — ключевого ресурса для обучения мощных ИИ-моделей, которые затем исполняются на вычислительных GPU.

Синтетическая генерация движений манипуляции для робототехники

Прикладное ПО NVIDIA Isaac GR00T для синтетической генерации траекторий манипуляции задаёт готовый каркас обучения роботов и показывает, как RT-ядра L40S позволяют получать большие обучающие датасеты из минимального числа человеческих демонстраций. Такой конвейер снимает одну из главных проблем в робототехнике — долгий и дорогой сбор достаточного объема качественных данных для задач манипуляции.

NVIDIA L40S-6.png

Традиционное обучение роботов во многом строится на контролируемом или имитационном подходе: робот осваивает навыки, наблюдая и воспроизводя действия эксперта-оператора. Но «идеальные» демонстрации получить трудно, а сбор обширных и качественных датасетов в реальных условиях — процесс монотонный, долгий и дорогой. Даже опытному оператору требуется около одной минуты, чтобы записать одну демонстрацию требуемого качества - масштабирование упирается в значительные трудозатраты и риск ошибок.

NVIDIA L40S-7.png

Программа Isaac GR00T решает проблему дефицита данных за счет синтетики из физически корректных симуляций, резко ускоряя сбор. За пару часов человеческих демонстраций организации получают на порядки больше обучающих примеров.

Три ключевых компонента GR00T формируют единый конвейер генерации синтетических данных.

GR00T-Teleop. Опытный оператор управляет виртуальным роботом через устройства пространственных интерфейсов, например Apple Vision Pro. Демонстрации выполняются в фотореалистичных виртуальных сценах и фиксируют не только траектории движения, но и контекст среды с взаимодействием объектов. Apple Vision Pro передает данные о движениях рук в Isaac Lab, а назад на устройство поступает «погруженный» вид сцены — управление получается интуитивным и наглядным.

GR00T-Mimic. Записанные демонстрации масштабируются в крупные синтетические датасеты с помощью продвинутых методов симуляции. Исходные траектории используются как опорные, на их базе Isaac Lab генерирует дополнительные движения для задач манипуляции — как одно-рычажных, так и двуручных гуманоидных роботов. Ключевые точки размечаются, а интерполяция обеспечивает плавность и уместность сгенерированных траекторий.

GR00T-Gen. На базе NVIDIA Omniverse и Cosmos датасеты расширяются за счет 3D-апскейла и доменной рандомизации: варьируются фон, освещение и другие параметры сцены. Дополнительно изображения обогащаются через NVIDIA Cosmos Transfer, достигая уровня фотореализма, который снижает разрыв между симуляцией и реальностью.

NVIDIA L40S-8.png

Этот конвейер наглядно показывает специализированные и взаимодополняющие роли современных GPU для ЦОД. L40S с выделенными RT-ядрами выступает «строителем мира»: на стартовом этапе генерации данных она отвечает за физически корректный рендер, трассировку лучей в реальном времени и доменную рандомизацию, формируя фотореалистичную и разнообразную виртуальную среду.

Далее этот высокоточый виртуальный мир становится основой для следующего шага. Генеративные модели (включая решения в составе NVIDIA Cosmos) запускаются уже на вычислительных GPU класса H100, формируя финальные обучающие наборы. H100 использует реалистичную среду, созданную L40S, чтобы генерировать миллионы динамичных сценариев, учитывающих физику и пространственные связи.

Тесты производительности вывода ИИ

Ещё один частый сценарий для карт уровня L40S — экономичный вывод моделей. Чтобы оценить «реальные» возможности L40S по сравнению с H100, был проведён бенчмарк LLM в среде vLLM с использованием модели NVIDIA Open Reasoning Nemotron 14B (режим BF16, максимальная длина контекста 32 К токенов).

Результаты vLLM

H100 ожидаемо лидирует по скорости: его пропускная способность примерно в 4,2 раза выше, чем у L40S. Преимущество напрямую связано с удвоенной производительностью Tensor-ядер и более чем двукратной полосой памяти (2 ТБ/с против 864 ГБ/с).

Производительность vLLM: пропускная способность vs. одновременные запросы

NVIDIA L40S-9.png

Но если смотреть на «производительность за рубль», картина иная. L40S обычно стоит меньше трети цены H100, поэтому во многих сценариях вывода моделей оказывается более выгодной. Для сервисов, где не нужен абсолютный пик скорости, L40S часто дает лучший TCO.

Если прицельно посмотреть на линейную область производительности, L40S показывает вполне приемлемый уровень: обслуживает 16 одновременных запросов при TPOT ≈ 52 мс (Time Per Output Token) в рамках заданного SLO.

Производительность vLLM: P99 TPOT vs. одновременность запросов

NVIDIA L40S-10.png

Важный момент: вывод ИИ, особенно фаза декодирования при генерации текста, по своей природе упирается в пропускную способность памяти. На каждом новом токене модель снова и снова читает веса из памяти GPU, поэтому скорость памяти становится ключевым узким местом. Отсюда понятно, почему H100 с более высокой пропускной способностью памяти и усиленной производительностью Tensor-ядер демонстрирует больший вывод по скорости.

Однако там, где развертывание требует и вывода ИИ, и графического ускорения — например, реал-тайм-рендер с ИИ-эффектами или интерактивные приложения с ИИ-функциями — L40S фактически остается единственно подходящим вариантом.

Выводы

NVIDIA L40S и её преемники класса Blackwell RTX Pro 6000 занимают стратегическую нишу в современных ЦОД, где все чаще пересекаются требования к вычислениям для ИИ и к продвинутой графике. При том что H100 и B200 остаются безусловными лидерами в «чистых» задачах обучения и вывода, L40S выступает универсальным GPU, закрывающим разрыв между вычислительными ИИ-картами и традиционными решениями для профессиональной визуализации.

Сильные стороны L40S проявляются там, где одновременно необходимы вывод ИИ-моделей и графическое ускорение. 142 RT-ядра третьего поколения открывают сценарии, недоступные «чисто вычислительным» GPU вроде H100: от трассировки лучей в реальном времени в профессиональных пайплайнах до фотореалистичной генерации синтетических данных для обучения следующего поколения моделей. Такая двойная природа делает карту практической основой для проектов цифровых двойников, обучения ИИ с учетом физики и экосистемы Omniverse.

С экономической точки зрения L40S предлагает убедительную ценность для организаций, которым не требуется абсолютный пик производительности H100. При ориентировочной цене около одной трети от стоимости H100 L40S обеспечивает достойные показатели вывода и одновременно дает графические возможности, существенно расширяющие варианты развертывания в ЦОД. Для многих организаций такая комбинация выгодной стоимости и универсальности оказывается рациональнее, чем закупка раздельных решений для ИИ и графики.


Автор:

Команда пресейла ITELON

Источник:

StorageReview

Скопировать ссылку Ссылка Добавить в закладки В закладки

Оцените статью и добавьте комментарий — будьте первым

Ваша оценка*

Ваш комментарий
Имя*
Почта*

Ваш адрес не будет опубликован или добавлен в рассылку

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close

Спасибо!

Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!

Подпишитесь на новости

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close

Консультация эксперта

#
#

Импортозамещение

#
#
#

Вам может быть интересно

#

5 AI-нагрузок, которые можно выполнять на CPU

Современные ИИ-сценарии необязательно требуют дорогих GPU. В статье — 5 кейсов, где CPU справляется с AI-нагрузками не хуже, а иногда и лучше, чем видеокарты: от ML-классификации до рекомендательных систем и компьютерного зрения.

#
Обновлено: 1 октября 2025
#
6028
#
1
#
5
#

Обзор: Сервер Dell PowerEdge XE9680 — эталон производительности для задач ИИ

Ключевые особенности и конфигурации Dell PowerEdge XE9680 для ИИ-нагрузок.. Разбираем топологию, питание и охлаждение, а также практические плюсы для обучения и инференса.
Опубликовано: 22 сентября 2025
#
2101
#
0
#
0
#

Серверы Dell PowerEdge под GPU/FPGA/DPU и единый портфель ускорителей — быстрее к наглядной аналитике с AI

Обзор серверов Dell PowerEdge для ускоряемых нагрузок: совместимость с GPU/FPGA/DPU, ключевые модели (XE9680, XE9640, XE8640, R760xa), охлаждение (воздух/DLC), варианты интерконнектов и области применения — от LLM и VDI до HPC и реальной-временной аналитики.
Опубликовано: 17 сентября 2025
#
1204
#
0
#
0

Подпишитесь на новости

Обратитесь к экспертам компании Itelon

Email*

РКН не разрешает нам получать ваши персональные данные без активного согласия. Поставьте, пожалуйста, галочку и мы немедленно с вами свяжемся!

close