
Маленькая станция, большая модель: как 128 ГБ памяти превращаются в локальный ИИ на 120 млрд параметров

В предыдущем обзоре блога разбиралась компактная рабочая станция HP Z2 Mini G1a и сценарий запуска крупной языковой модели локально - без дискретной видеокарты. Прямо накануне Нового года к нам в демо-лабораторию приехала эта рабочая станция. Поставка заняла около 6 недель - примерно 4 недели ушло на производство и еще около 2 недель на транспортировку и таможенную очистку. После получения устройства логичным шагом для нас стал повтор эксперимента с запуском модели.
Внутри то, что важно именно для задач локального ИИ:
-
Процессор AMD Ryzen AI MAX+ Pro 395 - 16 ядер, частоты до 5,1 ГГц
-
Интегрированная графика AMD Radeon 8060S
-
Общая память до 128 ГБ LPDDR5X, заявлена поддержка ECC и скорости до 8000 МТ/с
-
Возможность выделять значительный объем общей памяти под видеопамять - вплоть до 112 ГБ под графику, что критично для больших моделей
-
Сетевые и периферийные интерфейсы из практического набора для офиса и лаборатории: 10GbE, USB-C с высокой пропускной способностью, опциональные варианты (в том числе для стойки)
Отдельно стоит подчеркнуть формат - это маленькая и тихая машина, которая по смыслу ближе к "кирпичику для стойки", чем к классическому системному блоку.
В тесте используется gpt-oss-120b - открытая модель OpenAI на 120 млрд параметров, которая умеет неплохо рассуждать. Внутри у нее устроено так, что при генерации ответа одновременно "работает" не вся модель целиком, а только нужная часть - поэтому нагрузка ниже, чем можно ожидать по числу параметров.
Главное, что делает запуск возможным на компактной рабочей станции, - квантование: веса модели хранятся в более компактном виде. Для gpt-oss в Ollama используется формат MXFP4, из-за чего модель занимает заметно меньше памяти, но при этом сохраняет приемлемое качество ответов.
На скриншоте видно главное:
-
вычислительная нагрузка держится на графике (высокая загрузка compute), а не на центральном процессоре
-
занята большая доля выделенной под графику памяти (порядка десятков гигабайт), при этом температура остается в рабочей зоне
-
это демонстрирует практический смысл общей памяти и возможности выделять ее под видеопамять: модель реально помещается и работает без дискретной видеокарты
Как итог - локальный запуск крупной модели становится задачей не только для "больших" рабочих станций с профессиональными ускорителями, но и для компактных решений при правильной конфигурации памяти. Этот же тезис подтверждают и независимые обзоры: 128 ГБ общей памяти и до 112 ГБ, доступных как видеопамять, позволяют запускать GPT-OSS 120B на Z2 Mini G1a без дискретной графики.
Один компактный узел решает задачи команды или пилота. Но когда появляется несколько команд, больше данных и больше пользователей, упираются в простую физику - память, параллельность, доступность.
Объединение нескольких одинаковых узлов в кластер дает бизнесу три преимущества:
-
Масштабирование "по мере роста": добавляется еще один узел - растет совокупная вычислительная мощность и доступная память под модели
-
Разделение задач: один узел обслуживает внутренний чат-помощник, другой - обработку обращений, третий - тестовую среду разработки
-
Надежность сервиса: при обслуживании или сбое одного узла сервис не обязательно останавливается полностью, если сценарий продуман заранее
Прагматичный бонус - предсказуемая стоимость владения. Вместо разовой крупной закупки "на вырост" можно двигаться небольшими шагами, привязывая расширение к реальной нагрузке и пользователям.
Если вам важно понять, где заканчивается экономическая эффективность “рабочей станции” и когда рациональнее переходить на датацентровые ускорители, мы подготовили отдельное сравнение HP Z2 Mini G1a и NVIDIA H100
Ниже четыре прикладных сценария, где подобная рабочая станция дает эффект без превращения ИИ в отдельный дорогостоящий проект.
-
Локальный помощник для работы с корпоративными документами
Внутренний поиск и ответы по регламентам, договорам, инструкциям, базе знаний - без передачи данных во внешние сервисы. Это удобно там, где важны конфиденциальность и предсказуемость. -
AI чат-бот для первой линии сервисной поддержки
Автоматические ответы на типовые вопросы, подсказки оператору в ходе диалога, быстрый поиск решения по базе знаний и истории обращений. В результате снижается нагрузка на сотрудников поддержки и сокращается время ответа клиенту. -
Черновая аналитика и автоматизация рутины в отделах продаж и поддержки
Суммаризация обращений, подготовка черновиков ответов, классификация тикетов, первичная обработка писем и отчетов. Экономия времени достигается быстрее всего, потому что сценарии повторяются. -
Пилоты для проверки гипотез
Быстрые эксперименты с моделями и сценариями: проверка идей, настройка подсказок, тестирование цепочек запросов, подготовка демонстраций для внутренних заказчиков. Это позволяет оценить эффект до масштабирования и закупки более крупной инфраструктуры.
Компактные рабочие станции с большой общей памятью и возможностью выделять ее под видеопамять закрывают нишу между "обычным офисным ПК" и дорогими ИИ-серверами. Для малого и среднего бизнеса это способ получить локальный ИИ-инструмент - в разумных сроках поставки, с контролем данных и с возможностью наращивать производительность постепенно: от одного узла к кластеру, когда польза уже доказана на практике.
Если вам важно понять, где заканчивается экономическая эффективность “рабочей станции” и когда рациональнее переходить на датацентровые ускорители, мы подготовили отдельное сравнение HP Z2 Mini G1a и NVIDIA H100.
ITELON
Вам может быть интересно


Обзор: Мини-рабочая станция HP Z2 Mini G1a с AMD Ryzen AI MAX+ Pro 395: запуск GPT-OSS 120B без дискретной видеокарты

NVIDIA L40S и Omniverse: от сцен OpenUSD к моделям мира с учётом законов физики
Подпишитесь на новости
Обратитесь к экспертам компании Itelon



Оцените статью и добавьте комментарий — будьте первым
Спасибо!
Комментарий успешно отправлен на модерацию! После модерации комментарий будет опубликован в ближайшее время!