Tilda Publishing
Привет, любопытный друг. Да, это Tilda. Потому что мы хотим быстро внедрять и управлять решением, а не ждать
в очереди разработчика. Контроль, предсказуемость и отказоустойчивость — наша главная идея.
Подберём типовое или произведем на заказ серверное оборудование, предоставим расчёт и поможем интегрировать в систему.

Заполните форму запроса слева или отправьте описание вашей задачи на почту get@work-system.ru

При отправке письма на почту укажите номер телефона вашего специалиста для обсуждения аналогов оборудования в случае необходимости

AI-инфраструктура под ключ — поставка и развёртывание GPU-кластеров

On-premise AI-инфраструктура — это серверы с GPU, сетевая фабрика, СХД и системы охлаждения, размещённые в вашем контуре и настроенные под конкретную задачу: обучение моделей, инференс или обработку больших данных. Такое решение нужно компаниям, которые обрабатывают персональные данные, коммерческую тайну или относятся к субъектам КИИ, а также тем, у кого утилизация GPU в облаке уже превысила 70% и аренда перестала быть выгодной. Work System поставляет оборудование Dell, Supermicro, ASUS, Gooxi и Xfusion и разворачивает его до состояния «готово к работе» — от аудита задач до нагрузочного тестирования кластера. Бизнес получает предсказуемый TCO, контроль над данными и производительность, не зависящую от тарифов облачного провайдера.

On-premise vs облако: когда собственный GPU-кластер окупается быстрее

Вопрос «облако или свой кластер» решается экономикой утилизации GPU. При постоянной нагрузке 70–100% — непрерывное дообучение моделей, высоконагруженный production-инференс — собственные серверы окупаются за 9–14 месяцев с учётом электроэнергии и обслуживания, а на горизонте трёх лет выходят на 40–55% дешевле облачной аренды.

Есть и нерыночные причины строить свою инфраструктуру. Обработка персональных данных по 152-ФЗ, медицинской информации и коммерческой тайны в публичных GPT-сервисах недопустима, а субъекты КИИ обязаны выполнять требования 187-ФЗ и указов президента №166 и №250 — вплоть до УЗ-1 и К1. Для промышленного контроля и анализа видеопотока в реальном времени физическое расстояние до облачного ЦОД напрямую влияет на латентность решения.

Из чего состоит AI-инфраструктура

  • GPU-серверы: от 4-GPU для инференса до 8-GPU-кластеров для обучения LLM
    Конфигурация зависит от задачи. Для fine-tuning на LoRA или QLoRA достаточно 1–4 серверов с акцентом на объём VRAM — здесь хорошо работают H200 или A100. Для полномасштабного обучения LLM нужна 8-GPU-конфигурация SXM с NVLink до 900 ГБ/с между картами: без такой связности узким местом становится PCIe-шина, и распределённое обучение не масштабируется. Для инференса и компьютерного зрения экономически оправданы серверы на 8–10 GPU PCIe — L40S, A30 или A10, без переплаты за H100.
  • Высокоскоростная сетевая фабрика: InfiniBand и RoCEv2
    InfiniBand NDR/XDR даёт задержку менее 1 мкс и аппаратный контроль потока через протокол SHARP — стандарт для сверхмасштабного обучения LLM, хотя вендор-лок на оборудование NVIDIA обходится дорого. RoCEv2 поверх 400G/800G Ethernet снижает CapEx на 40–55% и подходит для кластеров среднего размера и инференса, но требует точной настройки QoS, PFC и ECN. Без этого каскадные перегрузки снижают реальную пропускную способность в 5–10 раз от расчётной — настройка RoCEv2 отдельная инженерная дисциплина.
  • Хранение данных для AI: параллельные файловые системы и NVMe-oF
    Для потоков обучения и инференса подходят параллельные файловые системы — Lustre, IBM GPFS, WekaIO — в связке с протоколом NVMe-oF. Технология NVIDIA GPUDirect Storage передаёт данные из СХД напрямую в память GPU, минуя оперативную память и CPU сервера, что снимает нагрузку на процессор при больших датасетах. Для BigData-задач, где важен баланс мощности GPU, скорости CPU и потокового чтения с диска, конфигурация СХД проектируется отдельно под профиль нагрузки.
  • Жидкостное охлаждение и требования к электропитанию
    Сервер с 8x H100 выделяет 10–12 кВт тепла, платформы на NVIDIA Blackwell B300 — от 14 кВт на юнит и свыше 100 кВт на стойку. Воздушное охлаждение физически не отводит больше 30–40 кВт со стойки, поэтому стандартом 2025–2026 становится Direct Liquid Cooling: водоблоки на GPU и CPU отводят тепло в 4000 раз эффективнее воздуха, а PUE при DLC держится в диапазоне 1.15–1.35.

Задачи, под которые проектируем инфраструктуру

  • Обучение и fine-tuning нейросетей
    Полномасштабное обучение фундаментальных моделей требует массивов из 8 GPU SXM и неблокирующей сетевой фабрики — InfiniBand NDR 400G или корректно настроенного RoCEv2: узким местом становится межузловая сеть, а не вычислительная мощность карт. Для fine-tuning методами LoRA и QLoRA достаточно 1–4 серверов с приоритетом на объём VRAM — H200 с 141 ГБ HBM3e или A100 закрывают большинство задач без переплаты за конфигурацию уровня обучения с нуля.
  • Инференс — production-serving моделей в реальном времени
    В продакшн-инференсе решает не пиковая производительность в TFLOPS, а пропускная способность и объём памяти. H200 с 141 ГБ HBM3e или MI300X с 192 ГБ позволяют держать в памяти объёмный KV-кэш и увеличивать размер батча, снижая стоимость генерации токена. Serving разворачивается на NVIDIA Triton Inference Server или vLLM, а Multi-Instance GPU делит один H100 на 7 изолированных инстансов для параллельных микросервисов инференса.
  • Компьютерное зрение и промышленная видеоаналитика
    Модели YOLO и ResNet не требуют больших объёмов VRAM, поэтому ставить под них H100 экономически нецелесообразно. Оптимальная конфигурация — сервер на 8–10 GPU PCIe с картами L40S, A30 или A10: задача хорошо распараллеливается без глобального интерконнекта между картами. Для промышленного контроля и анализа видеопотока в реальном времени критично физическое расположение инфраструктуры рядом с производством — задержка до облачного ЦОД здесь недопустима.
  • Высокопроизводительные вычисления и BigData
    Для HPC-задач и обработки больших данных важен баланс вычислительной мощности GPU, скорости CPU и пропускной способности дисковой подсистемы — конфигурация с мощными картами и медленным хранением не даёт прироста. В проекте для ИНМЭ РАН такие задачи решались на серверах Gigabyte и ASUS, подобранных под требования к вычислительной производительности научного учреждения. Похожий подход применим к BigData-кластерам на HDFS и Spark.

Кейсы из нашей практики

ИНМЭ РАН
серверы Gigabyte и ASUS для высокопроизводительных вычислений
Институт металлургии и материаловедения им. А.А. Байкова РАН — научное учреждение, где вычислительная нагрузка складывается из задач физического и химического моделирования материалов. Для таких расчётов важна стабильная производительность процессоров и памяти на протяжении длительных сессий, а не только пиковая мощность отдельного узла.

Work System подобрал и поставил серверы Gigabyte и ASUS — тех же вендоров, что входят в текущий каталог решений для AI-инфраструктуры. Конфигурации ориентированы на высокую вычислительную производительность, требуемую для научных расчётов. Оборудование введено в эксплуатацию, институт получил ресурс для проведения вычислений и обработки данных в нужном режиме. Проект показывает, что подход, применяемый в AI-кластерах, работает и для классического научного HPC.
Медиаскоп
DataNode-сервер для BigData-кластера HDFS
Медиаскопу нужно было масштабировать хранение и обработку BigData с жёстким сроком — ввод в эксплуатацию за месяц. Work System подобрал DataNode-сервер для обработки блоков данных в составе HDFS-кластера и спроектировал систему под требования по производительности и масштабируемости. Весь путь от запроса до интеграции занял 5 недель. Существующая система мониторинга масштабирована, качество медиаисследований выросло.
Rutube
масштабирование инфраструктуры с ростом нагрузки в 6 раз
RuTube модернизировал CDN-инфраструктуру в условиях ужесточающихся санкций на поставки зарубежных комплектующих — с сохранением совместимости с уже установленным оборудованием. Work System, сотрудничающий с RuTube с 2020 года, провёл аудит текущей системы, подобрал оборудование и нашёл рабочий маршрут поставки в срок. В результате инфраструктура выдержала рост посещений с 8 до 50 млн в месяц — в 6 раз, увеличен объём хранения и повышено пиковое ограничение по нагрузке сети.

Почему выбирают Work System

Work System работает на рынке серверного оборудования с 2017 года и закрыл больше 600 проектов — от отдельных серверов до комплексных кластеров для бизнеса и госсектора. Компания поставляет оборудование от Dell, Supermicro, ASUS, Gooxi, Xfusion и других производителей из каталога 30+ партнёров, а сертификация 70+ специалистов закрывает серверную, сетевую и инженерную часть проекта одновременно.

Перед отгрузкой каждый сервер проходит тестирование под нагрузкой и финальную проверку по 20 параметрам — это снижает риск простоя оборудования на этапе монтажа. Work System не облачный провайдер и не разрабатывает нейросети: задача компании — довести физическую инфраструктуру до состояния «готово к работе» и передать её вашей команде с исполнительной документацией.

Опишите задачу

обучение, инференс, видеоаналитика или BigData — и получите технический аудит с подбором конфигурации GPU, сетевой фабрики и платформы под ваш бюджет и требования по защите данных. 

Этапы реализации AI-инфраструктуры под ключ

  • Технический аудит: профилирование задач и выбор конфигурации GPU
    Аудит начинается с профилирования задач: архитектура нейросетей, размеры датасетов, целевые показатели throughput и TTFT. На основе этих данных строится TCO-модель, которая показывает, окупится ли собственный кластер за 9–14 месяцев или разумнее остаться в облаке при текущей утилизации GPU. Результат этапа — конкретная конфигурация: количество и модель GPU, форм-фактор SXM или PCIe, требования к сети и хранению.
  • Проектирование сетевой фабрики, СХД и инженерных систем
    На этом этапе разрабатывается схема сетевой фабрики Spine-Leaf с нужным коэффициентом oversubscription, выбирается InfiniBand или RoCEv2 в зависимости от масштаба и бюджета. Параллельно рассчитывается тепловыделение — от 10–12 кВт на сервер с 8x H100 — и требования к электропитанию, проектируется контур DLC или подтверждается достаточность воздушного охлаждения. СХД подбирается под профиль нагрузки: параллельная файловая система для обучения, быстрый NVMe-oF для инференса.
  • Поставка оборудования, монтаж и базовая настройка
    Логистика для GPU уровня H100 или MI300X идёт через транзитные хабы с учётом санкционного комплаенса — это отдельная работа, которую Work System берёт на себя. Монтаж 8U-сервера весом свыше 80 кг, прокладка оптических патч-кордов AOC/DAC и трансиверов OSFP/QSFP-DD, тестирование контуров DLC — задачи для отдельной инженерной бригады. Базовая настройка включает обновление BMC/BIOS, установку Ubuntu Server LTS или RHEL, настройку сети и драйверов OFED для RDMA.
  • Развёртывание программного стека и нагрузочное тестирование
    Программный стек строится на Kubernetes с NVIDIA GPU Operator, который автоматизирует установку драйверов, CUDA и cuDNN на всех узлах. Для серверов на инференсе настраивается Multi-Instance GPU и разворачивается Triton Inference Server или vLLM, для мониторинга — Prometheus и DCGM Exporter. Перед передачей кластера команда прогоняет HPL/Linpack, GEMM, NCCL-tests и MLPerf Training/Inference, чтобы подтвердить проектную производительность, и обучает специалистов заказчика работе с системой.

Часто задаваемые вопросы