GPU для inference и продакшен-нагрузки

Запускайте модели в продакшене на выделенных GPU с предсказуемой стоимостью.

Для inference важны объём памяти, пропускная способность и стабильность. Подберём столько GPU, сколько нужно под вашу нагрузку, и масштабируем по мере роста трафика.

A100 80 ГБ и H100 закрывают большинство сервисов на vLLM/TGI. H200 даёт запас по памяти для длинного контекста и больших моделей.

Условия зависят от срока аренды. Когда нагрузка станет постоянной и высокой, QBS поставит собственный сервер.

Частые вопросы

Как быстро запускается GPU?

Срок запуска зависит от модели GPU, их количества и наличия мощностей. Мы называем его при заявке вместе с ценой и конфигурацией.

Что входит в инстанс?

Готовая вычислительная инфраструктура: NVIDIA GPU, CUDA, драйверы, Docker, хранилище, сеть, SSH/API-доступ и техническая поддержка.

Как проходит оплата?

Безналичная оплата от юридического лица по договору: счёт, закрывающие документы, НДС где применимо. Порядок расчётов и стоимость фиксируем в коммерческом предложении.

Можно ли потом перейти на собственный сервер?

Да. Когда аренда перестаёт быть экономически выгодной при постоянной загрузке, QBS поставит и настроит собственный GPU-сервер.

Заявка

Скоро открываем приём заявок

Публикуем юридическую информацию об обработке персональных данных — форма появится сразу после этого.

Приём заявок скоро откроется

Мы готовим юридическую информацию об обработке персональных данных, поэтому форма пока недоступна. Загляните чуть позже.