GPU для inference и продакшен-нагрузки
Запускайте модели в продакшене на выделенных GPU с предсказуемой стоимостью.
Для inference важны объём памяти, пропускная способность и стабильность. Подберём столько GPU, сколько нужно под вашу нагрузку, и масштабируем по мере роста трафика.
A100 80 ГБ и H100 закрывают большинство сервисов на vLLM/TGI. H200 даёт запас по памяти для длинного контекста и больших моделей.
Условия зависят от срока аренды. Когда нагрузка станет постоянной и высокой, QBS поставит собственный сервер.
Частые вопросы
Как быстро запускается GPU?
Срок запуска зависит от модели GPU, их количества и наличия мощностей. Мы называем его при заявке вместе с ценой и конфигурацией.
Что входит в инстанс?
Готовая вычислительная инфраструктура: NVIDIA GPU, CUDA, драйверы, Docker, хранилище, сеть, SSH/API-доступ и техническая поддержка.
Как проходит оплата?
Безналичная оплата от юридического лица по договору: счёт, закрывающие документы, НДС где применимо. Порядок расчётов и стоимость фиксируем в коммерческом предложении.
Можно ли потом перейти на собственный сервер?
Да. Когда аренда перестаёт быть экономически выгодной при постоянной загрузке, QBS поставит и настроит собственный GPU-сервер.
Заявка
Скоро открываем приём заявок
Публикуем юридическую информацию об обработке персональных данных — форма появится сразу после этого.
Приём заявок скоро откроется
Мы готовим юридическую информацию об обработке персональных данных, поэтому форма пока недоступна. Загляните чуть позже.