RAG-поиск по внутренним документам

Команде нужно, чтобы сотрудники могли задавать вопросы на естественном языке по внутренним документам, а модель отвечала со ссылкой на источник, а не «галлюцинировала».

Как обычно решают такую задачу

Документы разбивают на фрагменты и превращают в эмбеддинги — векторные представления для поиска по смыслу, а не по ключевым словам.

При вопросе система сначала находит релевантные фрагменты (retrieval), затем LLM формулирует ответ на их основе (generation) — отсюда название RAG.

Модель эмбеддингов и языковая модель для генерации ответа обычно разворачиваются на одной GPU, если корпус документов не очень большой.

Частые вопросы

Как быстро запускается GPU?

Срок запуска зависит от модели GPU, их количества и наличия мощностей. Мы называем его при заявке вместе с ценой и конфигурацией.

Что входит в инстанс?

Готовая вычислительная инфраструктура: NVIDIA GPU, CUDA, драйверы, Docker, хранилище, сеть, SSH/API-доступ и техническая поддержка.

Как проходит оплата?

Безналичная оплата от юридического лица по договору: счёт, закрывающие документы, НДС где применимо. Порядок расчётов и стоимость фиксируем в коммерческом предложении.

Можно ли потом перейти на собственный сервер?

Да. Когда аренда перестаёт быть экономически выгодной при постоянной загрузке, QBS поставит и настроит собственный GPU-сервер.

Заявка

Скоро открываем приём заявок

Публикуем юридическую информацию об обработке персональных данных — форма появится сразу после этого.

Приём заявок скоро откроется

Мы готовим юридическую информацию об обработке персональных данных, поэтому форма пока недоступна. Загляните чуть позже.