Skip to Content
Primo RPA AI ServerПользователямМашиныУправление моделями на целевой машине

Управление моделями на целевой машине

Каждая целевая машина в системе может быть задействована под разные задачи в зависимости от того, как системный администратор выполнил развертывание:

  • Машина для AI Текста: позволяет управлять жизненным циклом и конфигурировать инференс LLM-модели на конкретном узле.
  • Машина для Агентских систем: открывает доступ к управлению исполнителями конвейеров агентских систем и RAG-серверами.
  • Машина для Умного OCR: позволяет обучать и выполнять инференс CV-моделей. В данном разделе при этом осуществляется мониторинг за процессами, позволяя наблюдать за тем, как ресурсы машины распределяются между проектами распознавания в текущий момент.

machines

На рисунке выше отмечены:

  • 1 — Область с общей информацией о целевой машине.
  • 2 — Область конфигурации и запуска LLM-модели компонента AI Текст.
  • 3 — Область, которая отражает, как машина используется в проектах компонента Умный OCR.

Область с информацией о машине

machines

  • Статус активности машины:

    • разблокирована — машина удерживает лицензию агента и готова к запуску процессов обучения/инференса в Умном OCR или к запуску LLM-модели в AI Тексте.
    • заблокирована — машина была заблокирована. Это значит, что она освободила лицензию агента и на ней невозможно запустить обучение/инференс в Умном OCR или запустить модель в AI Тексте.
  • Доступность машины для сервера: находится в сети или нет.

  • Наличие действующей лицензии агента: на каждой целевой машине установлен агент, который требует лицензии. Агенты управляет моделью: запускают, настраивают, останавливают, отправляют запросы от сервера. Если отправить запрос на машину без лицензии, то такой запрос завершится ошибкой.

Виджет мониторинга ресурсов машины

machines

В верхней панели интерфейса отображается компактный виджет с текущей загрузкой машины: CPU, GPU, RAM, VRAM и Диск. При клике виджет разворачивается в панель Ресурсы машины, где показаны:

  • Подробные показатели загрузки для текущей машины и её статусные метки.
  • Список остальных целевых машин с их адресом и теми же статусными метками, чтобы быстро увидеть, какие машины сейчас доступны, без перехода на страницу Просмотр целевых машин.

Данные в виджете обновляются автоматически (отметка времени вида «обновлено несколько секунд назад»), также доступна кнопка ручного обновления.

Область AI Текст

Эта область предназначена для конфигурации и запуска больших языковых моделей, NLP-обработки и работы агентских систем. Она разделена на четыре блока: LLM, NLP, Исполнитель агентских систем и RAG-сервер.

  • LLM
    Языковые модели (движки инференса), развернутые на машине. Запущенная LLM используется как источник инференса для конфигураций NLP, как ViT-механизм для Умного OCR или в конвейере Агентских систем.

  • NLP
    Отдельные конфигурации, которые обрабатывают NLP-запросы. Каждая подключается к одной из LLM-моделей машины (или к внешнему LLM-провайдеру) и настраивается независимо.

  • Исполнитель агентских систем
    Позволяет исполнять и тестировать конвейеры проектов Агентских систем.

  • RAG
    Позволяет наполнять собственную или внешнюю векторную БД (postgres + pgVector) данными на основе базы знаний, документов и т.д. Используется в конвейерах проектов Агентских систем.

Текущее состояние

При выборе в списке конкретной LLM-модели, NLP-конфигурации, исполнителя агентских систем или RAG отображается блок Текущее состояние — статус этого компонента и кнопки управления.

  • Статус: показывает текущий режим использования («Запущена», «Бездействует», «Ошибка»). Если компонент находится в статусе «Ошибка», при наведении курсора на иконку вопроса отобразится всплывающая подсказка с детальной технической информацией.
  • Стадии запуска: после нажатия кнопки «Запустить» отображается пошаговый прогресс инициализации, каждая стадия отмечается галочкой по мере завершения. Набор стадий зависит от типа компонента, например:
    • для NLP-конфигурации: Запуск, Подготовка хранилища, Конфигурация NLP-сервера, Запуск NLP-сервера, Запуск инференса модели;
    • для Исполнителя агентских систем: Запуск, Подготовка хранилища, Запуск LFX-сервера, Готов к исполнению;
    • для RAG: Запуск, Подготовка хранилища, Кэширование rerank-модели, Кэширование embed-модели, Запуск postgres-сервера, Запуск RAG-сервера, RAG-сервер запущен.
  • Кнопки управления: кнопка «Запустить» активирует модель/сервер, а кнопка «Остановить» прекращает выполнение текущего процесса.

Проекты

Отдельным блоком отображается список проектов, чьи навыки обслуживаются выбранной LLM-моделью, NLP-конфигурацией или другим компонентом. Каждое название проекта является кликабельной ссылкой, которая ведет на страницу этого проекта.

Конфигурация

Конфигурировать можно только бездействующую модель. Настройки нельзя изменять, если модель/сервер уже исполняется.

Для LLM

machines

На одной машине можно развернуть несколько LLM: каждая добавляется через + Добавить LLM и настраивается независимо.

Параметры конфигурации:

  1. Выбор базовой модели — выберите тип базовой модели из выпадающего списка. По умолчанию доступны следующие типы:

    Название моделиДвижок / РазмерТипОписание
    base-LLM-06-7b-gguf-q8Ollama, 7BМультимодальнаяКвантование GGUF q8. Поддерживает текст и изображения, используется как ViT (ранее: base-LLM-05).
    base-LLM-06-7b-safetensors-fp16vLLM, 7BМультимодальнаяФормат safetensors fp16. Рекомендуется для работы с изображениями и ViT (ранее: base-LLM-06).
    base-LLM-07-8b-safetensors-fp16vLLM, 8BТекстоваяФормат safetensors fp16. Дополнительно обучена на фактах русской культуры (ранее: base-LLM-07).
    base-LLM-06-7b-gguf-fp16Ollama, 7BМультимодальнаяПоддерживает изображения (ММ).
    base-LLM-08-27b-gguf-q4_k_mOllama, 27BМультимодальнаяКвантование q4_k_m. Поддержка изображений (ММ).
    base-LLM-09-30b-gguf-q4_k_mOllama, 30BММ + ReasoningКвантование q4_k_m. Оптимизирована под рассуждения.
    base-LLM-11-30b-gguf-q4_k_mOllama, 30BМультимодальнаяРаспознавание изображений и ViT для Умного OCR.
    base-LLM-12-35b-gguf-q4_k_mOllama, 35BММ + ReasoningРаспознавание изображений. Поддерживает рассуждения.
    base-LLM-12-35b-safetensors-nfvp4vLLM, 35BММ + ReasoningФормат safetensors. Распознавание изображений и ViT для Умного OCR. Поддерживает рассуждения.
    base-LLM-13-26b-gguf-q4_k_mOllama, 26BММ + ReasoningРаспознавание изображений. Поддерживает рассуждения.
    ft-base-0.6b-fp16vLLM, 0.6BДля FTКомпактная базовая модель для файнтюнинга.
    ft-base-2b-fp16vLLM, 2BДля FTКомпактная базовая модель для файнтюнинга.
  2. Размер контекстного окна — предельное количество токенов (текстовых единиц), которые могут быть указаны во входном тексте для обработки. Одно слово на русском языке ~ 2 токена. По умолчанию 4096.

  3. Выбор устройства — тип устройства, который используется на целевой машине с сервером LLM. Доступные значения:

    • CPU — значение по умолчанию. Центральный процессор, выполняющий основные операции и управляющий работой компьютера.
    • CUDA — архитектура CUDA позволяет использовать графический процессор (GPU) от NVIDIA для повышения производительности параллельных вычислений. CUDA представляет собой набор инструментов и библиотек для работы с графическим процессором.

    Если вы выбрали CPU, дополнительно установите:

    • Кол-во используемых CPU — количество ядер CPU, которые будет использовать контейнер с выбранным движком для генерации ответов.

    Если вы выбрали CUDA, дополнительно установите:

    • Кол-во используемых GPU — количество видеокарт. Если модель не помещается в VRAM одной GPU, используйте несколько видеокарт.
    • Загруженность видеокарты — процент использования памяти видеокарты.
    • Кол-во памяти от хоста — если модель не помещается в VRAM одной GPU, оставьте часть слоев LLM на хосте.

Для NLP

machines

На одной машине можно запустить несколько NLP-конфигураций параллельно: каждая добавляется через + Добавить NLP и настраивается независимо.

Параметры конфигурации:

  1. LLM — выберите, какая модель будет обрабатывать запросы этой NLP-конфигурации:
    • по умолчанию доступен выпадающий список LLM, в котором перечислены LLM-модели, уже запущенные на машинах системы (в списке указывается название модели и машина, на которой она развернута);
    • переключатель Вручную позволяет вместо выбора из списка подключить внешний LLM-провайдер напрямую по API. При включенном переключателе становятся доступны поля:
      • Адрес модели — URL-адрес, по которому доступен внешний LLM;
      • Авторизация — заголовок авторизации запроса к внешнему LLM (например, Bearer <ваш_api_key>). Поле не обязательно к заполнению;
      • Движок — тип API внешнего LLM-провайдера (например, vLLM);
      • ID модели — идентификатор модели у внешнего провайдера.
  2. Размер контекстного окна — предельное количество токенов (текстовых единиц), которые могут быть указаны во входном тексте для обработки. Одно слово на русском языке ~ 2 токена.
  3. Разрешение изображения, МП — параметр разрешения изображения (в мегапикселях) для NLP-запросов.
    • Рядом расположен флаг Выполнять апскейл — если включён, изображения меньше заданного разрешения увеличиваются (апскейлятся) до него перед обработкой; если выключен, такие изображения обрабатываются в исходном размере.

Для исполнителя агентских систем

machines

  • Ограничивать CPU — переключатель, включающий ограничение процессорных ресурсов, выделяемых контейнеру исполнителя. При включении задайте:
    • количество используемых ядер CPU;
    • номер ядра, начиная с которого будут выделяться ядра.

Если переключатель выключен, контейнеру доступны все ядра машины.

Для RAG

machines

Embed- и Rerank-модели

  • Embed-модель — модель для создания векторных представлений текста, выбирается из выпадающего списка.
  • Rerank-модель — модель для повторного ранжирования результатов поиска, выбирается аналогично.

Для каждой модели отдельно задайте Выбор устройства:

  • CPU — укажите Кол-во используемых CPU (число ядер, выделяемых для инференса модели).
  • CUDA — укажите Кол-во используемых GPU (если модель не помещается в VRAM одной видеокарты), Загруженность видеокарты (процент используемой памяти) и Кол-во памяти от хоста (для слоёв, не поместившихся в VRAM).

Postgres-сервер

Для хранения и управления индексами данных используется база данных Postgres. Два сценария подключения:

  1. Автоматическое развертывание — включите переключатель «Запустить postgres сервер»: система самостоятельно инициализирует локальный экземпляр БД с необходимыми параметрами.
  2. Внешняя база данных — при выключенном переключателе вручную заполните: БД (название базы), Хост (сетевой адрес), Порт, Имя пользователя и Пароль.

Логирование

В нижней части блоков AI Текст предусмотрен раздел для работы с логами, который позволяет отслеживать технические процессы в реальном времени.

Вы можете просмотреть логи для следующих компонентов:

  • LLM: Журнал работы языковой модели.
  • NLP: Журнал работы NLP-конфигурации.
  • RAG: Логи системы поиска и генерации ответов на основе внешних данных.
  • Исполнитель агентских систем: Журнал выполнения агентских конвейеров.

В интерфейсе доступны кнопки для быстрого копирования содержимого логов в буфер обмена и скачивания лога в виде файла.

Как запустить и остановить модель

Сконфигурируйте модель и нажмите Запустить — начнется пошаговая инициализация (см. Стадии запуска выше). Когда все стадии отмечены галочками, статус сменится на Готова принимать запросы. Если запуск завершился ошибкой, вместо этого статуса появится индикатор ошибки — наведите на него курсор, чтобы увидеть текст.

Чтобы остановить LLM-модель или NLP-конфигурацию (например, для выключения машины или изменения настроек), нажмите Остановить и дождитесь смены статуса с Запущена на Бездействует.

⚠️

Если компонент используется другими проектами (см. блок Проекты), их остановка повлияет на работу этих проектов: навыки, которые от него зависят, перестанут обрабатывать запросы.

Область OCR

Отображает список проектов Умного OCR, в которых используется целевая машина, в том случае, если:

  • это целевая машина с компонентом OCR;
  • это единая целевая машина для AI Текста и OCR.

В противном случае область с проектами OCR будет свернута.

Что дальше

Перейдите к настройке проекта с типом Задачи NLP.

Last updated on