Управление моделями на целевой машине
Каждая целевая машина в системе может быть задействована под разные задачи в зависимости от того, как системный администратор выполнил развертывание:
- Машина для AI Текста: позволяет управлять жизненным циклом и конфигурировать инференс LLM-модели на конкретном узле.
- Машина для Агентских систем: открывает доступ к управлению исполнителями конвейеров агентских систем и RAG-серверами.
- Машина для Умного OCR: позволяет обучать и выполнять инференс CV-моделей. В данном разделе при этом осуществляется мониторинг за процессами, позволяя наблюдать за тем, как ресурсы машины распределяются между проектами распознавания в текущий момент.

На рисунке выше отмечены:
1— Область с общей информацией о целевой машине.2— Область конфигурации и запуска LLM-модели компонента AI Текст.3— Область, которая отражает, как машина используется в проектах компонента Умный OCR.
Область с информацией о машине

-
Статус активности машины:
разблокирована— машина удерживает лицензию агента и готова к запуску процессов обучения/инференса в Умном OCR или к запуску LLM-модели в AI Тексте.заблокирована— машина была заблокирована. Это значит, что она освободила лицензию агента и на ней невозможно запустить обучение/инференс в Умном OCR или запустить модель в AI Тексте.
-
Доступность машины для сервера: находится в сети или нет.
-
Наличие действующей лицензии агента: на каждой целевой машине установлен агент, который требует лицензии. Агенты управляет моделью: запускают, настраивают, останавливают, отправляют запросы от сервера. Если отправить запрос на машину без лицензии, то такой запрос завершится ошибкой.
Виджет мониторинга ресурсов машины

В верхней панели интерфейса отображается компактный виджет с текущей загрузкой машины: CPU, GPU, RAM, VRAM и Диск. При клике виджет разворачивается в панель Ресурсы машины, где показаны:
- Подробные показатели загрузки для текущей машины и её статусные метки.
- Список остальных целевых машин с их адресом и теми же статусными метками, чтобы быстро увидеть, какие машины сейчас доступны, без перехода на страницу Просмотр целевых машин.
Данные в виджете обновляются автоматически (отметка времени вида «обновлено несколько секунд назад»), также доступна кнопка ручного обновления.
Область AI Текст
Эта область предназначена для конфигурации и запуска больших языковых моделей, NLP-обработки и работы агентских систем. Она разделена на четыре блока: LLM, NLP, Исполнитель агентских систем и RAG-сервер.
-
LLM
Языковые модели (движки инференса), развернутые на машине. Запущенная LLM используется как источник инференса для конфигураций NLP, как ViT-механизм для Умного OCR или в конвейере Агентских систем. -
NLP
Отдельные конфигурации, которые обрабатывают NLP-запросы. Каждая подключается к одной из LLM-моделей машины (или к внешнему LLM-провайдеру) и настраивается независимо. -
Исполнитель агентских систем
Позволяет исполнять и тестировать конвейеры проектов Агентских систем. -
RAG
Позволяет наполнять собственную или внешнюю векторную БД (postgres + pgVector) данными на основе базы знаний, документов и т.д. Используется в конвейерах проектов Агентских систем.
Текущее состояние
При выборе в списке конкретной LLM-модели, NLP-конфигурации, исполнителя агентских систем или RAG отображается блок Текущее состояние — статус этого компонента и кнопки управления.
- Статус: показывает текущий режим использования («Запущена», «Бездействует», «Ошибка»). Если компонент находится в статусе «Ошибка», при наведении курсора на иконку вопроса отобразится всплывающая подсказка с детальной технической информацией.
- Стадии запуска: после нажатия кнопки «Запустить» отображается пошаговый прогресс инициализации, каждая стадия отмечается галочкой по мере завершения. Набор стадий зависит от типа компонента, например:
- для NLP-конфигурации: Запуск, Подготовка хранилища, Конфигурация NLP-сервера, Запуск NLP-сервера, Запуск инференса модели;
- для Исполнителя агентских систем: Запуск, Подготовка хранилища, Запуск LFX-сервера, Готов к исполнению;
- для RAG: Запуск, Подготовка хранилища, Кэширование rerank-модели, Кэширование embed-модели, Запуск postgres-сервера, Запуск RAG-сервера, RAG-сервер запущен.
- Кнопки управления: кнопка «Запустить» активирует модель/сервер, а кнопка «Остановить» прекращает выполнение текущего процесса.
Проекты
Отдельным блоком отображается список проектов, чьи навыки обслуживаются выбранной LLM-моделью, NLP-конфигурацией или другим компонентом. Каждое название проекта является кликабельной ссылкой, которая ведет на страницу этого проекта.
Конфигурация
Конфигурировать можно только бездействующую модель. Настройки нельзя изменять, если модель/сервер уже исполняется.
Для LLM

На одной машине можно развернуть несколько LLM: каждая добавляется через + Добавить LLM и настраивается независимо.
Параметры конфигурации:
-
Выбор базовой модели — выберите тип базовой модели из выпадающего списка. По умолчанию доступны следующие типы:
Название модели Движок / Размер Тип Описание base-LLM-06-7b-gguf-q8Ollama, 7B Мультимодальная Квантование GGUF q8. Поддерживает текст и изображения, используется как ViT (ранее:base-LLM-05).base-LLM-06-7b-safetensors-fp16vLLM, 7B Мультимодальная Формат safetensors fp16. Рекомендуется для работы с изображениями и ViT (ранее:base-LLM-06).base-LLM-07-8b-safetensors-fp16vLLM, 8B Текстовая Формат safetensors fp16. Дополнительно обучена на фактах русской культуры (ранее:base-LLM-07).base-LLM-06-7b-gguf-fp16Ollama, 7B Мультимодальная Поддерживает изображения (ММ). base-LLM-08-27b-gguf-q4_k_mOllama, 27B Мультимодальная Квантование q4_k_m. Поддержка изображений (ММ).base-LLM-09-30b-gguf-q4_k_mOllama, 30B ММ + Reasoning Квантование q4_k_m. Оптимизирована под рассуждения.base-LLM-11-30b-gguf-q4_k_mOllama, 30B Мультимодальная Распознавание изображений и ViT для Умного OCR. base-LLM-12-35b-gguf-q4_k_mOllama, 35B ММ + Reasoning Распознавание изображений. Поддерживает рассуждения. base-LLM-12-35b-safetensors-nfvp4vLLM, 35B ММ + Reasoning Формат safetensors. Распознавание изображений и ViT для Умного OCR. Поддерживает рассуждения.base-LLM-13-26b-gguf-q4_k_mOllama, 26B ММ + Reasoning Распознавание изображений. Поддерживает рассуждения. ft-base-0.6b-fp16vLLM, 0.6B Для FT Компактная базовая модель для файнтюнинга. ft-base-2b-fp16vLLM, 2B Для FT Компактная базовая модель для файнтюнинга. -
Размер контекстного окна — предельное количество токенов (текстовых единиц), которые могут быть указаны во входном тексте для обработки. Одно слово на русском языке ~ 2 токена. По умолчанию
4096. -
Выбор устройства — тип устройства, который используется на целевой машине с сервером LLM. Доступные значения:
CPU— значение по умолчанию. Центральный процессор, выполняющий основные операции и управляющий работой компьютера.CUDA— архитектура CUDA позволяет использовать графический процессор (GPU) от NVIDIA для повышения производительности параллельных вычислений. CUDA представляет собой набор инструментов и библиотек для работы с графическим процессором.
Если вы выбрали
CPU, дополнительно установите:- Кол-во используемых CPU — количество ядер CPU, которые будет использовать контейнер с выбранным движком для генерации ответов.
Если вы выбрали
CUDA, дополнительно установите:- Кол-во используемых GPU — количество видеокарт. Если модель не помещается в VRAM одной GPU, используйте несколько видеокарт.
- Загруженность видеокарты — процент использования памяти видеокарты.
- Кол-во памяти от хоста — если модель не помещается в VRAM одной GPU, оставьте часть слоев LLM на хосте.
Для NLP

На одной машине можно запустить несколько NLP-конфигураций параллельно: каждая добавляется через + Добавить NLP и настраивается независимо.
Параметры конфигурации:
- LLM — выберите, какая модель будет обрабатывать запросы этой NLP-конфигурации:
- по умолчанию доступен выпадающий список LLM, в котором перечислены LLM-модели, уже запущенные на машинах системы (в списке указывается название модели и машина, на которой она развернута);
- переключатель Вручную позволяет вместо выбора из списка подключить внешний LLM-провайдер напрямую по API. При включенном переключателе становятся доступны поля:
- Адрес модели — URL-адрес, по которому доступен внешний LLM;
- Авторизация — заголовок авторизации запроса к внешнему LLM (например,
Bearer <ваш_api_key>). Поле не обязательно к заполнению; - Движок — тип API внешнего LLM-провайдера (например,
vLLM); - ID модели — идентификатор модели у внешнего провайдера.
- Размер контекстного окна — предельное количество токенов (текстовых единиц), которые могут быть указаны во входном тексте для обработки. Одно слово на русском языке ~ 2 токена.
- Разрешение изображения, МП — параметр разрешения изображения (в мегапикселях) для NLP-запросов.
- Рядом расположен флаг Выполнять апскейл — если включён, изображения меньше заданного разрешения увеличиваются (апскейлятся) до него перед обработкой; если выключен, такие изображения обрабатываются в исходном размере.
Для исполнителя агентских систем

- Ограничивать CPU — переключатель, включающий ограничение процессорных ресурсов, выделяемых контейнеру исполнителя. При включении задайте:
- количество используемых ядер CPU;
- номер ядра, начиная с которого будут выделяться ядра.
Если переключатель выключен, контейнеру доступны все ядра машины.
Для RAG

Embed- и Rerank-модели
- Embed-модель — модель для создания векторных представлений текста, выбирается из выпадающего списка.
- Rerank-модель — модель для повторного ранжирования результатов поиска, выбирается аналогично.
Для каждой модели отдельно задайте Выбор устройства:
CPU— укажите Кол-во используемых CPU (число ядер, выделяемых для инференса модели).CUDA— укажите Кол-во используемых GPU (если модель не помещается в VRAM одной видеокарты), Загруженность видеокарты (процент используемой памяти) и Кол-во памяти от хоста (для слоёв, не поместившихся в VRAM).
Postgres-сервер
Для хранения и управления индексами данных используется база данных Postgres. Два сценария подключения:
- Автоматическое развертывание — включите переключатель «Запустить postgres сервер»: система самостоятельно инициализирует локальный экземпляр БД с необходимыми параметрами.
- Внешняя база данных — при выключенном переключателе вручную заполните: БД (название базы), Хост (сетевой адрес), Порт, Имя пользователя и Пароль.
Логирование
В нижней части блоков AI Текст предусмотрен раздел для работы с логами, который позволяет отслеживать технические процессы в реальном времени.
Вы можете просмотреть логи для следующих компонентов:
- LLM: Журнал работы языковой модели.
- NLP: Журнал работы NLP-конфигурации.
- RAG: Логи системы поиска и генерации ответов на основе внешних данных.
- Исполнитель агентских систем: Журнал выполнения агентских конвейеров.
В интерфейсе доступны кнопки для быстрого копирования содержимого логов в буфер обмена и скачивания лога в виде файла.
Как запустить и остановить модель
Сконфигурируйте модель и нажмите Запустить — начнется пошаговая инициализация (см. Стадии запуска выше). Когда все стадии отмечены галочками, статус сменится на Готова принимать запросы. Если запуск завершился ошибкой, вместо этого статуса появится индикатор ошибки — наведите на него курсор, чтобы увидеть текст.
Чтобы остановить LLM-модель или NLP-конфигурацию (например, для выключения машины или изменения настроек), нажмите Остановить и дождитесь смены статуса с Запущена на Бездействует.
Если компонент используется другими проектами (см. блок Проекты), их остановка повлияет на работу этих проектов: навыки, которые от него зависят, перестанут обрабатывать запросы.
Область OCR
Отображает список проектов Умного OCR, в которых используется целевая машина, в том случае, если:
- это целевая машина с компонентом OCR;
- это единая целевая машина для AI Текста и OCR.
В противном случае область с проектами OCR будет свернута.
Что дальше
Перейдите к настройке проекта с типом Задачи NLP.