Корпоративная ИИ-платформа: переход от отдельных сценариев к управляемой системе

Автор: Роман Садрисламов, директор производственного направления «Девелоника» (fabricaONE.AI, акционер – ГК Softline).
ИИ-агент может написать код, подготовить тестовые данные и выполнить задачу без постоянного участия разработчика. В демонстрациях это выглядит как очевидный шаг вперед: быстрее, удобнее, технологичнее. Но при переносе в корпоративную среду возникает другой вопрос: сколько на самом деле стоит такой результат и за счет чего формируется эта стоимость.
Демонстрация и промышленная эксплуатация
Главное заблуждение при внедрении генеративного искусственного интеллекта состоит в том, что результаты, которые модель показывает в публичных сервисах, можно без изменений воспроизвести внутри компании. На практике – модель, которая уверенно решает задачу в открытом инструменте, после интеграции во внутренние процессы может работать иначе: медленнее, дороже или менее стабильно.
Публичные сервисы уже оснащены набором инструментов для работы с кодом, файлами и внешними источниками. Иногда достаточно короткого запроса, чтобы система последовательно выполнила несколько операций и выдала готовый результат.
В корпоративной среде доступ к инструментам и данным приходится ограничивать. Например, когда команда ГК Softline тестировала Cursor для написания кода, дальнейшее использование внешнего сервиса на проекте с клиентскими данными не было согласовано. Это определило требования к размещению моделей: локальная инфраструктура или защищенный сегмент инфраструктуры с учетом 152-ФЗ.
Первым рабочим решением Softline стал веб-интерфейс с чат-режимом. Команда подключила модели и с помощью системных промптов настроила их (включая дополнительные параметры - температуру, пенальти и т.д.) под разные профессиональные роли. Такой формат позволил сотрудникам работать с искусственным интеллектом в согласованной среде, но не решал задачу интеграции в полный жизненный цикл программного обеспечения.
Чат остается отдельным окном, в котором пользователь сам собирает контекст, формулирует запрос и переносит ответ в рабочую систему. Чтобы технология влияла на сроки разработки, ее нужно встраивать в конкретные операции: обработку требований, написание кода, подготовку тестовой документации и оценку покрытия.
Специализация и оркестрация
Для внедрения агентов в процессы команда изучила несколько платформ и остановилась на N8N. Платформу адаптировали под внутренние требования, включая работу с файлами и передачу необходимых параметров в смежные системы (биллинг, трейсинг, мониториг.
Практика Softline показала, что начинать с универсального агента неэффективно. Сотрудникам приходится одновременно осваивать новый инструмент, учиться ставить задачи модели и понимать многошаговую логику выполнения. При разном уровне подготовки это создает слишком высокий порог входа.
Более управляемый подход состоит в том, чтобы выделить конкретные операции и создать для каждой специализированного агента. В аналитике такими операциями стали обработка требований, подготовка схем и маскирование данных. В тестировании: работа с документацией, тестовыми данными и оценкой покрытия.
По той же схеме команда Softline разрабатывает агентов для производственных предприятий, юристов, дизайнеров и кадровых служб. Принцип во всех случаях один: у системы должна быть конкретная функция, понятные правила и проверяемый результат.
Следующий уровень представляет собой ассистент-оркестратор. Он принимает запрос на естественном языке, определяет последовательность действий и вызывает специализированных агентов как инструменты. Например, «Ассистент аналитика» может собрать данные из внутренних систем, передать отдельные части задачи агентам и объединить их результаты.
Если работа требует значительного времени, ассистент предлагает выполнить ее асинхронно. Пользователь согласует план, после чего система продолжает обработку и отправляет готовый файл или отчет по почте. Такой режим важен для задач, которые невозможно завершить за несколько секунд.
Контекст и стоимость
Чем сложнее задача агента, тем больше данных необходимо передать модели. В разработке это исходный код, документация, история изменений, правила проекта и результаты предыдущих действий.
Для повышения качества используются корпоративные вики и «банк памяти». Они дают модели сведения, необходимые для выполнения задачи, и снижают риск того, что агент остановится из-за нехватки контекста. Небольшие задания при этом могут занимать от 15 минут до часа.
Этот подход повышает автономность, но одновременно увеличивает расход токенов. В разработке возникает сильная асимметрия между объемом запроса и ответа. По статистике реальных проектов, на 100 тыс. входящих токенов может приходиться около 50 токенов результата.
Масштаб расходов стал виден после запуска внутреннего биллинга, который учитывает обращения к моделям и работу агентов. За несколько недель июля система Softline зафиксировала около 5 млрд израсходованных токенов, из них почти 1,5 млрд пришлись на модель, развернутую на собственном сервере. За тот же период было выполнено порядка 200 тыс. запросов со средним объемом около 12–13 тыс. токенов.
Такие цифры меняют подход к оценке эффективности. Недостаточно знать, что агент выполнил задачу быстрее человека. Необходимо сопоставить сэкономленное рабочее время со стоимостью модели и инфраструктуры.
По доступным в России рыночным тарифам агентная разработка в рассматриваемой конфигурации в лучшем случае выходит в ноль. Стоимость токенов может полностью компенсировать выигрыш во времени. Это особенно заметно в корпоративной среде, где к цене вычислений добавляются требования к отказоустойчивости, защищенности и предсказуемой нагрузке.
Биллинг и наблюдаемость
Контролировать такую систему можно только на уровне отдельных запросов и задач. Для этого в ГК Softline используется биллинг на базе Lighthouse и Grafana.
Он показывает, какая модель обработала запрос, какой агент его сформировал, сколько токенов было передано и где возник перерасход. Эти данные помогают найти случаи, когда система многократно загружает один и тот же контекст, использует лишние инструменты или неправильно строит последовательность действий.
При небольшом числе пользователей такие ошибки можно обнаруживать вручную. Однако уже при 600 разработчиках они становятся финансовым риском. Один неверно настроенный процесс способен за короткий срок израсходовать значительный объем ресурсов.
Поэтому наблюдаемость нужна не для формального учета. Она позволяет управлять методологией работы агентов: сокращать лишний контекст, корректировать память, менять набор инструментов и выбирать подходящую конфигурацию инференса.
Универсальной настройки для всех сценариев нет, считают в Softline. При работе с короткими пользовательскими запросами важна многопоточность. В разработке модель многократно получает почти одинаковый контекст, поэтому большее значение имеет кеширование. Одинаковая конфигурация в этих случаях не даст сопоставимой эффективности.
Загрузка инфраструктуры
Собственный сервер снижает стоимость токена при высокой загрузке. Однако в течение рабочего дня разработчик не может непрерывно ставить агенту задачи и принимать результаты. Его эффективное время ограничено примерно восемью часами.
Оставшиеся 16 часов можно использовать для асинхронной очереди. Разработчик ставит задачи, проверяет план и определяет ожидаемый результат. После завершения рабочего дня агент продолжает кодирование, запускает тесты и готовит изменения к проверке.
По оценке Softline, такой подход может увеличить объем с пяти задач за рабочий день до 20 задач за сутки. Более полная загрузка собственного сервера распределяет стоимость инфраструктуры на большее число выполненных операций.
Но для этого агент должен работать автономно и доводить задачу до завершения. Если система теряет контекст, регулярно останавливается или требует уточнений, очередь не дает ожидаемого эффекта.
Единая система управления
Корпоративная ИИ-платформа не сводится к модели, интерфейсу или набору агентов. Ее результат зависит от того, как связаны между собой защищенная инфраструктура, специализация агентов, оркестрация, память, биллинг и загрузка вычислительных мощностей.
Именно поэтому количество внедренных агентов мало говорит о зрелости системы. Важнее, понимает ли компания стоимость конкретной задачи, может ли найти источник перерасхода и способна ли использовать инфраструктуру в те часы, когда сотрудники не работают с ней напрямую.
ИИ-агенты становятся производственным инструментом не тогда, когда начинают писать код. Эксперты Softline уверены, что тот переход происходит, когда бизнес умеет управлять качеством, автономностью и стоимостью результата в одном процессе.