Сколько на самом деле стоит локальный ИИ-агент: считаем оборудование, поддержку и проверку
Цена модели не равна цене процесса
Когда обсуждают локальный ИИ, разговор часто начинается с размера видеопамяти и заканчивается ценой оборудования. Но запущенная модель ещё не является полезным рабочим процессом. Нужно подготовить безопасные данные, интегрировать инструменты, собирать логи, обновлять зависимости, реагировать на сбои и проверять ответы. Если агент делает действие, кто-то должен убедиться, что он сделал именно то, что было разрешено.
Поэтому правильная метрика — стоимость принятого результата, а не стоимость одного токена или одного запуска. В неё входят вычисления, инженерное время, человеческая проверка и доля неудачных попыток. Для сравнения с API или ручной работой период и сценарий должны быть одинаковыми.
Посчитайте аппаратную часть
Начните с реальной нагрузки: сколько запросов одновременно, какой размер входа, сколько выходных токенов и какая задержка приемлема. Параметры модели сами по себе не отвечают, сколько ускорителей потребуется. Влияют квантизация, формат весов, контекст, движок, кеширование и резерв для параллельных запросов. Проведите измерение на целевом оборудовании, а не экстраполируйте данные из чужого бенчмарка.
В капитальные расходы включите сервер или аренду выделенного узла, диски, резервное хранение, сетевое оборудование и охлаждение. В операционные — электричество, замену компонентов, мониторинг и простой во время обслуживания. Если сервис нужен только несколько часов в неделю, простаивающее оборудование может сделать локальный вариант дороже API. Если нагрузка стабильна и данные не могут покидать контур, баланс будет другим.
Не потеряйте стоимость эксплуатации
Кто установит драйверы, обновит рантайм, проверит совместимость и откатит неудачный релиз? Кто следит за заполнением дисков, очередями и ошибками памяти ночью? Даже небольшая внутренняя модель требует владельца. Посчитайте его время по фактическим задачам, а не как будто обслуживание происходит бесплатно.
Добавьте резервирование, обновление библиотек, контроль уязвимостей, ротацию секретов, политику удаления логов и восстановление после сбоя. Для агента нужен аудит прав каждого инструмента и план отключения. Если модель умеет изменять файл или создавать запись, стоимость разработки безопасной среды должна входить в проект с первого дня.
Включите человеческую проверку
Запишите, сколько минут эксперт тратит на принятие одного результата. Время может уйти на чтение источника, проверку цифр, исправление формата и отмену ошибочного действия. Для высокой цены ошибки добавьте второй уровень проверки. Ошибка, обнаруженная до публикации, и ошибка, обнаруженная клиентом, стоят по-разному — учитывайте вероятный ущерб, а не только среднее время.
Сравните базовый процесс и процесс с моделью на одинаковых примерах. Если человек раньше обрабатывал десять документов за час, а теперь за час читает ответы агента и исправляет половину, экономии может не быть. Если модель стабильно извлекает поля, а эксперт выборочно проверяет исключения, выигрыш возможен. Данные должны показать разницу, а не рекламный экран.
Простая формула для пилота
За период сложите: амортизацию или аренду оборудования, энергопотребление, хранилище, инженерную поддержку, мониторинг, проверку человеком, неудачные запуски и ожидаемые расходы на восстановление после ошибки. Разделите на число результатов, которые действительно приняли. Для ручного и API-варианта примените те же границы учёта: работа оператора, тариф, повторные запросы, обработка данных и контроль.
Проведите три сценария — низкую, ожидаемую и пиковую нагрузку. Отдельно покажите чувствительность к простоям и доле исправлений. Не подставляйте искусственно высокий объём, чтобы оправдать покупку: прогноз должен опираться на текущую работу или подтверждённый план внедрения. Если неизвестные переменные велики, пилотируйте аренду оборудования прежде капитальных затрат.
Сравните локальную модель, API и гибрид
Локальный запуск даёт контроль над размещением и версией, но переносит ответственность за работу сервиса на команду. API снижает начальный порог и часто проще масштабируется, но требует анализа договора, хранения, региона и стоимости при пике. Гибрид может отправлять чувствительные задачи в одобренную локальную среду, а простые — во внешний сервис, но добавляет маршрутизацию, проверку правил и риск отправить запрос не туда.
Для сравнения используйте одинаковый набор задач и одинаковый критерий «готово». Проверьте русский язык, длинные документы, пустой ответ, задержку и работу с инструментами. Подсчитайте не только стоимость инференса, но и долю ручных правок. Итогом может быть не одна модель на все случаи, а несколько узких маршрутов с разными правилами данных.
Когда локальный вариант оправдан
Он может быть рационален при стабильной высокой нагрузке, ограничениях на передачу данных и наличии команды, способной поддерживать инфраструктуру. Но если оборудование используется эпизодически, данные можно безопасно обрабатывать через подходящий API, а команда не хочет брать эксплуатацию на себя, локальный вариант может проиграть даже при бесплатных весах.
Не закупайте сервер после одного успешного демо. Проведите пилот на ограниченном наборе, зафиксируйте полный стек и измерьте стоимость принятого результата. Составьте условие выхода: качество ниже порога, обслуживание превышает бюджет, критичная ошибка повторяется или специалист по инфраструктуре недоступен. Решение отказаться — такой же корректный результат оценки, как и масштабирование.
FAQ
Бесплатные веса означают бесплатную эксплуатацию?
Нет. Остаются оборудование, энергия, хранение, поддержка, безопасность и работа человека, который проверяет результат.
Что важнее для расчёта — число параметров или нагрузка?
Нагрузка и измерения целевого сценария. Архитектура, контекст, формат весов и параллельность меняют требования к инфраструктуре.
Как сравнить с API?
Использовать одинаковые задачи, критерии качества и период, включая стоимость повторов, проверки, поддержки и хранения данных.
Итог
Сравнивайте полную стоимость принятого результата и цену риска, а не только цену запуска модели. Локальная инфраструктура добавляет контроль, но переносит на команду эксплуатацию. Начните с малого пилота и прозрачных допущений. Для методики выбора откройте гайд по тестированию открытой модели и сравнение скрипта, чата и агента.