Доклад

Свои ИИ-модели или API по подписке?

Как разложить выбор между внешним API и собственной моделью на требования к качеству, SLO, загрузке, инженерной поддержке, контексту и лицензии.

Площадка
ROИИ 2026 · день 1
Формат
Доклад
Дата выступления
Запись опубликована

Ключевые выводы

  • Цена MaaS. Внешний сервис покупает команде масштабирование и сокращает объём собственной serving-инженерии, но не снимает продуктовую ответственность. 07:28
  • Экономика self-hosted. Локальная модель требует стабильного спроса и высокой полезной загрузки; сравнивать только цену устройства и токена недостаточно. 11:50
  • Скрытая стоимость. В расчёт входят инженеры, круглосуточная эксплуатация, observability и поддержка инфраструктуры. 13:36
  • Контекст. Размер контекстного окна влияет на память serving-системы и способен ограничить достижимое качество сценария. 16:37
  • Лицензия. Открытые веса не отменяют условий модельной лицензии; ограничения проверяют до выбора кандидата. 26:02

19 февраля 2026 года я выступил в первый день онлайн-конференции ROИИ 2026Внешняя ссылка, откроется в новой вкладке. Организатор поставил доклад в блок продуктов и стратегии и опубликовал тему как «MaaS (модель как сервис) vs локальные модели: как перейти на свои модели без провала качества и SLO». На сайте моя публичная роль — AI Platform Lead в Битрикс24; организатор подтверждает её формулировкой «Руководитель ИИ-платформы, Битрикс24».

Метаданные записи на YouTubeВнешняя ссылка, откроется в новой вкладке указывают дату загрузки: 22 февраля 2026 года. Запись длится 58 минут 10 секунд. Название в YouTube формулирует вопрос шире: «Свои AI-модели или API по подписке? MaaS vs Self-Hosted». Публичную ссылку на слайды подтвердить не удалось.

Зачем смотреть

Доклад полезен команде, которая дошла до фразы «пора развернуть свою модель» и хочет проверить основание для решения. Разговор о self-hosted часто начинается с цены GPU и заканчивается таблицей моделей. За рамкой остаются инженерная поддержка, эксплуатация, требования к контексту, лицензия и цена недоступности. В результате два варианта сравниваются в разных границах.

В записи выбор разобран как решение об ответственности. MaaS передаёт часть serving-задач провайдеру. Self-hosted возвращает контроль над runtime и размещением, но вместе с ним команда получает capacity, обновления, наблюдаемость и реакцию на сбои. Ни один вариант автоматически не даёт нужное качество продукта.

Это не инструкция купить конкретную модель или сервер. Названия продуктов служат иллюстрациями для вопросов, которые нужно задать до пилота. Числа и ограничения из записи относятся к моменту доклада; перед архитектурным решением их проверяют заново на текущих версиях, лицензиях и своём workload.

Смотреть подряд необязательно. Первые смысловые точки дают рамку MaaS и self-hosted, середина возвращает скрытые эксплуатационные расходы, затем разговор переходит к контексту и лицензиям. Для рабочего обсуждения достаточно открыть указанные фрагменты, записать спорные допущения своей команды и проверить их по текущим публичным источникам. Запись помогает составить вопросы; ответ всё равно рождается из собственного сценария, профиля нагрузки и принятых границ данных.

Пять проверяемых фрагментов

07:28. Что покупает MaaS

В фрагменте с 07:28Внешняя ссылка, откроется в новой вкладке внешняя модель рассматривается как готовая сервисная возможность: провайдер берёт на себя масштабирование serving-системы и часть инженерного труда. Команда всё равно отвечает за интеграцию, данные, качество результата, лимиты и деградацию своего сценария. API сокращает один класс работы, а не заменяет платформенный контракт.

11:50. Когда сходится self-hosted

С 11:50Внешняя ссылка, откроется в новой вкладке речь идёт об экономике локального инференса. Основание появляется при стабильном спросе и возможности полезно загружать выделенную инфраструктуру. Сравнение «цена токена против цены GPU» неполно: оно не видит простаивающий резерв, профиль нагрузки и обязательство выдерживать SLO.

13:36. Люди и эксплуатация входят в TCO

На 13:36Внешняя ссылка, откроется в новой вкладке в расчёт возвращаются инженеры, круглосуточная эксплуатация, observability и поддержка. Этот фрагмент хорошо останавливает слишком гладкую финансовую модель. Self-hosted значит, что кто-то обновляет runtime, расследует деградацию и принимает решение при дефиците capacity. Стоимость такой функции зависит от организации; запись не подставляет за неё универсальную цифру.

16:37. Контекст тоже потребляет ресурс

С 16:37Внешняя ссылка, откроется в новой вкладке обсуждается контекстное окно. Большой лимит в карточке модели ещё не обещает, что serving-конфигурация выдержит нужную concurrency и сохранит качество сценария. Контекст занимает память, меняет prefill-профиль и способен сузить рабочую область конфигурации. Проверять надо не рекламный максимум, а свой набор запросов.

26:02. Открытые веса и лицензия

На 26:02Внешняя ссылка, откроется в новой вкладке выбор модели упирается в условия лицензии. Доступные веса не означают отсутствие ограничений на использование и распространение. Лицензию проверяют вместе с качеством и системными требованиями, до того как модель становится частью плана миграции.

Как использовать запись

Возьмите один сценарий и выпишите рядом две колонки: что остаётся у вашей команды при MaaS и что добавляется при self-hosted. Отдельно зафиксируйте качество, data boundary, SLO, профиль спроса, деградацию, лицензию и владельца эксплуатации. После этого сравнение становится проверяемым.

Следующий шаг удобно делать по карте AI Platform. Она разводит стратегию, Control Plane, Inference Plane, качество, эксплуатацию и безопасность, чтобы решение о модели не поглотило остальные ответственности.

Проверенные источники

Связанные материалы