Стрим

«Каждый токен на счету» — как экономить токены при создании AI-агентов

Разговор о двух способах экономить токены в AI-агентах: управлении контекстом через RAG и семантический поиск, а также правильной работе с prefix cache.

Площадка
YouTube · Константин Доронин
Формат
Стрим
Дата эфира

Ключевые выводы

  • Контекст AI Platform. Prefix cache имеет смысл рассматривать вместе с инференсом, стоимостью и реальным профилем запросов. 1:00:14
  • Зачем нужен prefix cache. Повторно используемый префикс сокращает стоимость и время обработки длинных запросов, если его структура остаётся стабильной. 1:05:26
  • Три правила кэшируемого запроса. Статическую часть ставим первой, динамическую — в конец, а одинаковые данные сериализуем одинаково. 1:17:56
  • Effective cost. Стоимость модели нужно считать с учётом цены кэшированных токенов и фактического cache hit rate. 1:24:43
  • Диагностика cache misses. Одного общего hit rate мало: изменения префикса нужно связывать с конкретными участками запроса и релизами. 1:45:27
  • Аудит проекта. audit-prompt-caching собирает проверяемые признаки проблем с кэшем и помогает не держать все правила провайдеров в голове. 1:49:32

О чём стрим

В первой части Родион Мостовой показывает, как CodeAlive использует RAG и семантический поиск, чтобы точнее собирать контекст по кодовой базе и тратить меньше токенов. Во второй я разбираю prefix cache: как он устроен, где ломается и что меняет в экономике AI-агента.

Мой блок — с 59:10Внешняя ссылка, откроется в новой вкладке. К AI Platform и prefix cache перехожу в 1:00:14Внешняя ссылка, откроется в новой вкладке.

Что разбираю я

  • место prefix cache в контуре AI Platform;
  • как расположение динамических данных и порядок tools влияют на cache hit rate;
  • почему модель нужно сравнивать по effective cost с учётом кэшированных токенов;
  • какие метрики помогают искать cache misses;
  • как audit-prompt-caching собирает признаки проблемы в коде и конфигурации.

Смотреть

Связанные материалы