Стрим

«Каждый токен на счету» — как экономить токены при создании AI-агентов

Разговор о двух способах экономить токены в AI-агентах: управлении контекстом через RAG и семантический поиск, а также правильной работе с prefix cache.

Участник — Сергей Нотевский

Площадка
YouTube · Константин Доронин
Формат
Стрим
Дата эфира

Ключевые выводы

  • Контекст AI Platform. Prefix cache имеет смысл рассматривать вместе с инференсом, стоимостью и реальным профилем запросов. 1:00:14
  • Зачем нужен prefix cache. Повторно используемый префикс сокращает стоимость и время обработки длинных запросов, если его структура остаётся стабильной. 1:05:26
  • Три условия повторного использования. Префикс должен совпасть, запрос — попасть к доступному KV, а нужные блоки — сохраниться до повторного обращения. 1:18:04
  • Effective cost. Стоимость модели нужно считать с учётом цены кэшированных токенов и фактического cache hit rate. 1:24:43
  • Диагностика cache misses. Одного общего hit rate мало: изменения префикса нужно связывать с конкретными участками запроса и релизами. 1:45:27
  • Аудит проекта. audit-prompt-caching собирает проверяемые признаки проблем с кэшем и помогает не держать все правила провайдеров в голове. 1:49:25
  • Куда продолжить: KV offload. Общий кэш и перенос KV в память CPU продолжают тему собственного инференса, но требуют отдельной проверки совместимости и стоимости. 1:55:11

О чём стрим

В первой части Родион Мостовой показывает, как CodeAlive использует RAG и семантический поиск, чтобы точнее собирать контекст по кодовой базе и тратить меньше токенов. Во второй я разбираю prefix cache: как он устроен, где ломается и что меняет в экономике AI-агента.

Мой блок — с 59:10Внешняя ссылка, откроется в новой вкладке. К AI Platform и prefix cache перехожу в 1:00:14Внешняя ссылка, откроется в новой вкладке.

Что разбираю я

  • место prefix cache в контуре AI Platform;
  • как расположение динамических данных и порядок tools влияют на cache hit rate;
  • почему модель нужно сравнивать по effective cost с учётом кэшированных токенов;
  • какие метрики помогают искать cache misses;
  • как начать аудит проекта и собрать признаки проблемы в коде и конфигурации.

Продолжить после эфира

Глава о префиксном кэше собирает общую модель и метрики. Дальше можно отдельно сравнить sticky sessions с маршрутизацией по префиксу, разобрать состояние кэш-роутера или посчитать экономику KV offload.

Смотреть

Связанные материалы