Стрим
«Каждый токен на счету» — как экономить токены при создании AI-агентов
Разговор о двух способах экономить токены в AI-агентах: управлении контекстом через RAG и семантический поиск, а также правильной работе с prefix cache.
Участник — Сергей Нотевский
- Площадка
- YouTube · Константин Доронин
- Формат
- Стрим
- Дата эфира
Ключевые выводы
- Контекст AI Platform. Prefix cache имеет смысл рассматривать вместе с инференсом, стоимостью и реальным профилем запросов. 1:00:14
- Зачем нужен prefix cache. Повторно используемый префикс сокращает стоимость и время обработки длинных запросов, если его структура остаётся стабильной. 1:05:26
- Три условия повторного использования. Префикс должен совпасть, запрос — попасть к доступному KV, а нужные блоки — сохраниться до повторного обращения. 1:18:04
- Effective cost. Стоимость модели нужно считать с учётом цены кэшированных токенов и фактического cache hit rate. 1:24:43
- Диагностика cache misses. Одного общего hit rate мало: изменения префикса нужно связывать с конкретными участками запроса и релизами. 1:45:27
- Аудит проекта. audit-prompt-caching собирает проверяемые признаки проблем с кэшем и помогает не держать все правила провайдеров в голове. 1:49:25
- Куда продолжить: KV offload. Общий кэш и перенос KV в память CPU продолжают тему собственного инференса, но требуют отдельной проверки совместимости и стоимости. 1:55:11
О чём стрим
В первой части Родион Мостовой показывает, как CodeAlive использует RAG и семантический поиск, чтобы точнее собирать контекст по кодовой базе и тратить меньше токенов. Во второй я разбираю prefix cache: как он устроен, где ломается и что меняет в экономике AI-агента.
Мой блок — с 59:10Внешняя ссылка, откроется в новой вкладке. К AI Platform и prefix cache перехожу в 1:00:14Внешняя ссылка, откроется в новой вкладке.
Что разбираю я
- место prefix cache в контуре AI Platform;
- как расположение динамических данных и порядок tools влияют на cache hit rate;
- почему модель нужно сравнивать по effective cost с учётом кэшированных токенов;
- какие метрики помогают искать cache misses;
- как начать аудит проекта и собрать признаки проблемы в коде и конфигурации.
Продолжить после эфира
Глава о префиксном кэше собирает общую модель и метрики. Дальше можно отдельно сравнить sticky sessions с маршрутизацией по префиксу, разобрать состояние кэш-роутера или посчитать экономику KV offload.
