Стрим
«Каждый токен на счету» — как экономить токены при создании AI-агентов
Разговор о двух способах экономить токены в AI-агентах: управлении контекстом через RAG и семантический поиск, а также правильной работе с prefix cache.
Автор — Сергей Нотевский
- Площадка
- YouTube · Константин Доронин
- Формат
- Стрим
- Дата эфира
Ключевые выводы
- Контекст AI Platform. Prefix cache имеет смысл рассматривать вместе с инференсом, стоимостью и реальным профилем запросов. 1:00:14
- Зачем нужен prefix cache. Повторно используемый префикс сокращает стоимость и время обработки длинных запросов, если его структура остаётся стабильной. 1:05:26
- Три правила кэшируемого запроса. Статическую часть ставим первой, динамическую — в конец, а одинаковые данные сериализуем одинаково. 1:17:56
- Effective cost. Стоимость модели нужно считать с учётом цены кэшированных токенов и фактического cache hit rate. 1:24:43
- Диагностика cache misses. Одного общего hit rate мало: изменения префикса нужно связывать с конкретными участками запроса и релизами. 1:45:27
- Аудит проекта. audit-prompt-caching собирает проверяемые признаки проблем с кэшем и помогает не держать все правила провайдеров в голове. 1:49:32
О чём стрим
В первой части Родион Мостовой показывает, как CodeAlive использует RAG и семантический поиск, чтобы точнее собирать контекст по кодовой базе и тратить меньше токенов. Во второй я разбираю prefix cache: как он устроен, где ломается и что меняет в экономике AI-агента.
Мой блок — с 59:10Внешняя ссылка, откроется в новой вкладке. К AI Platform и prefix cache перехожу в 1:00:14Внешняя ссылка, откроется в новой вкладке.
Что разбираю я
- место prefix cache в контуре AI Platform;
- как расположение динамических данных и порядок tools влияют на cache hit rate;
- почему модель нужно сравнивать по effective cost с учётом кэшированных токенов;
- какие метрики помогают искать cache misses;
- как audit-prompt-caching собирает признаки проблемы в коде и конфигурации.
