Skip to main content
Кеширование промптов — это метод снижения расходов на API благодаря сохранению и переиспользованию ранее обработанных запросов. Система сохраняет результаты обработки часто используемых частей, позволяя моделям применять кешированные данные вместо повторной обработки.

Преимущества

Экономия

Снижение затрат до 90%

Скорость

Ускорение времени ответа

Нагрузка

Уменьшение нагрузки на инфраструктуру

Поддержка провайдерами

Использование с Claude

Для Anthropic Claude требуется явное указание точек кеширования через cache_control:
Claude поддерживает максимум 4 точки кеширования с TTL 5 минут или 1 час.

Мониторинг кеша

Информация об использовании кеша возвращается в ответе API:

Пример экономии

Без кеширования

С кешированием (90% hit rate)

Реальный сценарий

Для техподдержки с 500 запросами в день и 15,000-токенным промптом базы знаний:
  • Без кеша: ~6,500 ₽/день
  • С кешем (90%): ~650 ₽/день
  • Месячная экономия: ~194,000 ₽

Рекомендации

1

Постоянная структура

Поддерживайте постоянную структуру промптов для эффективного кеширования
2

Явное управление

Используйте cache_control для больших текстов с Claude
3

Группировка

Группируйте похожие запросы для максимизации попаданий в кеш

Ограничения

  • Минимальный размер промпта обычно 1000+ токенов
  • Не все модели поддерживают кеширование
  • TTL варьируется: 5 минут (Claude) — неограниченно (OpenAI в рамках сессии)