Как работает
- Автоматический подсчет токенов и расходов
- Детальная аналитика по типам (prompt, completion, reasoning, cached)
- Готовая стоимость в рублях, уже списанная
- Информация включается в стандартный ответ API без задержек
Структура ответа
Каждый ответ API содержит объектusage:
Поля usage
Детализация входных токенов (prompt_tokens_details)
Детализация выходных токенов (completion_tokens_details)
Типы токенов и стоимость
Streaming режим
В потоковом режиме информация оusage приходит в последнем SSE-сообщении перед [DONE]:
Оптимизация расходов
Используйте кеширование
Для повторяющихся промптов экономия до 90%
Выбирайте модель
Подбирайте модель под сложность задачи
Ограничивайте max_tokens
Устанавливайте разумные лимиты
Мониторьте reasoning
Reasoning токены дороже, но эффективнее
