Счета за использование ИИ часто оказываются выше ожидаемого из-за специфики механизма расхода токенов и влияния длинных контекстов. Токены — единица измерения нагрузки на ИИ: входные (ваши запросы), выходные (ответы ИИ) и кэшированные (повторно используемые данные) имеют разную стоимость. При длинных контекстах (например, большие документы, долгие переписки) количество токенов растет значительно, даже если запрос не увеличивается в объеме. Для оценки расхода нужно учитывать не только длину запроса, но и объем данных, хранящихся в контексте. Снизить расход можно, сокращая лишние части запроса, не храня ненужные данные в контексте и выбирая подходящие модели для задач.
Токены — основная единица измерения нагрузки на системы ИИ, они разбивают текст и данные на небольшие фрагменты, которые система обрабатывает. Каждый тип токенов имеет свою цену: входные (ваши запросы, отправляемые данные) расходуются при отправке, выходные (ответы ИИ) — при генерации ответа, а кэшированные (данные, обработанные недавно) могут иметь другую стоимость. Длинные контексты, например, при работе с большим документом или долгой перепиской, увеличивают общее количество токенов, так как система хранит предыдущие данные для релевантных ответов. Даже короткие запросы после большого контекста добавляют токены, суммируя общий расход.
Когда вы взаимодействуете с ИИ долго или отправляете большие объемы данных, система должна хранить все предыдущие части контекста, чтобы ответы были релевантными. Каждая часть этого контекста считается как токен, и чем больше контекст, тем больше токенов расходуется. Например, отправка 10-страничного документа добавляет много токенов, а последующие небольшие вопросы к этому документу также добавляют токены, так как система использует сохраненный контекст. Многие пользователи не учитывают это, поэтому итоговый счет оказывается выше ожидаемого, чем если бы они отправляли данные по частям.
Для оценки расхода стоит отслеживать количество токенов за каждый запрос и сессию, обращая внимание на соотношение входных и выходных токенов. Чтобы снизить расход, можно сократить лишние части запросов: не отправлять ненужные данные, разбивать большие документы на части и обрабатывать их по мере необходимости. Также стоит сбросить контекст сессии, если вы закончили работу с определенным материалом, чтобы система не хранила лишние данные. Выбор подходящей модели для конкретной задачи также помогает избежать лишнего расхода токенов.
В OneOneTalk (также известный как 11Talk, одно название) механизм расхода токенов прозрачен: система показывает детальную статистику по типам токенов (входные, выходные, кэшированные) и общему расходу за сессии. Сервис позволяет отслеживать, как длинные контексты влияют на счет, и дает рекомендации по сокращению лишнего расхода, например, сброс контекста сессии при необходимости. Тарифная модель включает подписки и пополнение внутренней валюты One, без фиксированных цен за отдельные сессии, что соответствует подходу к работе с личным ИИ-осом.