Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

#Почему #Claude #Другой #AI-агента #Цифры
Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход

Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенами

Один пользователь Claude пишет, что потратил больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit стоит воспринимать осторожно, но проблема за ними реальная: длинный контекст обходится дороже, а иногда ещё и мешает модели нормально работать.

В мае на Reddit появился пост с довольно специфическим достижением. Его автор утверждает, что прогнал через Claude 1 156 308 524 входных токена, после чего решил поделиться тем, где именно они сгорели и какие привычки пришлось менять.

Чуть раньше там же появилась история болезненнее. Пользователь Claude Code настроил команду, которая каждые 30 минут проверяла открытые pull request, и забыл её остановить. За 26 часов цикл выполнился 46 раз. По его подсчётам, две разросшиеся сессии вместе обошлись примерно в $6000.

К самой сумме я бы относился осторожно. Это рассказ пользователя Reddit, а не подтверждённый биллинг Anthropic. Но техническая причина, которую он обнаружил в логах, заслуживает внимания. К концу одной из сессий автор оценивал накопленный контекст примерно в 800 тысяч токенов, и каждая следующая итерация снова работала с этой разросшейся историей.

Похожие статьи

Google представила новый телефон с расширенными функциями ИИ РБК
РБК

Google представила новый телефон с расширенными функциями ИИ

Google анонсировала обновленную серию смартфонов Pixel.

РБК
Спорт-Экспресс
Спорт-Экспресс

«Астрахань», «Муром», «Сокол» и владимирское «Торпедо» вышли в третий кубковый раунд пути регионов

«Астрахань» на своем поле прошла «Машук-КМВ» во втором раунде пути регионов FONBET Кубка России.

Спорт-Экспресс
Гоблин раскрыл сильно удививший его во время первой поездки в Европу факт Lenta.ru
Lenta.ru

Гоблин раскрыл сильно удививший его во время первой поездки в Европу факт

Блогер и переводчик Дмитрий Пучков, известный как Гоблин, рассказал, какой факт сильно удивил его во время первой поездки в Европу. Его блогер раскрыл в эфире радио Sputnik, запись которого доступна н...

Lenta.ru
Поиск
Поиск

Нейросети дают сбой при разработке новых лекарств

Исследователи Московского физико-технического института проверили четыре популярных инструмента для моделирования комплексов белков с малыми молекулами — AlphaFold 3, Boltz-2, Chai-1 и Protenix-v1. Со...

Поиск
Nebius сообщила о росте выручки AI Cloud на 514% на фоне спроса на ИИ РБК
РБК

Nebius сообщила о росте выручки AI Cloud на 514% на фоне спроса на ИИ

Компания Nebius Group NV Аркадия Воложа сообщила о росте выручки своего облачного бизнеса (AI Cloud) на 514% на фоне высокого спроса на вычислительные мощности для ИИ, передает Bloomberg.

РБК
Как я написал PID 1 для контейнеров на чистом ассемблере: x86-64 и ARM64 Хабр
Хабр

Как я написал PID 1 для контейнеров на чистом ассемблере: x86-64 и ARM64

Не потому, что контейнерному миру срочно нужен ещё один init. Есть Tini, есть docker run --init , и для большинства production-сценариев я бы по-прежнему начал именно с них. Мне скорее хотелось разобр...

Хабр