Мы посчитали, за что платим, когда ИИ работает. Оказалось — не за ответы, а за чтение.
Мы ведём книгу о том, как мозг строит предсказания, и попутно считаем каждый свой расход. За два дня работы агентов накопилось 3 722 запроса, и вот что из них видно:
— 1 248 941 525 входных токенов, из них 99 % — попадания в кэш;
— 4 278 894 выходных токена, то есть 0,34 % от всего объёма;
— контекста на каждый токен ответа — 292 токена.
А теперь как эти токены превращаются в деньги:
— чтение из кэша — 45 % расхода;
— свежий служебный текст, который в кэш не попал (логи, файлы, вывод команд) — 23 %;
— собственно ответ модели — 31 %.
Здесь и спрятана главная неочевидность: ответ занимает треть денег при 0,34 % токенов. Один токен ответа примерно в двести раз дороже токена чтения — но чтения в двести девяносто раз больше. Поэтому «сократить документ» экономит копейки, а «сократить число и длину ходов агента» — рубли.
Теперь честно про грабли, на которые я сам наступил. Я решил посчитать «рублей за час работы агента» и разделил расход на длительность сессий. Получилось 0,86 ₽ в час — в 582 раза дешевле, чем у отрасли. Красивая цифра, и она ложь: сессии висят сутками в ожидании, и в длительность входит простой. Правильная база — запрос и активный час: 117–293 ₽ в час (1,4–3,5 доллара) при скорости 2–5 секунд на шаг. Это уже сравнимая величина, а не фантастика.
Дальше — эксперимент, который мы провели специально, чтобы поймать экономию на вранье. Мы сжали служебный текст до 12 % от исходного и прогнали проверку «утверждение ↔ источник» дважды: на полном тексте и на сжатом, сверяя с человеческой разметкой.
Результат: согласие с человеком упало с 85 % до 75 %. Ложных подтверждений сжатие не создало — оно сделало хуже другое: на контрольной паре, где утверждение было дословно первой фразой самого источника, проверяющий после сжатия перестал видеть там утверждение вообще. То есть экономия покупается молчаливой потерей качества: ошибка не светится в логах, она просто исчезает из результата.
Поэтому у нас теперь правило: на рутине и батчах сжимать можно — там результат проверяет валидатор. Там, где рождается цифра, — проверка утверждений, деньги, клиентские материалы — нельзя.
Мы делимся этим не для красоты. Мы проверяем источники в чужих текстах и знаем, как выглядит «правдоподобно, но неверно».
Вопрос к вам: считали ли вы, сколько стоит час работы вашего агента — и готовы ли к тому, что экономия на сжатии тихо меняет результат, а не ломает его с ошибкой?
#КнигаМКС #ЗамерыИИ #разбор #наука
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | 85 % на шаг — это 20 % на десяти ... | 1 | 13.61 | 08-10-2026 |
| 2 | Мы взяли книгу, нарезали её на куски 100, 300 и ... | 0 | 12.62 | 08-10-2026 |
| 3 | Облачные провайдеры берут плату не за железо, а за лень ... | 0 | 11.1 | 27-09-2026 |
| 4 | Как я перестала платить копирайтерам и дизайнерам. Спойлер: нейросети рулят ... | 0 | 5.18 | 30-09-2026 |
| 5 | ИИ делает нас производительнее. Чем мы за это платим? | 0 | 6.28 | 26-09-2026 |
| 6 | Про ИИ и нейросети... Я очень часто встречаюсь с заблуждениями ... | 0 | 5.44 | 01-10-2026 |
| 7 | Облачные провайдеры берут плату не за железо, а за лень ... | 0 | 9.49 | 29-09-2026 |
| 8 | Расходы крупного бизнеса в России на ИИ могут вырасти вдвое, пишут СМИ | 0 | 11.18 | 07-10-2026 |
| 9 | Мой личный «железный человек»: как я научил нейросеть быть моим ... | 0 | 8.11 | 06-10-2026 |
| 10 | AIの「トークン浪費」を減らす5つの打ち手――AI請求額が“また増えた”をどう抑制? | 0 | 10 | 07-10-2026 |