Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Мы посчитали, за что платим, когда ИИ работает. Оказалось — ...

Дата публикации: 08-10-2026 11:01:36

Мы посчитали, за что платим, когда ИИ работает. Оказалось — не за ответы, а за чтение.
Мы ведём книгу о том, как мозг строит предсказания, и попутно считаем каждый свой расход. За два дня работы агентов накопилось 3 722 запроса, и вот что из них видно:
— 1 248 941 525 входных токенов, из них 99 % — попадания в кэш;
— 4 278 894 выходных токена, то есть 0,34 % от всего объёма;
— контекста на каждый токен ответа — 292 токена.
А теперь как эти токены превращаются в деньги:
— чтение из кэша — 45 % расхода;
— свежий служебный текст, который в кэш не попал (логи, файлы, вывод команд) — 23 %;
— собственно ответ модели — 31 %.
Здесь и спрятана главная неочевидность: ответ занимает треть денег при 0,34 % токенов. Один токен ответа примерно в двести раз дороже токена чтения — но чтения в двести девяносто раз больше. Поэтому «сократить документ» экономит копейки, а «сократить число и длину ходов агента» — рубли.
Теперь честно про грабли, на которые я сам наступил. Я решил посчитать «рублей за час работы агента» и разделил расход на длительность сессий. Получилось 0,86 ₽ в час — в 582 раза дешевле, чем у отрасли. Красивая цифра, и она ложь: сессии висят сутками в ожидании, и в длительность входит простой. Правильная база — запрос и активный час: 117–293 ₽ в час (1,4–3,5 доллара) при скорости 2–5 секунд на шаг. Это уже сравнимая величина, а не фантастика.
Дальше — эксперимент, который мы провели специально, чтобы поймать экономию на вранье. Мы сжали служебный текст до 12 % от исходного и прогнали проверку «утверждение ↔ источник» дважды: на полном тексте и на сжатом, сверяя с человеческой разметкой.
Результат: согласие с человеком упало с 85 % до 75 %. Ложных подтверждений сжатие не создало — оно сделало хуже другое: на контрольной паре, где утверждение было дословно первой фразой самого источника, проверяющий после сжатия перестал видеть там утверждение вообще. То есть экономия покупается молчаливой потерей качества: ошибка не светится в логах, она просто исчезает из результата.
Поэтому у нас теперь правило: на рутине и батчах сжимать можно — там результат проверяет валидатор. Там, где рождается цифра, — проверка утверждений, деньги, клиентские материалы — нельзя.
Мы делимся этим не для красоты. Мы проверяем источники в чужих текстах и знаем, как выглядит «правдоподобно, но неверно».
Вопрос к вам: считали ли вы, сколько стоит час работы вашего агента — и готовы ли к тому, что экономия на сжатии тихо меняет результат, а не ломает его с ошибкой?
#КнигаМКС #ЗамерыИИ #разбор #наука

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
185 % на шаг — это 20 % на десяти ...113.6108-10-2026
2Мы взяли книгу, нарезали её на куски 100, 300 и ...012.6208-10-2026
3Облачные провайдеры берут плату не за железо, а за лень ...011.127-09-2026
4Как я перестала платить копирайтерам и дизайнерам. Спойлер: нейросети рулят ...05.1830-09-2026
5ИИ делает нас производительнее. Чем мы за это платим?06.2826-09-2026
6Про ИИ и нейросети... Я очень часто встречаюсь с заблуждениями ...05.4401-10-2026
7Облачные провайдеры берут плату не за железо, а за лень ...09.4929-09-2026
8Расходы крупного бизнеса в России на ИИ могут вырасти вдвое, пишут СМИ011.1807-10-2026
9Мой личный «железный человек»: как я научил нейросеть быть моим ...08.1106-10-2026
10AIの「トークン浪費」を減らす5つの打ち手――AI請求額が“また増えた”をどう抑制?01007-10-2026

Классификация: . Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 14.49. Источник: vk.com.