Ціна AI-агентів: чому рахунок росте, коли токени дешевшають
Я писав, що вартість роботи AI падає завжди. Gemini 3.5 Flash подорожчав утричі, і той самий бенчмарк коштує в 5,6 раза більше. Розбір помилки та висновки.
Andrew Maryasov, AI-консультант. У лютому 2026 я публічно стверджував, що ціна за одиницю роботи AI падає завжди. У травні Google випустив Gemini 3.5 Flash — і той самий набір тестів, який попередня модель проходила за $278, став коштувати $1 551. Ціна за токен впала. Рахунок виріс. Помилка була в тому, що я вважав ці дві величини однією.
TL;DR (за 30 секунд)
- Ціна за токен і ціна за роботу — різні величини. Перша падає. Друга — не обов’язково.
- Gemini 3.5 Flash коштує $1,50/$9,00 за мільйон токенів (вхід/вихід) проти $0,50/$3,00 у моделі, яку він замінив. Утричі дорожче під тим самим брендом «Flash».
- На прогоні Intelligence Index від Artificial Analysis новий Flash вийшов дорожчим за Gemini 3.1 Pro — при тому, що за токен він дешевший.
- Причина не в прайсі, а в тому, що reasoning-модель витрачає ітерації: мислення, багатослівність, повтори, ретраї.
- Важіль вартості — топологія системи, а не рядок у прайс-листі. Агент, який робить п’ять викликів там, де вистачає одного, дорожчий за будь-яку економію на моделі.
Мене спіймали ще в лютому
21 лютого 2026 я опублікував пост про падіння цін на AI. Приводом був коментар підписника: «Андрій, $200 — це дисконтна ціна. Скоро ця підписка буде коштувати $2000. Що робитимеш тоді?»
Я відповів цифрами. Stanford AI Index: вартість інференсу рівня GPT-3.5 впала в 280 разів за два роки — з двадцяти доларів до семи центів за мільйон токенів. GPT-4 на старті коштував $30/$60, GPT-4o mini через шістнадцять місяців — $0,15/$0,60. Далі я дістав парадокс Джевонса: коли вугілля дешевшає, його купують не менше, а більше. Корпоративні витрати на AI зросли на 320% саме тоді, коли ціна за токен обвалилася.
І дописав фразу, за яку тепер розплачуюсь: ціна за одиницю роботи падає, і падатиме — так працює кожна технологія в історії.
Я відповів підписнику графіком. Через три місяці графік відповів мені :)
Що сталося 19 травня
На Google I/O 2026 вийшов Gemini 3.5 Flash. Одразу в general availability, без публічного preview. А тоді розробники подивилися на прайс.
| Модель | Вхід ($/1M) | Вихід ($/1M) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
| Gemini 3 Flash | $0,50 | $3,00 |
| Gemini 3.5 Flash | $1,50 | $9,00 |
| Gemini 3.1 Pro | $2,00 | $12,00 |
Модель, яку позиціонують як заміну Gemini 3 Flash, коштує рівно втричі дорожче за попередницю. І сидить лише на чверть нижче за Pro-тариф. Слово «Flash» роками означало «дешевий, але притомний ярус» — тепер воно не означає нічого конкретного (уявіть, що бензин А-92 на заправці раптом коштує як А-98, а напис на колонці не змінився). Офіційний прайс підтверджує: $1,50 за мільйон вхідних, $9,00 за мільйон вихідних із урахуванням токенів мислення, $0,15 за кешований контекст.
The Batch виніс це в заголовок випуску 355 від 29 травня: Gemini Flash Gets Pricey. Редакція відзначила ширший контекст: Anthropic, OpenAI і Google підняли ціну за токен на своїх нових моделях. Тренд не одиничний.
Саме по собі подорожчання одного релізу мене б не зачепило — ціни ходять в обидва боки, це нормально.
Де саме я помилявся
Моя теза була не «токени дешевшають». Моя теза була «одиниця роботи дешевшає». І ось тут мене підловили на власному формулюванні.
Artificial Analysis ганяє всі моделі через однаковий набір тестів — Intelligence Index. Це буквально одна й та сама робота: ті самі задачі, той самий обсяг. Скільки коштує її прогнати:
Gemini 3 Flash — $278. Gemini 3.1 Pro Preview — $892. Gemini 3.5 Flash із увімкненим мисленням — $1 551.
Прочитайте ці три числа ще раз. Новий Flash дешевший за Pro за токен ($1,50 проти $2,00) і водночас дорожчий за Pro за виконану роботу — майже вдвічі. А проти моделі, яку він замінив, та сама робота подорожчала в 5,6 раза. The Batch формулює це без пом’якшень: за вимірюванням Artificial Analysis, Flash обходиться дорожче, ніж Gemini 3.1 Pro.
Обидва твердження істинні одночасно, і саме цю можливість моя лютнева модель світу не передбачала — я тоді був щиро певен, що це одна й та сама крива, просто в різних одиницях.
Агент витрачає ітерації, а не токени
Механізм простий, коли його побачиш.
Токен — це не одиниця роботи. Це одиниця розрахунку. Одиниця роботи — розв’язана задача. Між ними стоїть кількість ітерацій, які модель витрачає, доки дійде до відповіді.
Reasoning-модель думає вголос, і кожен токен мислення оплачується як вихідний. Вона багатослівна там, де попередниця відповідала одним рядком. Вона перепитує саму себе. У складному ланцюжку вона повторює крок, який не зійшовся. Провайдер може знизити ціну за токен удвічі — і все одно виставити більший рахунок, якщо модель почала витрачати вчетверо більше токенів на ту саму відповідь.
Далі це множиться на архітектуру. Уявіть агента з десяти послідовних кроків, кожен із надійністю 95% — цифра, якою більшість команд була б задоволена. Наскрізна надійність такого ланцюжка: 0,95¹⁰ ≈ 60%. Чотири прогони з десяти доведеться повторити. Мозок при цьому каже: «ну 95% же, майже ідеально» — а множення каже інше. Рахунок за ретраї не з’явиться в прайс-листі жодного вендора, але прийде у вас на картку.
Причому повтор коштує дорожче за перший прогон: агент заходить на другий круг із роздутим контекстом. А без окремого кроку верифікації він навіть не знає, що перший результат був хибним, — і платить за впевнену дурницю за повним тарифом.
Я вже писав, що токени — погана метрика ризику AI-агента, і пропонував міряти blast radius. Виявляється, токени — так само погана метрика вартості. Мене двічі привела до одного й того самого висновку різна дорога, і я примудрився не помітити цього перший раз.
Топологія коштує дорожче за модель
Різниця між найдешевшою і найдорожчою моделлю в лінійці Google — шестикратна: від $0,25 за мільйон у Flash-Lite до $1,50 у 3.5 Flash. Різниця між акуратним послідовним пайплайном і планувальником із суддею та консенсусом — порядок величини на тій самій задачі. Топологія рухає вартість через порядки. Вибір моделі рухає її всередині одного порядку.
З цього випливає порядок дій, зворотний до інтуїтивного. Спершу аудит структури: скільки викликів робить агент, скільки з них справді потрібні, де ланцюжок можна згорнути в один виклик із чіткішим evalʼом. Тільки потім — торг за модель.
Найдорожча архітектурна помилка навіть не в топології, а в аліасах. Якщо у вашому конфізі прописано gemini-flash без версії, ваш «дешевий запасний варіант» міг подорожчати втричі, поки ви читали цей абзац. Fallback-політика, написана на початку 2026 року, сьогодні веде в іншу цінову категорію під тією самою назвою.
Klarna: рахунок приходить не в тій валюті
Найвідоміший приклад того, що вартість вимірюють не там, — Klarna.
Їхній AI-асистент на моделях OpenAI за перший місяць провів 2,3 мільйона розмов з клієнтами, що прирівнювали до роботи 700 агентів підтримки. Час розв’язання впав з одинадцяти хвилин до менш ніж двох. Компанія оцінювала ефект приблизно в $40 мільйонів.
А в травні 2025 Себастьян Сємятковський, співзасновник і CEO, почав набирати людей назад. Його формулювання: коли витрати стають надто домінантним критерієм оцінки, на виході ви отримуєте нижчу якість.
Цей кейс масово переказують неправильно — і я мало не переказав слідом. Речник Klarna згодом уточнив, що CEO говорив про якість аутсорсингових людських агентів, а не про AI. Аналітикиня Forrester вважає, що проблема була в надто різкому скороченні штату, а не в самій автоматизації. Klarna не «визнала провал AI» — вона перейшла на гібридну модель і залишила клієнту гарантований шлях до людини.
Але базова структура помилки та сама, що й у мене з токенами. Klarna мала чисту, вимірювану, падаючу метрику — вартість транзакції обслуговування, $0,32 → $0,19. Метрика падала. Рахунок виставили в іншій валюті: повторні звернення, задоволеність, довіра до бренду. Я мав чисту падаючу метрику — вартість токена. Рахунок виставили в ітераціях.
Дешевшає те, що ви міряєте. Дорожчає те, чого ви не міряєте.
Чи скасовує це парадокс Джевонса
Ні. Джевонс живий і здоровий: витрати на AI ростуть саме тому, що одиниця подешевшала, а застосувань стало більше. Мій лютневий пост правильно описував макрокартину і правильно відповів підписнику — $200 не перетворяться на $2000 за ту саму роботу.
Помилка була у слові «завжди». Я взяв історичний тренд, який тримався на здешевленні інференсу, і поширив його на одиницю, яка визначається не інференсом, а поведінкою моделі та формою вашої системи. Тренд ціни за токен — про залізо, квантизацію та конкуренцію. Тренд ціни за роботу — про те, скільки разів ваш агент подумає, перш ніж відповісти. Це дві різні криві, і вони не зобов’язані йти в один бік.
Що я змінив у себе. Я перестав дивитися на прайс за мільйон токенів як на індикатор вартості. Замість цього міряю вартість одного успішного завершення задачі — з ретраями, з токенами мислення, з усіма кроками ланцюжка. Перед тим, як оцінювати новий інструмент, я тепер додаю до розрахунку вартість ітерацій, а не тільки вартість вбудовування. І фіксую версії моделей у конфігах явно, бо аліас — це необмежений чек на пред’явника.
Наступного разу, коли вендор покаже вам графік падіння ціни за токен, поставте одне питання: а скільки токенів тепер потрібно на ту саму відповідь?
FAQ
Чому Gemini 3.5 Flash дорожчий за Gemini 3.1 Pro, якщо за токен він дешевший?
За токен новий Flash справді дешевший: $1,50 проти $2,00 на вході. Але на прогоні Intelligence Index від Artificial Analysis він з увімкненим мисленням обійшовся в $1 551 проти $892 у Pro. Модель генерує значно більше токенів мислення на ту саму задачу, і це з’їдає економію на ставці.
Наскільки саме подорожчав Gemini Flash?
Gemini 3.5 Flash коштує $1,50 за мільйон вхідних і $9,00 за мільйон вихідних токенів. Модель, яку він замінює, Gemini 3 Flash, коштувала $0,50 і $3,00 відповідно. Це рівно трикратне зростання під тією самою назвою «Flash».
Що таке «ціна ітерації» на противагу ціні токена?
Ціна токена — скільки провайдер бере за одиницю тексту. Ціна ітерації — скільки токенів ваша система витрачає, доки дійде до прийнятної відповіді: мислення моделі, повтори кроків, ретраї після невдалої валідації, координація між агентами. Рахунок формує друга величина, а прайс-лист показує першу.
Як реально знизити вартість AI-агента?
Спершу аудит топології: скільки викликів моделі робить агент і скільки з них справді необхідні. Згортання зайвого ланцюжка в один виклик дає економію на порядок. Вибір дешевшої моделі дає економію в межах одного порядку. Тому структуру оптимізують першою, а модель — другою.
Чи означає це, що AI дорожчає загалом?
Ні. Вартість інференсу фіксованої якості історично падає, і це триває. Змінилося те, що нові моделі витрачають більше токенів на відповідь, а агентні архітектури множать кількість викликів. Тому конкретний рахунок конкретної команди може зростати на тлі загального здешевлення.
Чому небезпечно писати gemini-flash без версії в конфігу?
Бренд «Flash» більше не гарантує цінового ярусу. Аліас без явної версії може вести на модель, що коштує втричі дорожче за ту, під яку писалася ваша fallback-політика. Фіксуйте повний ідентифікатор моделі.
Парадокс Джевонса більше не працює?
Працює. Сукупні витрати на AI ростуть саме тому, що одиниця подешевшала і застосувань стало більше. Парадокс описує макрорівень. Помилка виникає, коли з нього виводять, що ціна кожної конкретної задачі теж падатиме — це не так.
Опубліковано Andrew Maryasov, засновником Auspex і Grow2.ai — впроваджую AI-агентів у бізнес-процеси малого та середнього бізнесу.
Якщо у вас уже крутиться агент у продакшені — порахуйте вартість одного успішного завершення задачі, а не вартість мільйона токенів. Різниця між цими двома числами і є ваш реальний рахунок. Як я розбираю топологію та вартість агентних систем — на сторінці консультацій. А якщо порахуєте самі, напишіть мені, що вийшло: цифри мене цікавлять більше за прогнози.
Лист про AI — 2–3 листи на місяць
Особисті есе про те, як AI змінює мислення й роботу: що я спробував сам, що спрацювало, а що ні. Наприкінці — посилання на найкраще за останній час.
Без спаму. Відписатися можна в один клік.