awareness · opinion 10 липня 2026 р. 9 хв

Ціна AI-агентів: чому рахунок росте, коли токени дешевшають

Я писав, що вартість роботи AI падає завжди. Gemini 3.5 Flash подорожчав утричі, і той самий бенчмарк коштує в 5,6 раза більше. Розбір помилки та висновки.

ціна AI-агентіввартість LLMLLM pricing 2026Gemini 3.5 FlashтокениAI-агенти

Andrew Maryasov, AI-консультант. У лютому 2026 я публічно стверджував, що ціна за одиницю роботи AI падає завжди. У травні Google випустив Gemini 3.5 Flash — і той самий набір тестів, який попередня модель проходила за $278, став коштувати $1 551. Ціна за токен впала. Рахунок виріс. Помилка була в тому, що я вважав ці дві величини однією.

TL;DR (за 30 секунд)

Мене спіймали ще в лютому

21 лютого 2026 я опублікував пост про падіння цін на AI. Приводом був коментар підписника: «Андрій, $200 — це дисконтна ціна. Скоро ця підписка буде коштувати $2000. Що робитимеш тоді?»

Я відповів цифрами. Stanford AI Index: вартість інференсу рівня GPT-3.5 впала в 280 разів за два роки — з двадцяти доларів до семи центів за мільйон токенів. GPT-4 на старті коштував $30/$60, GPT-4o mini через шістнадцять місяців — $0,15/$0,60. Далі я дістав парадокс Джевонса: коли вугілля дешевшає, його купують не менше, а більше. Корпоративні витрати на AI зросли на 320% саме тоді, коли ціна за токен обвалилася.

І дописав фразу, за яку тепер розплачуюсь: ціна за одиницю роботи падає, і падатиме — так працює кожна технологія в історії.

Я відповів підписнику графіком. Через три місяці графік відповів мені :)

Що сталося 19 травня

На Google I/O 2026 вийшов Gemini 3.5 Flash. Одразу в general availability, без публічного preview. А тоді розробники подивилися на прайс.

МодельВхід ($/1M)Вихід ($/1M)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3 Flash$0,50$3,00
Gemini 3.5 Flash$1,50$9,00
Gemini 3.1 Pro$2,00$12,00

Модель, яку позиціонують як заміну Gemini 3 Flash, коштує рівно втричі дорожче за попередницю. І сидить лише на чверть нижче за Pro-тариф. Слово «Flash» роками означало «дешевий, але притомний ярус» — тепер воно не означає нічого конкретного (уявіть, що бензин А-92 на заправці раптом коштує як А-98, а напис на колонці не змінився). Офіційний прайс підтверджує: $1,50 за мільйон вхідних, $9,00 за мільйон вихідних із урахуванням токенів мислення, $0,15 за кешований контекст.

The Batch виніс це в заголовок випуску 355 від 29 травня: Gemini Flash Gets Pricey. Редакція відзначила ширший контекст: Anthropic, OpenAI і Google підняли ціну за токен на своїх нових моделях. Тренд не одиничний.

Саме по собі подорожчання одного релізу мене б не зачепило — ціни ходять в обидва боки, це нормально.

Де саме я помилявся

Моя теза була не «токени дешевшають». Моя теза була «одиниця роботи дешевшає». І ось тут мене підловили на власному формулюванні.

Artificial Analysis ганяє всі моделі через однаковий набір тестів — Intelligence Index. Це буквально одна й та сама робота: ті самі задачі, той самий обсяг. Скільки коштує її прогнати:

Gemini 3 Flash — $278. Gemini 3.1 Pro Preview — $892. Gemini 3.5 Flash із увімкненим мисленням — $1 551.

Прочитайте ці три числа ще раз. Новий Flash дешевший за Pro за токен ($1,50 проти $2,00) і водночас дорожчий за Pro за виконану роботу — майже вдвічі. А проти моделі, яку він замінив, та сама робота подорожчала в 5,6 раза. The Batch формулює це без пом’якшень: за вимірюванням Artificial Analysis, Flash обходиться дорожче, ніж Gemini 3.1 Pro.

Обидва твердження істинні одночасно, і саме цю можливість моя лютнева модель світу не передбачала — я тоді був щиро певен, що це одна й та сама крива, просто в різних одиницях.

Агент витрачає ітерації, а не токени

Механізм простий, коли його побачиш.

Токен — це не одиниця роботи. Це одиниця розрахунку. Одиниця роботи — розв’язана задача. Між ними стоїть кількість ітерацій, які модель витрачає, доки дійде до відповіді.

Reasoning-модель думає вголос, і кожен токен мислення оплачується як вихідний. Вона багатослівна там, де попередниця відповідала одним рядком. Вона перепитує саму себе. У складному ланцюжку вона повторює крок, який не зійшовся. Провайдер може знизити ціну за токен удвічі — і все одно виставити більший рахунок, якщо модель почала витрачати вчетверо більше токенів на ту саму відповідь.

Далі це множиться на архітектуру. Уявіть агента з десяти послідовних кроків, кожен із надійністю 95% — цифра, якою більшість команд була б задоволена. Наскрізна надійність такого ланцюжка: 0,95¹⁰ ≈ 60%. Чотири прогони з десяти доведеться повторити. Мозок при цьому каже: «ну 95% же, майже ідеально» — а множення каже інше. Рахунок за ретраї не з’явиться в прайс-листі жодного вендора, але прийде у вас на картку.

Причому повтор коштує дорожче за перший прогон: агент заходить на другий круг із роздутим контекстом. А без окремого кроку верифікації він навіть не знає, що перший результат був хибним, — і платить за впевнену дурницю за повним тарифом.

Я вже писав, що токени — погана метрика ризику AI-агента, і пропонував міряти blast radius. Виявляється, токени — так само погана метрика вартості. Мене двічі привела до одного й того самого висновку різна дорога, і я примудрився не помітити цього перший раз.

Топологія коштує дорожче за модель

Різниця між найдешевшою і найдорожчою моделлю в лінійці Google — шестикратна: від $0,25 за мільйон у Flash-Lite до $1,50 у 3.5 Flash. Різниця між акуратним послідовним пайплайном і планувальником із суддею та консенсусом — порядок величини на тій самій задачі. Топологія рухає вартість через порядки. Вибір моделі рухає її всередині одного порядку.

З цього випливає порядок дій, зворотний до інтуїтивного. Спершу аудит структури: скільки викликів робить агент, скільки з них справді потрібні, де ланцюжок можна згорнути в один виклик із чіткішим evalʼом. Тільки потім — торг за модель.

Найдорожча архітектурна помилка навіть не в топології, а в аліасах. Якщо у вашому конфізі прописано gemini-flash без версії, ваш «дешевий запасний варіант» міг подорожчати втричі, поки ви читали цей абзац. Fallback-політика, написана на початку 2026 року, сьогодні веде в іншу цінову категорію під тією самою назвою.

Klarna: рахунок приходить не в тій валюті

Найвідоміший приклад того, що вартість вимірюють не там, — Klarna.

Їхній AI-асистент на моделях OpenAI за перший місяць провів 2,3 мільйона розмов з клієнтами, що прирівнювали до роботи 700 агентів підтримки. Час розв’язання впав з одинадцяти хвилин до менш ніж двох. Компанія оцінювала ефект приблизно в $40 мільйонів.

А в травні 2025 Себастьян Сємятковський, співзасновник і CEO, почав набирати людей назад. Його формулювання: коли витрати стають надто домінантним критерієм оцінки, на виході ви отримуєте нижчу якість.

Цей кейс масово переказують неправильно — і я мало не переказав слідом. Речник Klarna згодом уточнив, що CEO говорив про якість аутсорсингових людських агентів, а не про AI. Аналітикиня Forrester вважає, що проблема була в надто різкому скороченні штату, а не в самій автоматизації. Klarna не «визнала провал AI» — вона перейшла на гібридну модель і залишила клієнту гарантований шлях до людини.

Але базова структура помилки та сама, що й у мене з токенами. Klarna мала чисту, вимірювану, падаючу метрику — вартість транзакції обслуговування, $0,32 → $0,19. Метрика падала. Рахунок виставили в іншій валюті: повторні звернення, задоволеність, довіра до бренду. Я мав чисту падаючу метрику — вартість токена. Рахунок виставили в ітераціях.

Дешевшає те, що ви міряєте. Дорожчає те, чого ви не міряєте.

Чи скасовує це парадокс Джевонса

Ні. Джевонс живий і здоровий: витрати на AI ростуть саме тому, що одиниця подешевшала, а застосувань стало більше. Мій лютневий пост правильно описував макрокартину і правильно відповів підписнику — $200 не перетворяться на $2000 за ту саму роботу.

Помилка була у слові «завжди». Я взяв історичний тренд, який тримався на здешевленні інференсу, і поширив його на одиницю, яка визначається не інференсом, а поведінкою моделі та формою вашої системи. Тренд ціни за токен — про залізо, квантизацію та конкуренцію. Тренд ціни за роботу — про те, скільки разів ваш агент подумає, перш ніж відповісти. Це дві різні криві, і вони не зобов’язані йти в один бік.

Що я змінив у себе. Я перестав дивитися на прайс за мільйон токенів як на індикатор вартості. Замість цього міряю вартість одного успішного завершення задачі — з ретраями, з токенами мислення, з усіма кроками ланцюжка. Перед тим, як оцінювати новий інструмент, я тепер додаю до розрахунку вартість ітерацій, а не тільки вартість вбудовування. І фіксую версії моделей у конфігах явно, бо аліас — це необмежений чек на пред’явника.

Наступного разу, коли вендор покаже вам графік падіння ціни за токен, поставте одне питання: а скільки токенів тепер потрібно на ту саму відповідь?

FAQ

Чому Gemini 3.5 Flash дорожчий за Gemini 3.1 Pro, якщо за токен він дешевший?

За токен новий Flash справді дешевший: $1,50 проти $2,00 на вході. Але на прогоні Intelligence Index від Artificial Analysis він з увімкненим мисленням обійшовся в $1 551 проти $892 у Pro. Модель генерує значно більше токенів мислення на ту саму задачу, і це з’їдає економію на ставці.

Наскільки саме подорожчав Gemini Flash?

Gemini 3.5 Flash коштує $1,50 за мільйон вхідних і $9,00 за мільйон вихідних токенів. Модель, яку він замінює, Gemini 3 Flash, коштувала $0,50 і $3,00 відповідно. Це рівно трикратне зростання під тією самою назвою «Flash».

Що таке «ціна ітерації» на противагу ціні токена?

Ціна токена — скільки провайдер бере за одиницю тексту. Ціна ітерації — скільки токенів ваша система витрачає, доки дійде до прийнятної відповіді: мислення моделі, повтори кроків, ретраї після невдалої валідації, координація між агентами. Рахунок формує друга величина, а прайс-лист показує першу.

Як реально знизити вартість AI-агента?

Спершу аудит топології: скільки викликів моделі робить агент і скільки з них справді необхідні. Згортання зайвого ланцюжка в один виклик дає економію на порядок. Вибір дешевшої моделі дає економію в межах одного порядку. Тому структуру оптимізують першою, а модель — другою.

Чи означає це, що AI дорожчає загалом?

Ні. Вартість інференсу фіксованої якості історично падає, і це триває. Змінилося те, що нові моделі витрачають більше токенів на відповідь, а агентні архітектури множать кількість викликів. Тому конкретний рахунок конкретної команди може зростати на тлі загального здешевлення.

Чому небезпечно писати gemini-flash без версії в конфігу?

Бренд «Flash» більше не гарантує цінового ярусу. Аліас без явної версії може вести на модель, що коштує втричі дорожче за ту, під яку писалася ваша fallback-політика. Фіксуйте повний ідентифікатор моделі.

Парадокс Джевонса більше не працює?

Працює. Сукупні витрати на AI ростуть саме тому, що одиниця подешевшала і застосувань стало більше. Парадокс описує макрорівень. Помилка виникає, коли з нього виводять, що ціна кожної конкретної задачі теж падатиме — це не так.


Опубліковано Andrew Maryasov, засновником Auspex і Grow2.ai — впроваджую AI-агентів у бізнес-процеси малого та середнього бізнесу.

Якщо у вас уже крутиться агент у продакшені — порахуйте вартість одного успішного завершення задачі, а не вартість мільйона токенів. Різниця між цими двома числами і є ваш реальний рахунок. Як я розбираю топологію та вартість агентних систем — на сторінці консультацій. А якщо порахуєте самі, напишіть мені, що вийшло: цифри мене цікавлять більше за прогнози.

A
Andrew Maryasov

Засновник Auspex та Grow2.ai. 28 AI-проєктів у 14 галузях і 7 країнах, 8 власних AI-систем у продакшні.

Розсилка

Лист про AI — 2–3 листи на місяць

Особисті есе про те, як AI змінює мислення й роботу: що я спробував сам, що спрацювало, а що ні. Наприкінці — посилання на найкраще за останній час.

Без спаму. Відписатися можна в один клік.

Безкоштовний 30-хв discovery →