discover · educational 10 липня 2026 р. 12 хв

Локальні AI-моделі: коли дані не виїжджають з офісу

Для розпізнавання мовлення, OCR і класифікації локальна модель дає достатню якість: українська в Parakeet — 6.79% WER. Але компроміс переїхав у рантайм.

локальні AI-моделіprivacy AIon-premise LLMOCRGDPR

Andrew Maryasov, AI-консультант, засновник Auspex і Grow2.ai. Локальна AI-модель — це модель, що працює на вашому залізі, без мережевого виклику до зовнішнього провайдера. Для трьох задач — розпізнавання мовлення, OCR документів і класифікація зображень — вона вже дає якість, достатню для продакшену: українська мова в Parakeet-TDT-0.6B-v3 показує 6.79% WER на Fleurs при середньому по мовах 11.97%. Компроміс при цьому нікуди не зник. Він просто переїхав з якості моделі в її експлуатацію: та сама модель на 258 мільйонів параметрів обробляє документ за шість секунд або за двадцять хвилин — залежно від того, яким рушієм ви її запустили.

TL;DR (за 30 секунд)

Шість секунд або двадцять хвилин

granite-docling-258M — модель IBM Research для конвертації документів, випущена у вересні 2025 під ліцензією Apache 2.0. Двісті п’ятдесят вісім мільйонів параметрів. За мірками 2026 року це майже нічого: у сто разів менше за моделі, які ви запускаєте через API.

У трекері проєкту Docling висить issue №2348, де інженер описує оцінку моделі на CPU: генерація виходу для документа займає п’ятнадцять-двадцять хвилин. В обговоренні №37 до картки моделі на Hugging Face інший користувач скаржиться, що навіть на RTX 6000 Ada з 48 гігабайтами відеопам’яті одна сторінка обробляється неприпустимо довго, і додає ремарку, від якої стає ніяково: кількамільярдні моделі в LM Studio віддають токени помітно швидше за цю 258-мільйонну.

У тій самій гілці третій учасник ставить правильне питання: а що саме ви міряєте? І показує свій вимір на одному файлі. Повний пайплайн через докер-UI — близько 35 секунд. Та сама модель через llama-server з bf16-квантизацією у форматі GGUF — 6 секунд. Причому відповідь із «простого», непайплайнового виклику виявилась точнішою.

Одна модель, один файл, розкид у два порядки.

Питання «чи достатньо якісна локальна модель» для цілого класу задач уже закрите. Питання «чи зможете ви її нормально експлуатувати» лишається відкритим, і обпікаються саме на ньому.

Три задачі, де локальна модель уже достатня

Спільна риса цих трьох задач: модель нічого не вигадує, вона перетворює один вид сигналу на інший — звук на текст, пікселі на структуру, зображення на мітку. Це вузькі, детерміновані, об’ємні операції, і саме на них маленькі моделі витягують.

Розпізнавання мовлення: українська всередині

NVIDIA випустила parakeet-tdt-0.6b-v3 — модель автоматичного розпізнавання мовлення на 600 мільйонів параметрів. Попередниця, v2, вміла тільки англійську. Третя версія розширена до 25 європейських мов, і українська в цьому списку є, поряд з польською, чеською, румунською, литовською.

Числа з картки моделі, WER (відсоток помилок за словами, менше — краще):

МоваFleursCoVoST
Українська6.79%5.10%
Російська5.51%3.00%
Португальська4.76%3.96%
Шведська15.08%20.16%
Словенська24.03%31.80%
Середнє по мовах11.97%11.98%

Українська йде помітно краще за середнє. Модель сама визначає мову аудіо — підказувати не треба. Вона розставляє пунктуацію і великі літери, віддає таймкоди на рівні слів і сегментів, тримає аудіо до 24 хвилин з повною увагою і до трьох годин з локальною. Ліцензія CC BY 4.0 — комерційне використання дозволено.

Шістсот мільйонів параметрів. Це не та вага, під яку купують сервер.

Зверніть увагу на нижні рядки таблиці. Словенська в тій самій моделі дає 24%, майже кожне четверте слово. Якщо ваша аудиторія говорить словенською, попередній абзац для вас не працює: середнє число в картці моделі не описує вашу мову. Дивіться свій рядок.

OCR документів: структура, а не просто текст

Класичний OCR віддає вам текст і втрачає все інше — де була таблиця, де формула, де підпис під рисунком. Для RAG-пайплайну це втрата, яку потім ніяк не відновити.

granite-docling-258M побудований інакше. Під капотом архітектура Idefics3, у якій IBM замінила візуальний енкодер на siglip2-base-patch16-512, а мовну частину — на Granite 165M. Модель зберігає розмітку: таблиці лишаються таблицями, формули формулами, код кодом, а вихід лягає в DoclingDocument — структуру, з якої зручно чанкувати для пошуку.

Apache 2.0. Можна брати, можна модифікувати, можна ставити всередину продукту.

І тут же — та сама пастка з рантаймом, з якої почалась стаття. Модель маленька, але це повноцінна візуально-мовна модель: вона генерує вихід токен за токеном на кожну сторінку. Наївний запуск через transformers на процесорі перетворює це на двадцятихвилинне очікування. Той самий вага-файл під правильним рушієм — секунди.

Класифікація і зір: те, що вже у вас у кишені

Apple опублікувала FastVLM — візуально-мовну модель, представлену на CVPR 2025, з відкритим репозиторієм. Головне в ній не точність, а затримка до першого токена: FastVLM-0.5B віддає перший токен у 85 разів швидше за LLaVA-OneVision і має візуальний енкодер у 3.4 раза менший. Старша FastVLM-7B на Qwen2 — у 7.9 раза швидша за Cambrian-1-8B при зіставній точності. Демо працює прямо в браузері через WebGPU.

Восьмого червня 2026 Apple показала третє покоління Apple Foundation Models — п’ять моделей, від тих, що живуть на пристрої, до серверних на Private Cloud Compute. На рівні фреймворку це виглядає буденно: в iOS 26 застосунок отримує сесію до трибільйонної моделі на пристрої, і мережі в шляху виклику просто немає.

Це важливий сигнал не тому, що Apple зробила щось унікальне. А тому, що «модель на пристрої» перестала бути дослідницьким жанром і стала елементом операційної системи, який купує кожен користувач разом із телефоном.

Де локальна модель ламається

Межа є, і проходить вона у трьох місцях.

Мова, якої немає у вашому рядку таблиці. Ми вже подивились на словенську. Загальне правило: якість маленької моделі розподілена нерівномірно, і розподіл цей ніяк не корелює з тим, наскільки мова вам важлива. Перед впровадженням візьміть двісті хвилин власного аудіо — не бенчмарк, своє — і поміряйте.

Рантайм, який тихо деградує. У березні 2026 в трекері Docling з’явився issue №3202, автор якого стверджує: у TableStructureModel зашитий безумовний відкат з MPS на CPU, через що прискорення на Apple Silicon мовчки вимикається. За його оцінкою, зняття цього відкату разом з автовибором VLM дає прискорення в 14–17 разів. Issue на момент написання відкритий.

Мене в цій історії цікавить слово «мовчки». Модель не падає. Логи чисті. Ви просто отримуєте продуктивність у п’ятнадцять разів гіршу за можливу і списуєте це на «ну, локально ж повільніше». Тут той самий клас проблем, що і з blast radius AI-агента: найдорожче коштує не те, що зламалось голосно.

Задачі, де треба міркувати. Транскрибація, витягування, класифікація — це перетворення. Генерація тексту, багатокроковий аналіз, довгий контекст, робота з двозначністю — це інше. Тут маленька локальна модель програє, і програє не трохи. Не намагайтесь замінити нею той виклик, у якому вам потрібна саме сильна модель.

Який клас питань зникає

Коли ви відправляєте скан паспорта клієнта в зовнішній API, ви робите не одну дію, а кілька — і кожна тягне за собою юридичний хвіст. Ви передаєте персональні дані обробнику, а отже вам потрібна угода про обробку за статтею 28 GDPR. Якщо обробник за межами ЄС — вмикається розділ V про транскордонну передачу з усім супроводом. Якщо обробка масштабна або чутлива — потрібна оцінка впливу за статтею 35.

Локальна модель не робить вас «відповідними GDPR». Вона робить дещо вужче і практичніше: прибирає з рівняння цілий доданок. Немає передачі — немає розділу V. Немає нового субпідрядника — немає ще однієї угоди за статтею 28. Дані клієнта не виїжджають з периметра, у якому вони й так законно лежали.

Це не юридична консультація, і ваш юрист все одно має подивитись на конкретну схему. Але «ми зменшили ризик» і «ми прибрали підставу для питання» — різні речення.

Другий шар — регуляторний. Європейська комісія опублікувала Digital Omnibus щодо AI 19 листопада 2025. Європарламент схвалив узгоджений текст 17 червня 2026 голосами 423 проти 57 при 174 утриманих. Рада ЄС дала фінальне зелене світло 29 червня 2026. Лишаються підписання і публікація в Офіційному журналі.

Що це означає по датах: зобов’язання для високоризикових систем з Додатку III зсунуто на 2 грудня 2027, а для AI, вбудованого в регульовані продукти з Додатку I, — на 2 серпня 2028. Початковим дедлайном було 2 серпня 2026.

Зсув дедлайнів не означає, що можна розслабитись: він означає, що невизначеність триватиме ще півтора-два роки. Архітектура, у якій персональні дані фізично не залишають ваш периметр, стійка до того, який саме текст врешті вийде в Офіційному журналі. Архітектура, побудована навколо конкретного пункту конкретної редакції регламенту, стійкою не буде.

Скільки це коштує насправді

Локальна модель — це не «безкоштовно замість підписки». Ви міняєте одну статтю витрат на іншу: замість оплати за токен, яка росте лінійно з обсягом, ви отримуєте залізо, яке купують один раз, і інженерний час, який витрачають постійно.

Порахуйте другу частину чесно: вибрати рушій, виміряти замість припустити, помітити що прискорення тихо вимкнулось, оновити модель коли вийде наступна версія. Це не разова робота, а утримання.

Арифметика повертається на бік локального в двох випадках. Перший — обсяг: коли той самий тип документа проходить через систему тисячами на місяць, per-token ціна перестає бути дрібницею. Другий — коли зовнішня передача даних або дорого коштує вам юридично, або взагалі неприйнятна для клієнта.

Якщо у вас триста документів на місяць і немає персональних даних — залишайтесь на API. Так буде дешевше і чесніше. Про те, як я взагалі вирішую, чи брати новий інструмент, є окремий розбір.

Правило маршрутизації

Практичний висновок, до якого я прийшов, будуючи пайплайни витягування даних з PDF і сканів для клієнтів, звучить так.

Маршрутизуйте не за секретністю задачі, а за тим, що саме перетинає периметр.

Сирий документ, живий звук, обличчя на фото — залишаються всередині. Локальна модель перетворює їх на похідні: текст без імен, вектор ознак, мітку класу, структуровану таблицю. Далі, якщо для наступного кроку справді потрібна сильна модель, назовні їде вже похідна, у якій персональних даних немає.

Розпізнавання, витягування, класифікація — вниз, на своє залізо. Міркування, генерація, довгий контекст — нагору, в хмару. Межа проходить не між «важливим» і «неважливим», а між перетворенням і мисленням.

Три роки тому цей поділ був теоретичним, бо локальна половина не витягувала за якістю. Зараз вона витягує. Ціна, яку за це платять, — не гірший результат, а обов’язок розібратись, як воно у вас запускається. Що з локального я тримаю у себе щодня, я розписував у своєму AI-стеку.

Шість секунд або двадцять хвилин. Різниця не в моделі.

FAQ

Чи підтримують локальні AI-моделі українську мову?

Так. Модель parakeet-tdt-0.6b-v3 від NVIDIA розпізнає українську серед 25 європейських мов з автоматичним визначенням мови. Показник WER для української — 6.79% на бенчмарку Fleurs і 5.10% на CoVoST, що краще за середнє значення по всіх підтримуваних мовах (11.97% на Fleurs). Ліцензія CC BY 4.0 дозволяє комерційне використання.

Чи означає локальна модель відповідність GDPR?

Ні. Локальна модель не робить обробку даних автоматично законною — підстава для обробки, мінімізація даних і строки зберігання лишаються вашою відповідальністю. Вона прибирає окремі юридичні питання: якщо дані не передаються зовнішньому обробнику, не виникає потреби в угоді за статтею 28 GDPR і в механізмах транскордонної передачі з розділу V. Конкретну схему має оцінити юрист.

Яке залізо потрібне для локальної OCR-моделі?

Розмір моделі важить менше за рушій. granite-docling-258M має 258 мільйонів параметрів, але при наївному запуску через transformers на CPU користувачі повідомляють про 15–20 хвилин на документ, тоді як той самий файл через llama-server з bf16 GGUF обробляється за секунди. Перед закупівлею заліза виміряйте свій пайплайн на своїх документах.

Коли локальна модель гірша за хмарну?

У трьох випадках: коли ваша мова погано представлена в моделі (у Parakeet словенська дає 24.03% WER проти 6.79% в української); коли задача вимагає міркування, генерації або довгого контексту; коли обсяг малий і вартість інженерного часу на утримання перевищує рахунок за API.

Що змінилось у термінах AI Act?

Рада ЄС 29 червня 2026 дала фінальне схвалення пакету Digital Omnibus, який раніше, 17 червня, схвалив Європарламент. Зобов’язання для високоризикових систем з Додатку III перенесено на 2 грудня 2027, для AI у регульованих продуктах з Додатку I — на 2 серпня 2028. Початковим дедлайном було 2 серпня 2026. Лишаються підписання і публікація в Офіційному журналі.

Чи можна запустити AI-модель на телефоні?

Так. Apple FastVLM працює на iPhone і навіть у браузері через WebGPU, а FastVLM-0.5B віддає перший токен у 85 разів швидше за LLaVA-OneVision. З iOS 26 застосунки отримують доступ до трибільйонної моделі на пристрої через фреймворк Foundation Models — мережевого виклику в цьому шляху немає.

З чого почати перехід на локальні моделі?

Візьміть одну задачу з трьох — транскрибація, OCR, класифікація — і поміряйте на власних даних, а не на бенчмарку. Спочатку якість на вашій мові та ваших документах, потім швидкість під конкретним рушієм. Якщо обидва числа влаштовують, переносьте цю одну задачу, а решту пайплайну залиште як є.

Що далі

Питання «чи можна довіряти локальній моделі» у 2026 році розпадається на два. Чи достатньо вона точна на ваших даних — це вимірюється за пів дня і найчастіше відповідь «так». Чи зумієте ви її експлуатувати так, щоб вона не працювала в двісті разів повільніше за можливе, — це вже про вашу команду, а не про модель.

Якщо у вашій компанії зараз вирішують, чи віддавати документи клієнтів у зовнішній API, перешліть їм цей текст до того, як рішення ухвалять. А якщо пайплайн уже працює і ви не знаєте, що саме з нього виїжджає назовні, приходьте на discovery-сесію — за годину зазвичай видно, які дані перетинають периметр і чи є для цього підстава.

Дивіться також:

Джерела:


Опубліковано Andrew Maryasov, засновником Auspex і Grow2.ai — впроваджує AI-агентів і автоматизацію для бізнесу.

A
Andrew Maryasov

Засновник Auspex та Grow2.ai. 28 AI-проєктів у 14 галузях і 7 країнах, 8 власних AI-систем у продакшні.

Розсилка

Лист про AI — 2–3 листи на місяць

Особисті есе про те, як AI змінює мислення й роботу: що я спробував сам, що спрацювало, а що ні. Наприкінці — посилання на найкраще за останній час.

Без спаму. Відписатися можна в один клік.

Безкоштовний 30-хв discovery →