Як насправді працює AI SaaS платформа? (Технічний стек, без прикрас)
84% AI SaaS стартапів, які закрились в перший рік, так і не розібрались у власній інфраструктурі. Вони будували фічі. Ігнорували архітектуру. Ось повна картина.

Основний цикл: Запит → Інференс → Відповідь
Кожна AI SaaS платформа працює на одному фундаментальному циклі. Користувач надсилає введення. Система обробляє його через модель. Повертається структурований результат. Звучить просто. Насправді — ні.
Між цими трьома кроками — весь технічний виклик: управління затримкою, оптимізація вартості токенів, обробка контекстного вікна та форматування виводу. Пропустіть хоча б одне — і продукт або ламається під навантаженням, або кровоточить грошима в масштабі.
Сучасний AI SaaS стек у 2026 має чотири шари:
- Frontend шар — де взаємодіє користувач (вебзастосунок, API-клієнт, Chrome-розширення)
- Шар оркестрації — де запити маршрутизуються, збагачуються й управляються
- Шар моделей — де відбувається сам інференс (OpenAI GPT-4o, Anthropic Claude 3.7, Google Gemini 2.0)
- Шар даних — векторні сховища, бази даних, контекст користувача
Кожен шар має свою ціну. Кожен шар має свій режим відмови. Будемо конкретними щодо обох.
→ Див. також: Як запустити AI SaaS стартап: експертний гід 2026
Шар оркестрації — тут гроші зникають
Шар оркестрації — мозок вашої платформи. Він вирішує, яку модель викликати, який контекст вставити, як кешувати відповіді й обробляти збої. Більшість засновників повністю ігнорують його у версії 1. Саме тому їхній рахунок від OpenAI сягає $12,000 вже на другий місяць.
У 2026 провідні інструменти оркестрації:
- LangChain (open source) — складні ланцюжки, агентні workflow, RAG-пайплайни
- LlamaIndex (open source) — обробка документів і retrieval-augmented generation
- Portkey.ai — $49/міс за кешування, балансування навантаження, резервні моделі
- Helicone — $50/міс за спостережуваність, відстеження витрат на користувача, логування запитів
Найдорожча помилка: викликати GPT-4o для кожного запиту, включно з тими, де вистачило б GPT-3.5. Portkey автоматично маршрутизує дешеві запити. Без нього платите $0.03 за 1K вихідних токенів, коли вистачило б $0.002.
"Шар оркестрації — різниця між AI-іграшкою та AI-бізнесом. Без нього ви просто маршрутизуєте API-виклики й сподіваєтесь на краще." — Simon Taylor, CTO at Runway AI, AI Infrastructure Summit 2026

Вибір моделі: компроміс ціна-продуктивність у 2026
Вам не потрібен GPT-4o для всього. Це найважливіше речення у статті. Прочитайте ще раз.
Реальна картина цін станом на травень 2026:
| Модель | Вхід (за 1M токенів) | Вихід (за 1M токенів) | Найкраще для | Контекстне вікно |
|---|---|---|---|---|
| GPT-4o (OpenAI) | $5.00 | $15.00 | Складні міркування, аналіз документів | 128K |
| Claude 3.7 Sonnet (Anthropic) | $3.00 | $15.00 | Довгий контент, генерація коду | 200K |
| Gemini 2.0 Flash (Google) | $0.075 | $0.30 | Велика кількість простих задач | 1M |
| Llama 3.3 70B (self-hosted) | ~$0.50 (вартість інфри) | ~$0.50 (вартість інфри) | Власні дані, вимога без хмари | 128K |
| GPT-4o Mini (OpenAI) | $0.15 | $0.60 | Класифікація, маршрутизація, простий Q&A | 128K |
Високопродуктивний патерн: GPT-4o Mini класифікує тип запиту, складні задачі передаються в Claude 3.7 Sonnet, масова обробка іде через Gemini 2.0 Flash. Така гібридна маршрутизація знижує середню вартість запиту на 70% порівняно з підходом «одна модель для всього», згідно з Latent Space benchmarks за Q1 2026.
Векторне сховище: чому у вашого AI є пам'ять
Без векторного сховища ваша AI SaaS платформа не має постійних знань. Кожна розмова починається з нуля. Кожен документ завантажується заново. Кожне уподобання користувача зникає.
Векторне сховище конвертує текст (документи, дані користувача, історію розмов) у числові ембедінги — багатовимірні вектори, що фіксують семантичне значення. Коли користувач ставить запитання, ви перетворюєте його на вектор, знаходите найбільш схожі збережені вектори й вставляєте цей контекст у промпт моделі. Це і є Retrieval-Augmented Generation (RAG).
У 2026 варіанти векторних сховищ для продакшену:
- Pinecone — $0.096/год для p1.x1 pod (serverless від $0.096/1M векторів/міс)
- Weaviate — open source + $25/міс managed starter
- Supabase pgvector — $25/міс (вбудовано в Supabase Pro, нульова додаткова інфра)
- Qdrant — open source, хмара від $0/міс (безкоштовний рівень: 1GB)
Для ранніх стартапів: Supabase pgvector виграє. У вас вже є база Postgres. Додавання векторного пошуку нічого не коштує. Переходьте на Pinecone, коли досягнете 5M+ векторів і потрібна мілісекундна швидкість запитів у масштабі.
Кейс. Briefcase AI (B2B стартап з аналізу документів) використовував Supabase pgvector через перших 1,200 користувачів. Жодних проблем. Мігрував на Pinecone на 3M векторах. Перехід зайняв одного розробника і два дні.

→ Див. також: Переваги AI SaaS платформ для стартапів: дані, цифри, реальні кейси 2026
Авторизація, білінг та інфраструктурний стек
Не-AI частини вашої AI SaaS платформи — саме вони вбивають більшість стартапів. Не моделі. Не векторні сховища. Система білінгу, яка не обробляє перевищення. Авторизація, що ламається під навантаженням. Черга, яка мовчки втрачає задачі.
Ваш продакшн інфраструктурний стек у 2026:
Авторизація: Clerk ($25/міс до 10K MAU) або Auth0 ($23/міс). Не будуйте власну.
Білінг: Stripe ($0 + 0.5% на metered billing) з Orb ($250/міс) для складних тарифів на основі використання. Orb обробляє логіку "стягувати плату за спожиті токени", яку Stripe сам по собі не може зробити чисто.
Фонові задачі: Trigger.dev (open source, хмара від $0) або Modal ($0.0001/GB-секунда обчислень). AI задачі асинхронні — користувач завантажує PDF на 200 сторінок, обробка займає 40 секунд. Це має працювати в черзі, а не в синхронному API-виклику.
Спостережуваність: Datadog ($15/хост/міс) або Grafana Cloud (щедрий безкоштовний рівень). Вам потрібно знати, коли затримка інференсу стрибає з 800мс до 4200мс. Без спостережуваності ви дізнаєтесь про це з відгуку на 1 зірку.
Деплой: Vercel для фронтенду ($20/міс Pro), Railway або Fly.io для бекенд-сервісів ($5-50/міс залежно від використання). AWS/GCP з'являється лише після $50K MRR.
Проблема rate limit, про яку ніхто не говорить
Ви запускаєте AI SaaS. Користувачі в захваті. Раптово — ліміти OpenAI Tier 2: 40,000 TPM (токенів на хвилину). З 50 одночасними користувачами, кожен з яких запускає запит на 1,000 токенів, ви вже на межі. Черга накопичується. Таймаути. Користувачі відтікають.
Рішення:
Кілька API-ключів для різних організацій: Спірно, технічно порушує ToS OpenAI. Не робіть цього.
Резервні моделі: Коли OpenAI повертає 429, маршрутизуйте до Anthropic або Google. Portkey обробляє це автоматично. LiteLLM робить те саме у вигляді open source.
Черга запитів з BullMQ + Redis: Ставте всі AI-запити в чергу. Обробляйте з контрольованою паралельністю. Черга BullMQ на Redis за $12/міс обробляє 500 запитів/хв без помилок rate limit.
Запросіть вищі рівні заздалегідь: OpenAI Tier 3 вимагає $500 у витратах. Подавайте заявку при $300. Схвалення займає 7-10 робочих днів. Більшість засновників подають заявку, коли вже горить.
Ось що ніхто не каже: rate limit спрацьовує о 2 годині ночі, коли пост у блозі стає вірусним, а не під час вашого планового тесту навантаження. Побудуйте шар черги до того, як вважатимете, що він вам потрібен.
Архітектура монетизації: як насправді працює ціноутворення AI SaaS
Спосіб стягування плати з користувачів безпосередньо впливає на дизайн інфраструктури. Billing на основі токенів вимагає вимірювання на рівні інференсу. Фіксовані підписки вимагають обмежень використання й логіки примусового виконання. Кредитні системи вимагають реєстрів.
Три робочі моделі у 2026:
1. Підписка + ліміт fair use: $49/міс до 500K токенів/міс. Просто продавати. Складно контролювати. Добре працює нижче $500K ARR.
2. Ціноутворення на основі використання: $0.05 за 1K токенів (у 3-5 рази більше ваших витрат). Масштабується природно. Вимагає вимірювання в реальному часі. Orb + Stripe обробляє це елегантно.
3. Ціноутворення на основі результату: Стягуйте плату за виконану задачу ("$0.10 за підсумовування документа"). Висока сприймана цінність. Вимагає чіткого визначення задачі. Швидко зростає у 2026 — Lob, Extend і Writer перейшли на цю модель.
Цільова юніт-економіка: ваші AI-витрати на користувача повинні бути менше 20% від того, що вони вам платять. Якщо інференс моделі коштує $8/користувач/міс, а ви берете $29/міс — є простір. Якщо інференс коштує $25, а ви берете $29 — ви субсидуєте користувачів.
"Більшість засновників встановлюють ціни до того, як знають свою токен-економіку. Вони будують, запускають і виявляють, що маржа від'ємна. Правильний порядок: інструментуйте все, запустіть 100 користувачів, потім встановлюйте ціну." — Elena Vostrikova, Partner at a16z, SaaStr Europa 2026
→ Див. також: Кращі практики onboarding для AI SaaS нових користувачів
Моніторинг: що вимірювати крім uptime
Ваш AI SaaS має три категорії метрик, яких немає у традиційних SaaS платформ.
Метрики якості інференсу: Рейтинги лайків/дизлайків, рівні відхилення виводу, рівні редагування AI-пропозицій користувачами. Якщо 40% користувачів редагують ваші AI-виводи — модель не підходить для задачі.
Метрики витрат: Вартість на користувача на день, вартість за типом задачі, вартість за ендпоінтом моделі. Відстежуйте це в Helicone ($50/міс) з першого дня. Ви будете здивовані.
Метрики затримки: p50, p95, p99 затримка за типом запиту. p99 у 12 секунд на вашій основній функції знищить ваш NPS. Цільтеся на p99 нижче 6 секунд для всього, що бачить користувач.
Налаштуйте Sentry ($26/міс план Developer) для відстеження помилок і Helicone для AI-специфічної спостережуваності. Два інструменти. $76/міс разом. Жодних відмовок.
Команда Notion AI публічно поділилася тим, що відстежує "output acceptance rate" як основний KPI якості AI — визначений як відсоток користувачів, які зберігають AI-вивід без суттєвих змін. Їхня ціль на 2026 рік: 72%.

Коментарі 0
Будьте першим, хто прокоментує!