- Виклик
- Інженерна задача, яку ми поставили собі: дати багатьом командам вільно користуватися мовними моделями так, щоб витрати лишалися передбачуваними й планованими — і без черги погоджень між розробником і його редактором. Обидві звичні відповіді не працюють. Відкритий доступ означає, що рахунок наприкінці місяця стає несподіванкою. Централізований контроль означає, що моделями не користується ніхто. Ми хотіли третю відповідь — і хотіли її виміряти, а не обговорити.
- Рішення
- Ми спроєктували й побудували єдину контрольовану точку входу, через яку проходить кожен запит, перш ніж дійти до постачальника моделі. Кожен ключ має ліміт витрат; кожна команда — бюджет із жорстким відсіканням: коли бюджет вичерпано, всі ключі команди зупиняються одночасно, а не після того, як хтось помітить. Використання рахується точно навіть для стрімінгових відповідей — саме там, де наївний облік тихо занижує цифри. Витрати, токени й затримка трасуються по кожному виклику, тож питання «скільки минулого місяця коштував AI і кому» має відповідь із розбивкою. Далі ми прогнали все це через інструменти, у яких інженери реально працюють, — бо gateway, до якого не можна підключити свій редактор, не використовує ніхто.
- Результат
- Перевитрату бюджету перевірено на рівні менш як 1% на реальних бюджетах. Жорстке відсікання по команді підтверджено — спрацьовує так, як спроєктовано. Додаткову затримку gateway виміряно на рівні близько двох секунд, із чіткими рекомендаціями, який трафік варто пускати через нього, а який краще надсилати напряму. Точність підрахунку токенів для стрімінгу підтверджено, а весь шлях перевірено на реальних щоденних клієнтах розробників.
R&D
LLM-gateway, який тримає витрати багатьох команд під контролем
Дайте цілій інженерній організації доступ до мовних моделей — і станеться дві речі: робота піде швидше, а скільки це коштуватиме, не скаже ніхто. Ми поставили собі задачу полагодити другу частину, не гальмуючи першу, і побудували gateway, який тримає бюджет по кожній команді, зупиняє доступ, коли бюджет вичерпано, і трасує кожен запит наскрізь.
Це R&D, який ми провели, а не клієнтська продакшен-система. Це саме та здатність, яку ми постачаємо, — архітектура, контроль і цифри нижче наші власні й виміряні.
Робота
Що ми хотіли довести.
Супровідна деталь: LLM-проксі (класу LiteLLM) перед AWS Bedrock, з PostgreSQL для стану бюджетів і Langfuse для трасування витрат, токенів і затримок; у контейнерах, з розгортанням у власний хмарний акаунт замовника. Той самий підхід працює перед іншими постачальниками або self-hosted моделями з відкритими вагами — він не прив'язаний до Bedrock.
Цікаво, скільки це коштуватиме — і як це контролювати — у вас?
Почати розмовуРезультати
Що ми виміряли.
Чотири цифри, всі з наших власних R&D-прогонів. Ми публікуємо їх, бо виміряли; ми не публікуємо обсяги запитів, суми заощаджень чи кількість команд, бо їх не вимірювали.
<1%
Перевитрата бюджету
Перевірено на реальних бюджетах — це різниця між витратами на AI, які можна планувати, і витратами, які виявляються в рахунку.
По командах
Жорсткі ліміти витрат
Бюджети й ліміти на команду та на ключ із жорстким відсіканням: коли бюджет команди вичерпано, всі її ключі зупиняються одночасно.
~+2с
Додаткова затримка
Власні накладні витрати gateway, виміряні, — з рекомендаціями, який трафік пускати через нього, а який надсилати прямо до моделі.
Повна
Observability витрат
Витрати, токени й затримка трасуються по кожному виклику в Langfuse, включно з точним обліком для стрімінгових відповідей.
Походження: ці результати отримані в R&D, який ми довели до готовності до продакшену, а не в системі, яку ми обслуговуємо для клієнта. Кожну цифру вище виміряно саме в тій роботі; тут немає ані оцінок, ані прогнозів.
Що це означає для вас
Той самий контроль — на вашій інфраструктурі.
Ми побудували це раніше, ніж почали пропонувати, тож метод перевірено за наш кошт, а не за ваш. Якщо ваша організація рухається до широкого використання AI, робота виглядатиме приблизно так.
Витрати, які фінанси можуть планувати
Бюджети на команду й на ключ, які діють, а не просто відображаються у звіті. Місячна вартість AI перестає бути цифрою, про яку дізнаються постфактум.
Доступ без «воротаря»
Розробники лишаються у своїх редакторах і внутрішніх системах. Контроль стоїть позаду них, тож впровадження не залежить від того, чи змінить хтось звички.
Одне місце, щоб бачити й перемикати
Єдина точка входу — це один журнал звернень, один набір правил доступу й одне місце, де можна змінити модель або постачальника, не чіпаючи код кожної команди.
Готовність до приватного розгортання
Той самий gateway однаково добре стоїть перед приватним хмарним ендпойнтом і перед self-hosted моделями з відкритими вагами — саме так впровадження приватної LLM лишається керованим у міру зростання.
Розгортаєте AI більш ніж на одну команду?
Розкажіть, як ваші команди користуються моделями зараз і що потрібно бачити фінансам і безпеці. Ми повернемося з тим контролем, який справді потрібен у вашому випадку, — і чесно скажемо, якщо gateway до нього не входить.