Koľko stojí prevádzka AI aplikácie a prečo to nikto nevie dopredu
Účet za AI nerastie s počtom používateľov, ale s tým, koľko sa pýtate modelu. O tom, z čoho sa cena skladá a ako ju udržať pod kontrolou.
Náklady na AI aplikáciu neurčuje počet používateľov, ale množstvo textu, ktoré cez model pretečie. Preto sa nedajú odhadnúť z počtu licencií — a preto sa dajú riadiť len meraním.
Klasický softvér má náklad, ktorý viete dopredu: server stojí mesačne toľko a toľko. AI funkcia takto nefunguje. Platíte za každé volanie modelu a to volanie je tým drahšie, čím viac textu doň vojde a čím viac z neho vyjde.
Znie to ako detail. Nie je.
Z čoho sa účet skladá
Model počíta vstup aj výstup. Vstup je všetko, čo mu pošlete — otázka používateľa, ale aj inštrukcie, príklady a podklady, ktoré ste do promptu pridali, aby odpovedal dobre. Výstup je to, čo napíše späť.
- Veľkosť kontextu. Keď k otázke priložíte desať strán dokumentácie, platíte tých desať strán pri každom jednom volaní, aj keby sa odpoveď týkala jedinej vety.
- Voľba modelu. Väčší model stojí viac za to isté. Časť úloh — triedenie, extrakcia polí, krátke zhrnutie — zvládne menší model prakticky rovnako.
- Opakovania. Keď model vráti niečo, čo neprejde validáciou, a systém to skúsi znova, zaplatili ste to dvakrát.
- Nevidená prevádzka. Testy, vývojárske skúšanie a automatické joby bežia na tom istom účte ako zákazníci.
Práve posledné dve položky bývajú prekvapením. Aplikácia funguje, používatelia sú spokojní, a účet je dvojnásobný oproti odhadu.
Prečo odhad dopredu nesedí
Spoľahlivý odhad by vyžadoval vedieť, koľko otázok ľudia položia a aké dlhé budú. To sa pred spustením nedá vedieť — a po spustení sa to mení podľa toho, ako sa aplikácia používa. Odhad má zmysel ako rádové číslo, nie ako rozpočet.
Rozumnejší postup je iný: pustiť funkciu na malú skupinu, zmerať skutočnú spotrebu na jedného používateľa a až z toho počítať. O výbere modelu a jeho cene sme písali samostatne.
Čo náklady naozaj zníži
Nie vyjednávanie s dodávateľom. Tieto štyri veci:
- Cache na opakované otázky. V zákazníckej podpore sa veľká časť otázok opakuje. Odpoveď, ktorú už raz model vytvoril, netreba tvoriť znova.
- Menší kontext. Namiesto celej dokumentácie pošlite len tie pasáže, ktoré sa otázky týkajú. To je práve úloha vyhľadávacej vrstvy (RAG).
- Správny model na správny krok. Rozbite úlohu a drahý model nechajte len na tú časť, ktorá ho naozaj potrebuje.
- Stropy. Limit na jednotlivú požiadavku aj na obdobie. Nie preto, že čakáte problém, ale preto, že chyba v cykle vie spáliť mesačný rozpočet za hodinu.
Merajte na úrovni funkcie, nie faktúry
Faktúra od poskytovateľa vám povie jedno číslo. To je na rozhodovanie málo. Užitočné je vedieť, ktorá funkcia koľko spotrebuje — potom viete, či sa oplatí optimalizovať, alebo ju rovno vypnúť, lebo ju nikto nepoužíva.
Upozornenie na neobvyklú spotrebu patrí k tomu. Rozdiel medzi „vieme o tom za dve hodiny" a „vieme o tom z vyúčtovania" je rozdiel medzi drobnosťou a nepríjemným mesiacom.
Toto všetko je súčasťou toho, ako prevádzkujeme AI aplikácie — a ak riešite, či to vôbec stavať vo vlastnej réžii, pozrite si porovnanie cloudu a vlastného servera.
Riešite niečo podobné vo vašej firme?
Chcem nezáväznú konzultáciu