Automatyzacja · Agenci AI
Agent AI w firmie: realny koszt po 3 miesiącach (i jak nie dać się zaskoczyć rachunkiem za API)
W skrócie
Koszt wdrożenia agenta AI to jednorazowa faktura, którą łatwo policzyć z góry. Koszt utrzymania to co miesiąc rachunek za tokeny, subskrypcje n8n albo Make i czasem hosting bazy wektorowej, który potrafi zaskoczyć klienta w drugim lub trzecim miesiącu. Na naszym przykładzie firmy obsługującej pocztę i CRM wychodzi od kilkudziesięciu do kilkuset złotych miesięcznie za jeden proces, a przy kilku agentach pracujących równolegle suma rośnie do 500-1200 zł. Da się to kontrolować: wyborem tańszego modelu do prostych zadań, cache'owaniem powtarzalnego kontekstu i twardymi limitami.
Dlaczego rachunek za API zaskakuje dopiero po 2-3 miesiącach
W ofertach wdrożeniowych, także naszych, klient dostaje jasną kwotę: tyle kosztuje zbudowanie agenta, integracja z CRM, testy, uruchomienie. To liczba, którą łatwo zaakceptować, bo jest jedna i konkretna. Problem w tym, że internet w zasadzie kończy temat na tej fakturze. Nikt szeroko nie pisze, że miesiąc później przychodzi rachunek z OpenAI albo Anthropic, a obok niego subskrypcja n8n lub Make, i że te dwie pozycje razem potrafią po kwartale przewyższyć jednorazowy koszt wdrożenia małego agenta.
W naszych wdrożeniach ten moment zaskoczenia pojawia się zwykle w drugim lub trzecim miesiącu. Pierwszy miesiąc rachunek jest niski, bo agent dopiero się rozkręca, zespół go testuje, wolumen zgłoszeń jest mniejszy niż docelowy. Od trzeciego miesiąca proces działa pełną parą i wtedy widać realne zużycie tokenów. Jeśli nikt wcześniej nie policzył tego na kartce, klient dzwoni z pytaniem, czemu rachunek za API jest dwa razy wyższy niż zakładał.
Z czego naprawdę składa się miesięczny koszt utrzymania
Na fakturę za utrzymanie agenta AI składają się w praktyce trzy pozycje, rzadko cztery. Warto je rozdzielić, bo każdą kontroluje się inaczej.
Tokeny, czyli opłata za samo myślenie modelu
To pozycja, która najbardziej rośnie wraz ze skalą. Modele językowe liczą koszt za miliony tokenów, osobno za tekst wejściowy (to, co wysyłasz do modelu: prompt systemowy, treść maila, historię rozmowy, wyniki wyszukiwania) i osobno za tekst wyjściowy (odpowiedź modelu). Na początek 2025 roku orientacyjne stawki wyglądały tak: GPT-4o kosztuje około 2,50 USD za milion tokenów wejściowych i 10 USD za milion wyjściowych. Tańszy wariant, GPT-4o mini, to odpowiednio 0,15 USD i 0,60 USD, czyli kilkanaście razy mniej. Po stronie Anthropic Claude 3.5 Sonnet wycenia się na około 3 USD za milion wejściowych i 15 USD za wyjściowe, a lżejszy Claude 3.5 Haiku na 0,80 USD i 4 USD. Google w wariancie Gemini 1.5 Flash schodzi jeszcze niżej, do 0,075 USD za milion wejściowych tokenów. Różnice między najdroższym a najtańszym modelem sięgają więc rzędu wielkości dwudziestu, trzydziestu razy.
Te liczby zmieniają się co kilka miesięcy, więc traktuję je jako punkt odniesienia, nie ostateczną prawdę. Ważniejszy jest wniosek: dobór modelu do zadania robi ogromną różnicę w rachunku, o wiele większą niż optymalizacja samego promptu.
Subskrypcje narzędzi do automatyzacji
Agent rzadko działa w próżni. Zwykle siedzi w workflow zbudowanym w n8n albo Make, który odbiera maila, woła model, zapisuje wynik w CRM albo arkuszu. Oba narzędzia liczą opłatę za liczbę wykonań albo operacji miesięcznie, nie za samą subskrypcję modelu. n8n w wersji chmurowej w planie startowym mieści zwykle kilka tysięcy wykonań miesięcznie, a przy większym wolumenie trzeba przejść na plan wyższy, rzędu 50 USD miesięcznie za około 10 000 wykonań. Make liczy inaczej, w operacjach, gdzie każdy moduł w scenariuszu to osobna operacja, i tańsze plany zaczynają się od kilkunastu dolarów miesięcznie za podobny wolumen 10 000 operacji.
To ważna pułapka przy szacowaniu kosztów: jedno "zgłoszenie klienta" w Make to zwykle nie jedna operacja, tylko tyle operacji, ile modułów ma scenariusz. Workflow z czterema krokami (klasyfikacja, wyszukanie w bazie wiedzy, wygenerowanie odpowiedzi, zapis do CRM) to cztery operacje na jedno zgłoszenie, nie jedna. Przy liczeniu limitu planu trzeba mnożyć przez liczbę kroków, a nie przez liczbę spraw.
Dodatkowe koszty, o których łatwo zapomnieć
Jeśli agent korzysta z bazy wiedzy firmy (RAG), dochodzi baza wektorowa: albo płatny serwis w chmurze za kilkanaście-kilkadziesiąt złotych miesięcznie, albo własny serwer, na którym stawia się open source'ową bazę obok samego n8n. Do tego czasem hosting samego n8n, jeśli firma nie korzysta z wersji chmurowej, tylko stawia własną instancję na VPS za równowartość 40-80 zł miesięcznie. Te koszty są zwykle stałe i niewielkie w porównaniu do tokenów, ale w małych wdrożeniach potrafią stanowić nawet jedną trzecią całej faktury.
Żywy przykład: agent do obsługi poczty i CRM
Weźmy firmę handlową z kilkunastoosobowym działem obsługi klienta, która wdrożyła agenta czytającego przychodzące maile, klasyfikującego intencję, szukającego kontekstu w bazie wiedzy, przygotowującego szkic odpowiedzi i zapisującego podsumowanie w CRM. To typowy przypadek z obszaru automatyzacji obsługi klienta, jeden z najczęstszych, jakie wdrażamy. Workflow ma cztery kroki, a firma przetwarza around 40 zgłoszeń dziennie, czyli około 880 miesięcznie przy 22 dniach roboczych.
Na jedno zgłoszenie, licząc razem prompt systemowy, treść maila, historię z CRM i wyniki wyszukiwania w bazie wiedzy, wychodzi orientacyjnie 6000 tokenów wejściowych i 900 tokenów wyjściowych rozłożonych na cztery kroki workflow. Miesięcznie daje to około 5,3 miliona tokenów wejściowych i 790 tysięcy wyjściowych.
Wariant A
Wszystko na jednym, drogim modelu
- Cały workflow na GPT-4o, także prosta klasyfikacja intencji
- Koszt tokenów: około 21 USD miesięcznie (ok. 84 zł)
- Prosto w budowie, ale płacisz premium stawkę nawet za zadanie, które nie wymaga najmocniejszego modelu
Wariant B
Tańszy model do prostych kroków
- Klasyfikacja i wyszukiwanie na GPT-4o mini, tylko finalna odpowiedź na GPT-4o
- Koszt tokenów: około 10 USD miesięcznie (ok. 40 zł)
- Ta sama jakość finalnej odpowiedzi klienta, bo najsłabszy model odpowiada tylko za rutynowe kroki
Sama zmiana doboru modelu do zadania obniża rachunek za tokeny o blisko połowę, bez utraty jakości tam, gdzie klient faktycznie czyta odpowiedź. Do tego dochodzi subskrypcja automatyzacji: 880 zgłoszeń razy cztery kroki workflow to 3520 operacji miesięcznie, co mieści się w tańszym planie Make (kilkanaście-dwadzieścia kilka dolarów) albo wymaga planu Pro w n8n, jeśli firma woli chmurową wersję tego narzędzia (rząd 50 USD). Jeśli agent korzysta z bazy wiedzy, doliczamy jeszcze 10-20 USD za hosting bazy wektorowej albo zero, jeśli stoi na tym samym serwerze co n8n.
Dla samego procesu obsługi poczty i CRM łączny koszt utrzymania wychodzi więc w przedziale 26-91 USD miesięcznie, czyli mniej więcej 100-370 zł. To dla jednego procesu. Firmy, z którymi pracujemy, rzadko poprzestają na jednym agencie: obok obsługi klienta dochodzi automatyzacja związana z fakturami czy księgowością, opisana szerzej przy okazji automatyzacji faktur, albo powiadomienia w CRM. Przy firmie robiącej łącznie 10-50 automatyzacji dziennie rozłożonych na kilka takich procesów, realny rachunek miesięczny mieści się orientacyjnie w przedziale 500-1200 zł: 300-800 zł tokeny, 200-400 zł subskrypcje narzędzi. To nie jest sztywna reguła, tylko rząd wielkości, jaki widzimy w naszych wdrożeniach, ale pozwala uniknąć sytuacji, w której klient dowiaduje się o realnym koszcie dopiero z faktury za trzeci miesiąc.
Jak kontrolować koszty w praktyce
Trzy rzeczy dają najwięcej oszczędności najmniejszym kosztem wysiłku, dlatego zawsze zaczynamy od nich, zanim ktokolwiek zacznie optymalizować sam prompt.
Pierwsza to dobór modelu do zadania, pokazany wyżej na przykładzie. Klasyfikacja intencji, ekstrakcja danych z dokumentu, proste tagowanie: to zadania dla najtańszego modelu z rodziny (mini, Haiku, Flash), bo różnica w jakości jest tu marginalna, a różnica w cenie kilkunastokrotna. Generowanie finalnej odpowiedzi wysyłanej do klienta, negocjacje, analiza złożonego kontekstu: tu warto płacić za mocniejszy model, bo błąd kosztuje więcej niż różnica w rachunku.
Druga to cache promptów. Duża część kontekstu, który agent wysyła do modelu przy każdym wywołaniu, powtarza się: ten sam prompt systemowy, ta sama instrukcja formatowania, często ten sam fragment bazy wiedzy. Dostawcy modeli oferują mechanizm cache'owania takiego powtarzalnego kontekstu, który potrafi obniżyć koszt wejściowych tokenów o kilkadziesiąt procent, bo płaci się mniej za fragment, który model "już widział" w niedawnym wywołaniu. W workflow z czterema krokami na jedno zgłoszenie, gdzie prompt systemowy powtarza się cztery razy, to często największa pojedyncza oszczędność, jaką da się wprowadzić bez zmiany logiki agenta.
Trzecia to twarde limity: maksymalna liczba tokenów w odpowiedzi, limit retry przy błędzie modelu, alert kiedy dzienne zużycie przekroczy ustalony próg. Bez takiego limitu agent, który wpadnie w pętlę (na przykład próbuje sparsować źle sformatowaną odpowiedź i ponawia zapytanie kilka razy) potrafi w jeden dzień spalić budżet planowany na cały miesiąc. To najprostsze zabezpieczenie i jednocześnie najczęściej pomijane przy wdrożeniach robionych na szybko.
Kiedy koszt utrzymania jest uzasadniony, a kiedy nie
Nie każdy proces opłaca się automatyzować agentem opartym na dużym modelu językowym, nawet jeśli technicznie się da. Jeśli zadanie jest w pełni deterministyczne, na przykład przepisanie danych z faktury o zawsze tym samym formacie do jednego pola w systemie, prostszy i tańszy będzie klasyczny skrypt albo reguła w n8n bez wywołania modelu w ogóle. Model językowy ma sens tam, gdzie w danych jest zmienność: różne sformułowania w mailach, różne układy dokumentów, konieczność zrozumienia intencji, a nie tylko rozpoznania wzorca.
Z drugiej strony, jeśli ktoś w firmie codziennie traci półtorej godziny na przepisywanie tych samych danych między systemami, koszt 100-400 zł miesięcznie za agenta, który to robi automatycznie, zwraca się praktycznie od razu, licząc samą stawkę godzinową pracownika. Problem nie leży w tym, czy agent jest opłacalny, tylko w tym, czy ktoś w firmie policzył ten rachunek z góry, zamiast dowiadywać się o nim z faktury.
Częste pytania
Czy da się dokładnie przewidzieć koszt agenta AI przed wdrożeniem?
Dokładnie co do złotówki nie, bo zależy od faktycznego wolumenu zgłoszeń i długości treści, które trafiają do modelu. Da się jednak policzyć rząd wielkości: liczba kroków workflow razy szacowana liczba tokenów na krok razy stawka wybranego modelu razy planowany wolumen miesięczny. To wystarcza, żeby uniknąć zaskoczenia.
Czy tańszy model, jak GPT-4o mini albo Claude Haiku, obniża jakość odpowiedzi?
Przy prostych zadaniach, takich jak klasyfikacja intencji czy ekstrakcja danych, różnica w jakości jest w naszych testach marginalna. Przy zadaniach wymagających rozumowania na złożonym kontekście albo generowania treści czytanej przez klienta, różnica bywa zauważalna i tam warto zostać przy mocniejszym modelu.
Co jest zwykle droższe: tokeny czy subskrypcja n8n albo Make?
Przy małej skali (do kilkuset zgłoszeń miesięcznie) subskrypcja narzędzia do automatyzacji często dominuje, bo płaci się za dostęp do planu niezależnie od faktycznego zużycia. Przy większej skali tokeny rosną szybciej i to one zaczynają stanowić większość rachunku.
Jak monitorować koszty na bieżąco, żeby nie czekać na fakturę?
Warto ustawić alert budżetowy bezpośrednio w panelu dostawcy modelu (OpenAI, Anthropic i Google udostępniają takie limity) oraz logować zużycie tokenów per workflow w n8n albo Make, żeby wiedzieć, który proces odpowiada za jaką część rachunku, zanim zrobi to księgowość.
Sprawdź, ile realnie będzie kosztować agent AI w Twojej firmie
Policzymy razem koszt wdrożenia i szacunkowy koszt utrzymania na Twoich danych, zanim podejmiesz decyzję.
Zacznij audytPowiązane materiały
Ile kosztuje wdrożenie automatyzacji i agentów AI
Ile kosztuje wdrożenie automatyzacji i agentów AI w firmie? Realne widełki cenowe, z czego składa się koszt, co go podbija, a co zbija. Konkretnie, bez „to zależy” na koniec.
PorównaniaAgent AI a chatbot: czym się różnią i co wybrać
Chatbot odpowiada na pytania, agent AI wykonuje zadania. Wyjaśniamy różnicę na przykładach i podpowiadamy, kiedy wystarczy chatbot, a kiedy potrzebujesz agenta.
Automatyzacja procesówJakie procesy w firmie warto automatyzować jako pierwsze
Nie każdy proces warto automatyzować na start. Pokazujemy pięć cech dobrego kandydata, listę typowych procesów i prosty sposób, żeby wybrać ten z największym zwrotem.