← Porównania

Automatyzacja · Obsługa klienta

5 chatbotów na teście: polskie literówki i odmiana (i gdzie wbudowany NLU się gubi)

W skrócie

Przetestowaliśmy Tidio, ManyChat, Landbot, Chatfuel i Voiceflow na typowych, niepoprawnych wiadomościach polskich klientów sklepów internetowych: literówkach, brakujących ogonkach, skrótach myślowych. Platformy z silnikiem opartym wyłącznie na dopasowywaniu słów kluczowych gubią się już przy prostym „chce zwrucic towar”. Te, które pod spodem korzystają z modelu językowego (GPT-4, Claude), radzą sobie zauważalnie lepiej, ale wymagają świadomie napisanego promptu, nie samej konfiguracji z panelu.

Większość recenzji chatbotów w sieci wygląda tak samo: tabelka z cennikiem, lista integracji z Shopify i Facebookiem, screenshot kreatora przepływów. Nikt nie sprawdza tego, co w polskim sklepie internetowym decyduje o tym, czy bot w ogóle zrozumie klienta. A klient nie pisze „Proszę o informację na temat statusu zamówienia”. Pisze „kiedy wysyłka”, „chce zwrucic towar” albo „zamowienie jeszcze nie przyszlo a mialo byc wczoraj”. Bez polskich znaków, z błędami w odmianie, czasem w skrócie, czasem w pośpiechu z telefonu.

W Ententrze wdrażaliśmy automatyzacje dla sklepów, które wcześniej kupiły gotowy chatbot „bo miał dobre opinie”, a po miesiącu okazywało się, że pytania o zwrot czy reklamację i tak trafiają do konsultanta, bo bot ich nie rozpoznaje. Dlatego zamiast kolejnego zestawienia funkcji, zrobiliśmy test na realnych wiadomościach. Bez owijania w bawełnę: część z tych pięciu platform w domyślnej konfiguracji nie nadaje się do obsługi polskiego klienta bez dodatkowej pracy nad warstwą rozumienia języka.

Jak testowaliśmy: zestaw wiadomości, które łamią większość botów

Zebraliśmy kilkadziesiąt wiadomości typowych dla polskich sklepów e-commerce: zapytania o status wysyłki, zwroty, reklamacje, czas dostawy, płatność za pobraniem. Każdą wiadomość przepuściliśmy przez bota w trzech wariantach: poprawnym gramatycznie, z typowymi literówkami i bez polskich znaków diakrytycznych, oraz w wersji potocznej ze skrótem myślowym. Przykłady, na których naprawdę widać różnice:

  • „kiedy wysyłka” vs „kiedy wysylka” vs „jak długo czekać na paczke”
  • „chcę zwrócić towar” vs „chce zwrucic towar” vs „da sie oddac bez paragonu?”
  • „zamówienie jeszcze nie przyszło” vs „zamowienie jeszcze nie doszlo a mialo byc wczoraj”
  • „ile kosztuje wysyłka za pobraniem” vs „ile za pobranie dolicza”

Dorzuciliśmy też jedną wiadomość z regionalizmem śląskim, bo w realnym ruchu sklepów ogólnopolskich takie wiadomości się zdarzają. Żadna z pięciu platform nie poradziła sobie z nią sensownie bez dodatkowego promptu, więc nie traktujemy tego jako różnicującego kryterium, tylko ciekawostkę.

Istotna różnica techniczna, o której większość recenzji milczy: część platform ma natywny silnik NLU (reguły, słowa kluczowe, czasem prosty klasyfikator intencji), a część w praktyce przerzuca rozumienie języka na zewnętrzny model GPT-4 lub Claude, podłączony przez API. To zupełnie inna architektura i inaczej się ją konfiguruje.

Wyniki platforma po platformie

Tidio

Tidio ma dwie warstwy: klasyczne przepływy oparte na regułach (Flows) i asystenta AI o nazwie Lyro, który pod spodem korzysta z modelu językowego. W wersji z regułami wyniki są przeciętne: proste, zdefiniowane z góry intencje („status zamówienia”, „zwrot”) łapią nawet lekko zniekształcone wiadomości, bo Tidio stosuje dopasowanie rozmyte, a nie tylko dokładne słowa kluczowe. Problem zaczyna się przy wiadomościach złożonych z dwóch intencji naraz, typu „zamowienie nie doszlo a chce tez zapytac o zwrot”, gdzie bot łapie tylko pierwszą część. Po włączeniu Lyro i podaniu mu bazy wiedzy sklepu wyniki wyraźnie się poprawiają, włącznie z literówkami i brakiem ogonków, ale to już nie jest „gotowe z pudełka”, tylko konfiguracja zbliżona do pracy z promptem.

ManyChat

ManyChat zbudowany jest przede wszystkim z myślą o Messengerze i Instagramie, a jego silnik to w gruncie rzeczy dopasowywanie słów kluczowych i prostych wyrażeń w regułach „Default Reply” oraz keyword triggers. Nie ma tu lemmatyzacji języka polskiego, więc żeby złapać „zwrucic”, trzeba ręcznie dopisać tę literówkę jako osobną frazę wyzwalającą, obok „zwrócić”, „zwrot”, „oddac” i tak dalej. Przy kilku intencjach to wykonalne, przy kilkunastu robi się to nie do ogarnięcia, bo polski czasownik odmienia się przez osoby, czasy i aspekt, a każdą formę trzeba by wpisać osobno. ManyChat dodał ostatnio krok AI Step oparty na GPT, który rozwiązuje ten problem, ale wtedy właściwie przestajemy korzystać z natywnego NLU platformy, tylko budujemy mini-prompt wewnątrz jednego bloku.

Landbot

Landbot to narzędzie do budowania przepływów wizualnych, nie silnik NLU sam w sobie. Domyślnie boty w Landbocie reagują na konkretne przyciski albo bardzo proste dopasowanie tekstu, co oznacza, że przy wiadomości swobodnej w stylu „kiedy bedzie wysylka bo zamawialem w poniedzialek” bot najczęściej nie wie, co zrobić, i spada do opcji domyślnej. Landbot oferuje blok AI Assist łączący się z modelem GPT, i dopiero tam literówki i odmiana przestają być problemem. Dla sklepu, który chce swobodnej rozmowy tekstowej a nie menu z przyciskami, sam Landbot bez warstwy AI to w polskich realiach rozwiązanie niewystarczające.

Chatfuel

Chatfuel historycznie był czystym silnikiem słów kluczowych dla Messengera, ale ostatnie wersje przestawiły rdzeń produktu na model GPT jako domyślny mechanizm odpowiedzi. To widać w testach: wiadomości z literówkami, brakiem ogonków i skrótami myślowymi są rozpoznawane poprawnie częściej niż w ManyChat czy Landbocie w konfiguracji bez AI, bo Chatfuel z automatu kieruje ruch przez LLM, a nie przez ręcznie zdefiniowane intencje. Minus: mniejsza kontrola nad tym, co bot dokładnie odpowie, i konieczność dopięcia promptu z twardymi zasadami (np. „nigdy nie podawaj numeru telefonu konsultanta, zawsze kieruj do formularza”), bo domyślny prompt bywa zbyt swobodny.

Voiceflow

Voiceflow jest inny od pozostałych czterech: to narzędzie projektowe dla deweloperów i agencji budujących własnych agentów, z natywną obsługą intencji (trzeba zdefiniować frazy treningowe dla każdej) albo z podłączeniem modelu LLM jako warstwy rozumienia. W trybie czysto intencyjnym wyniki są podobne do ManyChat, czyli słabo z literówkami, bo liczy się dopasowanie do wzorca. W trybie z podłączonym GPT-4 lub Claude i dobrze napisanym promptem systemowym, Voiceflow wypadł w naszym teście najlepiej ze wszystkich pięciu, łącznie z poprawnym rozpoznawaniem wiadomości łączących dwie intencje naraz. Cena tej jakości: Voiceflow wymaga więcej pracy wdrożeniowej niż pozostałe platformy, to nie jest kreator „kliknij i działa”.

Silnik wbudowany (reguły, słowa kluczowe)

Kiedy wystarczy

  • bot obsługuje 3-4 proste, dobrze rozdzielone intencje
  • ruch idzie głównie przez przyciski i menu, nie przez dowolny tekst
  • liczy się pełna przewidywalność odpowiedzi
  • budżet i czas wdrożenia są bardzo ograniczone

Prompt oparty o LLM

Kiedy jest konieczny

  • klienci piszą swobodnym tekstem, z literówkami i bez ogonków
  • intencje się przenikają (pytanie o zwrot i status naraz)
  • sklep ma bazę wiedzy (FAQ, regulamin), którą bot ma rozumieć, nie tylko cytować
  • skala ruchu uzasadnia czas na dopięcie i testy promptu

Różnica w konfiguracji: intencja to nie to samo co prompt

W silniku opartym na intencjach (klasyczny ManyChat, Voiceflow bez AI, domyślny Landbot) konfiguracja wygląda tak: definiujesz intencję „zwrot”, wpisujesz listę fraz treningowych albo słów kluczowych, które mają ją wyzwalać, i dla każdej odmiany, literówki czy synonimu musisz dopisać osobny wpis. To podejście jest w pełni przewidywalne, bo wiesz dokładnie, co uruchomi jaki scenariusz, ale skaluje się fatalnie przy języku polskim z jego siedmioma przypadkami i bogatą koniugacją czasowników. W praktyce oznacza to dziesiątki wariantów na jedną intencję, jeśli chcesz pokryć realny rozrzut wiadomości klientów.

W podejściu z promptem LLM nie definiujesz list fraz, tylko opisujesz zadanie: „Jesteś asystentem sklepu X. Klient może pytać o status zamówienia, zwrot, reklamację lub czas dostawy. Rozpoznaj intencję nawet przy literówkach i braku polskich znaków, a jeśli nie jesteś pewien, zapytaj doprecyzowująco zamiast zgadywać.” Model generalizuje na podstawie znaczenia, nie dopasowania ciągu znaków, więc „zwrucic”, „zwrucic towar” i „chce oddac paczke” trafiają do tej samej logiki bez ręcznego wypisywania wariantów. Koszt tego podejścia to mniejsza kontrola i konieczność testowania promptu na realnych wiadomościach, nie na wymyślonych przykładach z dokumentacji.

Dla kogo który model: nasza rekomendacja

Jeśli sklep obsługuje niewielki ruch i ma dwie, trzy proste ścieżki (status zamówienia, kontakt, godziny pracy), czysty silnik intencji w Tidio albo Landbocie w zupełności wystarczy, a wdrożenie zajmuje dosłownie popołudnie. Nie polecamy w takim przypadku od razu sięgać po Voiceflow z promptem LLM, to przerost formy nad treścią i niepotrzebny koszt utrzymania.

Jeśli jednak sklep dostaje dziesiątki wiadomości dziennie pisanych swobodnym językiem, literówki i brak ogonków to norma, a nie wyjątek, i warto od razu projektować bota wokół warstwy LLM. Z naszych wdrożeń wynika, że automat dobrze skonfigurowany tym sposobem przejmuje większość rutynowych pytań, ale decyzję w nietypowych przypadkach (spór o zwrot po terminie, reklamacja z niejasnym opisem usterki) i tak trzeba zostawić człowiekowi. Dobry bot to taki, który wie, kiedy się poddać i przekazać rozmowę dalej, a nie taki, który za wszelką cenę próbuje odpowiedzieć. Więcej o tym, jak to ułożyć krok po kroku, piszemy przy okazji automatyzacji obsługi klienta, a dla sklepów internetowych konkretnie w kontekście zamówień i zwrotów warto zajrzeć też do automatyzacji e-commerce.

Częste pytania

Która platforma najlepiej radzi sobie z polskimi literówkami bez dodatkowej konfiguracji?

Spośród pięciu testowanych, Chatfuel wypadł najlepiej w domyślnej konfiguracji, bo z automatu kieruje odpowiedzi przez model GPT zamiast przez sztywne słowa kluczowe. Voiceflow potrafi być jeszcze lepszy, ale wymaga świadomego podłączenia i napisania promptu, nie działa tak dobrze od razu po instalacji.

Czy ManyChat i Landbot w ogóle nadają się do polskiego sklepu?

Tak, ale głównie do prostych ścieżek opartych na przyciskach i menu, nie do swobodnej rozmowy tekstowej. Przy dowolnym tekście klienta obie platformy potrzebują dodanego bloku AI, żeby sensownie obsłużyć literówki i odmianę.

Czy wystarczy wyłączyć wymaganie polskich znaków w konfiguracji bota?

Nie ma takiej jednej opcji. Problem nie leży w samych ogonkach, tylko w tym, że silniki oparte na dopasowywaniu ciągów znaków nie rozumieją odmiany słów, więc i tak trzeba by wypisać osobno każdą formę wyrazu. Model LLM rozwiązuje to przy okazji, bo pracuje na znaczeniu, nie na literach.

Czy regionalizmy i gwara to w ogóle problem w praktyce?

W testowanej próbce wiadomości ze sklepów ogólnopolskich pojawiają się rzadko, ale się zdarzają. Żadna z pięciu platform nie poradziła sobie z nimi bez dodatkowego promptu uczącego bota na konkretnych zwrotach regionalnych używanych przez klientów danego sklepu.

Czy warto od razu inwestować w najdroższą platformę z LLM?

Zależy od skali. Przy kilku wiadomościach dziennie to nieopłacalne. Przy kilkudziesięciu i więcej, inwestycja w prompt oparty na LLM zwraca się szybko, bo zdejmuje z konsultanta powtarzalne pytania o status i zwroty.

Nie wiesz, który model sprawdzi się w Twoim sklepie?

Zrobimy bezpłatny audyt Twoich realnych wiadomości od klientów i powiemy wprost, czy wystarczy prosty bot, czy potrzebny jest prompt oparty o LLM.

Zacznij audyt

Powiązane materiały

Ostatnia aktualizacja: 2 pazdziernika 2026 · Autor: Zespół Ententra · wróć do bazy wiedzy