Automatyzacja · Obsługa klienta
5 chatbotów na teście: polskie literówki i odmiana (i gdzie wbudowany NLU się gubi)
W skrócie
Przetestowaliśmy Tidio, ManyChat, Landbot, Chatfuel i Voiceflow na typowych, niepoprawnych wiadomościach polskich klientów sklepów internetowych: literówkach, brakujących ogonkach, skrótach myślowych. Platformy z silnikiem opartym wyłącznie na dopasowywaniu słów kluczowych gubią się już przy prostym „chce zwrucic towar”. Te, które pod spodem korzystają z modelu językowego (GPT-4, Claude), radzą sobie zauważalnie lepiej, ale wymagają świadomie napisanego promptu, nie samej konfiguracji z panelu.
Większość recenzji chatbotów w sieci wygląda tak samo: tabelka z cennikiem, lista integracji z Shopify i Facebookiem, screenshot kreatora przepływów. Nikt nie sprawdza tego, co w polskim sklepie internetowym decyduje o tym, czy bot w ogóle zrozumie klienta. A klient nie pisze „Proszę o informację na temat statusu zamówienia”. Pisze „kiedy wysyłka”, „chce zwrucic towar” albo „zamowienie jeszcze nie przyszlo a mialo byc wczoraj”. Bez polskich znaków, z błędami w odmianie, czasem w skrócie, czasem w pośpiechu z telefonu.
W Ententrze wdrażaliśmy automatyzacje dla sklepów, które wcześniej kupiły gotowy chatbot „bo miał dobre opinie”, a po miesiącu okazywało się, że pytania o zwrot czy reklamację i tak trafiają do konsultanta, bo bot ich nie rozpoznaje. Dlatego zamiast kolejnego zestawienia funkcji, zrobiliśmy test na realnych wiadomościach. Bez owijania w bawełnę: część z tych pięciu platform w domyślnej konfiguracji nie nadaje się do obsługi polskiego klienta bez dodatkowej pracy nad warstwą rozumienia języka.
Jak testowaliśmy: zestaw wiadomości, które łamią większość botów
Zebraliśmy kilkadziesiąt wiadomości typowych dla polskich sklepów e-commerce: zapytania o status wysyłki, zwroty, reklamacje, czas dostawy, płatność za pobraniem. Każdą wiadomość przepuściliśmy przez bota w trzech wariantach: poprawnym gramatycznie, z typowymi literówkami i bez polskich znaków diakrytycznych, oraz w wersji potocznej ze skrótem myślowym. Przykłady, na których naprawdę widać różnice:
- „kiedy wysyłka” vs „kiedy wysylka” vs „jak długo czekać na paczke”
- „chcę zwrócić towar” vs „chce zwrucic towar” vs „da sie oddac bez paragonu?”
- „zamówienie jeszcze nie przyszło” vs „zamowienie jeszcze nie doszlo a mialo byc wczoraj”
- „ile kosztuje wysyłka za pobraniem” vs „ile za pobranie dolicza”
Dorzuciliśmy też jedną wiadomość z regionalizmem śląskim, bo w realnym ruchu sklepów ogólnopolskich takie wiadomości się zdarzają. Żadna z pięciu platform nie poradziła sobie z nią sensownie bez dodatkowego promptu, więc nie traktujemy tego jako różnicującego kryterium, tylko ciekawostkę.
Istotna różnica techniczna, o której większość recenzji milczy: część platform ma natywny silnik NLU (reguły, słowa kluczowe, czasem prosty klasyfikator intencji), a część w praktyce przerzuca rozumienie języka na zewnętrzny model GPT-4 lub Claude, podłączony przez API. To zupełnie inna architektura i inaczej się ją konfiguruje.
Wyniki platforma po platformie
Tidio
Tidio ma dwie warstwy: klasyczne przepływy oparte na regułach (Flows) i asystenta AI o nazwie Lyro, który pod spodem korzysta z modelu językowego. W wersji z regułami wyniki są przeciętne: proste, zdefiniowane z góry intencje („status zamówienia”, „zwrot”) łapią nawet lekko zniekształcone wiadomości, bo Tidio stosuje dopasowanie rozmyte, a nie tylko dokładne słowa kluczowe. Problem zaczyna się przy wiadomościach złożonych z dwóch intencji naraz, typu „zamowienie nie doszlo a chce tez zapytac o zwrot”, gdzie bot łapie tylko pierwszą część. Po włączeniu Lyro i podaniu mu bazy wiedzy sklepu wyniki wyraźnie się poprawiają, włącznie z literówkami i brakiem ogonków, ale to już nie jest „gotowe z pudełka”, tylko konfiguracja zbliżona do pracy z promptem.
ManyChat
ManyChat zbudowany jest przede wszystkim z myślą o Messengerze i Instagramie, a jego silnik to w gruncie rzeczy dopasowywanie słów kluczowych i prostych wyrażeń w regułach „Default Reply” oraz keyword triggers. Nie ma tu lemmatyzacji języka polskiego, więc żeby złapać „zwrucic”, trzeba ręcznie dopisać tę literówkę jako osobną frazę wyzwalającą, obok „zwrócić”, „zwrot”, „oddac” i tak dalej. Przy kilku intencjach to wykonalne, przy kilkunastu robi się to nie do ogarnięcia, bo polski czasownik odmienia się przez osoby, czasy i aspekt, a każdą formę trzeba by wpisać osobno. ManyChat dodał ostatnio krok AI Step oparty na GPT, który rozwiązuje ten problem, ale wtedy właściwie przestajemy korzystać z natywnego NLU platformy, tylko budujemy mini-prompt wewnątrz jednego bloku.
Landbot
Landbot to narzędzie do budowania przepływów wizualnych, nie silnik NLU sam w sobie. Domyślnie boty w Landbocie reagują na konkretne przyciski albo bardzo proste dopasowanie tekstu, co oznacza, że przy wiadomości swobodnej w stylu „kiedy bedzie wysylka bo zamawialem w poniedzialek” bot najczęściej nie wie, co zrobić, i spada do opcji domyślnej. Landbot oferuje blok AI Assist łączący się z modelem GPT, i dopiero tam literówki i odmiana przestają być problemem. Dla sklepu, który chce swobodnej rozmowy tekstowej a nie menu z przyciskami, sam Landbot bez warstwy AI to w polskich realiach rozwiązanie niewystarczające.
Chatfuel
Chatfuel historycznie był czystym silnikiem słów kluczowych dla Messengera, ale ostatnie wersje przestawiły rdzeń produktu na model GPT jako domyślny mechanizm odpowiedzi. To widać w testach: wiadomości z literówkami, brakiem ogonków i skrótami myślowymi są rozpoznawane poprawnie częściej niż w ManyChat czy Landbocie w konfiguracji bez AI, bo Chatfuel z automatu kieruje ruch przez LLM, a nie przez ręcznie zdefiniowane intencje. Minus: mniejsza kontrola nad tym, co bot dokładnie odpowie, i konieczność dopięcia promptu z twardymi zasadami (np. „nigdy nie podawaj numeru telefonu konsultanta, zawsze kieruj do formularza”), bo domyślny prompt bywa zbyt swobodny.
Voiceflow
Voiceflow jest inny od pozostałych czterech: to narzędzie projektowe dla deweloperów i agencji budujących własnych agentów, z natywną obsługą intencji (trzeba zdefiniować frazy treningowe dla każdej) albo z podłączeniem modelu LLM jako warstwy rozumienia. W trybie czysto intencyjnym wyniki są podobne do ManyChat, czyli słabo z literówkami, bo liczy się dopasowanie do wzorca. W trybie z podłączonym GPT-4 lub Claude i dobrze napisanym promptem systemowym, Voiceflow wypadł w naszym teście najlepiej ze wszystkich pięciu, łącznie z poprawnym rozpoznawaniem wiadomości łączących dwie intencje naraz. Cena tej jakości: Voiceflow wymaga więcej pracy wdrożeniowej niż pozostałe platformy, to nie jest kreator „kliknij i działa”.
Silnik wbudowany (reguły, słowa kluczowe)
Kiedy wystarczy
- bot obsługuje 3-4 proste, dobrze rozdzielone intencje
- ruch idzie głównie przez przyciski i menu, nie przez dowolny tekst
- liczy się pełna przewidywalność odpowiedzi
- budżet i czas wdrożenia są bardzo ograniczone
Prompt oparty o LLM
Kiedy jest konieczny
- klienci piszą swobodnym tekstem, z literówkami i bez ogonków
- intencje się przenikają (pytanie o zwrot i status naraz)
- sklep ma bazę wiedzy (FAQ, regulamin), którą bot ma rozumieć, nie tylko cytować
- skala ruchu uzasadnia czas na dopięcie i testy promptu
Różnica w konfiguracji: intencja to nie to samo co prompt
W silniku opartym na intencjach (klasyczny ManyChat, Voiceflow bez AI, domyślny Landbot) konfiguracja wygląda tak: definiujesz intencję „zwrot”, wpisujesz listę fraz treningowych albo słów kluczowych, które mają ją wyzwalać, i dla każdej odmiany, literówki czy synonimu musisz dopisać osobny wpis. To podejście jest w pełni przewidywalne, bo wiesz dokładnie, co uruchomi jaki scenariusz, ale skaluje się fatalnie przy języku polskim z jego siedmioma przypadkami i bogatą koniugacją czasowników. W praktyce oznacza to dziesiątki wariantów na jedną intencję, jeśli chcesz pokryć realny rozrzut wiadomości klientów.
W podejściu z promptem LLM nie definiujesz list fraz, tylko opisujesz zadanie: „Jesteś asystentem sklepu X. Klient może pytać o status zamówienia, zwrot, reklamację lub czas dostawy. Rozpoznaj intencję nawet przy literówkach i braku polskich znaków, a jeśli nie jesteś pewien, zapytaj doprecyzowująco zamiast zgadywać.” Model generalizuje na podstawie znaczenia, nie dopasowania ciągu znaków, więc „zwrucic”, „zwrucic towar” i „chce oddac paczke” trafiają do tej samej logiki bez ręcznego wypisywania wariantów. Koszt tego podejścia to mniejsza kontrola i konieczność testowania promptu na realnych wiadomościach, nie na wymyślonych przykładach z dokumentacji.
Dla kogo który model: nasza rekomendacja
Jeśli sklep obsługuje niewielki ruch i ma dwie, trzy proste ścieżki (status zamówienia, kontakt, godziny pracy), czysty silnik intencji w Tidio albo Landbocie w zupełności wystarczy, a wdrożenie zajmuje dosłownie popołudnie. Nie polecamy w takim przypadku od razu sięgać po Voiceflow z promptem LLM, to przerost formy nad treścią i niepotrzebny koszt utrzymania.
Jeśli jednak sklep dostaje dziesiątki wiadomości dziennie pisanych swobodnym językiem, literówki i brak ogonków to norma, a nie wyjątek, i warto od razu projektować bota wokół warstwy LLM. Z naszych wdrożeń wynika, że automat dobrze skonfigurowany tym sposobem przejmuje większość rutynowych pytań, ale decyzję w nietypowych przypadkach (spór o zwrot po terminie, reklamacja z niejasnym opisem usterki) i tak trzeba zostawić człowiekowi. Dobry bot to taki, który wie, kiedy się poddać i przekazać rozmowę dalej, a nie taki, który za wszelką cenę próbuje odpowiedzieć. Więcej o tym, jak to ułożyć krok po kroku, piszemy przy okazji automatyzacji obsługi klienta, a dla sklepów internetowych konkretnie w kontekście zamówień i zwrotów warto zajrzeć też do automatyzacji e-commerce.
Częste pytania
Która platforma najlepiej radzi sobie z polskimi literówkami bez dodatkowej konfiguracji?
Spośród pięciu testowanych, Chatfuel wypadł najlepiej w domyślnej konfiguracji, bo z automatu kieruje odpowiedzi przez model GPT zamiast przez sztywne słowa kluczowe. Voiceflow potrafi być jeszcze lepszy, ale wymaga świadomego podłączenia i napisania promptu, nie działa tak dobrze od razu po instalacji.
Czy ManyChat i Landbot w ogóle nadają się do polskiego sklepu?
Tak, ale głównie do prostych ścieżek opartych na przyciskach i menu, nie do swobodnej rozmowy tekstowej. Przy dowolnym tekście klienta obie platformy potrzebują dodanego bloku AI, żeby sensownie obsłużyć literówki i odmianę.
Czy wystarczy wyłączyć wymaganie polskich znaków w konfiguracji bota?
Nie ma takiej jednej opcji. Problem nie leży w samych ogonkach, tylko w tym, że silniki oparte na dopasowywaniu ciągów znaków nie rozumieją odmiany słów, więc i tak trzeba by wypisać osobno każdą formę wyrazu. Model LLM rozwiązuje to przy okazji, bo pracuje na znaczeniu, nie na literach.
Czy regionalizmy i gwara to w ogóle problem w praktyce?
W testowanej próbce wiadomości ze sklepów ogólnopolskich pojawiają się rzadko, ale się zdarzają. Żadna z pięciu platform nie poradziła sobie z nimi bez dodatkowego promptu uczącego bota na konkretnych zwrotach regionalnych używanych przez klientów danego sklepu.
Czy warto od razu inwestować w najdroższą platformę z LLM?
Zależy od skali. Przy kilku wiadomościach dziennie to nieopłacalne. Przy kilkudziesięciu i więcej, inwestycja w prompt oparty na LLM zwraca się szybko, bo zdejmuje z konsultanta powtarzalne pytania o status i zwroty.
Nie wiesz, który model sprawdzi się w Twoim sklepie?
Zrobimy bezpłatny audyt Twoich realnych wiadomości od klientów i powiemy wprost, czy wystarczy prosty bot, czy potrzebny jest prompt oparty o LLM.
Zacznij audytPowiązane materiały
Ile kosztuje wdrożenie automatyzacji i agentów AI
Ile kosztuje wdrożenie automatyzacji i agentów AI w firmie? Realne widełki cenowe, z czego składa się koszt, co go podbija, a co zbija. Konkretnie, bez „to zależy” na koniec.
PorównaniaAgent AI a chatbot: czym się różnią i co wybrać
Chatbot odpowiada na pytania, agent AI wykonuje zadania. Wyjaśniamy różnicę na przykładach i podpowiadamy, kiedy wystarczy chatbot, a kiedy potrzebujesz agenta.
Automatyzacja procesówJakie procesy w firmie warto automatyzować jako pierwsze
Nie każdy proces warto automatyzować na start. Pokazujemy pięć cech dobrego kandydata, listę typowych procesów i prosty sposób, żeby wybrać ten z największym zwrotem.