W analizie 17 012 anglojęzycznych recenzji sześciu aplikacji AI negatywny sentyment miało 91% opinii zaklasyfikowanych do kategorii reklam. Ta kategoria liczyła jednak 65 recenzji, czyli około 0,4% całego zbioru. W kategoriach logowania, niezawodności serwera i cen subskrypcji udział negatywnych ocen wynosił od 73% do 89%, przy innych liczebnościach. Dla marketera własnej aplikacji to tematy do sprawdzenia w opiniach klientów, ale same procenty nie wystarczą do ustalenia kolejności poprawek.
Jak przeanalizowano 17 012 recenzji
Badanie objęło recenzje ChatGPT, Gemini, Microsoft Copilot, Claude, DeepSeek i Perplexity z Google Play oraz Apple App Store. Analizowany okres trwał od września 2025 do maja 2026. Dane zebrano w maju 2026; z początkowych 54 748 recenzji po filtrowaniu pozostało 17 012 anglojęzycznych.
Autorzy użyli BERTopic do wyodrębnienia tematów, a modelu RoBERTa do klasyfikacji sentymentu, czyli emocjonalnego wydźwięku wypowiedzi. Wyniki obu metod sprawdzili na warstwowej próbce 300 recenzji ocenionych ręcznie.
Publikacja jest dostępna w arXiv jako preprint w trakcie recenzji naukowej.
Wysoki udział krytyki, różne liczebności kategorii
W czterech kategoriach dotyczących reklam, dostępu do aplikacji i subskrypcji większość przypisanych recenzji miała negatywny wydźwięk.
| Kategoria | Liczba recenzji w kategorii | Udział negatywnych recenzji w tej kategorii |
|---|---|---|
| Reklamy | 65 | 91% |
| Logowanie i konto | 566 | 89% |
| Niezawodność serwera | 163 | 83% |
| Ceny subskrypcji | 388 | 73% |
Każdy procent ma inny mianownik. Wynik 91% dotyczy kategorii liczącej 65 recenzji, a 89% — kategorii liczącej 566 recenzji. Nie są to odsetki wszystkich opinii ani wszystkich użytkowników aplikacji. Zaokrąglone wartości nie pozwalają też wyliczyć dokładnej liczby negatywnych recenzji.
W kategorii reklam najwięcej opinii pochodziło z recenzji Microsoft Copilot. Wynik tej kategorii nie opisuje więc w równym stopniu wszystkich sześciu aplikacji.
Na podstawie samego odsetka krytyki nie da się ustalić, który problem dotyka największej części klientów ani który powinien otrzymać najwyższy priorytet w produkcie.
Dlaczego te wyniki nie wyjaśniają rezygnacji z subskrypcji
Badanie analizuje treść recenzji, a nie decyzje o przedłużeniu subskrypcji. Nie pokazuje, ile osób przestało płacić po problemie z logowaniem ani jak cena wpłynęła na utrzymanie klientów.
Autorzy opinii nie stanowią reprezentatywnej próby wszystkich użytkowników. Dodatkowo podczas filtrowania odrzucono recenzje krótsze niż 10 słów. Zgodnie z dodatkiem C były one częściej pozytywne, więc filtr przesunął skład zbioru w stronę dłuższych, bardziej krytycznych wypowiedzi.
Analiza nie dostarcza osobnych wyników dla polskich klientów. Polski zespół może wykorzystać opisane kategorie do przeglądu własnego produktu, ale nie powinien zakładać, że wystąpią w nim takie same odsetki krytyki.
Karta kontroli własnej aplikacji
Poniższa karta jest propozycją redakcyjną, a nie wynikiem badania ani sprawdzoną metodą zwiększania sprzedaży. Pomaga porównać komunikację produktu z tym, co użytkownik widzi przy pierwszym uruchomieniu i zakupie.
Reklamy w bezpłatnym planie
Jeśli aplikacja wyświetla reklamy, sprawdź, czy użytkownik dowiaduje się o nich przed instalacją lub rozpoczęciem korzystania. Porównaj opis bezpłatnego planu z rzeczywistym miejscem i momentem wyświetlania reklam.
Logowanie i dostęp do konta
Przejdź rejestrację, weryfikację adresu i logowanie po zmianie urządzenia. Zapisz etapy, na których użytkownik nie wie, co zrobić dalej, oraz komunikaty, które nie wyjaśniają problemu.
Niezawodność i komunikaty o przerwach
Sprawdź, czy komunikaty pozwalają odróżnić awarię od wyczerpania limitu użycia lub problemu po stronie użytkownika. Oceń, czy wskazują następny krok.
Ceny i warunki subskrypcji
Porównaj opis płatnego planu z jego ograniczeniami widocznymi podczas korzystania. Sprawdź, czy przed zakupem można poznać cenę, limity i różnice między planami, również bez rejestracji.
Dla każdego obszaru zapisz zaobserwowany problem i proponowaną poprawkę. Następnie zestaw te obserwacje z własnymi recenzjami, oddzielając temat wypowiedzi od jej wydźwięku. Pomocny będzie poradnik klasyfikowania odpowiedzi klientów funkcją =AI() w Arkuszach Google i sprawdzania wyniku na próbce.
Źródła
- What Users Think of Generative AI: A Cross-Platform NLP Analysis of Trust and Friction in App Store Reviews, arXiv:2609.19151, preprint.



