Marketer może poprosić model AI o ocenę logo, opakowania albo reklamy. Taka ocena nie musi jednak przewidywać reakcji odbiorców. W sześciu eksperymentach marketingu wizualnego żadna z czterech sprawdzonych konfiguracji nie odtworzyła w warunkach bazowych więcej niż dwóch efektów zaobserwowanych wcześniej u ludzi.
Autorzy porównali dwa modele w dwóch formatach wejścia: zwykłym tekście i JSON-ie. Wynik nie rozstrzyga, czy AI przydaje się do każdej oceny kreacji. Pokazuje za to, że rozpoznanie badanej cechy obrazu nie wystarcza, by uznać przewidywaną reakcję ludzi za wiarygodną.
Co sprawdzono w sześciu eksperymentach
Yi-Lin Tsai i Yung-Hsiu (Arvin) Lai opisali badanie „Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing” jako preprint na arXiv, zgłoszony 22 września 2026 r. Autorzy wykorzystali sześć klasycznych eksperymentów dotyczących elementów wizualnych w marketingu.
Zestawili modele GPT-4o-mini i GPT-5.4-mini z dwoma formatami wejścia: poleceniami zapisanymi zwykłym tekstem oraz danymi w formacie JSON. Powstały cztery konfiguracje. Liczebność prób syntetycznych dopasowano do prób w badaniach referencyjnych, które obejmowały od 69 do 220 osób.
Wszystkie konfiguracje przechodziły testy manipulacji dotyczące badanych cech obrazów. Oznacza to, że reagowały na zmianę, którą miał sprawdzić eksperyment. Nie oznacza to jednak, że odtwarzały reakcję ludzi na tę zmianę. W warunkach bazowych żadna konfiguracja nie odtworzyła więcej niż dwóch z sześciu efektów ludzkich.
Rozpoznanie cechy obrazu to nie przewidywanie reakcji
Wyobraźmy sobie dwa warianty logo różniące się jednym elementem. Model może zauważyć tę zmianę i opisać ją zgodnie z poleceniem. To osobna umiejętność niż przewidzenie, czy ludzie uznają jeden wariant za bardziej wiarygodny, czytelny albo atrakcyjny.
Autorzy sprawdzili również, co dzieje się po przekazaniu modelowi informacji o wynikach uzyskanych wcześniej przez ludzi. Takie wskazówki przesuwały średnią odpowiedzi w stronę efektu z badań referencyjnych, ale nie odtwarzały całego zróżnicowania ludzkich reakcji. Zgodność średnich ocen nie wystarcza więc, by stwierdzić, że model oddaje różne reakcje odbiorców.
Co zapisać przed użyciem oceny AI
Poniższa karta pomaga uporządkować decyzję przed użyciem oceny modelu. To propozycja redakcyjna, a nie zwalidowana metoda wyboru kreacji ani zamiennik badania z ludźmi.
| Co zapisać | Pytanie kontrolne |
|---|---|
| Konfigurację modelu | Którego modelu i jakiego formatu wejścia użyto? |
| Zadanie | O jaką konkretną ocenę poproszono model? |
| Badaną cechę | Jaki element materiału różni warianty lub podlega ocenie? |
| Ludzki punkt odniesienia | Czy ludzie ocenili te same materiały? |
| Zgodność ocen | Czy model i ludzie wskazali ten sam kierunek reakcji? |
| Rozbieżności | Gdzie oceny się różnią? |
Przy dwóch wariantach logo zespół może zapisać, który z nich ludzie uznali za czytelniejszy, a następnie sprawdzić, czy model wskazał ten sam kierunek. Taka zgodność przy jednej parze nie potwierdza, że model będzie trafnie oceniać inne kreacje.
Jeśli zespół nie ma oceny tych samych wariantów od ludzi, ranking wygenerowany przez AI pozostaje opinią modelu. Nie mówi, który wariant preferują odbiorcy. Zapiszcie brak punktu odniesienia i nie przedstawiajcie wyboru jako potwierdzonego badaniem.
Czego preprint nie rozstrzyga
Badanie nie sprawdzało konwersji reklam ani wyników polskich kampanii. Nie dowodzi też, że wszystkie modele błędnie oceniają każdą kreację. Opisuje sześć konkretnych eksperymentów i cztery konfiguracje. Wyniku nie należy przenosić automatycznie na inne materiały, zadania ani grupy odbiorców.
To preprint, a nie ustalony konsensus naukowy. Jego wyniki uzasadniają ostrożność przy traktowaniu oceny syntetycznych konsumentów jak danych z panelu ludzkiego. Przed użyciem takiej oceny zapiszcie, czy macie ludzki punkt odniesienia. Jeśli go nie ma, ograniczcie wniosek do odpowiedzi modelu.
Źródła
- Yi-Lin Tsai i Yung-Hsiu (Arvin) Lai, „Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing” — preprint opisujący sześć eksperymentów marketingu wizualnego.



