AI Agent Builder od OpenAI – przewodnik po architekturze, budowie i wdrażaniu agentówAI Raport o Realnych Zagrożeniach AI w Polsce do 2040 RokuMARKETING Budujemy personę klienta z pomocą ChatGPT 4oSEO SurferSEO + ChatGPT: kompletny workflow optymalizacji artykułuB2B AI w Marketingu B2B: perspektywy rozwoju i przyszłość branżyAI Agent Builder od OpenAI – przewodnik po architekturze, budowie i wdrażaniu agentówAI Raport o Realnych Zagrożeniach AI w Polsce do 2040 RokuMARKETING Budujemy personę klienta z pomocą ChatGPT 4oSEO SurferSEO + ChatGPT: kompletny workflow optymalizacji artykułuB2B AI w Marketingu B2B: perspektywy rozwoju i przyszłość branży

AIMARKETING /

Żadna z czterech konfiguracji AI nie odtworzyła ponad 2 z 6 efektów u ludzi

Żadna z czterech konfiguracji AI nie odtworzyła ponad 2 z 6 efektów u ludzi

Marketer może poprosić model AI o ocenę logo, opakowania albo reklamy. Taka ocena nie musi jednak przewidywać reakcji odbiorców. W sześciu eksperymentach marketingu wizualnego żadna z czterech sprawdzonych konfiguracji nie odtworzyła w warunkach bazowych więcej niż dwóch efektów zaobserwowanych wcześniej u ludzi.

Autorzy porównali dwa modele w dwóch formatach wejścia: zwykłym tekście i JSON-ie. Wynik nie rozstrzyga, czy AI przydaje się do każdej oceny kreacji. Pokazuje za to, że rozpoznanie badanej cechy obrazu nie wystarcza, by uznać przewidywaną reakcję ludzi za wiarygodną.

Co sprawdzono w sześciu eksperymentach

Yi-Lin Tsai i Yung-Hsiu (Arvin) Lai opisali badanie „Seeing Is Not Perceiving: When Synthetic Consumers Can and Cannot Pretest Visual Marketing” jako preprint na arXiv, zgłoszony 22 września 2026 r. Autorzy wykorzystali sześć klasycznych eksperymentów dotyczących elementów wizualnych w marketingu.

Zestawili modele GPT-4o-mini i GPT-5.4-mini z dwoma formatami wejścia: poleceniami zapisanymi zwykłym tekstem oraz danymi w formacie JSON. Powstały cztery konfiguracje. Liczebność prób syntetycznych dopasowano do prób w badaniach referencyjnych, które obejmowały od 69 do 220 osób.

Wszystkie konfiguracje przechodziły testy manipulacji dotyczące badanych cech obrazów. Oznacza to, że reagowały na zmianę, którą miał sprawdzić eksperyment. Nie oznacza to jednak, że odtwarzały reakcję ludzi na tę zmianę. W warunkach bazowych żadna konfiguracja nie odtworzyła więcej niż dwóch z sześciu efektów ludzkich.

Rozpoznanie cechy obrazu to nie przewidywanie reakcji

Wyobraźmy sobie dwa warianty logo różniące się jednym elementem. Model może zauważyć tę zmianę i opisać ją zgodnie z poleceniem. To osobna umiejętność niż przewidzenie, czy ludzie uznają jeden wariant za bardziej wiarygodny, czytelny albo atrakcyjny.

Autorzy sprawdzili również, co dzieje się po przekazaniu modelowi informacji o wynikach uzyskanych wcześniej przez ludzi. Takie wskazówki przesuwały średnią odpowiedzi w stronę efektu z badań referencyjnych, ale nie odtwarzały całego zróżnicowania ludzkich reakcji. Zgodność średnich ocen nie wystarcza więc, by stwierdzić, że model oddaje różne reakcje odbiorców.

Co zapisać przed użyciem oceny AI

Poniższa karta pomaga uporządkować decyzję przed użyciem oceny modelu. To propozycja redakcyjna, a nie zwalidowana metoda wyboru kreacji ani zamiennik badania z ludźmi.

Co zapisaćPytanie kontrolne
Konfigurację modeluKtórego modelu i jakiego formatu wejścia użyto?
ZadanieO jaką konkretną ocenę poproszono model?
Badaną cechęJaki element materiału różni warianty lub podlega ocenie?
Ludzki punkt odniesieniaCzy ludzie ocenili te same materiały?
Zgodność ocenCzy model i ludzie wskazali ten sam kierunek reakcji?
RozbieżnościGdzie oceny się różnią?

Przy dwóch wariantach logo zespół może zapisać, który z nich ludzie uznali za czytelniejszy, a następnie sprawdzić, czy model wskazał ten sam kierunek. Taka zgodność przy jednej parze nie potwierdza, że model będzie trafnie oceniać inne kreacje.

Jeśli zespół nie ma oceny tych samych wariantów od ludzi, ranking wygenerowany przez AI pozostaje opinią modelu. Nie mówi, który wariant preferują odbiorcy. Zapiszcie brak punktu odniesienia i nie przedstawiajcie wyboru jako potwierdzonego badaniem.

Czego preprint nie rozstrzyga

Badanie nie sprawdzało konwersji reklam ani wyników polskich kampanii. Nie dowodzi też, że wszystkie modele błędnie oceniają każdą kreację. Opisuje sześć konkretnych eksperymentów i cztery konfiguracje. Wyniku nie należy przenosić automatycznie na inne materiały, zadania ani grupy odbiorców.

To preprint, a nie ustalony konsensus naukowy. Jego wyniki uzasadniają ostrożność przy traktowaniu oceny syntetycznych konsumentów jak danych z panelu ludzkiego. Przed użyciem takiej oceny zapiszcie, czy macie ludzki punkt odniesienia. Jeśli go nie ma, ograniczcie wniosek do odpowiedzi modelu.

Źródła

AI BRIEF

Raz w tygodniu. Bez hype'u.

Trzy newsy, jedno narzędzie, jeden prompt tygodnia.
OSTATNIO DODANE
AI Skills

Przykładowe skille

Zobacz całą bibliotekę
CO DALEJ?

Podobne artykuły