AI Agent Builder od OpenAI – przewodnik po architekturze, budowie i wdrażaniu agentówAI Raport o Realnych Zagrożeniach AI w Polsce do 2040 RokuMARKETING Budujemy personę klienta z pomocą ChatGPT 4oSEO SurferSEO + ChatGPT: kompletny workflow optymalizacji artykułuB2B AI w Marketingu B2B: perspektywy rozwoju i przyszłość branżyAI Agent Builder od OpenAI – przewodnik po architekturze, budowie i wdrażaniu agentówAI Raport o Realnych Zagrożeniach AI w Polsce do 2040 RokuMARKETING Budujemy personę klienta z pomocą ChatGPT 4oSEO SurferSEO + ChatGPT: kompletny workflow optymalizacji artykułuB2B AI w Marketingu B2B: perspektywy rozwoju i przyszłość branży

AIMARKETING /

Symulator AI zawyżał efekty testów A/B. Kalibrację sprawdzono na 16 eksperymentach

Symulator AI zawyżał efekty testów A/B. Kalibrację sprawdzono na 16 eksperymentach

Stefan Hut i Lorenzo Masoero ocenili symulator AI na 67 historycznych testach A/B dotyczących klikalności kreacji na dużej platformie e-commerce. Model bazowy zawyżał wielkość efektów, a kalibracja poprawiła prognozy w podzbiorze 16 eksperymentów. Dla marketera, który chce używać symulacji do wyboru kampanii, oznacza to konieczność dwóch osobnych ocen: czy narzędzie wskazuje właściwy kierunek zmiany i czy poprawnie szacuje jej skalę. Samo wskazanie zwycięskiego wariantu nie wystarcza do oceny, ile można zyskać.

Co porównano z wynikami rzeczywistych testów

Badacze zestawili prognozy symulatora z wynikami 67 historycznych eksperymentów. Mierzoną reakcją był CTR, czyli stosunek liczby kliknięć do liczby wyświetleń kreacji.

Historyczne wyniki też były oszacowaniami obarczonymi niepewnością. To istotne przy ocenie symulatora: różnica między jego prognozą a wynikiem eksperymentu może obejmować zarówno błąd prognozy, jak i szum pomiaru w rzeczywistym teście.

Autorzy sprawdzili dwie odrębne zmiany: kalibrację prognoz oraz porównywanie obu wariantów na tych samych symulowanych osobach. Każda z nich ma osobny wynik, który trzeba interpretować zgodnie z mierzoną wielkością.

Kalibracja zmniejszyła błąd około 77 razy w 16 eksperymentach

Kalibracja metodą Platta zmniejszyła skorygowany błąd średniokwadratowy prognoz około 77 razy. Wynik dotyczy podzbioru 16 eksperymentów, a nie wszystkich 67 testów.

Autorzy użyli miary CMSE, od angielskiego corrected mean squared error. Porównuje ona prognozę symulatora z historycznym oszacowaniem średniego efektu badanego wariantu, oznaczanym jako ATE. Dla każdego eksperymentu od kwadratu różnicy odejmuje się wariancję historycznego oszacowania, czyli kwadrat jego błędu standardowego. Następnie oblicza się średnią.

Ta korekta uwzględnia szum pomiaru historycznego efektu. Nie polega na odjęciu błędu modelu bazowego ani wyniku prognozy zerowej.

Spadek CMSE opisuje poprawę prognoz według tej konkretnej miary. Nie oznacza 77-krotnego wzrostu CTR ani 77-krotnie większej trafności wskazywania zwycięzcy.

Wynik 0,70 wymaga nazwy miary i punktu odniesienia

Autorzy oceniali kierunek prognoz za pomocą dwóch miar: sign accuracy i sign overlap. Obie przyjęły wartość 0,70, ale miały inne reguły odniesienia.

MiaraWynik symulatoraProste reguły odniesienia w badaniu
Sign accuracy0,70; błąd standardowy 0,06Losowanie kierunku: 0,50; przewidywanie zawsze dodatniego efektu: 0,57
Sign overlap0,70; błąd standardowy 0,03Stałe prawdopodobieństwo 0,5: wynik 0,75

Sign accuracy opisuje zgodność przewidywanego kierunku efektu. Wynik symulatora był liczbowo wyższy niż wyniki obu prostych reguł, ale przy ocenie przewagi trzeba uwzględnić niepewność oszacowania.

Sign overlap jest odrębną miarą kierunkową. W tym zestawieniu symulator uzyskał niższą wartość niż reguła stałego prawdopodobieństwa. Nie należy utożsamiać jej wyniku z odsetkiem poprawnie wskazanych zwycięzców.

Dlatego deklaracja dostawcy „70% trafności” nie wystarcza do oceny narzędzia. Potrzebujesz definicji miary, wyniku właściwej prostej reguły i informacji o niepewności porównania. Wartości 0,57 i 0,75 z tego badania nie są uniwersalnymi progami dla kolejnych zbiorów testów. Sam wynik 0,70 nie rozstrzyga przewagi symulatora nad prostymi prognozami.

Te same symulowane osoby zmniejszyły błędy standardowe

Porównanie obu wariantów przez te same symulowane osoby zmniejszyło błędy standardowe około 2,4 razy. Autorzy określają ten układ jako within-subject.

Zamiast zestawiać odpowiedzi dwóch różnych grup, porównuje się reakcje tych samych symulowanych uczestników na oba warianty. To zmiana sposobu przeprowadzenia porównania. Wynik około 2,4 razy dotyczy błędów standardowych; wynik około 77 razy dotyczy CMSE po kalibracji. Są to dwa osobne rezultaty badania.

Trafny kierunek może prowadzić do złej oceny skali

Załóżmy fikcyjny przykład: symulator przewiduje, że wariant B zwiększy CTR o 18% względem wariantu A. Rzeczywisty test daje oszacowanie wzrostu o 1,4%. Obie liczby oznaczają zmianę względną, nie punkty procentowe.

Symulator wskazał poprawny kierunek, lecz prognozowany wzrost był około 12,9 razy większy od oszacowania z testu. Jeśli zespół przyjął roboczą zasadę, że w pierwszej kolejności sprawdza pomysły z oczekiwanym wzrostem CTR powyżej 10%, taka prognoza mogła nadać wariantowi zbyt wysoki priorytet. Próg 10% jest wyłącznie założeniem tego przykładu, a nie rekomendacją.

Przykład pokazuje różnicę między wyborem kierunku a oceną skali. Nie jest wynikiem badania Huta i Masoero ani testem wykonanym przez redakcję.

Karta oceny dostawcy symulacji

Przed użyciem prognoz do ustalania kolejności testów poproś dostawcę o udokumentowanie poniższych punktów. Sama deklaracja, że system „odtwarza zachowania klientów”, nie pozwala ocenić jego przydatności.

1. Dane sprzed eksperymentu. Jakie informacje były dostępne w chwili prognozy? Poproś o zakres i daty danych, także tych użytych do kalibracji. Oddziel je od informacji poznanych dopiero po zakończeniu testu.

2. Stała wersja modelu i promptu. Czy zapisano konfigurację używaną do ocenianych prognoz? Wyniki różnych wersji powinny być raportowane osobno. Zmiana promptu lub modelu wymaga ponownej oceny, zamiast dopisywania wyników do jednej zbiorczej „trafności”.

3. Ukryte wyniki testów. Czy wyniki eksperymentów użytych do oceny pozostawały niedostępne do chwili zapisania prognoz? Poproś o rozdzielenie danych służących do dostrajania systemu od danych służących do jego sprawdzenia.

4. Błąd wielkości efektu. Jak zdefiniowano błąd i jak wypada on wobec prognozy zerowego efektu na tych samych testach? Jeśli dostawca podaje CMSE, sprawdź, czy uwzględnia niepewność historycznych oszacowań. Podobny błąd obu metod nie daje podstaw do deklarowania przewagi symulatora w tej ocenie.

5. Ocena kierunku. Jaką miarę podaje dostawca i z jaką prostą regułą ją porównuje? Wyniki liczbowe reguł odniesienia powinny dotyczyć ocenianego zbioru. Nie przenoś automatycznie wartości z omawianego badania na własne kampanie.

6. Niepewność prognoz. Czy poza jedną liczbą dostajesz zakres niepewności i wyjaśnienie sposobu jego wyznaczenia? Sprawdź, czy zakres obejmuje efekty, przy których podjąłbyś różne decyzje o kolejności testów.

7. Podstawa profili odbiorców. Czy symulowane osoby opierają się na danych o zachowaniach klientów, czy na fikcyjnych opisach? Poproś o wyniki walidacji pokazujące, na ile te profile pomagają przewidywać reakcje.

Tworzenie person z ChatGPT może pomóc uporządkować założenia o potrzebach odbiorców. Szczegółowa persona nie zastępuje jednak rzeczywistych danych o zachowaniu ani sprawdzenia prognoz symulatora.

Jeden zbiór CTR nie potwierdza skuteczności w twojej firmie

Badanie dotyczyło testów klikalności kreacji na jednej dużej platformie e-commerce. Wyniku nie można automatycznie przenieść na sprzedaż, marżę, inne platformy ani inne typy kampanii. Nie dowodzi on też skuteczności konkretnego narzędzia w polskiej firmie.

Odrębnym zagadnieniem jest reakcja odbiorców na informację, że w reklamie wykorzystano AI. Przykład takiego problemu opisuje materiał o testowaniu komunikatów o AI w reklamie i ofercie. Tutaj przedmiotem oceny jest zdolność symulatora do przewidywania wyników.

Przed ustaleniem kolejności kampanii na podstawie symulacji poproś o raport z oceną kierunku, wielkości efektu i niepewności na testach podobnych do twoich. Do czasu takiej walidacji traktuj wskazania narzędzia jako hipotezy do rzeczywistych eksperymentów.

Źródła

AI BRIEF

Raz w tygodniu. Bez hype'u.

Trzy newsy, jedno narzędzie, jeden prompt tygodnia.
OSTATNIO DODANE
AI Skills

Przykładowe skille

Zobacz całą bibliotekę
CO DALEJ?

Podobne artykuły