Evals to uporządkowane testy, w których odpowiedzi systemu AI porównuje się z ustalonymi kryteriami jakości na zestawie przykładów.
Co to znaczy
Model może odpowiadać inaczej na podobne pytania, więc jednorazowy pokaz nie wystarcza do oceny. Zestaw testowy powinien obejmować typowe zadania, trudne wyjątki i błędy, których chcemy uniknąć. Kryterium może dotyczyć poprawności, kompletności albo zgodności z zasadami marki.
Powiązane pojęcia: Weryfikacja faktów przez AI (AI Fact-Checking), Halucynacja AI.
Źródło definicji: OpenAI Developers, Evaluation best practices.
Dlaczego to ważne
Przed zmianą modelu lub promptu w firmowym asystencie uruchom ten sam zestaw prób. Wtedy można zobaczyć, czy poprawa tonu nie pogorszyła faktów lub czy oszczędność kosztu nie zwiększyła liczby błędów.
Zespół tworzy 30 rzeczywistych pytań o ofertę, zapisuje zatwierdzone odpowiedzi i sprawdza, czy nowa wersja asystenta nie wymyśla rabatów ani terminów.
Czym to nie jest
Evals nie są samą oceną „brzmi dobrze”. Test wymaga jawnych przykładów, kryteriów i zapisu wyników. Nie zastępuje kontroli redaktora w sprawach wysokiej stawki.
Jak rozpoznać
Projekt ma zestaw pytań testowych, oczekiwane cechy odpowiedzi i wynik porównywany między wersjami.