Badacze sprawdzili, czy modele językowe gorzej trzymają się danych z kontekstu, gdy te dane przeczą ich wiedzy parametrycznej. W eksperymencie opublikowanym 8 września 2026 roku dane kontrfaktyczne otrzymały od Kimi K3 ocenę wierności o 0,05 punktu niższą niż dane faktyczne na skali 1–5. Autorzy spodziewali się silniejszego konfliktu. Ustalili też, że suboptymalny model oceniający może zawyżać jego skalę.
Badanie nie dotyczyło CRM ani sprzedaży. Dla zespołów używających AI do kwalifikacji leadów lub podsumowywania rozmów podsuwa jednak dwa osobne obszary kontroli: odpowiedzi modelu oraz metodę ich oceny.
Modele pracowały na danych faktycznych, kontrfaktycznych i fikcyjnych
Modele generowały tekst na podstawie trzech rodzajów trójek RDF: faktycznych, kontrfaktycznych i fikcyjnych. Eksperyment obejmował język angielski, czeski, słowacki oraz górnołużycki. Dane opisywały lokalną wiedzę czeską i słowacką, którą wiedza parametryczna modeli obejmuje tylko częściowo.
Autorzy mierzyli, czy wygenerowany tekst zachowuje fakty przekazane w kontekście. Kimi K3 pełnił funkcję sędziego LLM, czyli modelu oceniającego odpowiedzi innych modeli. Na próbce z adnotacjami ludzkimi jego oceny wykazały dobrą zgodność z ocenami ludzi.
W ocenie Kimi K3 różnica między danymi faktycznymi a kontrfaktycznymi wyniosła −0,05 punktu na skali 1–5. Autorzy uznali konflikt między kontekstem a wiedzą parametryczną za słaby, wbrew swojej hipotezie wyjściowej. Ta liczba nie opisuje jednak wszystkich LLM ani innych zastosowań.
Model oceniający może wyolbrzymić problem
Drugi wynik eksperymentu dotyczy samego pomiaru. Według autorów suboptymalny wybór sędziego LLM prowadziłby do przeszacowania siły konfliktu między kontekstem a wiedzą parametryczną.
Ma to praktyczne znaczenie, gdy jeden model automatycznie ocenia odpowiedzi drugiego, na przykład w kwalifikacji leadów lub kontroli podsumowań rozmów. Słaba nota nie musi wynikać wyłącznie z błędu ocenianego modelu. Jej źródłem może być również model, który niepoprawnie rozpoznaje zachowanie faktów.
Przed zmianą promptu albo modelu warto więc porównać automatyczne oceny z ręczną kontrolą części odpowiedzi. Osobnej uwagi wymaga także to, jakie informacje rzeczywiście trafiają do modelu. Ten problem omawiamy szerzej w materiale o architekturze danych dla AI.
Jak sprawdzić nietypowe, ale poprawne rekordy CRM
Eksperyment wykorzystywał formalne trójki RDF, a nie dane sprzedażowe. Poniższa procedura jest redakcyjną propozycją diagnostyczną. Nie stanowi replikacji badania ani dowodu, że model zachowa się tak samo w systemie CRM.
Wybierz dwa zestawy rekordów
Przygotuj małą próbę, na przykład 5–10 nietypowych rekordów, oraz podobną liczbę zwykłych przypadków do porównania. Nietypowy rekord może opisywać:
- szansę sprzedażową o wartości znacznie wyższej niż mediana segmentu, zamkniętą w krótkim czasie;
- osobę decyzyjną w roli rzadko spotykanej w dotychczasowych transakcjach;
- małą firmę składającą zamówienie o wartości typowej dla większego klienta;
- wyjątkowo długi cykl sprzedaży w branży, w której zwykle jest on krótki.
Rekord powinien być poprawny i wcześniej zweryfikowany. Nie chodzi o celowe dodawanie błędów, lecz o sprawdzenie, czy model zachowa dane odbiegające od typowego wzorca.
Ustal wzorzec odpowiedzi przed uruchomieniem modelu
Pracuj na kopii danych i usuń informacje pozwalające zidentyfikować firmy lub osoby. Zachowaj te relacje między wartościami, które są potrzebne do wykonania zadania.
Następnie zapisz fakty, które prawidłowa odpowiedź powinna zachować. Dla kwalifikacji leada może to być ocena wraz z uzasadnieniem. Dla podsumowania rozmowy — lista ustaleń, kwot i terminów. Nie dopasowuj wzorca po zobaczeniu odpowiedzi modelu.
Przepuść oba zestawy przez ten sam prompt i przy tych samych ustawieniach. Dzięki temu zobaczysz, czy błędy częściej dotyczą rekordów nietypowych, czy pojawiają się niezależnie od ich charakteru.
Oceniaj konkretne błędy
| Typ błędu | Co zrobił model | Pytanie kontrolne |
|---|---|---|
| Pominięcie faktu | Nie uwzględnił wartości obecnej w rekordzie | Czy pole trafiło do kontekstu i było potrzebne w odpowiedzi? |
| Zmiana faktu | Zastąpił wartość inną lub bardziej typową | Czy wartość zmieniła się przed wysłaniem danych, w prompcie czy w odpowiedzi? |
| Dopisanie faktu | Dodał informację nieobecną w rekordzie | Czy instrukcja zachęca model do uzupełniania braków? |
Pierwszą partię powinien ocenić człowiek na podstawie przygotowanego wzorca. Jeśli później chcesz używać sędziego LLM, porównaj jego noty z ocenami ręcznymi na tej samej próbce. Dopiero wtedy wiadomo, czy automatyczna ocena wykrywa rzeczywiste błędy.
Przy takim sprawdzeniu trzeba również kontrolować, gdzie trafiają dane i kto ma do nich dostęp. Pomocny będzie materiał o shadow AI i kontroli danych.
Jak interpretować wynik próby
Jeśli model częściej zmienia lub pomija fakty w rekordach nietypowych niż w zwykłych, potraktuj to jako sygnał do sprawdzenia promptu, sposobu przekazywania pól oraz konfiguracji modelu. Taki wynik nie dowodzi jeszcze konfliktu kontekst–pamięć opisanego w badaniu.
Jeżeli podobne błędy występują w obu grupach, problem może dotyczyć całego procesu: przygotowania danych, długości kontekstu albo nieprecyzyjnej instrukcji. Gdy natomiast oceny sędziego LLM rozmijają się z ocenami ręcznymi, najpierw popraw metodę pomiaru. Bez tego porównanie modeli będzie niewiarygodne.
Szerszy kontekst oceny odpowiedzi generowanych przez modele opisujemy w artykule o zaufaniu do treści z AI.
Ograniczenia badania
Badanie dotyczy generowania tekstu z trójek RDF. Nie obejmuje systemów CRM, asystentów sprzedażowych ani generowania odpowiedzi na podstawie dokumentów handlowych.
Różnica −0,05 punktu pochodzi z oceny Kimi K3. Nie daje podstaw do przyjęcia takiego samego wyniku dla innych sędziów, modeli, języków i rodzajów danych. To pojedyncze badanie, bez polskiego kontekstu sprzedażowego, dlatego nie można na jego podstawie opisywać zachowania wszystkich LLM.
Procedura dla CRM pomaga znaleźć przypadki wymagające dalszej analizy. Nie zastępuje pomiaru na własnych danych ani ręcznej kontroli odpowiedzi.
Źródła
- arXiv Computational Linguistics, Do LLMs Make More Mistakes If They Do Not Believe the Input Data?, 8 września 2026
Zanim rozszerzysz użycie AI w kwalifikacji leadów lub podsumowaniach rozmów, sprawdź kilka nietypowych rekordów. Zweryfikuj zarówno odpowiedzi modelu, jak i narzędzie używane do ich oceny.



