Prompt caching to mechanizm, który pozwala ponownie wykorzystać wcześniej przetworzony początek promptu, gdy kolejne żądania mają taki sam fragment wejścia.
Co to znaczy
Dostawca API może dzięki temu szybciej obsłużyć powtarzalne żądania i rozliczyć część tokenów według stawki dla danych z pamięci podręcznej. Warunki zależą od modelu i usługi; podobny, ale zmieniony początek promptu może nie zostać ponownie użyty.
Powiązane pojęcia: Prompt (Polecenie), Koszt tokenów (Token Pricing).
Źródło definicji: OpenAI Developers, Prompt caching.
Dlaczego to ważne
Przy seryjnym opracowywaniu opisów produktów warto oddzielić stałe zasady marki od zmiennych danych produktu. Potem mierzyć faktyczne trafienia cache i jakość wyników, zamiast zakładać oszczędność z góry.
Sklep wysyła przez API stałą instrukcję dotyczącą tonu, formatu i zakazanych obietnic, a na końcu dopisuje dane kolejnego produktu. Powtarzalny początek może kwalifikować się do cache.
Czym to nie jest
Cache promptu nie jest pamięcią rozmowy ani bazą wiedzy. Nie gwarantuje też identycznych odpowiedzi.
Jak rozpoznać
W statystykach API szukaj informacji o tokenach wejściowych obsłużonych z cache oraz czasie odpowiedzi.