Strona główna / Rozdział 3 · Jak model pisze i ile to kosztuje
    Ostatnia zmiana · 5 min czytania

    Użyj z AI

    Prompt caching

    Prompt caching to KV cache zachowany u dostawcy między requestami. Request, który zaczyna się identycznie jak niedawny, pomija prefill tej części: płaci ułamek ceny wejścia i szybciej dostaje pierwszy token.

    Po ludzkuKelner, który zna stałych gości, nie pyta od nowa o alergie i ulubiony stolik. Ale wystarczy przedstawić się innym imieniem i zaczyna od zera. I pamięta gościa tylko kilka minut od ostatniej wizyty.

    Wybierz układ promptu. Zobacz, jaka część drugiego requestu trafia w cache i ile to kosztuje

    Request 1

    Request 2, chwilę później

    zapis do cache’utrafienieliczone od nowa i zapisywane
    tokenów requestu 2 z cache’u
    koszt wejścia requestu 1: sam zapis
    koszt wejścia requestu 2: odczyt plus zapis nowych tokenów
    taniej niż bez cache’u

    Przykładowe stawki: 3 USD za milion tokenów wejściowych, odczyt z cache’u 10% tej ceny, zapis 125%. Tak liczą Anthropic przy 5-minutowym wpisie i OpenAI od GPT-5.6 (wrzesień 2026). U starszych modeli i innych dostawców zapis bywa bez dopłaty.

    Jak działa prompt caching

    Warunki u dostawców

    Jak układać prompt pod cache

    Sprawdź się

    Jak działa prompt caching i jak układać pod niego prompt?

    To KV cache zachowany u dostawcy między requestami. Działa tylko przy identycznym prefiksie, bo K i V tokena zależą od wszystkiego przed nim: pierwszy zmieniony token unieważnia resztę. Dlatego stałe części, czyli narzędzia, system prompt i duże dokumenty, idą na początek, historię się tylko dopisuje, a zmienne dane trafiają na koniec. Odczyt kosztuje zwykle 10% ceny wejścia, zapis bywa droższy od zwykłego wejścia, a wpis żyje minuty. Zysk to tańsze wejście i krótszy czas do pierwszego tokena. Hit rate odczytuje się z pól usage.

    In English

    It is the KV cache kept by the provider across requests. It only matches an identical prefix, because a token’s keys and values depend on everything before it: the first changed token invalidates the rest. So stable parts such as tools, the system prompt and large documents go first, history is append-only, and volatile data goes last. Reads usually cost 10% of the input price, writes can cost more than plain input, and entries live for minutes. The payoff is cheaper input and faster time to first token. The hit rate comes from the usage fields.

    Pytania pogłębiające (4)
    Rachunek za agenta jest wysoki, a hit rate niski. Co sprawdzasz?
    Porównaj kolejne requesty token po tokenie i szukaj pierwszej różnicy: data lub identyfikator na początku, niedeterministyczna serializacja narzędzi i JSON-a, edycja historii, zmiana modelu albo poziomu myślenia. Potem sprawdź, czy przerwy między turami nie są dłuższe niż czas życia wpisu i czy prefiks przekracza minimalną długość.
    Czym prompt caching różni się od cache’u semantycznego?
    Prompt caching przechowuje obliczenia dla identycznego prefiksu, a model i tak generuje nową odpowiedź, więc jakość się nie zmienia. Cache semantyczny zwraca starą odpowiedź na podobne pytanie: oszczędza całe wywołanie, ale może zwrócić odpowiedź na inne pytanie.
    Kiedy caching się nie opłaca?
    Gdy prefiks rzadko się powtarza w czasie życia wpisu. Przy dopłacie za zapis każdy wpis bez trafienia kosztuje więcej niż request bez cache’u.
    Czy cache może zdradzić dane innego użytkownika?
    Duzi dostawcy nie dzielą cache’u między organizacjami, ale w twojej aplikacji użytkownicy z tym samym prefiksem trafiają w ten sam wpis. Trafienie widać po krótszym czasie odpowiedzi, więc ktoś może sprawdzić, czy inny użytkownik niedawno wysłał dany tekst. Audyt z 2025 roku wykrył cache współdzielony globalnie, między organizacjami, u 7 z 17 dostawców API, a co najmniej pięciu zmieniło to dopiero po zgłoszeniu. Rozdziel cache per klient (w Anthropic osobny workspace, w OpenAI od GPT-5.6 osobny prompt_cache_key; w starszych modelach klucz wpływa tylko na routing) albo trzymaj wrażliwe dane poza wspólnym prefiksem.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę