Strona główna / Rozdział 3 · Jak model pisze i ile to kosztuje
    Ostatnia zmiana · 6 min czytania

    Użyj z AI

    Okno kontekstowe i agent

    Model niczego nie pamięta między requestami, wie tylko to, co dostał w bieżącym. Context window to wspólny limit tokenów wejścia i wyjścia jednego requestu. Agent w każdej turze wysyła całą rosnącą historię, więc płaci za nią wielokrotnie, a jakość odpowiedzi spada wraz z jej długością.

    Po ludzkuModel to konsultant z amnezją. Przed każdą rozmową dostaje teczkę i wie tylko to, co w niej jest. Teczka ma ograniczoną grubość, a agent przy każdym kroku dokłada do niej kartki.

    Przesuń suwak tur agenta. Zobacz, co zapełnia okno i jak szybko rośnie łączny koszt wejścia

    tokenów wejścia w tej turze
    tokenów wejściowych wysłanych od startu
    koszt wejścia bez cache’u
    z prompt cachingiem
    łączny koszt wejścia bez cache’uz prompt cachingiem

    Liczby poglądowe. Okno 200 tys. tokenów, z czego 32 tys. zarezerwowane na odpowiedź i myślenie. Każda tura dokłada 6 tys. tokenów wyników narzędzi i 300 tokenów odpowiedzi. Stawki jak w temacie „Prompt caching”: 3 USD za milion tokenów wejściowych, zapis do cache’u 125%, odczyt 10%. Bez kosztu wyjścia.

    Co liczy się do limitu

    Limit wejścia i limit wyjścia

    Koszt rośnie z każdą turą

    Context rot: jakość spada z długością kontekstu

    Sprawdź się

    Co liczy się do context window i czemu długa sesja agenta jest droga i coraz słabsza?

    Model jest bezstanowy i widzi tylko bieżący request. Okno to limit tokenów na request, wspólny dla system promptu, definicji narzędzi, historii z wynikami narzędzi i tego, co model wygeneruje, łącznie z myśleniem. Limit samego wyjścia jest osobny i dużo mniejszy. Agent w każdej turze wysyła całą historię, więc łączna liczba tokenów wejściowych rośnie z kwadratem liczby tur. Prompt caching obniża cenę, ale nie kształt krzywej. Jakość spada z długością na długo przed końcem okna, więc kontekst warto trzymać krótki i testować na realnych długościach.

    In English

    The model is stateless and only sees the current request. The window caps tokens per request and is shared by the system prompt, tool definitions, history with tool results and everything the model generates, thinking included. The output limit is separate and much smaller. An agent resends the whole history every turn, so cumulative input tokens grow quadratically with turns. Prompt caching lowers the price, not the shape of the curve. Quality degrades with length long before the window is full, so keep context lean and test at realistic lengths.

    Pytania pogłębiające (4)
    Co to context rot?
    Spadek jakości z długością wejścia, zanim okno się skończy. Jest silniejszy, gdy w kontekście leżą podobne, ale nieistotne fragmenty, i gdy odpowiedź nie powtarza słów z pytania, więc test needle-in-a-haystack go nie pokazuje.
    Model ma okno 1 mln tokenów. Czemu nie wrzucić całej bazy wiedzy do promptu?
    Bo każdy request płaci za cały milion, u części dostawców drożej powyżej progu, czas do pierwszego tokena rośnie, a jakość spada z długością. Przy małym, stałym zbiorze z prompt cachingiem to rozsądne, przy dużym albo zmiennym wygrywa wyszukiwanie (temat „RAG”).
    Agent przepełnia okno po 40 turach. Co robisz?
    Najpierw zmierz, co zajmuje okno, zwykle stare wyniki narzędzi i definicje narzędzi. Potem przytnij wyniki u źródła, wyczyść stare, przenieś poboczne zadania do subagentów, a dopiero na końcu skompaktuj historię (temat „Context engineering i pamięć”).
    Czy API trzymające historię po stronie serwera obniża koszt?
    Nie. Funkcje takie jak previous_response_id w Responses API OpenAI oszczędzają ci przesyłania, ale cała historia i tak trafia do modelu i jest liczona jako wejście. Koszt obniża dopiero prompt caching albo krótszy kontekst.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę