Strona główna / Rozdział 4 · Kontekst i wiedza
    Ostatnia zmiana · 9 min czytania

    Użyj z AI

    Context engineering i pamięć

    Model wie tylko to, co jest w kontekście bieżącego wywołania. Context engineering to wybór, co tam włożyć: najmniej tokenów, które wystarczą do następnego kroku, a z pamięci poza oknem tylko to, co potrzebne teraz.

    Po ludzkuPrzekazanie dyżuru w szpitalu. Nocna zmiana nie opowiada całej nocy minuta po minucie, tylko zostawia kartę: uczulenia, podane leki, co się zmieniło, co zostało do zrobienia. Czego nie ma w karcie, tego dzienna zmiana nie wie.

    Agent od 40 tur dodaje obsługę zwrotów do modułu płatności. Wybierz, jak zarządza kontekstem, i zobacz, które z sześciu faktów dotrwają do pytania w turze 41 i czy agent odpowie dobrze

    tokenów wejścia w wywołaniu 41
    zapełnienia okna 200 tys.
    tokenów wejścia w całej sesji
    faktów w kontekście

      Liczby poglądowe: okno 200 tys. tokenów, z czego 32 tys. zarezerwowane na odpowiedź, stały prefiks 11 tys., ok. 6 tys. tokenów na turę, kompakcja i reset przy 150 tys. Sesja, fakty i odpowiedzi agenta są zmyślone, żeby pokazać typowe zachowania. Prawdziwy agent może zgubić albo zachować inne fakty.

      Co walczy o miejsce w oknie

      Jak pisać prompty: minimum, które działa

      Techniki dla długich zadań

      Pamięć między sesjami

      Sprawdź się

      Agent po godzinie pracy zapomina ustalenia z początku sesji i robi się coraz droższy. Jak zaprojektujesz zarządzanie kontekstem i pamięcią?

      Model wie tylko to, co jest w bieżącym kontekście, więc przed każdym wywołaniem składaj najmniejszy zestaw tokenów potrzebny do następnego kroku. Stały prefiks z instrukcjami i narzędziami idzie na początek, pod cache. Duże dane agent pobiera narzędziami, gdy ich potrzebuje. Stare wyniki narzędzi czyść, historię przy progu kompaktuj, ale reguły i kluczowe ustalenia agent zapisuje w pliku z notatkami, bo streszczenie gubi szczegóły. Zadania poboczne dostają subagenci z czystym oknem. Pamięć między sesjami traktuj jak niezaufane dane: z datą, źródłem, wygasaniem i kontrolą użytkownika.

      In English

      The model knows only what is in the current context, so before every call assemble the smallest set of tokens the next step needs. A stable prefix with instructions and tools goes first, for the cache. The agent fetches large data with tools when it needs it. Clear old tool results and compact history at a threshold, but have the agent write rules and key decisions to a notes file, because a summary loses details. Side tasks go to subagents with a clean window. Treat cross-session memory as untrusted data: dated, sourced, expiring and under user control.

      Pytania pogłębiające (5)
      Kompakcja czy start od czystego okna?
      Kompakcja zachowuje ciągłość długiej rozmowy, ale streszczenie gubi szczegóły i kosztuje dodatkowe wywołanie. Przy kodzie często lepszy jest czysty start: stan leży na dysku w notatkach, testach i historii gita, a model umie go odczytać. Dokumentacja Claude podaje to jako alternatywę dla kompakcji.
      Jak sprawdzisz, czy kompakcja gubi coś ważnego?
      Ewaluacją na długich sesjach: fakty podane wcześnie, pytania o nie po kompakcji, porównanie z odpowiedzią na pełnej historii. Prompt kompakcji najpierw dopracowujesz pod kątem kompletności, potem tniesz to, co zbędne. Fakty, których zgubić nie wolno, agent zapisuje w notatkach, zanim dojdzie do streszczenia.
      Co trzymasz w stałym prefiksie, a co pobierasz na żądanie?
      W prefiksie reguły obowiązujące zawsze i krótkie fakty potrzebne w większości kroków. Wyszukiwanie znajduje to, co przypomina pytanie, a ogólna reguła rzadko przypomina konkretne pytanie. Duże i rzadko potrzebne dane agent pobiera przez ścieżki i narzędzia.
      Użytkownik mówi, że asystent „pamięta” coś, czego nigdy mu nie powiedział. Co sprawdzasz?
      Skąd przyszedł wpis: z rozmowy, dokumentu, strony czy wyniku narzędzia. Jeśli z obcej treści, to memory poisoning. Poprawka: zapis tylko z wypowiedzi użytkownika albo po jego potwierdzeniu, źródło i data przy każdym wpisie, widoczny komunikat o zapisie.
      Czemu nie wrzucić wszystkiego do okna miliona tokenów?
      Każde wywołanie płaci za całe wejście i dłużej czeka na pierwszy token, a jakość spada z długością i szumem. W badaniu Chroma każdy testowany model wypadł wyraźnie lepiej na ok. 300 tokenach potrzebnych fragmentów niż na ok. 113 tys. tokenów, w których ta sama odpowiedź ginęła w szumie. Duże okno to zapas, nie strategia.

      Źródła

      Zgłoś błąd · Zaproponuj poprawkę