Strona główna / Rozdział 4 · Kontekst i wiedza
    Ostatnia zmiana · 7 min czytania

    Użyj z AI

    RAG

    RAG (retrieval-augmented generation) to wyszukanie fragmentów twoich dokumentów i wklejenie ich do promptu przed pytaniem. Model odpowiada z podanego tekstu zamiast z pamięci, więc wiedza może być aktualna, prywatna i cytowana, ale jakość odpowiedzi zależy głównie od tego, co znajdzie wyszukiwanie.

    Po ludzkuEgzamin z otwartą książką. Zamiast liczyć na pamięć ucznia, kładziesz przed nim właściwą stronę podręcznika tuż przed pytaniem. Jeśli podasz złą stronę, uczeń odpowie źle równie pewnie, bo czyta to, co dostał.

    Przejdź krok po kroku przez pipeline. Zobacz, które fragmenty odpadają na wyszukiwaniu i rerankingu oraz co zmienia się w odpowiedzi

    Pytanie pracownika: „Ile dni urlopu mam po 10 latach pracy u nas?”

    Indeksowanie i chunking

    Wyszukiwanie i reranking

    Sztuczki po stronie zapytania i indeksu

    Prompt i cytaty

    Ewaluacja, agenci i alternatywy

    Sprawdź się

    Jak działa RAG i gdzie najczęściej zawodzi?

    RAG podaje modelowi wiedzę w kontekście zamiast liczyć na jego pamięć. Wcześniej, offline, dokumenty się parsuje, tnie po strukturze, opisuje metadanymi i uprawnieniami, a potem indeksuje wektorowo oraz w BM25. Przy pytaniu wyszukiwanie idzie hybrydowo z filtrem uprawnień, reranker wybiera kilka najlepszych fragmentów, a prompt każe odpowiadać tylko z nich, z cytatami, i przyznać, gdy odpowiedzi nie ma. Najczęściej zawodzi parsowanie i wyszukiwanie, nie model: właściwego fragmentu po prostu nie ma w prompcie. Dlatego recall wyszukiwania i wierność odpowiedzi mierz osobno.

    In English

    RAG gives the model knowledge through its context instead of relying on its memory. Offline, documents are parsed, chunked along their structure, tagged with metadata and permissions, and indexed both as vectors and in BM25. At query time a hybrid search runs with a permission filter, a reranker picks the few best chunks, and the prompt says to answer only from them, with citations, and to admit when the answer is missing. What fails most often is parsing and retrieval, not the model: the right chunk simply is not in the prompt. So measure retrieval recall and answer faithfulness separately.

    Pytania pogłębiające (5)
    Użytkownicy zgłaszają złe odpowiedzi. Jak szukasz przyczyny?
    Na trace’ach sprawdź etap po etapie: czy właściwy fragment był w wynikach wyszukiwania, czy przetrwał reranking, czy trafił do promptu i czy model go użył. Brak w wynikach to parsowanie, chunking albo zapytanie. Obecny, ale źle użyty to prompt albo model. Nieaktualna treść to proces indeksowania.
    RAG czy długi kontekst?
    Długi kontekst jest prostszy przy małym, stałym zbiorze, zwłaszcza z prompt cachingiem. RAG wygrywa przy dużym albo zmiennym zbiorze pod względem kosztu na pytanie, opóźnienia, uprawnień i cytatów, a krótszy kontekst to też mniejszy spadek jakości z długością.
    Jak obsłużyć uprawnienia?
    ACL zapisane w metadanych każdego chunka i zsynchronizowane ze źródłem, filtr w zapytaniu do indeksu na podstawie tożsamości użytkownika i test, że osoba bez dostępu nie dostaje fragmentu. Nigdy przez instrukcję w prompcie.
    Kiedy agentic retrieval zamiast jednego wyszukiwania?
    Gdy pytanie wymaga kilku kroków albo porównania źródeł i nie wystarczy do niego jedno zapytanie. Zacznij od jednego wyszukiwania, zmierz, na jakich pytaniach zawodzi, i dopiero tam płać turami i opóźnieniem agenta.
    Kiedy HyDE szkodzi?
    Gdy model nie zna domeny: hipotetyczna odpowiedź ma zmyślone nazwy, liczby i terminy, więc jej embedding ląduje obok dokumentów o czymś innym. Nie pomaga też przy wyszukiwaniu identyfikatorów i dokładnych fraz, gdzie wygrywa BM25, i przy ciasnym budżecie opóźnienia. Rozstrzyga porównanie recall@k z HyDE i bez niego na własnym zestawie pytań.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę