Strona główna / Rozdział 6 · Jakość i bezpieczeństwo
    Ostatnia zmiana · 5 min czytania

    Użyj z AI

    Halucynacje

    Model nie ma trybu „nie wiem”: zawsze dopisze prawdopodobny ciąg dalszy, równie pewnym tonem, gdy zna odpowiedź i gdy zgaduje. Halucynacji nie da się wyłączyć, da się je ograniczać i mierzyć.

    Po ludzkuStudent, który na egzaminie ustnym nigdy nie mówi „nie wiem”. Gdy zna odpowiedź, mówi płynnie i pewnie. Gdy nie zna, mówi tak samo płynnie i pewnie, więc po tonie nie poznasz różnicy.

    Włączaj źródło w kontekście i zgodę na „nie wiem”, osobno i razem. Patrz, które zmyślenia znikają, które zostają i ile odpowiedzi przy tym tracisz

    poprawne
    zmyślone
    „nie wiem”
    błędów wśród udzielonych odpowiedzi

    Symulacja poglądowa, nie pomiar żadnego modelu: odpowiedzi napisano ręcznie, żeby pokazać typowe zachowania. Wrzosowa Wola, jej muzeum, kronika gminy i artykuł Zielińskiej i Brandta są wymyślone. Zestaw celowo składa się głównie z trudnych pytań, więc proporcje nie mówią nic o skuteczności prawdziwych modeli. Wiersze, w których ocena zmieniła się po kliknięciu, są podświetlone.

    Skąd się biorą halucynacje

    Rodzaje halucynacji

    Co pomaga i gdzie są granice

    Próg pewności i pomiar

    Przesuwaj próg pewności, poniżej którego model mówi „nie wiem”. Porównaj punkty w ocenie 0/1 i w ocenie z karą za błąd i sprawdź, przy której opłaca się wstrzymać

    pytań z odpowiedzią
    błędów wśród odpowiedzi
    punktów na 100 pytań w ocenie 0/1, jak w większości benchmarków
    punktów na 100 pytań, gdy błąd kosztuje −1

    Poglądowy model: 1000 pytań, połowa łatwych, połowa trudnych, i idealna kalibracja, czyli przy pewności 70% ma rację w 70% przypadków. Liczby poglądowe, nie wynik benchmarku. Ocena z karą za błąd to propozycja z pracy Kalai i in. „Why Language Models Hallucinate” (2025).

    Sprawdź się

    Skąd biorą się halucynacje i jak je ograniczasz oraz mierzysz na produkcji?

    Model zawsze generuje prawdopodobny ciąg dalszy i nie ma wbudowanego „nie wiem”, więc przy rzadkich faktach zgaduje tym samym pewnym tonem. Trening i benchmarki oceniane 0/1 nagradzają trafienie, a za wstrzymanie dają zero, więc zgadywanie się opłaca. Nie da się tego wyłączyć, można ograniczać: źródła z przypisami w kontekście, zgoda na „nie wiem”, narzędzia do faktów i rachunków, sprawdzanie cytatów kodem. Niższa temperatura tylko powtarza ten sam strzał. Mierz osobno błędy, wstrzymania i wierność źródłom, a próg odpowiadania ustawiaj pod koszt pomyłki.

    In English

    The model always produces a plausible continuation and has no built-in “I don’t know”, so on rare facts it guesses in the same confident tone. Training and benchmarks graded 0/1 reward a hit and give zero for abstaining, so guessing pays. It can’t be switched off, only reduced: sourced context with citations, permission to say “I don’t know”, tools for facts and arithmetic, and checking citations in code. Lower temperature just repeats the same guess. Measure errors, abstentions and faithfulness to sources separately, and set the answer threshold according to the cost of a mistake.

    Pytania pogłębiające (4)
    Czy da się wykryć halucynację po logprobs?
    Częściowo. Niska pewność bywa sygnałem, ale model potrafi być pewny błędu, pewność rozkłada się na różne sformułowania tej samej odpowiedzi, a post-training psuje kalibrację. Lepszy sygnał daje kilka próbek i sprawdzenie, czy znaczą to samo.
    Czemu system z RAG nadal zmyśla?
    Wyszukiwarka zawsze coś zwraca. Jeśli fragment nie zawiera odpowiedzi, model często uzupełnia lukę z wag i dokleja przypis do najbliższego źródła. Do tego potrafi przekręcić fragment, który ma przed sobą.
    Agent melduje „testy przechodzą”, a nie przechodzą. Co robisz?
    Nie ufasz meldunkom, tylko sprawdzasz stan. Testy uruchamia kod i odsyła wynik modelowi, a warunek końca zadania sprawdza narzędzie, nie deklaracja modelu. W ewaluacji oceniasz stan końcowy, a przebiegi z fałszywym meldunkiem dopisujesz do zestawu jako nowe przypadki.
    Jak zmierzyć halucynacje we własnym systemie?
    Zestaw pytań ze sprawdzoną odpowiedzią plus pytania, na które w źródłach odpowiedzi nie ma. Liczysz osobno poprawne, błędne i wstrzymane, a dla RAG także wierność: czy każde twierdzenie ma pokrycie w podanym fragmencie.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę