Strona główna / Rozdział 6 · Jakość i bezpieczeństwo
    Ostatnia zmiana · 7 min czytania

    Użyj z AI

    Ewaluacje

    Wynik LLM-a jest losowy i czuły na drobne zmiany promptu, więc „sprawdziłem na trzech przykładach” nic nie znaczy. Ewaluacja to stały zestaw przypadków z automatyczną oceną, puszczany po każdej zmianie promptu, modelu i narzędzi, plus pomiar jakości na ruchu produkcyjnym.

    Po ludzkuTesty w CI dla kodu, który za każdym razem odpowiada trochę inaczej. Zamiast „przeszedł albo nie” liczysz, ile razy na pięć przeszedł, a części asercji nie da się zapisać jako porównania napisów, więc sprawdza je drugi model, którego najpierw sam sprawdzasz.

    Poprawiony prompt v2 podnosi wynik z 5 do 7 na 8. Sprawdź w tabeli, co ta liczba ukrywa, potem włącz pięć powtórzeń każdego przypadku i zobacz, która zmiana była szumem

    zaliczonych, prompt v1
    zaliczonych, prompt v2
    przypadków zepsutych przez v2

    Dane poglądowe: klasyfikator zgłoszeń do działu obsługi, osiem przypadków. Czerwone wiersze to przypadki, które v2 psuje, wyszarzone to te bez istotnej zmiany.

    Zestaw testowy i metody oceny

    Szum i powtórzenia

    Ewaluacje offline, bramka w CI i pomiar na produkcji

    Sprawdź się

    Jak sprawdzasz, czy system z LLM-em działa i czy zmiana go nie zepsuła?

    Zbuduj stały zestaw przypadków z prawdziwych błędów: czytaj trace’y, nazwij typy pomyłek i każdy zamień w test. Oceniaj najtańszą wystarczającą metodą: dopasowanie, test w kodzie, sędzia-LLM sprawdzony na ocenach eksperta, człowiek. Każdy przypadek puszczaj kilka razy, bo wynik jest losowy, a wersje porównuj w parach. Zestaw regresji jest w CI bramką dla każdej zmiany promptu, modelu i narzędzi. Na produkcji oceniaj próbkę ruchu sędzią bez wzorca i patrz na sygnały użytkowników, a nieudane przypadki wracają do zestawu.

    In English

    Build a fixed set of cases from real failures: read traces, name the error types and turn each into a test. Grade with the cheapest method that suffices: exact match, code checks, an LLM judge validated against expert labels, humans. Run every case several times because outputs are random, and compare versions pairwise. The regression set gates every prompt, model and tool change in CI. In production, grade a sample of traffic with a reference-free judge and watch user signals, and feed failures back into the set.

    Pytania pogłębiające (5)
    Jak zacząć, gdy nie masz jeszcze zestawu testowego?
    Od analizy błędów na 50–100 prawdziwych przykładach: czytasz odpowiedzi, nazywasz typy pomyłek i z nich robisz przypadki testowe. Na start wystarczy 20–50 przypadków, byle z prawdziwych porażek.
    Kiedy ufać modelowi jako sędziemu?
    Gdy jego oceny zgadzają się z oceną eksperta na próbce kontrolnej, liczone osobno dla dobrych i złych odpowiedzi. Sędzia, który wszystko przepuszcza, też ma wysoką trafność, gdy dobrych odpowiedzi jest większość. Daj mu jedno kryterium i ocenę tak/nie, a w porównaniu dwóch odpowiedzi zamieniaj ich kolejność.
    Jak ustawić bramkę w CI, żeby nie blokowała przez szum?
    W bramce trzymasz stabilne przypadki regresji z wynikiem bliskim 100% i puszczasz każdy kilka razy. Blokujesz, gdy przypadek krytyczny wyraźnie spada albo średnia spada o więcej niż margines szumu. Niestabilne przypadki, które bez żadnej zmiany raz przechodzą, a raz nie, przenosisz do kwarantanny i badasz, zamiast luzować próg.
    Jak ewaluować agenta?
    Testem stanu końcowego, a nie podsumowaniem agenta, każde zadanie kilka razy, z pass^k jako miarą niezawodności. Do tego koszt, liczba tur i czas na zadanie. Trace’y pokazują, gdzie agent błądzi. Ścieżki nie oceniasz sztywno, bo do celu prowadzi kilka dróg, ale sprawdzasz w niej zakazane wywołania i naruszenia zasad.
    Chcesz przejść na tańszy model. Jak podjąć decyzję?
    Ten sam zestaw na obu modelach, w parach i z powtórzeniami, z osobnym wynikiem dla każdego typu przypadku, plus koszt i opóźnienie. Potem canary albo shadow na części ruchu i porównanie sygnałów z produkcji. Prompt często trzeba dostroić pod nowy model, więc porównujesz modele, każdy z najlepszym dla niego promptem.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę