Strona główna / Rozdział 8 · Wybór modelu
    Ostatnia zmiana · 6 min czytania

    Użyj z AI

    Kiedy nie używać LLM-a: klasyfikatory i System One

    Gdy system potrzebuje decyzji, a nie tekstu (etykiety, oceny, tak albo nie), LLM i tak pisze ją token po tokenie, a jego prawdopodobieństwa często są niedostępne albo źle skalibrowane. Model niegeneratywny bywa szybszy, tańszy i lepiej skalibrowany; LLM wygrywa, gdy przestrzeń odpowiedzi jest otwarta albo zadanie wymaga rozumowania. System One od TypeSafe służy tu za przykład nowego typu modelu.

    Po ludzkuRóżnica między napisaniem uzasadnienia na pół strony a zaznaczeniem kratek w ankiecie. Do ankiety nie trzeba pisarza, ale ankieta ma tylko te kratki, które ktoś wcześniej przewidział.

    Uruchom oba tory: LLM pisze JSON z trzema polami token po tokenie, Jev (model System One od TypeSafe) dostaje te same trzy pytania w jednym wywołaniu

    Stan: zgłoszenie „Pobraliście mi opłatę dwa razy, chcę zwrotu!”. Pytania: który zespół, czy to prośba o zwrot, jak bardzo klient jest zirytowany.

    LLM

    pisze JSON, jeden przebieg modelu na token

    Przebiegów: 0

    Jev

    stan i trzy pytania w jednym wywołaniu

    Wywołań: 0

    Animacja poglądowa, nie benchmark. Krok LLM-a to jeden przebieg decode po przetworzeniu promptu. Model z rozumowaniem przed JSON-em pisze jeszcze setki tokenów. Po stronie Jev widać jedno wywołanie API; ile pracy model wykonuje w środku, producent nie opisuje.

    Klasyfikator czy LLM: czym podjąć decyzję

    Przykład: System One (twierdzenia producenta)

    Przesuń próg: decyzje powyżej wykonuje automat, poniżej idą do LLM-a lub człowieka. Patrz, ile pomyłek automat przepuści

    automateskalacja
    decyzji wykonanych automatycznie
    eskalowanych do LLM-a lub człowieka
    oczekiwanych pomyłek wśród automatycznych, jeśli prawdopodobieństwa są skalibrowane

    Kropki to prawdopodobieństwo wybranej odpowiedzi dla 12 poglądowych zgłoszeń. Przy dobrej kalibracji decyzje z prawdopodobieństwem 0,9 są błędne średnio w 10% przypadków. Nie mówi to, czy akurat ta decyzja jest trafna.

    Jak wpiąć model decyzyjny w system

    Sprawdź się

    Kiedy klasyfikator albo model decyzyjny, taki jak System One, wygrywa z LLM-em, a kiedy nie?

    Model niegeneratywny wygrywa, gdy odpowiedzią jest etykieta, ocena albo tak/nie z zamkniętej listy, a liczą się wolumen, opóźnienie albo skalibrowane prawdopodobieństwa. Dostrojony enkoder odpowiada w milisekundach, ale wymaga oznaczonych danych dla każdego zadania; enkodery zero-shot oparte na NLI ich nie potrzebują. LLM obywa się bez danych, ale pisze decyzję token po tokenie, a jego logprobs często są niedostępne albo po post-trainingu źle skalibrowane. Modele decyzyjne, takie jak Jev od TypeSafe, obiecują typowane odpowiedzi ze skalibrowanymi prawdopodobieństwami w jednym wywołaniu, co trzeba zmierzyć na własnych danych. LLM wygrywa przy tekście, rozumowaniu, narzędziach i otwartej przestrzeni odpowiedzi. Wzorzec: szybki model rozstrzyga przypadki o wysokiej pewności, a resztę eskaluje do LLM-a albo człowieka.

    In English

    A non-generative model wins when the answer is a label, a score or yes/no from a closed list, and volume, latency or calibrated probabilities matter. A fine-tuned encoder answers in milliseconds but needs labelled data for each task; zero-shot NLI encoders need none. An LLM needs no data but writes the decision token by token, and its logprobs are often unavailable or poorly calibrated after post-training. Decision models such as TypeSafe’s Jev claim typed answers with calibrated probabilities in one call, which has to be measured on your own data. An LLM wins for text, reasoning, tools and open answer spaces. The pattern: the fast model settles confident cases and escalates the rest to an LLM or a human.

    Pytania pogłębiające (4)
    Kiedy LLM nadal jest lepszy?
    Gdy potrzebny jest tekst, kod, wyjaśnienie decyzji, wieloetapowe rozumowanie, arytmetyka albo wywoływanie narzędzi. Także gdy przestrzeni odpowiedzi nie da się z góry zamknąć w liście opcji albo wolumen jest za mały, żeby opłacało się zbierać oznaczone dane.
    Jak sprawdzić kalibrację?
    Na własnych danych z etykietami: dzielisz decyzje na przedziały deklarowanego prawdopodobieństwa i w każdym porównujesz średnie prawdopodobieństwo z faktyczną trafnością. Średnią ważoną różnicę raportujesz jako ECE. Osobno dla każdego typu pytania i języka.
    Czym model decyzyjny różni się od klasyfikatora na LLM-ie z logprobs?
    Klasyfikator z jednym tokenem etykiety to jeden krok decode po prefillu, więc też jest szybki. Każde pytanie to jednak osobne żądanie albo dłuższe wyjście, logprobs często nie ma (Claude API nigdy, aktualne modele OpenAI tylko z wyłączonym rozumowaniem), a post-training nie optymalizuje ich pod kalibrację i zwykle psuje to, co dał pretraining. Rozstrzyga pomiar trafności, kalibracji, opóźnienia i kosztu na tym samym zbiorze.
    Jak ustawisz próg eskalacji?
    Z kosztów: automat działa, gdy (1 − p) × koszt pomyłki jest mniejszy niż koszt eskalacji. Potem sprawdzasz na danych, czy przy tym progu rzeczywisty odsetek błędów zgadza się z oczekiwanym, i powtarzasz to po każdej zmianie wersji modelu.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę