Strona główna / Rozdział 8 · Wybór modelu
Ostatnia zmiana · 6 min czytania
Kiedy nie używać LLM-a: klasyfikatory i System One
Gdy system potrzebuje decyzji, a nie tekstu (etykiety, oceny, tak albo nie), LLM i tak pisze ją token po tokenie, a jego prawdopodobieństwa często są niedostępne albo źle skalibrowane. Model niegeneratywny bywa szybszy, tańszy i lepiej skalibrowany; LLM wygrywa, gdy przestrzeń odpowiedzi jest otwarta albo zadanie wymaga rozumowania. System One od TypeSafe służy tu za przykład nowego typu modelu.
Po ludzkuRóżnica między napisaniem uzasadnienia na pół strony a zaznaczeniem kratek w ankiecie. Do ankiety nie trzeba pisarza, ale ankieta ma tylko te kratki, które ktoś wcześniej przewidział.
Uruchom oba tory: LLM pisze JSON z trzema polami token po tokenie, Jev (model System One od TypeSafe) dostaje te same trzy pytania w jednym wywołaniu
Stan: zgłoszenie „Pobraliście mi opłatę dwa razy, chcę zwrotu!”. Pytania: który zespół, czy to prośba o zwrot, jak bardzo klient jest zirytowany.
LLM
pisze JSON, jeden przebieg modelu na token
Przebiegów: 0
Jev
stan i trzy pytania w jednym wywołaniu
Wywołań: 0
Animacja poglądowa, nie benchmark. Krok LLM-a to jeden przebieg decode po przetworzeniu promptu. Model z rozumowaniem przed JSON-em pisze jeszcze setki tokenów. Po stronie Jev widać jedno wywołanie API; ile pracy model wykonuje w środku, producent nie opisuje.
Klasyfikator czy LLM: czym podjąć decyzję
- Dostrojony enkoder (model typu BERT) albo embeddingi z regresją logistyczną: jeden przebieg, milisekundy, ułamek centa, działa obok usługi, a prawdopodobieństwa da się skalibrować na zbiorze walidacyjnym. Ceną są oznaczone dane dla każdego zadania i ponowny trening przy każdej nowej klasie.
- Zero-shot, bez danych treningowych: model NLI ocenia, czy etykieta zapisana w języku naturalnym wynika z tekstu (Yin i in., 2019), a cross-encoder ocenia pary tekst–etykieta. Tani punkt odniesienia dla wszystkiego innego.
- LLM jako klasyfikator: prompt z listą etykiet i odpowiedź jednym tokenem odczytana z logprobs. To jeden krok decode po prefillu, więc też szybko, ale każde pytanie to osobne żądanie albo dłuższe wyjście. Logprobs często nie ma (Claude API nigdy, aktualne modele OpenAI tylko przy poziomie rozumowania none, stan na wrzesień 2026), a post-training psuje kalibrację: w raporcie o GPT-4 model bazowy był dobrze skalibrowany, a po post-trainingu wyraźnie gorzej. Kalibrację trzeba zmierzyć i poprawić, np. przez temperature scaling.
- LLM wygrywa, gdy potrzebny jest tekst, kod, uzasadnienie, wieloetapowe rozumowanie, arytmetyka albo narzędzia, gdy odpowiedzi nie da się z góry zamknąć w liście i przy małym wolumenie, kiedy prompt jest tańszy niż zbiór z etykietami. Ścisły structured output też pozwala LLM-owi zwracać typowane odpowiedzi (zobacz „Wymuszanie formatu”), więc realne różnice to koszt, opóźnienie i jakość prawdopodobieństw. Który LLM wybrać, opisuje temat „Wybór modelu”.
Przykład: System One (twierdzenia producenta)
- Według dokumentacji TypeSafe (wrzesień 2026, wersja jev-1.13) model Jev przyjmuje tekstowy „stan” (string, obiekt JSON albo listę tekstów) i typowane pytania: Choice (wybór z listy), Score (poziom na opisanej skali) i Noul (prawdopodobieństwo odpowiedzi „tak”). Choice i Score zwracają rozkład i pole
confidence. Tekstu nie generuje. Producent pozycjonuje go jako model, który w odróżnieniu od dostrojonego enkodera nie wymaga trenowania pod zadanie. - Wszystkie pytania z jednego żądania są oceniane równolegle i niezależnie względem tego samego stanu. Producent pisze, że dodawanie pytań prawie nie wydłuża czasu odpowiedzi, ale żadnych czasów nie publikuje. Cennik: 0,042 USD za milion tokenów wejściowych, wyjście darmowe. Limit: do 64 tys. tokenów na żądanie, z czego stan plus najdłuższe pytanie najwyżej 32 tys. Głównym językiem jest angielski.
- Model trenowano pod kalibrację metodą, którą producent nazywa RLCD (reinforcement learning for calibrated decisions). Sam producent zastrzega, że kalibracja dotyczy grup decyzji, nie pojedynczej odpowiedzi. Dokumentacja nie opisuje architektury ani nie podaje niezależnych porównań, więc cała ta sekcja to twierdzenia do sprawdzenia na własnych danych.
- Ograniczenia, które producent opisuje dla jev-1.13: nie liczy wiarygodnie, słabo porównuje daty i liczby, czyta pytania dosłownie, gubi się przy pytaniach pośrednich i w dużym stanie pełnym nieistotnych danych, a treść stanu może nim sterować jak prompt injection. Odpowiedzi na pytanie i jego zaprzeczenie nie muszą sumować się do 1.
Przesuń próg: decyzje powyżej wykonuje automat, poniżej idą do LLM-a lub człowieka. Patrz, ile pomyłek automat przepuści
Kropki to prawdopodobieństwo wybranej odpowiedzi dla 12 poglądowych zgłoszeń. Przy dobrej kalibracji decyzje z prawdopodobieństwem 0,9 są błędne średnio w 10% przypadków. Nie mówi to, czy akurat ta decyzja jest trafna.
Jak wpiąć model decyzyjny w system
- Wzorzec: szybki model decyzyjny rozstrzyga proste przypadki, a przy niskiej pewności sprawa idzie do LLM-a z rozumowaniem albo do człowieka (zobacz „LLM na produkcji”). Automat opłaca się, gdy (1 − p) × koszt pomyłki < koszt eskalacji. Przy pomyłce za 100 zł i eskalacji za 5 zł próg wynosi p > 0,95.
- Kalibrację sprawdzasz sam, niezależnie od modelu: grupujesz decyzje według deklarowanego prawdopodobieństwa i porównujesz z trafnością w każdej grupie (wykres kalibracji, błąd ECE). Osobno dla każdego typu pytania i języka, bo kalibracja na angielskim nie gwarantuje kalibracji na polskim.
- Arytmetyka, daty i twarde reguły zostają w kodzie. Po strojeniu progów przypinasz wersję modelu (dla Jev
jev-1.13.0, nie aliasjev-latest): alias przesuwa się przy każdym wydaniu, a razem z nim rozkład prawdopodobieństw.
Sprawdź się
Kiedy klasyfikator albo model decyzyjny, taki jak System One, wygrywa z LLM-em, a kiedy nie?
Model niegeneratywny wygrywa, gdy odpowiedzią jest etykieta, ocena albo tak/nie z zamkniętej listy, a liczą się wolumen, opóźnienie albo skalibrowane prawdopodobieństwa. Dostrojony enkoder odpowiada w milisekundach, ale wymaga oznaczonych danych dla każdego zadania; enkodery zero-shot oparte na NLI ich nie potrzebują. LLM obywa się bez danych, ale pisze decyzję token po tokenie, a jego logprobs często są niedostępne albo po post-trainingu źle skalibrowane. Modele decyzyjne, takie jak Jev od TypeSafe, obiecują typowane odpowiedzi ze skalibrowanymi prawdopodobieństwami w jednym wywołaniu, co trzeba zmierzyć na własnych danych. LLM wygrywa przy tekście, rozumowaniu, narzędziach i otwartej przestrzeni odpowiedzi. Wzorzec: szybki model rozstrzyga przypadki o wysokiej pewności, a resztę eskaluje do LLM-a albo człowieka.
In English
A non-generative model wins when the answer is a label, a score or yes/no from a closed list, and volume, latency or calibrated probabilities matter. A fine-tuned encoder answers in milliseconds but needs labelled data for each task; zero-shot NLI encoders need none. An LLM needs no data but writes the decision token by token, and its logprobs are often unavailable or poorly calibrated after post-training. Decision models such as TypeSafe’s Jev claim typed answers with calibrated probabilities in one call, which has to be measured on your own data. An LLM wins for text, reasoning, tools and open answer spaces. The pattern: the fast model settles confident cases and escalates the rest to an LLM or a human.
Pytania pogłębiające (4)
- Kiedy LLM nadal jest lepszy?
- Gdy potrzebny jest tekst, kod, wyjaśnienie decyzji, wieloetapowe rozumowanie, arytmetyka albo wywoływanie narzędzi. Także gdy przestrzeni odpowiedzi nie da się z góry zamknąć w liście opcji albo wolumen jest za mały, żeby opłacało się zbierać oznaczone dane.
- Jak sprawdzić kalibrację?
- Na własnych danych z etykietami: dzielisz decyzje na przedziały deklarowanego prawdopodobieństwa i w każdym porównujesz średnie prawdopodobieństwo z faktyczną trafnością. Średnią ważoną różnicę raportujesz jako ECE. Osobno dla każdego typu pytania i języka.
- Czym model decyzyjny różni się od klasyfikatora na LLM-ie z logprobs?
- Klasyfikator z jednym tokenem etykiety to jeden krok decode po prefillu, więc też jest szybki. Każde pytanie to jednak osobne żądanie albo dłuższe wyjście, logprobs często nie ma (Claude API nigdy, aktualne modele OpenAI tylko z wyłączonym rozumowaniem), a post-training nie optymalizuje ich pod kalibrację i zwykle psuje to, co dał pretraining. Rozstrzyga pomiar trafności, kalibracji, opóźnienia i kosztu na tym samym zbiorze.
- Jak ustawisz próg eskalacji?
- Z kosztów: automat działa, gdy (1 − p) × koszt pomyłki jest mniejszy niż koszt eskalacji. Potem sprawdzasz na danych, czy przy tym progu rzeczywisty odsetek błędów zgadza się z oczekiwanym, i powtarzasz to po każdej zmianie wersji modelu.