Strona główna / Rozdział 1 · Jak model czyta i przewiduje
    Ostatnia zmiana · 5 min czytania

    Użyj z AI

    Następny token

    Model nie zwraca tekstu, tylko wynik (logit) dla każdego tokena ze słownika. Osobny kod, sampler, zamienia wyniki w prawdopodobieństwa i losuje jeden token. Tak powstaje każdy token odpowiedzi, jeden po drugim.

    Po ludzkuKlawiatura w telefonie podpowiada trzy słowa. Model robi to samo dla stu tysięcy kawałków słów naraz, a potem rzuca kostką obciążoną tymi szansami. Temperatura decyduje, jak mocno obciążona jest kostka.

    Zmieniaj temperaturę i top-p, a potem losuj. Porównaj pytanie, na które model zna odpowiedź, takie, na które odpowiada pewnie i błędnie, i takie, przy którym zgaduje

    Prawdziwe prawdopodobieństwa następnego tokena z Qwen3-0.6B-Base, małego otwartego modelu bez treningu czatowego: jego osiem najbardziej prawdopodobnych tokenów, przeskalowanych do 100%. Przekreślone słupki odciął top-p.

    Od logitów do tokena

    Pułapki

    Co ustawiasz w praktyce

    Sprawdź się

    Jak model wybiera następny token i jak dobierasz temperaturę i top-p?

    Model zwraca logity dla całego słownika. Softmax z temperaturą, exp(logit/T), zamienia je w rozkład: T poniżej 1 wyostrza, powyżej 1 spłaszcza, a T = 0 to zawsze najlepszy token. Top-p zostawia najmniejszy zbiór tokenów pokrywający np. 90% prawdopodobieństwa i odcina ogon, z którego biorą się dziwne tokeny. W modelach bez rozumowania ekstrakcja i kod dostają niską temperaturę, teksty twórcze wyższą; zmieniaj jeden parametr naraz i sprawdzaj na ewaluacjach. T = 0 nie daje pełnej powtarzalności, a modele rozumujące często blokują sampler albo, jak Gemini 3, działają najlepiej przy domyślnym 1,0.

    In English

    The model returns logits for the whole vocabulary. A temperature softmax, exp(logit/T), turns them into a distribution: T below 1 sharpens it, above 1 flattens it, and T = 0 always picks the top token. Top-p keeps the smallest set of tokens covering, say, 90% of the probability and cuts the tail where odd tokens come from. On non-reasoning models, use a low temperature for extraction and code and a higher one for creative text, change one parameter at a time and check the effect on evals. T = 0 is not fully reproducible, and reasoning models often lock the sampler or, like Gemini 3, work best at the default 1.0.

    Pytania pogłębiające (4)
    Czemu temperatura 0 nie daje pełnej powtarzalności?
    Wynik zależy od tego, z kim request trafił do batcha: inny rozmiar batcha to inna kolejność działań zmiennoprzecinkowych i minimalnie inne logity. Przy dwóch tokenach o prawie równych logitach to wystarczy, żeby wybrać inny, a dalej rozjeżdża się cała odpowiedź.
    Top-k, top-p, min-p: jaka różnica?
    Top-k zostawia stałą liczbę kandydatów bez względu na pewność modelu. Top-p zostawia tylu, żeby pokryć zadany procent prawdopodobieństwa, więc dopasowuje się do rozkładu. Min-p odcina tokeny słabsze niż ułamek najlepszego, np. 0,1 × jego prawdopodobieństwo. Autorzy min-p piszą, że lepiej znosi wysoką temperaturę, ale ponowna analiza z 2025 r. uznała, że ich dowody tego nie potwierdzają.
    Czy niższa temperatura zmniejsza halucynacje?
    Tylko te, które biorą się z wylosowania tokena z ogona. Jeśli model „wierzy” w błędny fakt, T = 0 wybierze go za każdym razem (zobacz „Halucynacje”).
    Jak użyć logprobs do klasyfikacji?
    Każ modelowi odpowiedzieć jednym tokenem etykiety i odczytaj prawdopodobieństwo każdej etykiety. Dostajesz rozkład zamiast jednej odpowiedzi i ustawiasz próg, poniżej którego sprawa idzie do człowieka. Próg kalibruj na własnych danych, bo po post-trainingu pewność modelu bywa zawyżona.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę