Strona główna / Rozdział 2 · Skąd model wie to, co wie
    Ostatnia zmiana · 9 min czytania

    Użyj z AI

    Destylacja

    Destylacja trenuje mały model, ucznia, na wyjściach dużego, nauczyciela. Dzięki niej małe modele są lepsze, niż wynikałoby z ich rozmiaru, rozumowanie trafiło do modeli 7B, a ty możesz zastąpić drogi model tańszym w jednym zadaniu.

    Po ludzkuUczeń szachowy, który widzi tylko ruchy arcymistrza, uczy się wolniej niż taki, któremu arcymistrz mówi też, które inne ruchy były prawie równie dobre, a które przegrywają od razu. Destylacja on-policy to arcymistrz, który ogląda partie ucznia i ocenia każdy jego ruch, zamiast pokazywać własne. Uczeń rzadko przerasta mistrza, za to przejmuje jego błędy.

    Przełącz cel, na którym uczy się uczeń, i zmieniaj temperaturę. Porównaj, ile mówi jedna etykieta, a ile rozkład nauczyciela

    entropia celu w bitach: 0 to jedna odpowiedź, 3 to osiem równych
    tokeny o prawdopodobieństwie co najmniej 5% w celu

    Prawdziwe dane: osiem najbardziej prawdopodobnych następnych tokenów z Qwen3-0.6B-Base, przeskalowanych do 100%. Ten mały model gra tu nauczyciela; prawdziwy nauczyciel jest większy, a jego rozkład obejmuje cały słownik. Etykieta twarda to token, który nauczyciel napisałby przy temperaturze 0. Próg 5% przyjęto na potrzeby tego widżetu.

    Etykiety twarde i rozkłady

    Destylacja on-policy

    W pretrainingu małych modeli

    Destylacja rozumowania

    Ograniczenia destylacji

    Regulaminy i ochrona przed destylacją

    Destylacja w twoim systemie

    Sprawdź się

    Jak destylacja przenosi umiejętności dużego modelu do małego i czym różnią się etykiety twarde, rozkłady nauczyciela i destylacja on-policy?

    Uczeń, mały model, uczy się naśladować nauczyciela, duży model. Najczęściej na etykietach twardych: nauczyciel generuje odpowiedzi, a uczeń przechodzi na nich zwykłe SFT, więc wystarczy tekst z API. Destylacja logitów minimalizuje dywergencję KL między pełnymi rozkładami następnego tokena nauczyciela i ucznia, zwykle przy podniesionej temperaturze. Jeden przykład niesie wtedy więcej informacji, bo pokazuje też, które alternatywy są bliskie, ale potrzebne są logity nauczyciela i wspólny tokenizer. W destylacji on-policy uczeń generuje sam, a nauczyciel ocenia każdy jego token odwrotną KL, więc uczeń uczy się też na własnych błędach; w Qwen3 dało to lepszy wynik niż RL przy ok. 1/10 godzin GPU. Uczeń rzadko przerasta nauczyciela, kopiuje jego błędy i łatwiej przejmuje styl niż umiejętności, więc sprawdzaj go na własnym zestawie ewaluacyjnym. Regulaminy OpenAI, Anthropic i Google zabraniają używania wyników do trenowania modeli konkurencyjnych.

    In English

    The student, a small model, learns to imitate the teacher, a large one. Most often with hard labels: the teacher generates answers and the student is trained on them with ordinary SFT, so text from an API is enough. Logit distillation minimises the KL divergence between the teacher’s and the student’s full next-token distributions, usually at a raised temperature. Each example then carries more information, because it also shows which alternatives are close, but the method needs the teacher’s logits and a shared tokeniser. In on-policy distillation the student generates and the teacher grades each of its tokens with reverse KL, so the student also learns from its own mistakes; in Qwen3 this beat RL at about a tenth of the GPU hours. The student rarely surpasses the teacher, copies its errors and picks up style more easily than skill, so test it on your own eval set. The terms of OpenAI, Anthropic and Google forbid using outputs to train competing models.

    Pytania pogłębiające (5)
    Skoro rozkłady niosą więcej informacji, czemu najczęściej destyluje się na etykietach twardych?
    Bo etykietom twardym wystarczy tekst. Rozkład wymaga logitów nauczyciela, czyli otwartych wag, a API zwraca co najwyżej krótką listę logprobs albo nic. Oba modele muszą mieć wspólny tokenizer, a pełny rozkład to 100–260 tys. liczb na pozycję, więc zapisuje się próbkę tokenów, jak 256 w Gemmie 3. Gdy nauczyciel jest dostępny tylko przez API, zostaje SFT na jego odpowiedziach.
    Czemu destylacja on-policy wygrywa z SFT na odpowiedziach tego samego nauczyciela?
    SFT uczy w sytuacjach, do których dochodzi nauczyciel. Uczeń przy generowaniu popełnia własne błędy, trafia na sytuacje, których nie widział, i błędy się kumulują. On-policy uczy na tekstach samego ucznia, a nauczyciel ocenia każdy token, więc sygnał jest gęsty jak w SFT i pochodzi z rozkładu ucznia jak w RL. Kosztem jest dostęp do logprobs nauczyciela i jego przebieg na każdej próbce ucznia.
    Uczeń dorównuje nauczycielowi na zestawie ewaluacyjnym, a na produkcji myli się na lekko innych wejściach. Co się stało?
    Dane destylacji pokrywały rozkład zestawu ewaluacyjnego, a nie ruch produkcyjny; do tego uczeń przejął styl nauczyciela łatwiej niż umiejętność. Pomaga poszerzenie wejść o prawdziwe przypadki z produkcji, w tym trudne i nietypowe, świeży zestaw ewaluacyjny z produkcji i kierowanie do nauczyciela przypadków, w których walidator odrzuca wynik ucznia.
    Czy wolno destylować model dostępny tylko przez API do własnego modelu?
    Technicznie wystarczą etykiety twarde. Regulaminy (stan na wrzesień 2026) zabraniają używania wyników do trenowania modeli konkurencyjnych. OpenAI robi wyjątek dla niedystrybuowanych klasyfikatorów i embeddingów oraz dla dotrenowania modeli OpenAI, a Anthropic dopuszcza to tylko za swoją wyraźną zgodą. Czy wąski model do własnego użytku „konkuruje”, regulaminy nie precyzują, więc to pytanie do prawnika. Otwarty nauczyciel z licencją, która pozwala na destylację, jak MIT w DeepSeek-R1, omija problem.
    Czy większy nauczyciel zawsze daje lepszego ucznia?
    Nie. W ablacji Gemmy 3 mniejszy nauczyciel wygrywał przy krótkim treningu, a większy dopiero przy długim. Modele do 3B nie zawsze zyskują na długich śladach rozumowania silnych nauczycieli, a pomaga im mieszanka krótkich i długich śladów (Li i in., 2025). Nauczyciela wybiera się po wyniku ucznia na ewaluacji, a nie po wyniku samego nauczyciela.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę