## Destylacja

*Skąd model wie to, co wie*

*Ostatnia zmiana: 29 września 2026*

Destylacja trenuje mały model, ucznia, na wyjściach dużego, nauczyciela. Dzięki niej małe modele są lepsze, niż wynikałoby z ich rozmiaru, rozumowanie trafiło do modeli 7B, a ty możesz zastąpić drogi model tańszym w jednym zadaniu.

**Po ludzku:** Uczeń szachowy, który widzi tylko ruchy arcymistrza, uczy się wolniej niż taki, któremu arcymistrz mówi też, które inne ruchy były prawie równie dobre, a które przegrywają od razu. Destylacja on-policy to arcymistrz, który ogląda partie ucznia i ocenia każdy jego ruch, zamiast pokazywać własne. Uczeń rzadko przerasta mistrza, za to przejmuje jego błędy.

*Interaktywny widżet na stronie: Przełącz cel, na którym uczy się uczeń, i zmieniaj temperaturę. Porównaj, ile mówi jedna etykieta, a ile rozkład nauczyciela.*

### Etykiety twarde i rozkłady

- Etykiety twarde (destylacja sekwencji): nauczyciel generuje odpowiedzi na twoje prompty, a uczeń przechodzi na nich zwykłe SFT (zobacz „Trening”). Wystarczy tekst, więc działa przez API i przy różnych tokenizerach. To najczęstsza forma destylacji.
- Rozkłady (miękkie etykiety, destylacja logitów): uczeń na każdej pozycji minimalizuje dywergencję KL między pełnym rozkładem następnego tokena nauczyciela a swoim. Hinton i in. (2015) podnoszą w obu modelach temperaturę softmaksu (zobacz „Następny token”), żeby wyciągnąć małe prawdopodobieństwa, a tę część straty mnożą przez T², bo jej gradienty maleją jak 1/T². To, która błędna odpowiedź jest prawie dobra, siedzi w stosunkach bardzo małych prawdopodobieństw; Hinton nazywał to „dark knowledge”.
- Rozkład niesie więcej informacji w każdym przykładzie: zamiast jednego indeksu ranking alternatyw, a gradient mniej się waha między przykładami. W eksperymencie z rozpoznawaniem mowy z tej pracy, na 3% danych, etykiety twarde przeuczały model przy 44,5% trafności, a rozkłady nauczyciela doprowadziły do 57,0%, przy 58,9% dla treningu na wszystkich danych.
- Cena: potrzebujesz logitów nauczyciela, czyli otwartych wag albo własnego modelu. API zwraca co najwyżej krótką listę logprobs, API Claude żadnej, podobnie jak OpenAI przy włączonym rozumowaniu. Oba modele muszą mieć wspólny tokenizer, bo rozkład przypisuje prawdopodobieństwa numerom tokenów. Pełny rozkład to 100–260 tys. liczb na pozycję, więc Gemma 3 zapisuje 256 tokenów losowanych według prawdopodobieństw nauczyciela, a resztę zeruje i renormalizuje rozkład.

### Destylacja on-policy

- Obie powyższe metody uczą na tekstach, których uczeń sam nie napisał: odpowiedziach nauczyciela albo gotowym zbiorze. Przy generowaniu uczeń popełnia błędy, których nauczyciel nie robi, trafia na sytuacje, których w treningu nie widział, i błędy się kumulują.
- W destylacji on-policy uczeń sam generuje odpowiedź, a nauczyciel w jednym przebiegu liczy prawdopodobieństwo każdego jej tokena. Strata to odwrotna KL na każdym tokenie: im mniej prawdopodobny token dla nauczyciela, tym większa kara. To jak RL, tylko z oceną każdego tokena zamiast jednej nagrody za całość. Odwrotna KL skłania ucznia do trzymania się jednego ze sposobów nauczyciela zamiast rozmywania się między kilkoma.
- W Qwen3 (2025) tak trenowano modele od 0,6B do 14B i 30B-A3B z nauczycielem Qwen3-32B albo 235B-A22B: najpierw SFT na odpowiedziach nauczyciela, potem etap on-policy. Na Qwen3-8B ten etap dał 74,4% w AIME 2024 kosztem 1800 godzin GPU, a RL z tego samego punktu 67,6% kosztem 17 920 godzin. Thinking Machines rozpisali metodę we wpisie „On-Policy Distillation” (październik 2025).

### W pretrainingu małych modeli

- W Gemmie 2 (2024) modele 2B i 9B trenowano na rozkładach większego nauczyciela, na ponad 50 razy więcej tokenów, niż wynika z optimum obliczeniowego. W ablacji model 2B po 500 mld tokenów miał średnio 67,7 pkt z destylacją z modelu 7B i 60,3 bez niej. W Gemmie 3 (2025) destylowane są wszystkie rozmiary.
- Llama 3.2 1B i 3B (wrzesień 2024) powstały przez przycięcie Llamy 3.1 8B, a w pretrainingu logity modeli 8B i 70B były celami dla każdego tokena.
- Zwykły cel w pretrainingu to jeden token, który akurat stał w dokumencie; rozkład nauczyciela mówi, co mogło tam stać, więc każdy token uczy więcej. To jeden z powodów, dla których modele 1–4B wypadają lepiej, niż sugeruje ich rozmiar.

### Destylacja rozumowania

- DeepSeek-R1 (styczeń 2025): ok. 800 tys. przykładów, w tym ok. 600 tys. śladów rozumowania, z których zostawiono tylko te z poprawnym wynikiem. Samo SFT na nich, bez RL, dało modele od Qwen2.5 1,5B do Llamy 3.3 70B. Qwen2.5-32B po destylacji miał 72,6% w AIME 2024, a ta sama baza po ponad 10 tys. krokach dużego RL 47,0%.
- Wystarcza też mały, starannie dobrany zbiór. s1 (2025): 1000 pytań ze śladami rozumowania z Gemini Flash Thinking i 26 minut treningu Qwen2.5-32B na 16 kartach H100. LIMO (2025): 800 wybranych rozwiązań i 63,3% w AIME 2024. Wiedza jest już w bazie, a ślady uczą formy długiego rozumowania (zobacz „Modele rozumujące”).

### Ograniczenia destylacji

- Uczeń rzadko przerasta nauczyciela i kopiuje jego błędy i uprzedzenia; autorzy R1 zaznaczają, że pójście dalej wymaga silniejszej bazy i większego RL. Etykiety twarde utrwalają nawet zgadywanie: jeśli nauczyciel wylosował imię, którego nie znał, uczeń nauczy się podawać je z pewnością.
- Zbyt duża różnica między nauczycielem a uczniem też szkodzi. W ablacji Gemmy 3 mniejszy nauczyciel wygrywał przy krótkim treningu, a większy dopiero przy długim. Li i in. (2025): modele do 3B nie zawsze zyskują na długich śladach rozumowania silnych nauczycieli i lepiej uczą się z mieszanki krótkich i długich.
- Styl przenosi się łatwiej niż umiejętności. Gudibande i in. (2023): oceniający uznali modele trenowane na odpowiedziach ChatGPT za konkurencyjne, ale testy celowane pokazały, że poza zadaniami dobrze pokrytymi w danych nie nadrobiły prawie nic. Przenosi się wynik na benchmarku bliskim danym destylacji, a odporność na nietypowe wejścia – słabiej.

### Regulaminy i ochrona przed destylacją

- Regulaminy zabraniają używania wyników do trenowania modeli konkurencyjnych (stan na wrzesień 2026). OpenAI, Terms of Use (od 1 stycznia 2026), wśród zakazów: „Use Output to develop models that compete with OpenAI”. Umowa dla API (Services Agreement, od tej samej daty) robi dwa wyjątki: niedystrybuowane modele do klasyfikacji i porządkowania danych, np. embeddingi i klasyfikatory, oraz dotrenowanie modeli OpenAI. Anthropic, Commercial Terms (od 17 czerwca 2025): nie wolno „access the Services to build a competing product or service, including to train competing AI models”, chyba że Anthropic wprost się zgodzi. Google, warunki Gemini API (od 23 marca 2026): „You may not use the Services to develop models that compete with the Services”.
- Surowy tok myślenia jest ukryty. OpenAI przy o1 (wrzesień 2024) jako powody podało wygodę użytkownika, przewagę konkurencyjną i możliwość monitorowania toku myślenia. Dokumentacja Claude pisze, że streszczenie „zapobiega nadużyciom” i że żadne ustawienie nie zwraca surowego toku. Gemini zwraca streszczenia bez podanego powodu.
- Anthropic (23 lutego 2026) twierdzi, że wykrył kampanie DeepSeek, Moonshot AI i MiniMax: ponad 16 mln wymian przez ok. 24 tys. fałszywych kont. Kampanie celowały w rozumowanie, narzędzia i kod, m.in. prośbami o rozpisanie krok po kroku rozumowania stojącego za gotową odpowiedzią. To twierdzenia jednej strony.

### Destylacja w twoim systemie

- Typowy przypadek: duży model z długim promptem dobrze robi jedno zadanie, ale przy twoim wolumenie jest za drogi albo za wolny. Zbierz kilka tysięcy prawdziwych wejść, wygeneruj odpowiedzi nauczycielem, odrzuć złe walidatorem albo sędzią i dotrenuj mały model, np. z LoRA (zobacz „Fine-tuning i LoRA”). Uczeń nie potrzebuje już długiego promptu, więc płacisz za mniej tokenów wejścia i szybciej dostajesz odpowiedź. Kandydatów na ucznia porównujesz jak w temacie „Wybór modelu”.
- Rozkłady i on-policy wchodzą w grę, gdy nauczyciel ma otwarte wagi i ten sam tokenizer, np. większy model z tej samej rodziny. OpenAI wprost pozwala dotrenować jego modele i budować wewnętrzne klasyfikatory, ale czy wąski model generatywny do własnego użytku „konkuruje”, żaden z tych regulaminów nie precyzuje, więc to pytanie do prawnika. Otwarty nauczyciel z odpowiednią licencją omija problem: DeepSeek-R1 ma licencję MIT, a jego karta modelu wprost dopuszcza destylację.
- Ucznia sprawdzasz na zestawie ewaluacyjnym z prawdziwych przypadków, odłożonym przed generowaniem danych (zobacz „Ewaluacje”): w porównaniu z nauczycielem, uwzględniając przypadki nietypowe i odmowy. Przypadki, na których uczeń przegrywa, możesz kierować do nauczyciela.

### Sprawdź się

**Pytanie:** Jak destylacja przenosi umiejętności dużego modelu do małego i czym różnią się etykiety twarde, rozkłady nauczyciela i destylacja on-policy?

**Krótka odpowiedź:** Uczeń, mały model, uczy się naśladować nauczyciela, duży model. Najczęściej na etykietach twardych: nauczyciel generuje odpowiedzi, a uczeń przechodzi na nich zwykłe SFT, więc wystarczy tekst z API. Destylacja logitów minimalizuje dywergencję KL między pełnymi rozkładami następnego tokena nauczyciela i ucznia, zwykle przy podniesionej temperaturze. Jeden przykład niesie wtedy więcej informacji, bo pokazuje też, które alternatywy są bliskie, ale potrzebne są logity nauczyciela i wspólny tokenizer. W destylacji on-policy uczeń generuje sam, a nauczyciel ocenia każdy jego token odwrotną KL, więc uczeń uczy się też na własnych błędach; w Qwen3 dało to lepszy wynik niż RL przy ok. 1/10 godzin GPU. Uczeń rzadko przerasta nauczyciela, kopiuje jego błędy i łatwiej przejmuje styl niż umiejętności, więc sprawdzaj go na własnym zestawie ewaluacyjnym. Regulaminy OpenAI, Anthropic i Google zabraniają używania wyników do trenowania modeli konkurencyjnych.

### Pytania pogłębiające

- **Skoro rozkłady niosą więcej informacji, czemu najczęściej destyluje się na etykietach twardych?** Bo etykietom twardym wystarczy tekst. Rozkład wymaga logitów nauczyciela, czyli otwartych wag, a API zwraca co najwyżej krótką listę logprobs albo nic. Oba modele muszą mieć wspólny tokenizer, a pełny rozkład to 100–260 tys. liczb na pozycję, więc zapisuje się próbkę tokenów, jak 256 w Gemmie 3. Gdy nauczyciel jest dostępny tylko przez API, zostaje SFT na jego odpowiedziach.
- **Czemu destylacja on-policy wygrywa z SFT na odpowiedziach tego samego nauczyciela?** SFT uczy w sytuacjach, do których dochodzi nauczyciel. Uczeń przy generowaniu popełnia własne błędy, trafia na sytuacje, których nie widział, i błędy się kumulują. On-policy uczy na tekstach samego ucznia, a nauczyciel ocenia każdy token, więc sygnał jest gęsty jak w SFT i pochodzi z rozkładu ucznia jak w RL. Kosztem jest dostęp do logprobs nauczyciela i jego przebieg na każdej próbce ucznia.
- **Uczeń dorównuje nauczycielowi na zestawie ewaluacyjnym, a na produkcji myli się na lekko innych wejściach. Co się stało?** Dane destylacji pokrywały rozkład zestawu ewaluacyjnego, a nie ruch produkcyjny; do tego uczeń przejął styl nauczyciela łatwiej niż umiejętność. Pomaga poszerzenie wejść o prawdziwe przypadki z produkcji, w tym trudne i nietypowe, świeży zestaw ewaluacyjny z produkcji i kierowanie do nauczyciela przypadków, w których walidator odrzuca wynik ucznia.
- **Czy wolno destylować model dostępny tylko przez API do własnego modelu?** Technicznie wystarczą etykiety twarde. Regulaminy (stan na wrzesień 2026) zabraniają używania wyników do trenowania modeli konkurencyjnych. OpenAI robi wyjątek dla niedystrybuowanych klasyfikatorów i embeddingów oraz dla dotrenowania modeli OpenAI, a Anthropic dopuszcza to tylko za swoją wyraźną zgodą. Czy wąski model do własnego użytku „konkuruje”, regulaminy nie precyzują, więc to pytanie do prawnika. Otwarty nauczyciel z licencją, która pozwala na destylację, jak MIT w DeepSeek-R1, omija problem.
- **Czy większy nauczyciel zawsze daje lepszego ucznia?** Nie. W ablacji Gemmy 3 mniejszy nauczyciel wygrywał przy krótkim treningu, a większy dopiero przy długim. Modele do 3B nie zawsze zyskują na długich śladach rozumowania silnych nauczycieli, a pomaga im mieszanka krótkich i długich śladów (Li i in., 2025). Nauczyciela wybiera się po wyniku ucznia na ewaluacji, a nie po wyniku samego nauczyciela.

### Źródła

- [Hinton, Vinyals, Dean: Distilling the Knowledge in a Neural Network (2015)](https://arxiv.org/abs/1503.02531)
- [DeepSeek-AI: DeepSeek-R1 (2025), rozdział o destylacji do Qwen i Llamy](https://arxiv.org/abs/2501.12948)
- [Qwen Team: Qwen3 Technical Report (2025), destylacja strong-to-weak](https://arxiv.org/abs/2505.09388)
- [Thinking Machines: On-Policy Distillation (październik 2025)](https://thinkingmachines.ai/blog/on-policy-distillation/)
- [Anthropic: Detecting and preventing distillation attacks (luty 2026)](https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)

Strona interaktywna: https://howaiworks.dev/pl/destylacja/
