## Trening

*Skąd model wie to, co wie*

*Ostatnia zmiana: 28 września 2026*

Model powstaje w trzech etapach. Pretraining daje język i wiedzę przez przewidywanie następnego tokena, SFT uczy roli asystenta, a RL szlifuje zachowanie i rozumowanie. Po treningu wagi są zamrożone, więc wszystko, czego model nie wie, trzeba mu dać w kontekście.

**Po ludzku:** Najpierw lata czytania wszystkiego jak leci. Potem kurs zawodowy na przykładowych rozmowach, po którym kursant wie, jak zachowuje się asystent. Na końcu praktyka z oceną: próbuje sam, a egzaminator nagradza dobre wyniki, więc uczy się tego, za co są punkty.

*Interaktywny widżet na stronie: Kliknij etap i porównaj, co model robi z tym samym promptem.*

### Pretraining

- Zadanie: przewidzieć następny token w ogromnym zbiorze tekstu i kodu (Llama 3: ok. 15 bln tokenów). Strata to cross-entropy, czyli −log prawdopodobieństwa, które model dał poprawnemu tokenowi. Backpropagation liczy gradient, a optymalizator, zwykle AdamW, przesuwa każdą wagę odrobinę w stronę mniejszego błędu. Każda pozycja w tekście to osobny przykład, więc jeden dokument daje naraz tysiące przykładów.
- Liczba operacji to ok. 6 × parametry × tokeny. Chinchilla (2022) wyliczyła, że przy stałym budżecie optimum to ok. 20 tokenów na parametr. Dziś trenuje się dużo dłużej (Qwen3, 2025: 36 bln tokenów dla każdego rozmiaru, ok. 60 tys. na parametr w modelu 0,6B; Llama 3 8B: prawie 2000 na parametr), bo mniejszy, dłużej trenowany model jest tańszy w inferencji przez cały okres użytkowania.
- Przed treningiem dane się filtruje: w Llama 3 usunięto duplikaty na poziomie URL-i, dokumentów (MinHash) i linii, odsiano śmieci heurystykami i wybrano tekst wysokiej jakości klasyfikatorami. Publiczne benchmarki leżą w tym samym internecie i przeciekają do korpusu. Na GSM1k, nowych zadaniach w stylu GSM8K, część modeli wypadła gorzej nawet o 8 punktów procentowych, więc wynik publicznego benchmarku może zawyżać to, co zobaczysz na własnym zadaniu (temat „Ewaluacje”).
- Pod koniec model trenuje się na coraz dłuższych sekwencjach, żeby wydłużyć kontekst, i na małej porcji najlepszych danych, np. kodu i matematyki, przy malejącym learning rate (annealing). Ten etap nazywa się też mid-training.
- Wynik, czyli model bazowy, jest wyuczony dokańczać dokumenty, a nie odpowiadać. Na „Jak upiec chleb?” może dopisać kolejne pytania z forum. W danych do pretrainingu jest dziś sporo par pytanie–odpowiedź i syntetycznych instrukcji, więc współczesne modele bazowe często i tak odpowiadają, ale zawodnie i bez roli asystenta.

### Post-training: SFT i RL

- SFT to trening z tą samą stratą, ale na rozmowach zapisanych w szablonie czatu (zobacz „Jak model widzi czat”), a stratę liczy się tylko na tokenach odpowiedzi asystenta. Setki tysięcy do milionów przykładów pisanych przez ludzi i generowanych przez silniejsze modele uczą formatu, roli i wywoływania narzędzi.
- RLHF: ludzie porównują pary odpowiedzi, na tych porównaniach trenuje się model nagrody, a model językowy optymalizuje się pod jego ocenę (klasycznie algorytmem PPO) z karą KL za odejście od modelu po SFT. W InstructGPT (2022) model o 1,3 mld parametrów po takim treningu wygrywał w ocenach ludzi z 175-miliardowym GPT-3. DPO uczy wprost z par lepsza/gorsza, bez osobnego modelu nagrody. Dziś porównania często robi model-sędzia według spisanych zasad (RLAIF, Constitutional AI); w Tülu 3 odpowiedzi oceniał GPT-4o.
- RLVR: nagrodę przyznaje program, np. testy albo porównanie z poprawnym wynikiem. Model generuje wiele prób, a lepsze są wzmacniane. GRPO porównuje próby na ten sam prompt między sobą, bez osobnego krytyka. Tak powstały modele rozumujące: długi tok myślenia się opłaca, bo zwiększa szansę na nagrodę (zobacz „Modele rozumujące”).
- RL w środowiskach: to samo dla agentów. W wieloturowych zadaniach z narzędziami (terminal, repozytorium z testami, symulowane API) nagradza się stan końcowy; Kimi K2 (2025) miał wspólny etap RL w prawdziwych i syntetycznych środowiskach. SFT uczy formatu wywołań narzędzi, a tu model ćwiczy długie, wieloetapowe przebiegi.
- Destylacja: mniejszy model uczy się na odpowiedziach albo rozkładach prawdopodobieństwa większego, dlatego małe modele są lepsze, niż wynikałoby z ich rozmiaru (zobacz „Destylacja”).

### Co z tego wynika w praktyce

- Po treningu wagi są zamrożone. Model nie uczy się z rozmowy, a „pamięć” w aplikacjach to notatki doklejane do kontekstu (zobacz „Context engineering i pamięć”). O świecie po dacie odcięcia wie tylko to, co dostanie w kontekście.
- RL optymalizuje nagrodę, nie intencję (reward hacking). Model nagradzany za przechodzące testy potrafi je obejść zamiast naprawić kod, a nagradzany ocenami ludzi uczy się im przytakiwać (sycophancy). W RLHF kara KL i różnorodne nagrody to ograniczają, ale nie eliminują. W RLVR dla rozumowania karę KL często się pomija (DAPO, 2025), bo przy długim toku myślenia model musi daleko odejść od punktu startu, więc tam przed reward hackingiem chroni głównie jakość weryfikatora.
- Własny trening zaczynasz od gotowego modelu. Fine-tuning dobrze uczy stylu, formatu i wąskich zadań, słabo nowej wiedzy. Wiedza, która się zmienia albo musi mieć źródło, idzie do kontekstu (zobacz „Fine-tuning i LoRA” i „RAG”).

### Sprawdź się

**Pytanie:** Jak powstaje LLM: czym różnią się pretraining, SFT, RLHF i RLVR?

**Krótka odpowiedź:** Pretraining uczy przewidywać następny token na bilionach tokenów tekstu ze stratą cross-entropy. Stąd język i wiedza, ale model bazowy tylko dokańcza dokumenty. SFT na rozmowach w szablonie czatu uczy roli asystenta i formatu wywołań narzędzi. RLHF optymalizuje pod model nagrody wyuczony z porównań ludzi albo modelu-sędziego, z karą KL za odejście od modelu po SFT. RLVR optymalizuje pod nagrodę z automatycznego sprawdzenia, np. testów: tak powstają modele rozumujące, a w wieloturowych środowiskach z narzędziami także modele do agentów. Ryzykiem RL jest reward hacking. Po treningu wagi są zamrożone, więc bieżącą wiedzę trzeba podać w kontekście.

### Pytania pogłębiające

- **RLHF a RLVR?** RLHF bierze nagrodę z modelu wyuczonego na preferencjach ludzi albo modelu-sędziego: sprawdza się, gdy liczą się styl i pomocność, ale model nagrody da się oszukać. RLVR bierze nagrodę z automatycznego sprawdzenia, np. testów albo wyniku zadania: trudniej ją oszukać i łatwo skalować, ale tylko tam, gdzie wynik da się sprawdzić programem.
- **PPO, DPO, GRPO?** PPO to klasyczne RL z modelem nagrody i osobnym krytykiem, który szacuje wartość stanu. DPO uczy wprost z par „lepsza/gorsza odpowiedź”, bez modelu nagrody i bez generowania w pętli. GRPO (DeepSeek) generuje kilka odpowiedzi na ten sam prompt i porównuje je między sobą, więc nie potrzebuje krytyka.
- **Po co kara KL w RL?** Trzyma model blisko modelu po SFT. Bez niej optymalizacja szybko znajduje odpowiedzi, które model nagrody ocenia wysoko, a ludzie nisko, i model traci ogólne umiejętności. W RLVR dla rozumowania często się ją pomija (DAPO), bo model musi daleko odejść od punktu startu, a przed obejściem nagrody chroni wtedy dobry weryfikator.
- **Kiedy fine-tuning, a kiedy RAG?** Fine-tuning dla stylu, formatu i wąskich umiejętności. RAG dla wiedzy, która się zmienia i musi mieć źródło (zobacz „Fine-tuning i LoRA” i „RAG”).

### Źródła

- [Ouyang i in.: Training language models to follow instructions with human feedback (InstructGPT, 2022)](https://arxiv.org/abs/2203.02155)
- [Lambert i in.: Tülu 3, otwarty przepis na post-training z RLVR (2024)](https://arxiv.org/abs/2411.15124)
- [Llama Team: The Llama 3 Herd of Models (2024), dane i dekontaminacja](https://arxiv.org/abs/2407.21783)
- [Kimi Team: Kimi K2: Open Agentic Intelligence (2025)](https://arxiv.org/abs/2507.20534)
- [Andrej Karpathy: Deep Dive into LLMs like ChatGPT](https://www.youtube.com/watch?v=7xTGNNLPyMI)

Strona interaktywna: https://howaiworks.dev/pl/trening/
