Strona główna / Rozdział 2 · Skąd model wie to, co wie
    Ostatnia zmiana · 6 min czytania

    Użyj z AI

    Trening

    Model powstaje w trzech etapach. Pretraining daje język i wiedzę przez przewidywanie następnego tokena, SFT uczy roli asystenta, a RL szlifuje zachowanie i rozumowanie. Po treningu wagi są zamrożone, więc wszystko, czego model nie wie, trzeba mu dać w kontekście.

    Po ludzkuNajpierw lata czytania wszystkiego jak leci. Potem kurs zawodowy na przykładowych rozmowach, po którym kursant wie, jak zachowuje się asystent. Na końcu praktyka z oceną: próbuje sam, a egzaminator nagradza dobre wyniki, więc uczy się tego, za co są punkty.

    Kliknij etap i porównaj, co model robi z tym samym promptem

    Odpowiedzi napisane ręcznie, poglądowo.

    Pretraining

    Post-training: SFT i RL

    Co z tego wynika w praktyce

    Sprawdź się

    Jak powstaje LLM: czym różnią się pretraining, SFT, RLHF i RLVR?

    Pretraining uczy przewidywać następny token na bilionach tokenów tekstu ze stratą cross-entropy. Stąd język i wiedza, ale model bazowy tylko dokańcza dokumenty. SFT na rozmowach w szablonie czatu uczy roli asystenta i formatu wywołań narzędzi. RLHF optymalizuje pod model nagrody wyuczony z porównań ludzi albo modelu-sędziego, z karą KL za odejście od modelu po SFT. RLVR optymalizuje pod nagrodę z automatycznego sprawdzenia, np. testów: tak powstają modele rozumujące, a w wieloturowych środowiskach z narzędziami także modele do agentów. Ryzykiem RL jest reward hacking. Po treningu wagi są zamrożone, więc bieżącą wiedzę trzeba podać w kontekście.

    In English

    Pretraining teaches next-token prediction on trillions of tokens of text with a cross-entropy loss. That gives language and knowledge, but the base model only continues documents. SFT on conversations in the chat template teaches the assistant role and the tool-call format. RLHF optimises against a reward model learned from comparisons made by people or a model judge, with a KL penalty for drifting away from the SFT model. RLVR optimises against a reward from an automatic check, such as tests: that is how reasoning models are made, and, in multi-turn tool environments, models for agents. The risk of RL is reward hacking. After training, the weights are frozen, so current knowledge has to be supplied in context.

    Pytania pogłębiające (4)
    RLHF a RLVR?
    RLHF bierze nagrodę z modelu wyuczonego na preferencjach ludzi albo modelu-sędziego: sprawdza się, gdy liczą się styl i pomocność, ale model nagrody da się oszukać. RLVR bierze nagrodę z automatycznego sprawdzenia, np. testów albo wyniku zadania: trudniej ją oszukać i łatwo skalować, ale tylko tam, gdzie wynik da się sprawdzić programem.
    PPO, DPO, GRPO?
    PPO to klasyczne RL z modelem nagrody i osobnym krytykiem, który szacuje wartość stanu. DPO uczy wprost z par „lepsza/gorsza odpowiedź”, bez modelu nagrody i bez generowania w pętli. GRPO (DeepSeek) generuje kilka odpowiedzi na ten sam prompt i porównuje je między sobą, więc nie potrzebuje krytyka.
    Po co kara KL w RL?
    Trzyma model blisko modelu po SFT. Bez niej optymalizacja szybko znajduje odpowiedzi, które model nagrody ocenia wysoko, a ludzie nisko, i model traci ogólne umiejętności. W RLVR dla rozumowania często się ją pomija (DAPO), bo model musi daleko odejść od punktu startu, a przed obejściem nagrody chroni wtedy dobry weryfikator.
    Kiedy fine-tuning, a kiedy RAG?
    Fine-tuning dla stylu, formatu i wąskich umiejętności. RAG dla wiedzy, która się zmienia i musi mieć źródło (zobacz „Fine-tuning i LoRA” i „RAG”).

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę