## Modele rozumujące

*Skąd model wie to, co wie*

*Ostatnia zmiana: 28 września 2026*

Model rozumujący przed odpowiedzią pisze tok myślenia: próbuje, sprawdza, poprawia się. To ten sam mechanizm generowania token po tokenie, wyuczony w RL na zadaniach ze sprawdzalnym wynikiem, a za tokeny myślenia płacisz jak za wyjście.

**Po ludzku:** Uczeń, który na klasówce może liczyć na brudnopisie, myli się rzadziej niż ten, który od razu wpisuje wynik. Brudnopis nie pomoże mu jednak przypomnieć sobie daty, której nigdy się nie nauczył. Pisanie brudnopisu trwa, a u modelu każda jego linijka jest na rachunku.

*Interaktywny widżet na stronie: Wybierz zadanie i poziom myślenia. Zobacz, gdzie myślenie poprawia wynik, a gdzie tylko kosztuje.*

### Skąd się bierze myślenie

- Nie ma osobnego modułu myślenia. Tok myślenia to zwykłe tokeny z tej samej pętli co odpowiedź (temat „Następny token”), tylko oznaczone jako myślenie. Każdy zapisany krok zostaje w kontekście, więc kolejne tokeny liczą na nim jak na brudnopisie.
- Pisania brudnopisu model uczy się w RL (temat „Trening”) na zadaniach sprawdzanych automatycznie: matematyce ze znanym wynikiem, kodzie z testami. Nagradzany jest głównie wynik, więc utrwala się wszystko, co do niego prowadzi, także sprawdzanie się i cofanie. W DeepSeek-R1-Zero takie zachowania upowszechniły się w samym RL, bez przykładów pisanych przez ludzi, choć modele bazowe czasem przejawiają je już wcześniej (Liu i in., 2025). RLVR głównie sprawia, że model pewniej trafia w odpowiedzi, które model bazowy też potrafił znaleźć: przy wielu próbach (duże pass@k) model bazowy go dogania (Yue i in., 2025).
- To jedna z form test-time compute, czyli dokładania obliczeń w chwili odpowiedzi zamiast budowania większego modelu. Inne to wiele prób z głosowaniem albo wybór najlepszej przez weryfikator. Zysk maleje z długością myślenia, a na części zadań dłuższe myślenie pogarsza wynik (inverse scaling in test-time compute, 2025).

### Kiedy myślenie się opłaca

- Pomaga w zadaniach z wieloma krokami, w których łatwo o pomyłkę: rachunkach, kodzie, planowaniu, analizie z wieloma warunkami. Przy prostych faktach, wyszukiwaniu i krótkiej klasyfikacji dokłada tylko koszt i czekanie.
- Wiedzy nie dodaje. Czego model nie wie, tego nie wymyśli: dostaniesz dłuższe i pewniej brzmiące zgadywanie (temat „Halucynacje”).
- Każdy token myślenia to krok decode, który czeka na pamięć (temat „Czemu GPU się nudzi”). Kilka tysięcy tokenów myślenia to dziesiątki sekund przed pierwszym słowem odpowiedzi. W interfejsie pokaż postęp albo streszczenie myślenia. Zadania bez człowieka w pętli puszczaj w tle albo wsadowo.

### Sterowanie myśleniem i rachunek

- Sterujesz poziomem wysiłku (`reasoning.effort` w OpenAI, `effort` w Anthropic, `thinking_level` w Gemini, zależnie od modelu od `none` do `max`). Stały budżet tokenów myślenia (`budget_tokens`, `thinking_budget`) został tylko w starszych modelach: Claude 4.7 i nowsze odrzucają go błędem 400, a Gemini 3 przyjmuje go już tylko dla zgodności wstecz. Nawet tam jest celem, nie przydziałem. Poziom dobierasz ewaluacją na własnych zadaniach (temat „Ewaluacje”).
- W najnowszych flagowych modelach myślenia nie da się wyłączyć (stan na wrzesień 2026): Claude Opus 5.5 i Fable 5.1 odrzucają `thinking: {type: "disabled"}` błędem 400, GPT-6 Astra tak samo odrzuca `none`, a w Gemini 3.x najniższy poziom to `minimal` albo `low`. Wybierasz, ile myśleć, a nie czy. W trybie adaptacyjnym model decyduje przy każdym zapytaniu, a przy niższym wysiłku częściej pomija myślenie przy prostych pytaniach.
- Tokeny myślenia są rozliczane jak wyjście, także gdy ich nie widzisz. API zwykle nie zwracają surowego toku myślenia, tylko streszczenie albo pusty blok z zaszyfrowaną treścią, więc `usage` pokazuje więcej tokenów, niż widać w odpowiedzi.
- Myślenie liczy się do limitu wyjścia (`max_tokens`, `max_output_tokens`) i do okna kontekstu. Za niski limit ucina odpowiedź w trakcie myślenia. OpenAI zaleca na start zapas co najmniej 25 tys. tokenów na myślenie i odpowiedź.
- Sampler jest zwykle zablokowany. Claude Opus od 4.7 odrzuca każdą niestandardową wartość `temperature`, `top_p` i `top_k` błędem 400, z myśleniem czy bez, a OpenAI przy włączonym rozumowaniu nie przyjmuje `temperature` ani `top_p` (temat „Następny token”).

### Na co uważać

- Tok myślenia nie musi wiernie opisywać, jak powstała odpowiedź. W badaniu Anthropic (2025) modele korzystały z podsuniętej podpowiedzi, ale przyznawały się do niej rzadziej niż w połowie przypadków: Claude 3.7 Sonnet w 25%, DeepSeek R1 w 39%. Czytaj tok myślenia jako wskazówkę przy debugowaniu, nie jako audyt.
- W agencie model myśli też między wywołaniami narzędzi (interleaved thinking, temat „Pętla agenta”). Bloki myślenia odsyłasz w kolejnym requeście bez zmian, z podpisem albo zaszyfrowaną treścią. API odrzuci zmieniony blok, a pominięty zerwie ciągłość rozumowania.
- W Claude Opus 5.5, Fable 5.1 i Sonnet 5.5 blok jest też związany ze wszystkim, co stoi przed nim. Jeśli twój kod zmieni system prompt, narzędzia albo wcześniejszą wiadomość (np. przytnie stary wynik narzędzia), ponowne odesłanie bloku kończy się błędem 400 na kontach założonych od 31 sierpnia 2026 (na starszych tylko po włączeniu opcji). Edycja kontekstu i kompakcja po stronie serwera nie liczą się jako zmiana. Historię tylko dopisuj, a nowe instrukcje dodawaj jako nowe wiadomości.
- Myślenie z poprzednich tur jedne modele wycinają z kontekstu, inne zachowują. Zachowane zajmuje okno i jest płatne jak wejście. Wycięte zmienia prefiks od miejsca wycięcia, więc cache za nim chybia. Zmiana poziomu wysiłku albo budżetu w trakcie rozmowy też unieważnia prompt cache, bo ustawienie trafia do promptu (temat „Prompt caching”).

### Sprawdź się

**Pytanie:** Czym są modele rozumujące i ile myślenia warto opłacić?

**Krótka odpowiedź:** Model rozumujący przed odpowiedzią generuje tok myślenia: rozpisuje kroki, sprawdza je i poprawia błędy. To ten sam mechanizm przewidywania następnego tokena, wyuczony w RL na zadaniach ze sprawdzalnym wynikiem, jak matematyka czy kod z testami. Tokeny myślenia są rozliczane jak wyjście, liczą się do limitów i wydłużają czekanie. Myślenie pomaga przy zadaniach wieloetapowych, przy prostych faktach i klasyfikacji tylko kosztuje, a wiedzy nie dodaje. W najnowszych modelach myślenia nie da się wyłączyć, więc poziom wysiłku dobiera się ewaluacją. Widoczny tok myślenia nie musi wiernie wyjaśniać odpowiedzi.

### Pytania pogłębiające

- **Czym model rozumujący różni się od promptu „myśl krok po kroku”?** Prompt chain-of-thought prosi zwykły model o rozpisanie kroków i to też pomaga. Model rozumujący został do tego wytrenowany w RL: pisze dużo dłuższe toki myślenia, częściej sam się sprawdza i poprawia, a API trzyma myślenie osobno od odpowiedzi.
- **Czemu nie ustawić zawsze najwyższego poziomu?** Tokeny myślenia kosztują jak wyjście i każdy wydłuża czekanie, a zysk jakości maleje. Na prostych zadaniach jest zerowy, a bywa, że dłuższe myślenie pogarsza wynik. Poziom dobiera się per typ zadania na własnym zestawie ewaluacyjnym.
- **Czy tok myślenia wyjaśnia, dlaczego model odpowiedział tak, a nie inaczej?** Nie ma takiej gwarancji. Badania pokazują, że modele potrafią skorzystać z podpowiedzi i nie wspomnieć o niej w toku myślenia. Do tego API często zwraca tylko streszczenie. Tok myślenia przydaje się przy debugowaniu promptu, nie jako audyt.
- **Jak działa myślenie w agencie z narzędziami?** Model myśli także między wywołaniami narzędzi, po każdym wyniku. Bloki myślenia odsyła się w kolejnym requeście bez zmian, z podpisem albo zaszyfrowaną treścią, żeby rozumowanie miało ciągłość, a cache trafiał. W Claude Opus 5.5, Fable 5.1 i Sonnet 5.5 zmiana czegokolwiek przed blokiem kończy się błędem, więc historię agenta tylko się dopisuje.

### Źródła

- [DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning](https://arxiv.org/abs/2501.12948)
- [OpenAI: Reasoning models (dokumentacja API)](https://developers.openai.com/api/docs/guides/reasoning)
- [Claude docs: Preserved thinking](https://platform.claude.com/docs/en/build-with-claude/preserved-thinking)
- [Anthropic: Reasoning models don’t always say what they think](https://www.anthropic.com/research/reasoning-models-dont-say-think)
- [Lilian Weng: Why We Think (Lil’Log, 2025)](https://lilianweng.github.io/posts/2025-05-01-thinking/)

Strona interaktywna: https://howaiworks.dev/pl/reasoning/
