Strona główna / Rozdział 2 · Skąd model wie to, co wie
    Ostatnia zmiana · 6 min czytania

    Użyj z AI

    Modele rozumujące

    Model rozumujący przed odpowiedzią pisze tok myślenia: próbuje, sprawdza, poprawia się. To ten sam mechanizm generowania token po tokenie, wyuczony w RL na zadaniach ze sprawdzalnym wynikiem, a za tokeny myślenia płacisz jak za wyjście.

    Po ludzkuUczeń, który na klasówce może liczyć na brudnopisie, myli się rzadziej niż ten, który od razu wpisuje wynik. Brudnopis nie pomoże mu jednak przypomnieć sobie daty, której nigdy się nie nauczył. Pisanie brudnopisu trwa, a u modelu każda jego linijka jest na rachunku.

    Wybierz zadanie i poziom myślenia. Zobacz, gdzie myślenie poprawia wynik, a gdzie tylko kosztuje

    Zadanie:
    Myślenie:
    tokenów myślenia
    czas generowania
    koszt 1000 takich zapytań

    Szansa na poprawną odpowiedź

    Tokeny wyjścia razem z odpowiedzią

    Liczby poglądowe, nie wynik benchmarku ani pomiaru. Cena 10 USD za milion tokenów wyjściowych, 80 tokenów na sekundę, liczone samo wyjście, bez wejścia i czasu do pierwszego tokena. Pokazany tok myślenia to skrót, prawdziwy bywa wielokrotnie dłuższy. Odpowiedź to jedna przykładowa próbka. Nie każdy model pozwala wyłączyć myślenie.

    Skąd się bierze myślenie

    Kiedy myślenie się opłaca

    Sterowanie myśleniem i rachunek

    Na co uważać

    Sprawdź się

    Czym są modele rozumujące i ile myślenia warto opłacić?

    Model rozumujący przed odpowiedzią generuje tok myślenia: rozpisuje kroki, sprawdza je i poprawia błędy. To ten sam mechanizm przewidywania następnego tokena, wyuczony w RL na zadaniach ze sprawdzalnym wynikiem, jak matematyka czy kod z testami. Tokeny myślenia są rozliczane jak wyjście, liczą się do limitów i wydłużają czekanie. Myślenie pomaga przy zadaniach wieloetapowych, przy prostych faktach i klasyfikacji tylko kosztuje, a wiedzy nie dodaje. W najnowszych modelach myślenia nie da się wyłączyć, więc poziom wysiłku dobiera się ewaluacją. Widoczny tok myślenia nie musi wiernie wyjaśniać odpowiedzi.

    In English

    A reasoning model generates a chain of thought before answering: it lays out steps, checks them and fixes mistakes. It is the same next-token machinery, trained with reinforcement learning on tasks with verifiable outcomes such as maths or code with tests. Thinking tokens are billed as output, count towards limits and add latency. Thinking helps on multi-step problems; on simple facts and classification it only adds cost, and it adds no knowledge. The newest models don’t let you switch thinking off, so pick the effort level with evals. The visible reasoning is not guaranteed to be a faithful explanation of the answer.

    Pytania pogłębiające (4)
    Czym model rozumujący różni się od promptu „myśl krok po kroku”?
    Prompt chain-of-thought prosi zwykły model o rozpisanie kroków i to też pomaga. Model rozumujący został do tego wytrenowany w RL: pisze dużo dłuższe toki myślenia, częściej sam się sprawdza i poprawia, a API trzyma myślenie osobno od odpowiedzi.
    Czemu nie ustawić zawsze najwyższego poziomu?
    Tokeny myślenia kosztują jak wyjście i każdy wydłuża czekanie, a zysk jakości maleje. Na prostych zadaniach jest zerowy, a bywa, że dłuższe myślenie pogarsza wynik. Poziom dobiera się per typ zadania na własnym zestawie ewaluacyjnym.
    Czy tok myślenia wyjaśnia, dlaczego model odpowiedział tak, a nie inaczej?
    Nie ma takiej gwarancji. Badania pokazują, że modele potrafią skorzystać z podpowiedzi i nie wspomnieć o niej w toku myślenia. Do tego API często zwraca tylko streszczenie. Tok myślenia przydaje się przy debugowaniu promptu, nie jako audyt.
    Jak działa myślenie w agencie z narzędziami?
    Model myśli także między wywołaniami narzędzi, po każdym wyniku. Bloki myślenia odsyła się w kolejnym requeście bez zmian, z podpisem albo zaszyfrowaną treścią, żeby rozumowanie miało ciągłość, a cache trafiał. W Claude Opus 5.5, Fable 5.1 i Sonnet 5.5 zmiana czegokolwiek przed blokiem kończy się błędem, więc historię agenta tylko się dopisuje.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę