Strona główna / Rozdział 8 · Wybór modelu
Ostatnia zmiana · 8 min czytania
Wybór modelu
Model dobierasz do zadania, nie do rankingu: bierzesz najtańszą konfigurację – model, poziom rozumowania i dostawcę – która przechodzi twój zestaw ewaluacyjny w wymaganym czasie i limitach. Publiczne benchmarki podpowiadają tylko, kogo warto sprawdzić.
Po ludzkuRekrutacja na konkretne stanowisko. Nie zatrudniasz osoby z najlepszym wynikiem w ogólnym teście, tylko dajesz kandydatom to samo zadanie próbne z twojej pracy i bierzesz tego, kto zrobi je dobrze i na czas za najniższą stawkę. Rankingi i dyplomy mówią tylko, kogo zaprosić na rozmowę. Zadanie próbne zostaje w szufladzie, więc gdy ktoś odchodzi, następcę sprawdzasz w godzinę.
Ustaw próg jakości i limit czasu. Zobacz, który model jest najtańszy wśród tych, które przechodzą, a potem przełącz na publiczny ranking
Dane poglądowe: siedem nienazwanych modeli, liczby dobrane ręcznie. Koszt ukończonego zadania: koszt wszystkich prób, także nieudanych, z tokenami rozumowania i po rabacie za cache, podzielony przez liczbę zaliczonych zadań. Pod kropką czas p95 całego zadania.
Od zadania do modelu
- Zaczynasz od zestawu przypadków z prawdziwego ruchu i progu, który model ma przejść (temat „Ewaluacje”). Puszczasz go na kilku kandydatach, każdy przypadek kilka razy, i bierzesz najtańszego, który przechodzi.
- Modele dzielą się na półki. Czołowe (frontier) biorą trudne rozumowanie, długie zadania agentowe i kod. Średnie wystarczają do większości pracy produkcyjnej. Małe i szybkie robią klasyfikację, ekstrakcję, routing i proste kroki w dużej skali.
- Poziom rozumowania to druga gałka tego samego wyboru. W poradnikach o wyborze modelu Anthropic pisze, że strojenie wysiłku często daje więcej niż zmiana modelu, a OpenAI radzi zostać przy najlżejszym ustawieniu, które spełnia próg jakości (stan na wrzesień 2026). Porównujesz więc pary model–poziom, nie same modele.
- Jeden model na cały system to rzadko optimum. W kaskadzie najpierw odpowiada tani model, a do droższego albo na wyższy poziom rozumowania trafia tylko to, co odrzuci walidator, testy albo niska pewność (temat „LLM na produkcji”). W agencie dobierasz model do kroku: mały streszcza wyniki narzędzi, czołowy planuje i podejmuje trudne decyzje.
Koszt i czas
- Liczysz koszt ukończonego zadania, nie cenę za token: koszt tokenów ze wszystkich prób, także nieudanych, dzielisz przez liczbę zaliczonych zadań. Mocniejszy model często potrzebuje mniej tur i poprawek. W pomiarach Anthropic na podzbiorze SWE-bench Pro model Fable 5.1 na niskim poziomie wysiłku rozwiązał 88,6% zadań za 0,54 USD na rozwiązane zadanie, a Sonnet 5, pięć razy tańszy za token, 77,4% za 0,84 USD. W długim researchu było odwrotnie: Fable 5.1 wyszedł ok. cztery razy drożej na zadanie. To liczby producenta, więc sprawdzasz je na swoim zadaniu.
- Cennik nie pokazuje trzech rzeczy. Za tokeny rozumowania płacisz jak za wyjście, także za niewidoczne (temat „Modele rozumujące”). Modele różnią się gadatliwością, więc na tym samym zadaniu jeden potrafi wygenerować kilka razy więcej tokenów niż drugi. Rabat za cache też się różni: u Anthropic odczyt kosztuje zwykle 10% ceny wejścia, w Opus 5.5 – 5%, a w Fable 5.1 – 2,5% (stan na wrzesień 2026, temat „Prompt caching”). W agencie, który większość wejścia czyta z cache’u, to potrafi odwrócić porównanie.
- Czas to dwie liczby: czas do pierwszego tokena (TTFT) i tokeny na sekundę po nim. Wysiłek rozumowania przesuwa obie. Pierwsze słowo odpowiedzi przychodzi dopiero po całym myśleniu, a użyteczne tokeny na sekundę spadają, bo część generowanych tokenów to myślenie, którego użytkownik nie widzi. Dlatego Artificial Analysis mierzy osobno czas do pierwszego tokena odpowiedzi. Wolniejszemu modelowi pomaga streaming, niższy poziom rozumowania albo przeniesienie kroku tam, gdzie nikt nie czeka.
Limity, funkcje i lokalizacja danych
- Okno kontekstu z karty modelu to górna granica, nie obietnica: jakość spada na długo przed jego końcem (temat „Okno kontekstowe i agent”), więc testujesz na swoich realnych długościach. Limit wyjścia jest osobny i dużo mniejszy, a myślenie się do niego wlicza.
- Limity zapytań zależą od poziomu konta (tier), który rośnie z historią wydatków. U Anthropic nowa organizacja może zacząć od niższego tieru, a każdy tier ma miesięczny limit wydatków, po którym API zwraca 429 do początku kolejnego miesiąca (stan na wrzesień 2026). Limity dla konkretnego modelu sprawdzasz przed wdrożeniem, nie po nim.
- Tryb ścisły structured output, równoległe wywołania narzędzi, obrazy, logprobs, batch i prompt caching nie działają w każdym modelu i u każdego dostawcy (temat „Wymuszanie formatu”). Brak jednej funkcji potrafi przekreślić model, który wygrywa na evalu.
- Miejsce inferencji i miejsce przechowywania danych to dwa osobne ustawienia. Przetwarzanie w wybranym regionie obejmuje tylko część modeli i funkcji, bywa dostępne po akceptacji dostawcy i kosztuje więcej: w OpenAI i Anthropic ok. 10% dla nowszych modeli (stan na wrzesień 2026). Własne API Anthropic pozwala przypiąć inferencję tylko do USA, a region w UE dają Bedrock i Google Cloud. Zerowa retencja (ZDR) wymaga umowy i nie obejmuje funkcji ze stanem (temat „LLM na produkcji”).
Jak czytać benchmarki
- Zadania z publicznych zestawów trafiają do danych treningowych, a gdy czołówka zbliża się do sufitu, różnice giną w szumie i w błędach samego zestawu. W lutym 2026 OpenAI przestał podawać wyniki w SWE-bench Verified: w zbadanej części zadań 59,4% miało wadliwe testy, które odrzucały poprawne rozwiązania, a wszystkie sprawdzone czołowe modele widziały w treningu część zadań i rozwiązań.
- SWE-bench Verified to 500 poprawek błędów z 12 repozytoriów w Pythonie. Mierzy małe, dobrze opisane łatki w popularnych projektach, a nie pracę w twoim repozytorium, z twoimi konwencjami i zmianami w wielu plikach.
- LMArena mierzy, którą odpowiedź woli głosujący, a głosujący wolą dłuższe i bogato sformatowane. Po uwzględnieniu stylu (style control, 2024) najsilniejszym czynnikiem okazała się długość, a ranking się przetasował: GPT-4o-mini spadł z 6. na 11. miejsce, a Claude 3 Opus awansował z 16. na 10. To miara preferencji w czacie, nie poprawności w twoim zadaniu.
- Wynik od producenta i wynik niezależny to różne pomiary. Producent wybiera harness, poziom rozumowania, liczbę prób i podzbiór zadań. Niezależne zespoły, jak Artificial Analysis czy Epoch AI, puszczają wszystkie modele w jednym harnessie, a Epoch zauważa, że wynik na SWE-bench mocno zależy od scaffoldu. Porównujesz tylko liczby z jednego źródła i jednego harnessu (temat „Harness agenta kodującego”).
- Ten sam model u różnych dostawców to nie ten sam produkt: różnią się kwantyzacja, szablon czatu, parser wywołań narzędzi i ustawienia serwowania. W pomiarze Moonshot z listopada 2025 Kimi K2 Thinking wywoływał narzędzia zgodnie ze schematem w 100% przez oficjalne API, a u kilku zewnętrznych hostów w 83–87%. Testujesz konkretny endpoint, nie nazwę modelu.
Wycofywanie i zmiana modelu
- Modele wycofuje się szybko. Anthropic uprzedza co najmniej 60 dni wcześniej: Claude Sonnet 4 z maja 2025 dostał datę wycofania w kwietniu 2026 i przestał działać 15 czerwca 2026. Przypinasz konkretną wersję zamiast aliasu, a zestaw ewaluacyjny trzymasz w repozytorium, żeby zmiana modelu była jednym uruchomieniem i canary, a nie projektem (temat „Czy model głupieje?”).
- Wywołania modelu idą przez jedną cienką warstwę, własną albo gateway, która zna ceny, limity i fallbacki. Wtedy zmiana modelu lub dostawcy to konfiguracja. Prompt i tak trzeba przestroić, bo nowy model inaczej czyta te same instrukcje.
- Otwarty czy zamknięty model to osobna decyzja o kontroli nad danymi, wersją i kosztem przy dużym ruchu (temat „Modele open-weight”). A zanim wybierzesz model, sprawdź, czy zadanie w ogóle potrzebuje LLM-a (temat „Kiedy nie używać LLM-a: klasyfikatory i System One”).
Sprawdź się
Jak wybrać model do nowej funkcji i czemu publiczny ranking tego nie rozstrzyga?
Punktem wyjścia jest zadanie i własny zestaw ewaluacyjny z progiem jakości. Kandydatów z kilku półek – czołowej, średniej i małej – puszcza się na tym zestawie z różnymi poziomami rozumowania i bierze najtańszą konfigurację, która przechodzi próg w wymaganym czasie. Koszt liczy się na ukończone zadanie, z tokenami rozumowania, gadatliwością modelu i rabatem za cache, a nie z cennika za token. Do tego limity: efektywna długość kontekstu, limit wyjścia, limity zapytań, structured output, tool calling i region danych. Publiczne rankingi bywają skażone, nasycone, zależne od stylu i harnessu, więc tylko zawężają listę kandydatów. Wersję się przypina, a zestaw zostaje w repozytorium, żeby zmiana modelu była jednym uruchomieniem.
In English
Start from the task and your own eval set with a quality bar. Run candidates from several tiers (frontier, mid and small) on that set at different reasoning effort levels, and take the cheapest configuration that clears the bar within the required latency. Count cost per completed task, including reasoning tokens, the model’s verbosity and the cache discount, rather than reading it off the per-token price list. Then check the limits: effective context length, output limit, rate limits, structured output, tool calling and data region. Public leaderboards can be contaminated, saturated, and sensitive to style and harness, so they only narrow the candidate list. Pin the version and keep the eval set in the repository, so that switching models is a single run.
Pytania pogłębiające (5)
- Najtańszy model ma 81% przy progu 80%. Czy to wystarczy?
- Nie bez sprawdzenia szumu. Przy 50 przypadkach przedział ufności ma ok. ±11 punktów procentowych, więc 81% i 80% są nie do odróżnienia. Potrzeba więcej przypadków albo powtórzeń, porównania w parach z droższym kandydatem i osobnego wyniku dla przypadków krytycznych. Jeśli tani model zawodzi na jednym typie przypadków, ten typ można kierować do droższego.
- Model A kosztuje za token pięć razy więcej niż B. Kiedy wyjdzie taniej?
- Gdy kończy zadanie w mniejszej liczbie kroków: mniej tur agenta, mniej poprawek, krótsze myślenie na niższym poziomie wysiłku i więcej zaliczonych zadań. Koszt ukończonego zadania to koszt wszystkich prób podzielony przez liczbę udanych, więc model, który zalicza 60% zadań, 40% prób opłaca na darmo. Rozstrzyga pomiar na własnym zestawie z pełnym rozliczeniem tokenów, także z cache’u i rozumowania.
- Jak zbudować routing między tanim a drogim modelem?
- Najprościej kaskadą z weryfikatorem: tani model odpowiada, a walidator schematu, testy albo sędzia decydują, czy wynik przyjąć, czy powtórzyć zadanie na mocniejszym modelu lub wyższym poziomie rozumowania. Router, który z góry ocenia trudność, sam się myli, więc mierzy się jego trafność i koszt pomyłek. W pomiarach Anthropic uruchamianie wszystkiego na niskim wysiłku i ponawianie nieudanych zadań na wysokim utrzymało wynik za ok. połowę kosztu, ale działa to tylko tam, gdzie jest wiarygodny sygnał porażki.
- Nowy model ma wyższy wynik na publicznym benchmarku. Czy zmieniać?
- Wynik publiczny tylko kwalifikuje kandydata. Liczy się porównanie w parach i z powtórzeniami na własnym zestawie, tym samym, który przeszedł obecny model, plus koszt na zadanie, p95 czasu i obsługa używanych funkcji. Prompt zwykle trzeba przestroić, więc porównuje się najlepszą wersję promptu dla każdego modelu. Potem canary na części ruchu i obserwacja sygnałów z produkcji.
- Po co warstwa abstrakcji nad API, skoro używasz jednego dostawcy?
- Bo dostawca wycofuje wersje zwykle po roku lub dwóch, ma awarie i limity, a lepszy model może pojawić się u innego. Jedna warstwa trzyma w jednym miejscu nazwy modeli, ceny, limity, fallback i logowanie tokenów, więc zmiana to konfiguracja i przebieg evali. Różnic w funkcjach, takich jak format narzędzi, myślenie czy cache, nie ukryje, więc powinna być cienka.
Źródła
- Anthropic: Optimizing for cost and intelligence (koszt na ukończone zadanie, wysiłek, kaskady)
- LMSYS: Does style matter? Style control w Chatbot Arena (2024)
- Epoch AI: SWE-bench Verified, przegląd benchmarku (z audytem OpenAI z 2026)
- Artificial Analysis: metodologia pomiaru TTFT i szybkości
- Moonshot AI: K2 Vendor Verifier (ten sam model u różnych hostów)