Strona główna / Rozdział 8 · Wybór modelu
    Ostatnia zmiana · 8 min czytania

    Użyj z AI

    Wybór modelu

    Model dobierasz do zadania, nie do rankingu: bierzesz najtańszą konfigurację – model, poziom rozumowania i dostawcę – która przechodzi twój zestaw ewaluacyjny w wymaganym czasie i limitach. Publiczne benchmarki podpowiadają tylko, kogo warto sprawdzić.

    Po ludzkuRekrutacja na konkretne stanowisko. Nie zatrudniasz osoby z najlepszym wynikiem w ogólnym teście, tylko dajesz kandydatom to samo zadanie próbne z twojej pracy i bierzesz tego, kto zrobi je dobrze i na czas za najniższą stawkę. Rankingi i dyplomy mówią tylko, kogo zaprosić na rozmowę. Zadanie próbne zostaje w szufladzie, więc gdy ktoś odchodzi, następcę sprawdzasz w godzinę.

    Ustaw próg jakości i limit czasu. Zobacz, który model jest najtańszy wśród tych, które przechodzą, a potem przełącz na publiczny ranking

    przechodzinajtańszy, który przechodziponiżej proguza wolnyA, B: czołowe · C, D, E: średnie · F, G: małe
    wybrany model
    koszt ukończonego zadania
    wynik na twoim zestawie

    Dane poglądowe: siedem nienazwanych modeli, liczby dobrane ręcznie. Koszt ukończonego zadania: koszt wszystkich prób, także nieudanych, z tokenami rozumowania i po rabacie za cache, podzielony przez liczbę zaliczonych zadań. Pod kropką czas p95 całego zadania.

    Od zadania do modelu

    Koszt i czas

    Limity, funkcje i lokalizacja danych

    Jak czytać benchmarki

    Wycofywanie i zmiana modelu

    Sprawdź się

    Jak wybrać model do nowej funkcji i czemu publiczny ranking tego nie rozstrzyga?

    Punktem wyjścia jest zadanie i własny zestaw ewaluacyjny z progiem jakości. Kandydatów z kilku półek – czołowej, średniej i małej – puszcza się na tym zestawie z różnymi poziomami rozumowania i bierze najtańszą konfigurację, która przechodzi próg w wymaganym czasie. Koszt liczy się na ukończone zadanie, z tokenami rozumowania, gadatliwością modelu i rabatem za cache, a nie z cennika za token. Do tego limity: efektywna długość kontekstu, limit wyjścia, limity zapytań, structured output, tool calling i region danych. Publiczne rankingi bywają skażone, nasycone, zależne od stylu i harnessu, więc tylko zawężają listę kandydatów. Wersję się przypina, a zestaw zostaje w repozytorium, żeby zmiana modelu była jednym uruchomieniem.

    In English

    Start from the task and your own eval set with a quality bar. Run candidates from several tiers (frontier, mid and small) on that set at different reasoning effort levels, and take the cheapest configuration that clears the bar within the required latency. Count cost per completed task, including reasoning tokens, the model’s verbosity and the cache discount, rather than reading it off the per-token price list. Then check the limits: effective context length, output limit, rate limits, structured output, tool calling and data region. Public leaderboards can be contaminated, saturated, and sensitive to style and harness, so they only narrow the candidate list. Pin the version and keep the eval set in the repository, so that switching models is a single run.

    Pytania pogłębiające (5)
    Najtańszy model ma 81% przy progu 80%. Czy to wystarczy?
    Nie bez sprawdzenia szumu. Przy 50 przypadkach przedział ufności ma ok. ±11 punktów procentowych, więc 81% i 80% są nie do odróżnienia. Potrzeba więcej przypadków albo powtórzeń, porównania w parach z droższym kandydatem i osobnego wyniku dla przypadków krytycznych. Jeśli tani model zawodzi na jednym typie przypadków, ten typ można kierować do droższego.
    Model A kosztuje za token pięć razy więcej niż B. Kiedy wyjdzie taniej?
    Gdy kończy zadanie w mniejszej liczbie kroków: mniej tur agenta, mniej poprawek, krótsze myślenie na niższym poziomie wysiłku i więcej zaliczonych zadań. Koszt ukończonego zadania to koszt wszystkich prób podzielony przez liczbę udanych, więc model, który zalicza 60% zadań, 40% prób opłaca na darmo. Rozstrzyga pomiar na własnym zestawie z pełnym rozliczeniem tokenów, także z cache’u i rozumowania.
    Jak zbudować routing między tanim a drogim modelem?
    Najprościej kaskadą z weryfikatorem: tani model odpowiada, a walidator schematu, testy albo sędzia decydują, czy wynik przyjąć, czy powtórzyć zadanie na mocniejszym modelu lub wyższym poziomie rozumowania. Router, który z góry ocenia trudność, sam się myli, więc mierzy się jego trafność i koszt pomyłek. W pomiarach Anthropic uruchamianie wszystkiego na niskim wysiłku i ponawianie nieudanych zadań na wysokim utrzymało wynik za ok. połowę kosztu, ale działa to tylko tam, gdzie jest wiarygodny sygnał porażki.
    Nowy model ma wyższy wynik na publicznym benchmarku. Czy zmieniać?
    Wynik publiczny tylko kwalifikuje kandydata. Liczy się porównanie w parach i z powtórzeniami na własnym zestawie, tym samym, który przeszedł obecny model, plus koszt na zadanie, p95 czasu i obsługa używanych funkcji. Prompt zwykle trzeba przestroić, więc porównuje się najlepszą wersję promptu dla każdego modelu. Potem canary na części ruchu i obserwacja sygnałów z produkcji.
    Po co warstwa abstrakcji nad API, skoro używasz jednego dostawcy?
    Bo dostawca wycofuje wersje zwykle po roku lub dwóch, ma awarie i limity, a lepszy model może pojawić się u innego. Jedna warstwa trzyma w jednym miejscu nazwy modeli, ceny, limity, fallback i logowanie tokenów, więc zmiana to konfiguracja i przebieg evali. Różnic w funkcjach, takich jak format narzędzi, myślenie czy cache, nie ukryje, więc powinna być cienka.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę