Strona główna / Rozdział 8 · Wybór modelu
    Ostatnia zmiana · 6 min czytania

    Użyj z AI

    Czy model głupieje?

    Wagi przypiętej wersji modelu się nie zmieniają, ale system, który je serwuje, zmienia się stale: sprzęt, kompilatory, sampler, routing, system prompt aplikacji i ustawienia domyślne. Za aliasem albo nazwą modelu w aplikacji czatu można podmienić nawet wagi, a nazwa zostaje ta sama. Do tego dostawca ma skończoną pulę kart, z której biorą i trening następnego modelu, i obecni użytkownicy.

    Po ludzkuJedna kuchnia i dwa zamówienia naraz: wielkie przyjęcie na przyszły miesiąc, czyli trening, i bieżący goście, czyli użytkownicy. Palników nie przybywa. W przypiętej wersji przepis się nie zmienia, ale nowy piec albo pomylona przyprawa zmienią smak.

    Przesuń trening i popyt. Zobacz, kiedy inferencji zaczyna brakować mocy i co wtedy widzi użytkownik

    treningbadania i ewaluacjezajęte przez inferencjęwolneżądania bez miejsca

    Poglądowo: 100 jednostek mocy, z czego 10 stale na badania i ewaluacje. Proporcje nie są danymi żadnego dostawcy.

    Co się zmienia, gdy wagi stoją

    Udokumentowane przypadki

    Hipoteza i złudzenie

    Jak się bronić

    Sprawdź się

    Użytkownicy mówią, że model „zgłupiał”. Jak to wyjaśnisz i co zrobisz?

    Najpierw sprawdzasz, czy model w ogóle się zmienił: w aplikacji albo za aliasem ta sama nazwa może wskazywać nowe wagi, jak GPT-4o w ChatGPT w kwietniu 2025. Wagi przypiętej wersji się nie zmieniają, ale zmienia się wszystko wokół: sprzęt i kompilatory, sampler, routing, system prompt aplikacji, domyślny poziom rozumowania, limity. Oba udokumentowane spadki u Anthropic, z 2025 i 2026 roku, wynikały z takich przyczyn, a nie z podmiany wag. Ciche cięcie jakości z braku mocy jest technicznie możliwe, ale niepotwierdzone. Dlatego zamiast zgadywać, przypinasz wersję, ustawiasz parametry jawnie, cyklicznie puszczasz własne ewaluacje i porównujesz trace’y.

    In English

    First check whether the model changed at all: in an app or behind an alias the same name can point to new weights, as GPT-4o in ChatGPT did in April 2025. The weights of a pinned version do not change, but everything around them does: hardware and compilers, the sampler, routing, the app’s system prompt, default reasoning effort, rate limits. Both documented regressions at Anthropic, in 2025 and 2026, had such causes, not different weights. Silent quality cuts due to a compute shortage are technically possible but unproven. So instead of guessing, pin the version, set parameters explicitly, run your own evals on a schedule and compare traces.

    Pytania pogłębiające (4)
    Jak odróżnić regresję u dostawcy od własnej?
    Przypięta wersja, stały zestaw ewaluacyjny z kilkoma powtórzeniami i porównanie trace’ów. Jeśli prompt, narzędzia i parametry są te same, a spadek wyników wykracza poza szum, problem leży po stronie dostawcy. Wtedy zbierasz przykłady i zgłaszasz je.
    Co przypinasz, żeby ograniczyć niespodziewane zmiany zachowania modelu?
    Dokładny identyfikator snapshotu modelu, poziom rozumowania, limit tokenów, temperaturę tam, gdzie model ją jeszcze przyjmuje, wersję promptu i definicji narzędzi. Przypięta wersja też ma datę wycofania, więc migrację sprawdzasz tym samym zestawem ewaluacyjnym.
    Czemu dostawca sam nie wyłapał regresji z 2025 roku?
    Według postmortemu ewaluacje Anthropic nie uchwyciły spadku, raporty użytkowników były zaszumione, a zasady prywatności ograniczają wgląd inżynierów w rozmowy. Błędy dotykały części ruchu na części platform, więc średnie wyglądały dobrze. Wniosek dla ciebie: potrzebujesz ewaluacji na własnym ruchu.
    Jak wykryć regresję w godzinę, a nie po tygodniu?
    Kanarek: mały zestaw przypadków puszczany co godzinę na produkcyjnym endpoincie, plus sygnały z ruchu: odsetek niepoprawnego JSON-a, długość odpowiedzi, liczba wywołań narzędzi, ponowienia i poprawki użytkowników. Alert na odchylenie od wartości bazowej.

    Źródła

    Zgłoś błąd · Zaproponuj poprawkę