Strona główna / Rozdział 8 · Wybór modelu
Ostatnia zmiana · 5 min czytania
Modele open-weight
Open-weight znaczy: możesz pobrać wagi, czyli wyuczone macierze modelu, i uruchomić go na własnym sprzęcie. To nie to samo co open-source: zwykle nie dostajesz danych ani kodu treningu, a licencja może ograniczać użycie.
Po ludzkuZamknięty model to restauracja: jesz, co podadzą, i nie zajrzysz do kuchni. Open-weight to gotowe danie na wynos: podgrzejesz i doprawisz u siebie, ale przepisu nie znasz. Open-source to danie razem z przepisem.
Przełącz rodzaj modelu i zobacz, co dostajesz w paczce i co z tego wynika
Co dostajesz, a czego nie
- Wagi, kod inferencji i tokenizer wystarczą, żeby model uruchomić, skwantyzować i dotrenować, na przykład metodą LoRA (zobacz „Fine-tuning i LoRA”). Nie wystarczą, żeby go odtworzyć albo sprawdzić, na czym się uczył.
- Definicja Open Source AI od OSI (wersja 1.0 z 2024 roku) wymaga wag, pełnego kodu treningu i uruchamiania oraz opisu danych na tyle szczegółowego, żeby kompetentna osoba mogła zbudować podobny system, wszystko na warunkach zatwierdzonych przez OSI: użycie w dowolnym celu bez pytania o zgodę. Samych danych publikować nie trzeba, ale publiczne i zewnętrzne dane treningowe trzeba wymienić i wskazać, skąd je wziąć. Spełnia to niewiele modeli, np. OLMo od Ai2; licencje z ograniczeniami użycia, jak licencja Llama, odpadają już przez same warunki.
- Licencje różnią się mocno. Apache 2.0 i MIT (np. gpt-oss, Qwen3, DeepSeek-R1) pozwalają prawie na wszystko. Licencje Llama (3.1 i 4) wymagają osobnej zgody Mety, jeśli w dniu premiery modelu twoje produkty miały ponad 700 mln aktywnych użytkowników miesięcznie, oraz oznaczenia „Built with Llama”. Dla modeli multimodalnych (Llama 3.2 Vision, Llama 4 Scout i Maverick) polityka dopuszczalnego użycia w ogóle nie udziela licencji osobom mieszkającym w UE ani firmom z siedzibą w UE; nie dotyczy to końcowych użytkowników produktu zbudowanego na takim modelu.
Po co firmom self-hosting
- Dane nie opuszczają twojej infrastruktury: własna chmura, serwerownia, nawet sieć bez dostępu do internetu. W branżach regulowanych to bywa jedyna dopuszczalna droga.
- Wersja jest zamrożona: nikt nie podmieni wag, ustawień ani stosu serwującego bez twojej wiedzy (zobacz „Czy model głupieje?”). To działa tylko wtedy, gdy hostujesz sam.
- Pełna kontrola nad modelem i inferencją: fine-tuning, własna kwantyzacja, dostęp do logitów, dowolne wymuszanie formatu, brak limitów zapytań narzuconych przez dostawcę.
Ustaw cenę API, koszt węzła, miesięczny wolumen i to, ile obsłuży jeden węzeł. Zobacz, od jakiego obciążenia własne GPU zaczynają się opłacać
Poglądowo. Przepustowość węzła mocno zależy od modelu i proporcji wejścia do wyjścia: 10 mld tokenów miesięcznie to ok. 3900 tokenów na sekundę bez przerwy, a DeepSeek podaje ok. 15 tys. tokenów wyjściowych albo 74 tys. wejściowych na sekundę na węzeł z 8 GPU dla swojego modelu MoE 671B (luty 2025). Cena API to średnia z cen tokenów wejściowych i droższych wyjściowych. Wykres pomija pracę ludzi przy utrzymaniu, a to zwykle największy koszt self-hostingu.
Koszt self-hostingu i pułapki
- Węzeł kosztuje tyle samo przy 5% i przy 90% obciążenia, a ruch ma szczyty i doliny. Realne średnie obciążenie jest dużo niższe niż 100%, więc liczysz koszt przy nim, nie przy pełnym. Do tego ludzie: serwowanie (vLLM, SGLang), monitoring, aktualizacje, bezpieczeństwo. Wagi ładujesz jako safetensors, od zaufanego wydawcy i z przypiętą rewizją: checkpoint w formacie pickle może przy wczytaniu uruchomić kod, a
trust_remote_codeuruchamia Pythona z repozytorium na twoich serwerach. - Trzecia droga to ten sam otwarty model z API zewnętrznego hosta: bez własnych GPU i zwykle taniej niż zamknięta czołówka. Dane znów wychodzą na zewnątrz, a host może zmienić kwantyzację albo stos serwujący.
- Ten sam model u różnych hostów działa różnie: inna kwantyzacja, inny szablon czatu, inna obsługa tool callingu i długiego kontekstu. Moonshot zmierzył to dla Kimi K2 (listopad 2025): poprawność schematu wywołań narzędzi od 100% w oficjalnym API do 72% u jednego z hostów, przez nieaktualne wersje silnika, błędne identyfikatory wywołań i brak wymuszania formatu. Testujesz konkretny endpoint własnym zestawem ewaluacyjnym, nie nazwę modelu (zobacz „Ewaluacje” i „LLM na produkcji”).
- W najtrudniejszych zadaniach zamknięta czołówka zwykle wyprzedza modele otwarte. Różnica bywa mała i zmienia się z każdym wydaniem, więc rozstrzyga pomiar na twoim zadaniu, nie ranking.
Sprawdź się
Open-weight a open-source: jaka różnica i kiedy self-hostować?
Open-weight znaczy, że można pobrać wagi i uruchomić model u siebie. Open-source według definicji OSI wymaga też kodu treningu, szczegółowego opisu danych i warunków bez ograniczeń użycia, a to rzadkość; licencje wag często ograniczają użycie, np. skalą albo regionem. Self-hosting daje kontrolę: dane zostają w firmie, wersja się nie zmienia, można dotrenować i skwantyzować. Płacisz za GPU i ludzi, a węzeł kosztuje tyle samo pusty i pełny, więc to się opłaca przy dużym, stałym ruchu albo twardych wymaganiach regulacyjnych. Pośrednia droga to otwarty model u zewnętrznego hosta.
In English
Open-weight means you can download the weights and run the model yourself. Open source, per the OSI definition, also requires the training code, a detailed description of the data and terms without use restrictions, which is rare; open-weight licences often restrict use, for example by scale or region. Self-hosting gives control: data stays in-house, the version never changes, and you can fine-tune and quantise. You pay for GPUs and people, and a node costs the same idle or full, so it pays off at high, steady volume or under hard regulatory constraints. The middle path is an open model from a third-party host.
Pytania pogłębiające (4)
- Co sprawdzasz w licencji?
- Użycie komercyjne, progi skali (np. 700 mln aktywnych użytkowników miesięcznie w Llama), ograniczenia geograficzne (Meta nie udziela licencji na multimodalne modele Llama osobom mieszkającym w UE ani firmom z siedzibą w UE), listę zakazanych zastosowań, warunki dla modeli pochodnych i trenowania innych modeli na wynikach oraz wymogi atrybucji.
- Jak porównać hosta otwartego modelu z oryginałem?
- Tym samym zestawem ewaluacyjnym na konkretnym endpoincie, z naciskiem na tool calling, wymuszanie formatu i długi kontekst, bo tam różnice w kwantyzacji i szablonie czatu wychodzą najpierw. Zapisujesz też, jaką kwantyzację i wersję host deklaruje.
- Kiedy odradzisz self-hosting mimo niższej ceny za token?
- Gdy ruch jest nieregularny i węzeł przez większość czasu stoi pusty, gdy zespół nie ma ludzi do utrzymania serwowania albo gdy zadanie wymaga jakości czołowego modelu zamkniętego. Koszt liczysz przy realnym średnim obciążeniu, nie przy 100%.
- Klient wymaga, żeby dane nie opuszczały UE. Jakie masz opcje?
- Model zamknięty u dostawcy chmury w regionie UE z umową powierzenia przetwarzania danych, otwarty model u hosta w UE albo self-hosting. Wybór zależy od tego, czy wystarczy umowa i region, czy wymagana jest pełna kontrola nad infrastrukturą.