# Jak działa AI > Interaktywny przewodnik dla inżynierów: jak działają modele językowe pod spodem i co jest ważne w budowaniu systemów agentowych. Z pytaniami sprawdzającymi. Przewodnik jest po polsku (wersja angielska pod /). Każdy temat: intuicja, interaktywny widżet, mechanizm, niuanse, krótka odpowiedź do sprawdzenia się, pytania pogłębiające i źródła. Ostatnia aktualizacja: 2026-09-26. Co nowego: https://howaiworks.dev/pl/changelog/ Cały przewodnik w jednym pliku: https://howaiworks.dev/pl/llms-full.txt Licencja: tekst i obrazy CC BY 4.0 (możesz cytować i przerabiać z linkiem do źródła), kod MIT. ## Jak model czyta i przewiduje Od liter na ekranie do decyzji, jaki będzie następny kawałek tekstu. - [Tokeny](https://howaiworks.dev/pl/tokeny.md): Model nie widzi liter, tylko kawałki słów zamienione na liczby. - [Wektory i macierze](https://howaiworks.dev/pl/macierze.md): Token to wektor, a warstwa to mnożenie go przez stałe macierze wag. - [Attention](https://howaiworks.dev/pl/attention.md): Każde słowo spogląda wstecz i wybiera, od kogo wziąć informację. - [Następny token](https://howaiworks.dev/pl/sampling.md): Model podaje szanse dla każdego tokena, a sampler losuje jeden. ## Skąd model wie to, co wie Trening, destylacja, dostrajanie, rola asystenta w rozmowie i myślenie przed odpowiedzią. - [Trening](https://howaiworks.dev/pl/trening.md): Oczytanie, kurs zawodowy, praktyka z oceną. - [Destylacja](https://howaiworks.dev/pl/destylacja.md): Jak mały model uczy się od dużego: etykiety twarde i rozkłady, on-policy, rozumowanie, granice i regulaminy. - [Fine-tuning i LoRA](https://howaiworks.dev/pl/finetuning.md): Kiedy dostrajać model, a kiedy wystarczy prompt albo RAG, jak LoRA trenuje ułamek wag i co fine-tuning psuje. - [Jak model widzi czat](https://howaiworks.dev/pl/czat.md): Rozmowa to jeden dokument, a model dopisuje kolejną kwestię. - [Modele rozumujące](https://howaiworks.dev/pl/reasoning.md): Brudnopis przed odpowiedzią: pomaga w zadaniach wieloetapowych, a płacisz za każdą linijkę. ## Jak model pisze i ile to kosztuje Pisanie po jednym kawałku, pamięć podręczna i to, czemu długie rozmowy są drogie. - [Pętla generowania i KV cache](https://howaiworks.dev/pl/kvcache.md): Pętla generowania, prefill kontra decode i pamięć GPU, którą zjada cache kluczy i wartości. - [Prompt caching](https://howaiworks.dev/pl/promptcache.md): KV cache trzymany u dostawcy między requestami: tańsze wejście i szybszy start, ale tylko dla identycznego początku promptu. - [Okno kontekstowe i agent](https://howaiworks.dev/pl/context.md): Co liczy się do limitu, czemu każda tura agenta kosztuje więcej od poprzedniej i czemu jakość spada z długością. ## Kontekst i wiedza Co włożyć do okna kontekstu i jak to znaleźć w swoich danych. - [Context engineering i pamięć](https://howaiworks.dev/pl/kontekst.md): Co włożyć do okna kontekstu przed każdym wywołaniem i jak agent pamięta to, co się w nim nie mieści. - [Embeddingi i wyszukiwanie wektorowe](https://howaiworks.dev/pl/embeddingi.md): Szukanie po znaczeniu zamiast po słowach: jak działa, ile kosztuje i gdzie zawodzi. - [RAG](https://howaiworks.dev/pl/rag.md): Pipeline od indeksowania i chunkingu przez wyszukiwanie i reranking po cytaty, uprawnienia i ewaluację. ## Agenci Model w pętli: narzędzia, standard ich podłączania, wymuszony format, harness agenta kodującego i podział pracy. - [Pętla agenta](https://howaiworks.dev/pl/agent.md): Model w pętli sam wybiera następny krok, aż uzna, że skończył. - [Narzędzia (function calling)](https://howaiworks.dev/pl/narzedzia.md): Model nie naciska guzików. Pisze, który nacisnąć, a naciska twój kod. - [MCP](https://howaiworks.dev/pl/mcp.md): Jeden standard podłączania narzędzi do wielu aplikacji z modelem. Model dalej widzi tylko definicje w prompcie. - [Wymuszanie formatu](https://howaiworks.dev/pl/format.md): Constrained decoding: tryb ścisły gwarantuje JSON zgodny ze schematem, ale nie jego treść. - [Harness agenta kodującego](https://howaiworks.dev/pl/harness.md): Wszystko wokół modelu, co robi z niego agenta kodującego: narzędzia, instrukcje, kontekst, uprawnienia i cofanie zmian. - [Wielu agentów](https://howaiworks.dev/pl/multiagent.md): Główny agent zleca części zadania subagentom z czystym kontekstem. Szybciej przy niezależnych częściach, zwykle drożej. ## Jakość i bezpieczeństwo Zmyślenia, mierzenie jakości zamiast oceny na oko i ataki ukryte w treści. - [Halucynacje](https://howaiworks.dev/pl/halucynacje.md): Model nie ma wbudowanego „nie wiem”, więc zgaduje tym samym pewnym tonem. - [Ewaluacje](https://howaiworks.dev/pl/evals.md): Stały zestaw przypadków puszczany po każdej zmianie i pomiar na produkcji, zamiast „chyba jest lepiej”. - [Prompt injection](https://howaiworks.dev/pl/injection.md): Tekst, który agent tylko czyta, może zacząć nim sterować. Chroni przed tym architektura, nie prompt. ## Model na produkcji Niezawodny system wokół modelu i to, co dzieje się w serwerowni. - [LLM na produkcji](https://howaiworks.dev/pl/produkcja.md): Co zbudować wokół API modelu: ponowienia, fallbacki, limity, koszty, trace’y i bezpieczne wdrażanie zmian. - [Czemu GPU się nudzi](https://howaiworks.dev/pl/roofline.md): Przy generowaniu karta głównie czeka na wagi z pamięci. Stąd batching, kwantyzacja i droższe tokeny wyjściowe. - [Continuous batching](https://howaiworks.dev/pl/batching.md): Serwer wymienia rozmowy w batchu co krok i przydziela im pamięć blokami, więc karta nie stoi pusta. - [Dekodowanie spekulacyjne](https://howaiworks.dev/pl/spec.md): Tani draft zgaduje kilka tokenów, duży model sprawdza je w jednym przebiegu. Szybciej, bez zmiany wyniku. - [Kwantyzacja](https://howaiworks.dev/pl/kwantyzacja.md): Wagi w 8 lub 4 bitach zamiast 16: 2–4 razy mniej pamięci i szybsze generowanie kosztem niewielkiej straty jakości. - [Mixture of Experts](https://howaiworks.dev/pl/moe.md): Wielu ekspertów, router wybiera kilku na token: obliczenia jak w małym modelu, pamięć jak w dużym. ## Wybór modelu Jak dobrać model do zadania, otwarte wagi, alternatywy dla LLM-a i to, czemu model bywa „głupszy”. - [Wybór modelu](https://howaiworks.dev/pl/wybor.md): Najtańszy model, który przechodzi twój zestaw ewaluacyjny: koszt na zadanie, opóźnienie, limity i czytanie benchmarków. - [Modele open-weight](https://howaiworks.dev/pl/openweight.md): Wagi do pobrania i uruchomienia u siebie. Kontrola nad danymi i wersją za cenę GPU i utrzymania. - [Kiedy nie używać LLM-a: klasyfikatory i System One](https://howaiworks.dev/pl/jev.md): Kiedy klasyfikator, ocena z logprobs albo model decyzyjny wygrywa z LLM-em. System One od TypeSafe jako przykład, z twierdzeniami producenta oddzielonymi od faktów. - [Czy model głupieje?](https://howaiworks.dev/pl/compute.md): Wagi przypiętej wersji się nie zmieniają, system wokół nich tak, a aplikacje i aliasy potrafią podmienić wagi. Co udokumentowano, co jest hipotezą i jak to mierzyć. ## Ćwiczenia i powtórka Zadania projektowe i fiszki do powtórki. - [Zaprojektuj system](https://howaiworks.dev/pl/design.md): Pięć praktycznych scenariuszy projektowych: wymagania, architektura, decyzje, ewaluacja, awarie. - [Fiszki](https://howaiworks.dev/pl/fiszki.md): Pytanie do każdego tematu: najpierw odpowiedz sam, potem odwróć kartę.