Okno kontekstu (ang. context window) to maksymalna ilość tekstu, jaką model językowy może „widzieć” i przetwarzać naraz w jednym zapytaniu. Do okna wlicza się wszystko: instrukcje systemowe, Twoją wiadomość, całą dotychczasową historię rozmowy, wklejone dokumenty, wyniki narzędzi oraz odpowiedź, którą model właśnie generuje. Rozmiar okna mierzy się w tokenach, a nie w słowach czy stronach.
Temat wraca za każdym razem, gdy ktoś wrzuca do czatu raport kwartalny spółki, kilka lat świec z wykresu albo logi bota i dziwi się, że model coś pominął, pomylił liczby albo „zapomniał”, co ustaliliście godzinę wcześniej. Z mojej perspektywy zrozumienie okna kontekstu to podstawa, jeśli używasz AI do analizy rynku. Poniżej opisuję, jak to działa, jakie są obecne limity i jak dzielić duże dane, żeby nie tracić na jakości.
Co to jest okno kontekstu w prostych słowach
Wyobraź sobie biurko, na którym model rozkłada wszystkie kartki potrzebne do odpowiedzi. Okno kontekstu to wielkość tego biurka. Model nie ma dostępu do rozmowy sprzed tygodnia ani do pliku, którego mu nie podałeś. Widzi tylko to, co aktualnie leży na blacie. Gdy blat się zapełni, coś trzeba zdjąć, streścić albo zacząć od nowa.
Ważne jest też to, że model nie „pamięta” rozmowy w ludzkim sensie. Przy każdej kolejnej wiadomości aplikacja wysyła mu ponownie całą historię. Dlatego długa rozmowa zjada okno kontekstu coraz szybciej, nawet jeśli Twoje pojedyncze pytania są krótkie.
Tokeny, czyli w czym liczy się okno
Token to fragment tekstu, na który model dzieli wejście: całe krótkie słowo, część dłuższego słowa, znak interpunkcyjny albo kawałek liczby. Dla języka angielskiego producenci podają przybliżenie, że 1 token to średnio około 4 znaki, a 100 tokenów to mniej więcej 60–80 słów. W praktyce przyjmuję widełki 3–4 znaki na token.
Przy polskim tekście trzeba być ostrożnym. Odmiana przez przypadki, długie formy wyrazów i polskie znaki sprawiają, że to samo zdanie zwykle zużywa więcej tokenów niż jego angielski odpowiednik. Dokładny przelicznik zależy od tokenizera danego modelu, więc jeśli liczy się każdy token, sprawdź go licznikiem udostępnianym przez dostawcę. Podobnie jest z liczbami: ciąg cen z wieloma miejscami po przecinku potrafi kosztować zaskakująco dużo tokenów.
Jak duże są okna kontekstu obecnych modeli
Rozmiary okien rosną bardzo szybko, więc traktuj poniższe dane jako stan z początku października 2026 roku, według oficjalnej dokumentacji producentów:
- Anthropic. Aktualne modele Claude (m.in. Opus 5.5, Sonnet 5.5 i Haiku 5.5) mają okno 1 mln tokenów i mogą wygenerować do 128 tys. tokenów odpowiedzi. Część starszych modeli ma okno 200 tys. tokenów.
- OpenAI. GPT-5.5 ma okno około 1,05 mln tokenów i do 128 tys. tokenów odpowiedzi.
- Google. Gemini 3.8 Flash przyjmuje do około 1,05 mln tokenów wejścia i zwraca do około 65 tys. tokenów. Gemini 3.1 Pro (wersja preview) również ma okno rzędu 1 mln tokenów.
Milion tokenów to w angielskim kilkaset tysięcy słów, czyli objętość kilku grubych książek. Zwróć uwagę, że limit odpowiedzi jest znacznie mniejszy niż limit wejścia. Model może przeczytać ogromny dokument, ale nie przepisze Ci go w całości w jednej odpowiedzi. Pamiętaj też, że aplikacje czatowe w planach konsumenckich mogą udostępniać mniejsze okno niż to, które oferuje API.
Co się dzieje po przekroczeniu okna kontekstu
To zależy od tego, czy korzystasz z API, czy z aplikacji czatowej:
- Błąd zapytania. W API zbyt długie wejście zwykle kończy się po prostu odrzuceniem zapytania z komunikatem, że prompt jest za długi.
- Ucięta odpowiedź. Jeśli samo wejście się mieści, ale model w trakcie generowania dojdzie do limitu, odpowiedź zostanie przerwana w połowie.
- Usuwanie najstarszych wiadomości. Aplikacje czatowe potrafią zarządzać kontekstem „na zakładkę”: najstarsze fragmenty rozmowy wypadają, żeby zrobić miejsce na nowe.
- Kompakcja, czyli podsumowanie. Coraz częściej wcześniejsza część rozmowy jest automatycznie streszczana, a model pracuje dalej na skrócie. Rozmowa trwa, ale szczegóły z początku mogą zostać uproszczone albo zgubione.
Właśnie stąd bierze się wrażenie, że model „zapomniał” ustalenia, na przykład Twój maksymalny stop loss albo to, że analizujesz kontrakty, a nie rynek spot. Te informacje albo wypadły z okna, albo zostały streszczone tak, że zniknął z nich istotny detal.
Lost in the middle i spadek jakości przy długim kontekście
Duże okno nie oznacza, że model równie dobrze wykorzystuje każdy jego fragment. W 2023 roku Nelson F. Liu i współautorzy opublikowali pracę „Lost in the Middle: How Language Models Use Long Contexts”. Pokazali, że modele najlepiej korzystają z informacji umieszczonych na początku i na końcu długiego wejścia, a wyraźnie gorzej z tych, które leżą w środku. Efekt dotyczył także modeli projektowanych do długiego kontekstu.
Nowsze modele radzą sobie z tym lepiej niż te z 2023 roku, ale problem nie zniknął całkowicie. Anthropic w swojej dokumentacji opisuje zjawisko nazywane „context rot”: im więcej tokenów w kontekście, tym bardziej może spadać dokładność i zdolność przywoływania szczegółów. Wniosek jest prosty: to, co wrzucasz do okna, trzeba selekcjonować, a nie tylko upychać.
Koszt i czas przy długim kontekście
W API płacisz za każdy token wejścia i wyjścia. Gdy w długiej rozmowie przy każdej wiadomości wysyłana jest cała historia, koszt rośnie z każdą wymianą. U niektórych dostawców bardzo długie zapytania są dodatkowo droższe za token. Przykładowo OpenAI dla GPT-5.5 nalicza podwójną stawkę za wejście i 1,5-krotną za wyjście, gdy zapytanie przekracza 272 tys. tokenów. Długi kontekst to też dłuższy czas oczekiwania na pierwszą część odpowiedzi. Częściowo pomaga tu cache’owanie powtarzanego początku zapytania, które obniża koszt, ale nie zwalnia miejsca w oknie.
Okno kontekstu a pamięć i RAG
Okno kontekstu to pamięć robocza na czas jednego zapytania. Funkcje „pamięci” w aplikacjach czatowych działają inaczej: zapisują wybrane informacje poza rozmową i dokładają je do kontekstu w kolejnych sesjach. Podobnie działa RAG, czyli wyszukiwanie fragmentów dokumentów w bazie i wstawianie do okna tylko tych, które pasują do pytania. W obu przypadkach model i tak widzi tylko to, co trafi do okna. Jeśli mechanizm wyszukiwania wybierze złe fragmenty, odpowiedź będzie oparta na złych danych.
Co to oznacza dla Ciebie jako tradera
- Raporty kwartalne. Zamiast wrzucać kilka raportów naraz, analizuj je osobno. Najpierw poproś o wyciągnięcie kluczowych liczb (przychody, marże, przepływy, zadłużenie) w stałym formacie, a dopiero potem porównuj zestawienia między kwartałami.
- Dane OHLC. Rok świec godzinowych to około 8760 wierszy, a każdy wiersz z datą i pięcioma liczbami to kilkadziesiąt tokenów. Model nie jest kalkulatorem, więc wskaźniki, statystyki i backtesty licz w kodzie albo w arkuszu, a modelowi podawaj wyniki lub poproś go o napisanie skryptu.
- Logi bota. Filtruj je przed wklejeniem: błędy, odrzucone zlecenia, okna czasowe wokół problemu. Tysiące identycznych linii z heartbeatem tylko zjadają okno i odciągają uwagę modelu.
- Kluczowe ustalenia. Zasady strategii, limity ryzyka i format odpowiedzi trzymaj w instrukcjach systemowych albo powtarzaj je na końcu długiej wiadomości. Najważniejsze pytanie umieść po danych, a nie przed nimi.
- Nowa rozmowa zamiast bardzo długiej. Gdy wątek się rozrósł, poproś o podsumowanie ustaleń, sprawdź je i zacznij od niego nową rozmowę.
Ryzyka związane z oknem kontekstu
- Ciche pominięcie danych. Model nie zawsze zasygnalizuje, że część dokumentu wypadła z okna albo że jej nie uwzględnił. Wynik może wyglądać na kompletny, choć nim nie jest.
- Błędy w liczbach. Przy długich tabelach model może pomylić wiersze, kwartały albo jednostki. Kluczowe liczby zawsze weryfikuj w źródle.
- Utrata ustaleń po kompakcji. Streszczenie wcześniejszej rozmowy może pominąć warunek, który dla Ciebie był krytyczny, na przykład maksymalną wielkość pozycji.
- Rosnące koszty. Bot lub agent, który przy każdym kroku wysyła całą historię, potrafi generować rachunki znacznie wyższe niż zakładałeś.
- Więcej miejsca na złośliwe treści. Im więcej zewnętrznych danych trafia do okna (strony, maile, wiadomości z czatów), tym większa szansa, że znajdzie się wśród nich tekst próbujący zmanipulować model.
Najczęstsze pytania o okno kontekstu
Czy większe okno kontekstu oznacza lepszy model?
Nie automatycznie. Większe okno pozwala zmieścić więcej danych, ale jakość wykorzystania długiego kontekstu bywa różna. Często lepszy wynik daje krótszy, dobrze wyselekcjonowany materiał niż wrzucenie wszystkiego naraz.
Czy odpowiedź modelu też zajmuje okno kontekstu?
Tak. Okno obejmuje wejście, historię rozmowy i generowaną odpowiedź, a w modelach z rozszerzonym rozumowaniem także tokeny „myślenia”. Dodatkowo odpowiedź ma własny, mniejszy limit długości.
Dlaczego model zapomina, co ustaliliśmy na początku rozmowy?
Najczęściej dlatego, że wcześniejsza część rozmowy została usunięta lub streszczona, żeby zmieścić nowe wiadomości, albo informacja zginęła w środku bardzo długiego kontekstu. Powtórz kluczowe założenia albo zacznij nową rozmowę od ich podsumowania.
Czy można wrzucić do modelu całą historię notowań?
Technicznie często się da, ale to zwykle zły pomysł. Model gorzej radzi sobie z masowymi obliczeniami na liczbach niż kod. Lepiej policzyć wskaźniki programem, a modelowi dać do interpretacji wyniki.
Podsumowanie
Okno kontekstu określa, ile tekstu model AI widzi naraz: instrukcje, historię rozmowy, dokumenty i własną odpowiedź. Na październik 2026 roku czołowe modele mają okna rzędu miliona tokenów, ale to nie znaczy, że równie dobrze wykorzystują każdy fragment, a długi kontekst kosztuje więcej i działa wolniej. Jeśli analizujesz raporty, dane rynkowe czy logi bota, dziel materiał na części, liczby licz w kodzie, kluczowe ustalenia powtarzaj i zawsze weryfikuj wyniki w źródle.


