Kontextové okno: proč je to pořád limit, který AI modely jen tak neobejdou

Kontextové okno určuje, kolik textu si AI model najednou 'pamatuje' — a čím delší konverzace nebo dokument, tím víc na něm záleží. Vysvětluji, co kontextové okno vlastně je, proč jeho zvětšování samo o sobě nestačí, a jak s tímhle limitem prakticky pracovat.

Když jsem s AI modely začínal pracovat, řešil jsem hlavně to, jestli odpověď dává smysl. Dnes mě mnohem víc zajímá jiná otázka: kolik toho model vlastně “vidí” najednou, a co se stane, když se toho vejde příliš.

Co je kontextové okno

Kontextové okno je množství textu, které model dokáže zpracovat v jedné konverzaci nebo požadavku — obvykle se měří v tokenech, ne ve slovech nebo znacích. Token je kousek textu, často kratší než slovo; anglické slovo “context” se typicky rozpadne na dva až tři tokeny.

Do kontextového okna se počítá úplně všechno: systémový prompt, historie konverzace, přiložené dokumenty, výsledky nástrojů, které model použil, i text, který právě generuje. Jakmile se toho sejde víc, než kolik okno pojme, něco musí ustoupit — a to obvykle znamená, že model nejstarší část konverzace přestane “vidět”.

Proč nestačí jen okno zvětšovat

Poslední roky se limity kontextu dost dramaticky zvětšily, z pár tisíc tokenů na statisíce. Dalo by se čekat, že tím problém prostě zmizí. V praxi to tak úplně nefunguje.

Čím delší kontext model dostane, tím hůř se v něm orientuje. Informace uprostřed dlouhého vstupu model často zpracuje s menší přesností než informace na začátku nebo na konci — tomuhle jevu se někdy říká “lost in the middle”. Velké okno tedy neznamená, že model umí stejně dobře pracovat s každou částí toho, co do něj vložíte.

Druhý problém je cena a rychlost. Delší kontext znamená víc výpočtu na každou odpověď, a to se projeví jak na latenci, tak na účtu za API. Nacpat do promptu celou dokumentaci jen proto, že to model technicky unese, je zbytečně drahé řešení problému, který jde vyřešit chytřeji.

Co s tím v praxi

V běžném používání mi pomáhá pár jednoduchých návyků. První je nedávat modelu víc kontextu, než skutečně potřebuje pro danou úlohu — relevantní části dokumentu místo celého souboru, shrnutí předchozí konverzace místo její kompletní historie.

Druhý je práce s nástroji typu RAG (retrieval-augmented generation) nebo MCP, které jsem tu už dřív popisoval: místo aby měl model všechno nacpané v kontextu od začátku, umí si relevantní informace vyhledat až ve chvíli, kdy je potřebuje. To výrazně sníží množství textu, který musí model najednou zpracovávat.

Třetí věc, kterou si čím dál víc uvědomuju, je sledovat, jak dlouho konverzace s AI trvá. U delších pracovních session mi přijde užitečné občas shrnout dosavadní průběh a začít znovu s čistším kontextem, místo abych donekonečna natahoval jednu konverzaci a spoléhal na to, že si model pamatuje úplně všechno stejně dobře.

Kontextové okno jako rozpočet, ne jako úložiště

Nejvíc mi pomohlo přestat o kontextovém okně přemýšlet jako o paměti, do které se dá naskládat cokoliv, a začít ho brát jako rozpočet, se kterým je potřeba hospodařit. Každý token, který tam pošlu navíc, něco stojí — buď peníze, nebo přesnost odpovědi.

Modely budou mít časem pravděpodobně ještě větší okna a lepší schopnost pracovat s dlouhým kontextem rovnoměrně. I tak si ale myslím, že schopnost vybrat, co modelu skutečně poslat, zůstane užitečná dovednost — podobně jako u lidí je lepší dostat k rozhodnutí pár relevantních podkladů než stoh dokumentů, ve kterém se ztratí to hlavní.