RAG je postup, při kterém si AI před odpovědí nejdřív vyhledá relevantní informace ve vašich datech (dokumentech, produktech, návodech) a odpověď postaví na nich. Model se nic nového neučí, jen dostane správné podklady do kontextu.
Jak RAG funguje
- Příprava: dokumenty, návody nebo popisy produktů se rozdělí na menší části a uloží do vyhledávacího indexu, často s pomocí embeddingů, aby šlo hledat podle významu.
- Vyhledání: když přijde dotaz, systém najde několik nejrelevantnějších částí.
- Odpověď: nalezené části se vloží modelu do promptu s pokynem odpovídat jen z nich. Dobrý systém k odpovědi připojí i odkaz na zdroj.
Model tak odpovídá z aktuálních podkladů, ne z toho, co si pamatuje z tréninku. Když změníte dokument, změní se i odpověď.
Kdy RAG, kdy fine-tuning a kdy MCP
- RAG se hodí na hodně textu, který se průběžně mění: obchodní podmínky, návody, produktové listy, interní wiki.
- Fine-tuning mění styl a formát odpovědí, na nová fakta se nehodí.
- MCP nebo přímé API je lepší pro živá data ze systému, jako je stav objednávky nebo sklad. Dotaz do systému je přesnější než hledání v indexu.
RAG je jen tak dobrý jako data pod ním. Zastaralý dokument v indexu znamená zastaralou odpověď, a když index najde špatné pasáže, model odpoví špatně, ale sebejistě.
Příklad z praxe e-shopu
Chatbot na e-shopu odpovídá na dotazy k dopravě, vrácení zboží a použití produktů. Přes RAG čerpá z obchodních podmínek, reklamačního řádu a návodů. Na dotaz „můžu vrátit rozbalený filtr do vody?“ najde odpovídající odstavec reklamačního řádu, odpoví podle něj a odkáže na něj. Neodpoví podle toho, co je obvyklé jinde.