Embedding je převod textu nebo obrázku na řadu čísel (vektor), která zachycuje jeho význam. Texty s podobným významem dostanou podobná čísla, takže počítač pozná, že „mikina s kapucí“ a „hoodie“ jsou skoro totéž, i když nesdílí ani slovo.
K čemu se embeddingy používají
- Vyhledávání podle významu. Dotaz i produkty se převedou na vektory a hledají se ty nejbližší. Najde to i výsledky, které nesdílí s dotazem žádné slovo.
- RAG. Embeddingy pomáhají najít v dokumentech pasáže, které se k dotazu hodí.
- Doporučování. Podobné produkty jsou si blízko i ve vektorovém prostoru.
- Třídění a shlukování. Recenze nebo dotazy zákazníků se dají automaticky seskupit podle tématu bez předem daných kategorií.
- Hledání duplicit. Dva skoro stejné popisy nebo dotazy mají skoro stejné vektory.
Vektory se ukládají do vektorové databáze nebo do běžné databáze s podporou vektorového hledání.
Co je dobré vědět
Embeddingy vytváří samostatný model, jiný než ten, se kterým si povídáte v chatu. Když ho vyměníte, musíte vektory přepočítat.
Na všechno nestačí. Přesné kódy produktů, EAN nebo čísla variant najde spolehlivěji klasické fulltextové vyhledávání. Dobré vyhledávání v e-shopu proto obvykle kombinuje oba přístupy.
Příklad z praxe e-shopu
Zákazník napíše do vyhledávání „něco na bolavá záda po sezení“. Klasické vyhledávání hledá shodu slov a nenajde nic. Vyhledávání podle významu najde ergonomickou podložku, bederní polštář a masážní míček, protože jejich popisy mají k dotazu významově blízko. Na hledání podle významu staví AI vyhledávání v e-shopech.