AI és információ-visszakeresés
Doc Chat
Előbb a kérdés értelmezése, aztán a bizonyítékok visszakeresése – és csak utána az LLM.
A Doc Chat mindenekelőtt információ-visszakereső rendszer; a chatfelület csak az egyik megjelenítési rétege. A React kliens olyan Python backenddel kommunikál, amely kiválasztja a megfelelő keresési műveletet, összegyűjti a bizonyítékokat, és csak ezután használ LLM-et a válasz összeállításához.
Nyilvános projekt megnyitásaRENDSZERARCHITEKTÚRA
A különböző kérdésekhez különböző keresési útvonalak tartoznak
A kérdésirányító strukturált PostgreSQL-lekérdezést, embedding- és pgvector-alapú szemantikus keresést vagy a kettő kombinációját választhatja. A jelöltek újrarangsorolás után kerülnek a nyelvi modellhez.
MÉRNÖKI MEGKÖZELÍTÉS
A dokumentumok kereshető bizonyítékokká válnak
A feldolgozási folyamat külön kezeli a dokumentumok beolvasását, darabolását, metaadatait és az embeddingek létrehozását. Az eredmény ugyanazon a gyűjteményen teszi lehetővé a szemantikus hasonlóságvizsgálatot és a determinisztikus szűrést.
Nem minden kérdésre a vektorkeresés a megfelelő válasz
Az azonosítókra, tulajdonosokra, darabszámokra vagy metaadatokra vonatkozó kérdések strukturált lekérdezéssel kezelhetők. A tartalmi kérdések szemantikus keresést használnak, az összetett kérdések pedig mindkét forrás eredményeit egyesíthetik.
A valószínűségi modell determinisztikus műveletek között dolgozik
Az agentjellegű folyamat célzott műveletek közül választ: entitásfeloldás, strukturált lekérdezés, szemantikus vagy hibrid keresés és válaszgenerálás. A modell részt vesz a vezérlésben, de nem helyettesíti az alkalmazáslogikát.
Az újrarangsorolás jobb kontextust ad a modellnek
Az első keresési lépés lehetséges szövegrészleteket ad vissza. Az újrarangsorolás ezek közül emeli ki a legerősebb bizonyítékokat, így a válaszgenerálás kisebb és relevánsabb kontextussal dolgozhat.
Magyar és angol dokumentumgyűjteményekhez tervezve
A dokumentum- és kérdésfeldolgozási folyamat magyar és angol tartalommal számol, anélkül hogy további, még nem megvalósított nyelvi támogatást ígérne.
TECHNIKAI ALAPOK
A rendszer rétegei
Frontend
AI-backend
Visszakeresési adatréteg
Megvalósított funkciók
- Dokumentumok beolvasása, feldolgozása, darabolása és embeddingek létrehozása
- Szemantikus, strukturált és hibrid visszakeresési útvonalak
- Eszközalapú kérdésirányítás és entitásfeloldás
- Találatok újrarangsorolása az LLM-alapú válaszgenerálás előtt
- Magyar és angol dokumentumok, illetve kérdések feldolgozása