Czy AI uczy się naszych dokumentów?
W profesjonalnym wdrożeniu trzeba jasno odróżnić korzystanie z dokumentów jako kontekstu od trenowania modelu. W architekturze RAG dokumenty są indeksowane, dzielone na fragmenty i wykorzystywane do wyszukiwania odpowiedzi, ale nie musi to oznaczać trenowania publicznego modelu na danych firmy. Model otrzymuje wybrane fragmenty jako kontekst zapytania i na tej podstawie przygotowuje odpowiedź. Decyzja o tym, gdzie dane są przetwarzane, jak są przechowywane i czy mogą być używane do trenowania, zależy od wybranego dostawcy, konfiguracji oraz wymagań bezpieczeństwa firmy.
Czy dane opuszczają firmę?
To zależy od architektury. Można zaprojektować rozwiązanie chmurowe, hybrydowe albo prywatne. W wariancie chmurowym część zapytań może być przetwarzana przez zewnętrzne API AI, ale nadal trzeba ograniczyć zakres danych, stosować maskowanie informacji wrażliwych i kontrolować retencję. W wariancie prywatnym lub on-premise większa część przetwarzania może działać w środowisku klienta. Przed wdrożeniem należy ustalić wymagania prawne, techniczne i organizacyjne oraz sprawdzić, które dokumenty mogą być indeksowane.
Czy baza wiedzy RAG działa on-premise?
Tak, ale taki wariant wymaga większej pracy infrastrukturalnej. On-premise może obejmować lokalną bazę danych, lokalny indeks wektorowy, prywatne API, własny serwer aplikacji, monitoring, backup i model AI uruchamiany lokalnie albo w prywatnej chmurze. Taki model ma sens przy wysokich wymaganiach bezpieczeństwa, danych wrażliwych lub ograniczeniach branżowych. Trzeba jednak uwzględnić koszt utrzymania, aktualizacji, skalowania, testów, zasobów GPU lub integracji z prywatnym dostawcą AI.
Jak wygląda indeksowanie dokumentów?
Indeksowanie zaczyna się od pobrania dokumentu ze źródła, na przykład SharePoint, OneDrive, Google Drive, folderu lub API. Następnie system wyciąga tekst, wykonuje OCR, jeśli dokument jest skanem, dzieli treść na fragmenty, dodaje metadane i tworzy embeddingi. Fragmenty trafiają do bazy wektorowej razem z informacją o źródle, wersji, właścicielu i uprawnieniach. Po zmianie dokumentu indeks powinien zostać zaktualizowany, aby odpowiedzi bazowały na najnowszych treściach.
Czy AI zna tylko nasze dokumenty?
W dobrze zaprojektowanym systemie odpowiedzi powinny być ograniczone do zatwierdzonych źródeł firmowych lub jasno oznaczać, że brakuje dokumentu potwierdzającego odpowiedź. Model językowy może mieć wiedzę ogólną, ale reguły systemu powinny wymuszać odpowiedzi oparte na dokumentach, procedurach i instrukcjach firmy. Jeżeli nie ma źródła, AI powinno powiedzieć, że nie znalazło informacji, i zaproponować kontakt z właścicielem procesu albo zgłoszenie luki w bazie wiedzy.
Jak wygląda aktualizacja bazy wiedzy?
Aktualizacja może działać cyklicznie, po webhooku albo ręcznie z panelu administratora. System powinien wykrywać zmiany dokumentów, usuwać stare wersje z indeksu lub oznaczać je jako nieaktualne, tworzyć nowe embeddingi i aktualizować metadane. Ważne jest wskazanie właściciela dokumentu oraz daty przeglądu. Dzięki temu administrator widzi, które źródła są aktywne, które wymagają aktualizacji i które odpowiedzi mogły korzystać z wcześniejszej wersji dokumentu.
Czy system obsługuje PDF?
Tak. PDF-y są jednym z typowych źródeł wiedzy w firmach, ale trzeba rozróżnić PDF z warstwą tekstową od skanu. Jeżeli plik ma tekst, system może go pobrać i podzielić na fragmenty. Jeżeli jest skanem, potrzebny jest OCR. Jakość OCR zależy od jakości skanu, układu dokumentu, tabel, pieczątek, podpisów i języka. Dlatego przed wdrożeniem warto przetestować reprezentatywną próbkę dokumentów, aby sprawdzić, które PDF-y nadają się do automatycznego indeksowania.
Czy RAG działa z SharePoint?
Tak. SharePoint jest jednym z najczęstszych źródeł dokumentów dla firm korzystających z Microsoft 365. Integracja zwykle wymaga Microsoft Graph API, aplikacji w Entra ID, odpowiednich uprawnień i ustalenia, które biblioteki dokumentów mają być indeksowane. Kluczowe jest zachowanie uprawnień: użytkownik powinien otrzymać odpowiedź tylko z dokumentów, do których ma dostęp. Wdrożenie powinno więc obejmować synchronizację źródeł, metadane, wersje i kontrolę dostępu.
Czy baza wiedzy może działać w Teams?
Tak. Teams może być interfejsem do zadawania pytań, ale często warto połączyć go z aplikacją webową i panelem administratora. Pracownik może pytać bota w Teams, a system odpowiada na podstawie indeksu dokumentów i pokazuje źródła. Administrator natomiast potrzebuje miejsca do zarządzania źródłami, feedbackiem, dokumentami do przeglądu i logami. Teams jest więc świetnym kanałem użycia, ale nie zastępuje całej warstwy operacyjnej RAG.
Czy można ograniczyć dostęp do dokumentów?
Tak i jest to jeden z najważniejszych elementów wdrożenia. System powinien uwzględniać role, grupy, działy, uprawnienia dokumentów i poziomy poufności. Odpowiedź AI nie może ujawniać fragmentów dokumentu, którego użytkownik nie powinien widzieć. W praktyce oznacza to filtrowanie wyników wyszukiwania przed przekazaniem ich do modelu oraz logowanie, które źródła zostały użyte. Document-level security powinno być projektowane od początku, a nie dodawane na końcu.
Czy AI odpowiada z podaniem źródeł?
Tak, właśnie to jest jedna z największych zalet RAG. Odpowiedź powinna zawierać link do dokumentu, nazwę źródła, wersję albo fragment, z którego korzystał system. Dzięki temu użytkownik może sprawdzić, skąd pochodzi informacja, a administrator może audytować odpowiedzi. Brak źródeł powinien być traktowany jako sygnał ostrzegawczy. Wtedy system powinien przyznać, że nie znalazł potwierdzenia, zamiast generować odpowiedź bez podstawy w dokumentach firmy.
Jak wygląda wersjonowanie dokumentów?
Wersjonowanie powinno przechowywać informację o aktualnej wersji dokumentu, dacie indeksowania, właścicielu, statusie przeglądu i zmianach w źródle. Jeżeli dokument zostanie zastąpiony nową wersją, indeks powinien zostać zaktualizowany, a starsze fragmenty powinny zostać usunięte albo oznaczone jako archiwalne. To ważne zwłaszcza przy procedurach ISO, politykach bezpieczeństwa, instrukcjach technicznych i dokumentach HR, gdzie nieaktualna odpowiedź może prowadzić do błędnego działania.
Jak mierzyć ROI z bazy wiedzy AI?
Najlepiej mierzyć czas znalezienia informacji, liczbę powtarzalnych pytań do ekspertów, czas onboardingu, liczbę wyszukiwań, trafność odpowiedzi, liczbę dokumentów do aktualizacji i udział odpowiedzi ze źródłami. Warto zacząć od pomiaru obecnego procesu: ile czasu pracownicy szukają informacji, jak często pytają innych i które działy są najbardziej obciążone. Dopiero potem można porównać wynik po MVP. ROI nie powinno być zakładane z góry, tylko mierzone na danych.
Ile trwa wdrożenie wewnętrznej bazy wiedzy RAG?
Czas zależy od liczby źródeł, jakości dokumentów, wymagań uprawnień, OCR, liczby działów i zakresu MVP. Prosty pilotaż dla jednego działu i wybranych dokumentów jest znacznie krótszy niż wdrożenie obejmujące wiele źródeł, Teams, SSO, document-level security, admin panel i dashboard. Najbezpieczniej zacząć od audytu dokumentów, listy pytań testowych i MVP dla jednego procesu, a dopiero po testach rozwijać kolejne źródła i działy.
Czy baza wiedzy może obsługiwać Word, Excel i PowerPoint?
Tak, ale każdy format wymaga innego sposobu ekstrakcji treści. Word zwykle jest prosty do przetworzenia, Excel wymaga rozpoznania arkuszy, tabel i kontekstu danych, a PowerPoint często zawiera skrótowe informacje, grafiki i układy slajdów. System powinien przechowywać metadane pliku i informację o źródle, aby odpowiedź była możliwa do sprawdzenia. W przypadku plików złożonych warto przygotować reguły, które fragmenty mają być indeksowane.